뇌 데이터 추출 8편 - 본 것을 복원하다
달라진 것은 스캐너가 아니라, 빌려 쓸 수 있을 만큼 좋아진 그림 생성 모델이었습니다.
사람이 스캐너에 누워 사진을 보면 거기서 그림이 나옵니다. 그 사진은 아니지만 같은 장면이라고 알아볼 만한 것이요. 확산 모델을 새로 학습하지 않고 빌려 쓰면서 선형 모델만 맞추는 설계, 초기 시각 피질에서 배치를 상위 시각 피질에서 내용을 뽑는 분업, 그리고 40시간 촬영을 1시간으로 줄인 이야기까지 봅니다.
다루는 논문
- Takagi & Nishimoto, High-resolution image reconstruction with latent diffusion models from human brain activity, CVPR 2023, 14453-14463
- Scotti et al., Reconstructing the Mind's Eye (MindEye), NeurIPS 2023
- Scotti et al., MindEye2: Shared-Subject Models Enable fMRI-To-Image With 1 Hour of Data, ICML 2024
영상 34분 6초 · 장표 71장 · 무료 공개
들어가며
이 시리즈에서 지금까지 본 것은 전부 언어였습니다. 단어와 글자, 문장, 그리고 그것을 말하려 했는지였습니다. 이번에는 출력이 그림입니다. 스캐너에 누워 사진을 보면 거기서 그림이 나옵니다. 그 사진은 아니지만, 같은 장면이라고 알아볼 만한 것입니다. 논문 셋을 보는데, 그 사이에 달라진 것은 스캐너가 아닙니다.
여기서의 주장은 앞선 언어 논문들보다 말하기 쉽습니다
여기서의 주장은 앞선 언어 논문들보다 말하기 쉽습니다. 이미지를 보는 사람의 뇌 영상을 다시 이미지로 바꿀 수 있습니다. 그걸 가능하게 한 것은 더 좋은 기록이 아닙니다. 저자들이 분명히 밝힙니다. 그림 만드는 모델이 손대지 않고 빌려 쓸 만큼 좋아진 덕입니다. 두 번째로 달라진 것은 사람마다 얼마나 많이 찍어야 하느냐입니다. 40시간에서 1시간으로 줄었고, 그것이 셋 중 마지막 논문입니다.
말에서 그림으로 바뀌면 놓치기 쉬운 것이 하나 달라집니다
말에서 그림으로 바뀌면 놓치기 쉬운 것이 하나 달라집니다. 문장이라면 단어가 맞았는지 물어서 답을 얻을 수 있습니다. 다르게 표현한 것도 가깝다고 치고, 대부분 거기 동의합니다. 그림에는 답이 하나인 그런 질문이 없습니다. 맞는 장면의 흐릿한 그림과 틀린 장면의 또렷한 그림이 있다고 해 보죠. 이 논문들이 지표를 여덟 개나 보고하는 이유는 하나로 결판이 안 나서입니다.
세 논문 모두 같은 공개 데이터셋을 쓰니 설명하고 가겠습니다
세 논문 모두 같은 공개 데이터셋을 쓰니 설명하고 가겠습니다. 8명이 각각 사진 1만 장을 보는 동안 촬영됐습니다. 모든 이미지를 세 번씩 보여 줬고, 30에서 40번의 세션에 걸쳐 진행했습니다. 사람당 스캐너 안에서 약 40시간입니다. 그리고 7테슬라 장비로, 병원 장비보다 훨씬 셉니다. 그 규모가 있어야 한 사람에게 모델을 맞추는 일이 가능해집니다.
이 논문들이 빌려 쓰는 것이 확산 모델이니 먼저 정리하겠습니다
이 논문들이 빌려 쓰는 것이 확산 모델이니 먼저 정리하겠습니다. 그림에 잡음을 조금씩 더해 결국 아무것도 안 보이는 상태로 만듭니다. 그다음 그 한 단계를 되돌리는 모델을 학습합니다. 완전한 잡음에서 돌리면 없던 그림이 그려집니다. 여기서 중요한 게 둘입니다. 잡음이 아니라 그림에서 시작할 수 있습니다. 그리고 설명을 주면 결과가 그 뜻 쪽으로 끌려갑니다.
생성 모델에서 먼저 알아 둘 것이 하나 더 있습니다
생성 모델에서 먼저 알아 둘 것이 하나 더 있습니다. 512픽셀 정사각형에는 숫자가 80만 개 가까이 들어 있습니다. 거기서 잡음 걷어 내기를 100번 돌리면 아주 느립니다. 그래서 별도 모델이 이미지를 훨씬 작은 코드로 먼저 줄입니다. 약 48배 작고, 복원 모델이 거의 그대로 되돌립니다. 그 작은 코드가 뇌에게 예측하라고 시키는 대상입니다. 이게 중요합니다.
논문 그림 2 a
Figure 2의 위쪽이 생성 모델인데, 공개된 그대로 그렸습니다. 왼쪽에서 이미지 X가 부호기를 거쳐 코드 z가 됩니다. 가운데 화살표가 잡음이 단계마다 더해지는 과정입니다. 오른쪽 끝이 잡음 섞인 판이고, 모델은 이것을 되돌리는 법을 배웁니다. 이 줄의 어느 것도 저자들이 바꾸지 않았습니다.
그림 2 읽기
Figure 2의 기호를 정리하고 가겠습니다. 계속 나오거든요. z는 그림 코드이고 배치와 색을 담습니다. c는 텍스트 코드이고 그림이 무엇에 관한 것인지를 담습니다. 논문은 그 둘을 뇌에서 따로 예측합니다. 그리고 생성 모델에 건넵니다. 생성 모델은 건드리지 않고요.
논문 그림 2 b
Figure 2의 둘째 줄이 설명이 들어가는 방식을 보여 줍니다. 가운데 나비 모양이 잡음을 걷어 내는 신경망입니다. U자형 신경망이라고 부르고, 같은 일을 여러 번 되풀이합니다. 아래에서 올라오는 노란 막대가 숫자로 바뀐 텍스트입니다. 매 단계마다 결과를 설명 쪽으로 밀어 줍니다.
생성 모델은 두 가지가 필요하고, 뇌가 둘 다 공급합니다
생성 모델은 두 가지가 필요하고, 뇌가 둘 다 공급합니다. 저자들이 나눈 방식은 임의가 아니라 시각 체계를 따릅니다. 뇌 뒤쪽 영역은 가장자리와 선, 색에 반응합니다. 그보다 앞쪽 영역은 가장자리가 어디인지가 아니라 그것이 무엇인지에 반응합니다. 그래서 그림 코드는 뒤에서, 텍스트 코드는 앞에서 예측합니다. 각 영역에 실제로 줄 수 있는 부분을 묻는 것입니다.
논문 그림 2 c
Figure 2의 아래 절반이 저자들이 실제로 만든 부분입니다. 왼쪽이 해독이고 기록에서 그림으로 갑니다. i, ii, iii 세 줄이고 각각 한 조각씩 더합니다. 오른쪽이 부호화이고 분석을 위해 반대 방향으로 갑니다. 가운데 범례가 어떤 상자가 얼려 있고 어떤 상자가 학습되는지 알려 줍니다.
그림 2 읽기
Figure 2에서 빨간 화살표를 세어 보세요. 아주 적습니다. 빨간색은 그 자리에 선형 모델을 맞췄다는 뜻이고, 학습은 그것뿐입니다. 초록은 복사, 검정은 그대로 둔 것을 뜻합니다. 부호기와 복원기, U자형 신경망, 텍스트 모델 모두 손대지 않았습니다. 저자들은 이 논문 어디에도 미세조정이 없다고 밝힙니다.
그 지점에 좀 더 머물겠습니다
그 지점에 좀 더 머물겠습니다. 이 논문이 왜 지금 나왔는지를 설명하거든요. 생성 모델은 학습이 매우 어렵고 거대한 데이터셋이 필요합니다. 그만큼의 뇌 데이터를 가진 사람은 없고 앞으로도 없을 겁니다. 반면 선형 모델은 한 사람의 데이터로 맞출 만큼 변수가 적습니다. 그래서 문제는 둘 사이의 선을 어디에 긋느냐가 됐습니다. 이 논문은 가능한 한 뒤쪽에 긋고, 그것이 설계의 전부입니다.
논문 그림 1
Figure 1이 결과이고, 많은 사람이 본 적 있는 그림입니다. 위쪽 줄이 그 사람이 실제로 본 것입니다. 아래쪽 줄이 뇌 기록에서 나온 것입니다. 곰 인형은 화면 가운데의 부드럽고 갈색인 무언가로 남습니다. 파란 하늘의 비행기는 파란 넓은 면 위의 형태로 남습니다.
그림 1 읽기
Figure 1에서 무엇이 살아남고 무엇이 아닌지 열마다 보겠습니다. 전체 배치는 거의 매번 살아남습니다. 범주도 대개 살아남아서 기차는 기차로 남습니다. 정체성은 절대 살아남지 않습니다. 그 기차가 아니라 어떤 기차입니다. 그 구분이 논문 셋 전체를 관통하고 끝까지 사라지지 않습니다.
논문 그림 3
Figure 3은 방법을 뜯어 각 입력이 무슨 일을 하는지 보여 줍니다. 둘째 열은 설명 없이 그림 코드만 씁니다. 맞는 색의 덩어리가 대략 맞는 자리에 나옵니다. 셋째 열은 배치 없이 설명만 씁니다. 맞는 종류의 물체가 생성 모델 마음대로 배치돼 나옵니다.
그림 3 읽기
Figure 3의 마지막 열이 두 입력을 함께 쓴 것입니다. 결과가 둘 중 어느 쪽보다 낫고, 그것이 주장입니다. 모델만이 아니라 뇌에 관한 주장이기도 합니다. 서로 다른 두 영역이 정말로 다른 종류의 정보를 담고 있었다는 것입니다. 같은 것을 담고 있었다면 합쳐도 얻는 것이 없었을 겁니다.
논문 그림 4 a
Figure 4는 같은 사진을 네 사람에게서 복원한 결과입니다. 각자 자기 촬영분으로 맞춘 자기만의 선형 모델을 가집니다. 맨 왼쪽 열이 넷 모두가 본 사진입니다. 그 뒤 네 열은 서로 눈에 띄게 다릅니다. 특히 한 참가자는 나머지보다 훨씬 나쁘게 나옵니다.
그림 4 읽기
Figure 4의 편차를 짚고 가겠습니다. 뒤에서 다시 나옵니다. 저자들은 그것을 각자의 기록 품질 탓으로 봅니다. 어떤 사람은 더 잘 가만히 있고, 어떤 사람은 신호가 더 또렷합니다. 그건 방법이 아니라 사람에 속한 성질입니다. 세 번째 논문이 이것을 진지하게 받아들여 우회하려 합니다.
논문 그림 4
Figure 4 전체입니다. 줄이 읽히게 두 쪽으로 갈랐습니다. 사진 여덟 장에 사람 넷씩이라 한 쪽에 복원 32개입니다. 결과를 보여 주는 공정한 방식이고, 모든 논문이 이렇게 하지는 않습니다. 가장 좋은 예만 보이면 편차가 통째로 가려집니다. 이번 편의 논문 셋 모두 성공과 실패를 함께 보입니다.
수치를 보기 전에 채점 방식을 짚겠습니다
수치를 보기 전에 채점 방식을 짚겠습니다. 지표가 두 묶음으로 나뉘고 서로 다른 질문에 답합니다. 첫째 묶음은 화소 단위로 똑같아 보이느냐를 묻습니다. 화소 상관, 구조 유사도, 그리고 시각 신경망의 앞쪽 층입니다. 둘째 묶음은 같은 것이냐를 묻고, 이쪽이 더 어렵습니다. 같은 신경망의 뒤쪽 층과, 맞는 사진을 찾아낼 수 있는지입니다.
논문 그림 5
Figure 5가 그것을 막대로 바꿔 두 가지 방식으로 잽니다. 과제는 식별이고, 들리는 것보다 단순합니다. 복원 결과와 사진 두 장을 주고 어느 쪽에서 나왔는지 묻습니다. 우연은 50%이고 칸을 가로지르는 점선이 그것입니다. 왼쪽 칸은 신경망이 판정하고 오른쪽 칸은 사람이 판정합니다.
그림 5 읽기
Figure 5에서 쓸모 있는 것은 두 칸이 일치한다는 점입니다. 자동 채점은 편하지만 의도하지 않아도 속아 넘어갈 수 있습니다. 사람이 보기엔 말이 안 되는 그림도 점수가 잘 나올 수 있습니다. 여기서는 사람 평가자가 자동 평가와 같은 결론에 닿습니다. 그래서 논문 나머지의 수치가 설 자리가 생깁니다.
논문 그림 6
Figure 6은 방법을 뒤집어 신경과학 질문을 합니다. 뇌에서 그림을 예측하는 대신 그림에서 뇌를 예측합니다. 그림 코드를 넣고 어느 복셀을 잘 예측하는지 봅니다. 그다음 텍스트 코드로 같은 일을 하고 두 지도를 비교합니다. 지도는 펼친 뇌 위에 그려서 뒤쪽이 왼쪽에 있습니다.
그림 6 읽기
Figure 6의 두 지도가 서로 다른 자리에서 밝아지고, 그것이 결과입니다. 그림 코드는 시각이 시작되는 영역을 예측합니다. 텍스트 코드는 그보다 앞쪽, 의미를 다루는 영역을 예측합니다. 해독 쪽이 세운 가정과 들어맞습니다. 설계 선택과 뇌 데이터가 같은 이야기를 하는 것입니다.
논문 그림 7
Figure 7은 출발점이 더 흐려지면 어떻게 되는지를 묻습니다. 생성 모델은 잡음 대신 그림에서 시작할 수 있다고 했습니다. 시작 전에 잡음을 얼마나 더하느냐가 돌릴 수 있는 손잡이입니다. 잡음이 적으면 원래 배치가 출력까지 살아남습니다. 많으면 배치가 씻겨 나가고 설명이 주도권을 잡습니다.
그림 7 읽기
Figure 7 아래의 지도가 손잡이를 돌릴수록 움직입니다. 잡음이 적으면 밝은 영역이 배치를 담당하는 뒤쪽에 있습니다. 잡음이 많으면 의미를 담는 앞쪽으로 옮겨 갑니다. 같은 출력이 뇌의 다른 부분에 의해 움직이고 있다는 뜻입니다. 저자들은 이것으로 대응이 우연이 아니라고 주장합니다.
논문 그림 8
Figure 8은 잡음이 아니라 시간에 대해 비슷한 질문을 합니다. 잡음 걷어 내기는 여러 단계로 돌고 중간에 멈출 수 있습니다. 과정 초반에는 결과가 아직 대부분 잡음입니다. 후반에는 세부가 채워지고 있습니다. 지도가 그 과정에 걸쳐 비슷한 방식으로 움직입니다.
논문 그림 9
Figure 9는 잡음 걷어 내는 신경망 안으로 들어갑니다. 그 신경망에는 층이 있고 층마다 다른 종류의 특징을 담습니다. 저자들은 여러 깊이에서 특징을 뽑아 각각으로 뇌를 예측합니다. 신경망의 앞쪽 층이 뇌의 앞쪽 영역을 예측합니다. 뒤쪽 층은 뒤쪽 영역을 예측하고, 순서가 끝까지 유지됩니다.
그림 9 읽기
Figure 9가 무엇을 입증하는지 조심해서 말하겠습니다. 두 순서 사이의 대응이고, 그것이 전부입니다. 신경망이 시각 체계와 같은 방식으로 작동한다는 말이 아닙니다. 저자들도 기전이 아니라 관찰로 내놓습니다. 그리고 이런 분석은 이 모델들이 나오기 전에는 불가능했다고 덧붙입니다.
논문 그림 2
Figure 2 전체를 두 쪽으로 보겠습니다. 위가 빌려 온 생성 모델, 아래가 저자들이 만든 것입니다. 그 두 절반의 비율이 논문의 요점입니다. 능력의 거의 전부가 이미 있던 것에서 왔습니다. 기여는 아주 단순한 모델을 어디에 붙일지 아는 것입니다.
두 번째 논문은 같은 해에 나왔고 다른 길을 갑니다
두 번째 논문은 같은 해에 나왔고 다른 길을 갑니다. 두 영역에서 코드 둘을 뽑는 대신 전부를 한 공간에 넣습니다. 그 공간으로 가는 사상은 선형이 아니라 학습하는 신경망입니다. 그리고 한 가지가 아니라 두 가지 일을 하는데, 그게 중요해집니다. 하나는 그림을 만드는 일, 다른 하나는 원래 사진을 찾는 일입니다. 세 번째 논문이 두 설계를 직접 비교하니 둘 다 볼 가치가 있습니다.
쓰는 공간을 설명하고 가겠습니다
쓰는 공간을 설명하고 가겠습니다. 하는 일이 많습니다. 수백만 장의 사진과 설명 쌍으로 학습한 모델이 있습니다. 사진과 그 설명을 공간의 같은 지점에 놓는 법을 배웠습니다. 저자들은 거기에 세 번째를 더합니다. 뇌 패턴입니다. 기록이 그 공간에 닿으면 그 공간을 읽는 어떤 모델이든 쓸 수 있습니다. 뒤쪽의 어느 것도 뇌가 관여했다는 사실을 알 필요가 없습니다.
논문 그림 1
두 번째 논문의 Figure 1이 결과이고 배치가 같습니다. 위가 본 이미지, 아래가 복원이고 예시가 한 줄입니다. 그림이 첫 논문보다 눈에 띄게 또렷합니다. 물체가 색 덩어리가 아니라 물체로 알아보입니다. 장면은 대개 맞고, 그 사진 자체는 여전히 아닙니다.
그림 1 읽기
Figure 1을 앞선 논문과 비교하면 향상이 어디서 왔는지 보입니다. 두 논문 모두 같은 사람들의 같은 기록을 썼습니다. 둘 다 확산 모델을 학습하지 않고 빌려 썼습니다. 달라진 것은 기록을 모델이 읽는 형태로 바꾸는 방식입니다. 선형 사상 둘 대신 하나의 공유 공간에 학습된 신경망입니다.
논문 그림 2 a
Figure 2의 위쪽 절반이 그림을 만드는 갈래입니다. 복셀이 큰 신경망에 들어가 임베딩을 내놓습니다. 그 임베딩은 공유 공간에서 사진이 있는 자리에 놓여야 합니다. 그다음 작은 모델이 그것을 다듬는데, 확산 사전확률이라 부릅니다. 오른쪽의 생성 모델이 결과를 읽고 그립니다.
이 모델이 하는 두 일은 같은 출력에서 서로 다른 것을 원합니다
이 모델이 하는 두 일은 같은 출력에서 서로 다른 것을 원합니다. 그림을 만들려면 임베딩이 정확히 그림이 있는 자리에 있어야 합니다. 사진을 찾으려면 틀린 모든 사진에서 멀리 떨어져 있어야 합니다. 둘은 같지 않고, 한쪽을 위해 학습하면 다른 쪽이 나빠집니다. 그래서 모델은 몸통 하나에 머리 둘이고, 각각 다른 손실을 씁니다. 세 번째 논문이 서로 얼마나 손해를 주는지 정확히 잽니다.
논문 그림 2 b
Figure 2의 아래쪽 절반이 훨씬 흐릿한 두 번째 출력입니다. 기록을 첫 논문이 쓴 그 작은 코드로 사상합니다. 그 자체로는 알아볼 내용이 전혀 없는 번진 자국입니다. 하지만 색과 대략의 배치가 맞는 자리에 있습니다. 그래서 잡음 대신 확산의 출발점으로 씁니다.
그림 2 읽기
Figure 2의 두 절반을 합치면 또렷함이 설명됩니다. 흐릿한 출력이 화면에서 물체의 자리를 정합니다. 임베딩이 그 물체가 무엇인지를 정합니다. 첫 논문이 한 것과 같은 분업입니다. 다른 점은 둘 다 선형 적합 둘이 아니라 학습된 신경망 하나에서 나온다는 것입니다.
논문 그림 2
두 번째 논문의 Figure 2 전체를 두 쪽으로 보겠습니다. 첫 논문보다 학습하는 부품이 훨씬 많습니다. 큰 신경망, 사전확률, 투영기, 그리고 별개의 손실 둘입니다. 그래도 전부 손대지 않은 생성 모델 앞에 붙어 있습니다. 빌린 것과 맞춘 것 사이의 선이 옮겨졌을 뿐 사라지지 않았습니다.
논문 그림 3
Figure 3은 다른 일이고 복원이 전혀 아닙니다. 뇌 패턴을 받아 사진 더미에서 본 것을 찾습니다. 후보 982장 중에서 93.6% 맞힙니다. 거기서 우연은 0.1%쯤입니다. 그림의 오른쪽 절반은 수십억 장의 데이터베이스에서 찾습니다.
그림 3 읽기
Figure 3의 검색 결과는 복원과 다른 것을 뜻합니다. 복원은 그 사람이 무엇을 보고 있었는지 종류를 알려 줍니다. 검색은 알려진 집합 중에서 정확히 어느 이미지인지 알려 줍니다. 잠깐만 생각해 보면 함의가 아주 다릅니다. 저자들은 검색이 이미지가 더미 안에 있을 때만 된다고 짚습니다.
논문 그림 4
Figure 4가 모델을 한 조각씩 뜯어 봅니다. 사전확률을 빼고, 저수준 갈래를 빼고, 둘 다 빼 봅니다. 뺄 때마다 그림이 서로 다른 방식으로 눈에 띄게 나빠집니다. 사전확률이 없으면 내용이 본 것에서 멀어집니다. 저수준 갈래가 없으면 배치가 안 맞기 시작합니다.
논문 표 1
Table 1에서 이 논문을 앞선 모든 것과 비교합니다. 행이 방법이고 열이 앞서 본 여덟 가지 지표입니다. 각 열 옆의 화살표가 어느 방향이 좋은지 알려 줍니다. 위는 높을수록, 아래는 낮을수록 좋다는 뜻입니다. 이번 편 앞부분에서 본 논문이 행 중 하나입니다.
표 1 읽기
Table 1은 한 열보다 한 행을 가로로 읽는 편이 많은 것을 알려 줍니다. 모든 지표에서 이기는 방법은 없고, 이 논문도 마찬가지입니다. 저수준 묶음에서 이기고 고수준 묶음에서 질 수 있습니다. 그림이 흐릿한데 배치가 맞을 때 그런 일이 일어납니다. 그래서 이 논문들 모두가 숫자 옆에 그림을 함께 싣습니다.
논문 표 2
Table 2는 검색 결과를 예시가 아니라 숫자로 보고합니다. 정방향 검색은 뇌 패턴에서 사진을 찾는 것입니다. 역방향 검색은 반대 방향입니다. 둘 다 보고하는 이유는 한쪽만 잘할 수 있기 때문입니다. 그리고 둘 다 앞선 방법들보다 한참 위입니다.
논문 표 3
Table 3이 방금 본 그림의 수치판입니다. 사전확률을 빼면 고수준 점수가 가장 크게 떨어집니다. 저수준 갈래를 빼면 저수준 점수가 가장 크게 떨어집니다. 예상대로이고, 확인했다는 점이 좋습니다. 전체 모델만 보이는 논문은 이 부분을 추측하게 만듭니다.
논문 표 4
Table 4는 끝에 어느 생성 모델을 붙일지를 묻습니다. 같은 임베딩을 서로 다른 이미지 모델 여럿에 넣습니다. 점수가 달라지고, 실용적인 이유로 알아 둘 만합니다. 더 좋은 생성 모델이 나오면 전체가 좋아진다는 뜻입니다. 뇌 쪽을 다시 학습하지 않고도요. 이 설계의 매력입니다.
세 번째 논문은 앞의 둘이 다루지 않은 문제를 집습니다
세 번째 논문은 앞의 둘이 다루지 않은 문제를 집습니다. 지금까지의 모든 결과가 읽을 사람에게서 40시간의 촬영을 필요로 했습니다. 아프거나 바쁘거나 참을성 없는 사람에게는 돌릴 수 없는 연구입니다. 그래서 저자들은 7명으로 미리 학습하고 여덟 번째 사람에게 맞춥니다. 그 사람의 1시간 데이터로요. 전체의 2.5%입니다. 스캐너 한 번 방문이고, 초록에 넣은 문장이 그것입니다.
여러 사람으로 미리 학습하는 데는 분명한 장애물이 있습니다
여러 사람으로 미리 학습하는 데는 분명한 장애물이 있습니다. 뇌는 모양이 다르고 사람마다 측정값 개수가 다릅니다. 어떤 참가자는 14,278개이고 다른 참가자는 17,907개입니다. 먼저 무언가 하지 않으면 같은 신경망에 넣을 수 없습니다. 그래서 각자 작은 선형 단계를 거쳐 크기가 정해진 공유 공간으로 들어갑니다. 그 뒤는 전부 공유이고, 그 단계만 사람마다 다릅니다.
논문 그림 2
세 번째 논문의 Figure 2가 전체 흐름을 한 쪽에 담았습니다. 왼쪽이 참가자 목록과 복셀 수입니다. 각자 가운데 공유 공간으로 들어가는 자기 화살표를 가집니다. 그 뒤에는 몸통 하나가 있고 전부로 한꺼번에 학습합니다. 그리고 머리 셋이 나옵니다. 그림, 검색, 배치입니다.
그림 2 읽기
Figure 2의 점선 상자를 짚고 가겠습니다. 새 사람에게 맞추는 부분을 표시한 것입니다. 그 바깥의 거의 전부는 다른 일곱 명에게서 배운 것입니다. 새 사람은 능력이 아니라 정렬을 공급하는 셈입니다. 한 시간에 요구할 만한 것은 그쪽이고 나머지는 아닙니다.
논문 그림 1
세 번째 논문의 Figure 1이 결과를 그림으로 말합니다. 기린 사진 한 장을 여섯 번 복원했습니다. 각 열이 그 사람 자신의 데이터를 서로 다른 양만큼 썼습니다. 왼쪽 10분부터 오른쪽 40시간까지입니다. 위 줄은 미리 학습했고 아래 줄은 아닙니다.
그림 1 읽기
Figure 1에서 볼 열은 1시간이라고 적힌 열입니다. 위 줄은 이미 마른 풍경에 선 동물을 보여 줍니다. 같은 열의 아래 줄은 들판의 기계입니다. 두 모델 모두 그 사람에게서 정확히 같은 양의 데이터를 봤습니다. 차이는 전적으로 그 사람을 만나기 전에 무엇을 알고 있었느냐입니다.
그 숫자를 실용적인 표현으로 옮겨 보겠습니다
그 숫자를 실용적인 표현으로 옮겨 보겠습니다. 스캐너에서 한 시간은 한 번 예약한 한 번의 방문입니다. 가서 찍고 그날 아침에 집에 옵니다. 40시간은 몇 달에 걸친 30~40번의 방문입니다. 실제로 이것을 원할 거의 모든 사람을 배제합니다. 대가는 모델 대부분이 다른 사람들의 뇌에서 온다는 점입니다.
논문 그림 4
세 번째 논문의 Figure 4가 이번 편의 모든 것과 비교합니다. 여섯 줄이고 각 열에 사진 한 장이 내려갑니다. 둘째 줄이 40시간을 다 쓴 이 논문입니다. 셋째 줄이 미리 학습하지 않은 같은 모델입니다. 맨 아래 줄이 이번 편 첫 논문이고 2022년 것입니다.
그림 4 읽기
Figure 4의 한 열을 내려 읽으면 3년치 연구의 요약이 됩니다. 맨 아래는 대략 맞는 색이 흐릿하게 배치된 것입니다. 가운데는 맞는 범주의 알아볼 수 있는 물체입니다. 맨 위는 누군가 찍은 사진처럼 보이는 장면입니다. 그래도 그들이 보고 있던 그 사진은 아닙니다.
논문 그림 3
세 번째 논문의 Figure 3은 다른 둘이 하지 않은 것을 보여 줍니다. 모델이 본 것이라고 생각하는 바를 문장으로도 씁니다. 싣고 있는 예시에서는 탁자에 앉은 고양이입니다. 그 설명은 그림과 같은 임베딩에서 나옵니다. 이 시리즈의 언어 쪽과 이미지 쪽이 여기서 만납니다.
논문 그림 5
세 번째 논문의 Figure 5가 모든 지표를 촬영 시간에 대해 그립니다. 실선은 미리 학습한 것, 점선은 처음부터 학습한 것입니다. 왼쪽 끝에서 점선은 불안정하고 때로 의미가 없습니다. 데이터가 늘수록 둘의 차이가 좁혀집니다. 예상대로입니다. 40시간에서는 대략 같은 자리에 도착합니다.
그림 5 읽기
Figure 5에서 선 하나가 반대로 가는데, 저자들이 설명합니다. 구조 유사도 점수가 모델이 좋아질수록 나빠집니다. 말이 안 되는 출력도 그 지표에서는 점수가 잘 나올 수 있어서입니다. 회색 번짐이 사진의 평균 구조와 꽤 잘 맞습니다. 저자들은 이 지표가 좋은 지표가 아닐 수 있다고 분명히 말합니다.
논문 표 1
세 번째 논문의 Table 1이 이번 편의 모든 방법을 한자리에 놓습니다. 첫 행이 40시간을 다 쓴 전체 모델입니다. 아래쪽 한 행이 1시간만 쓴 같은 모델입니다. 그 사이 행들이 앞선 논문이고 나머지 둘도 들어 있습니다. 굵은 글씨가 각 열의 1위, 밑줄이 2위입니다.
표 1 읽기
Table 1에서 비교할 행은 1시간짜리와 2022년 논문입니다. 1시간 모델은 자기 참가자의 데이터를 2.5%만 썼습니다. 그런데도 대부분의 열에서 앞섭니다. 전부는 아니고, 저자들도 그렇게 주장하지 않습니다. 1시간 판이 가장 많이 내주는 쪽은 저수준 열들입니다.
논문 표 2
Table 2는 그림이 아니라 설명을 채점합니다. 기계 번역에서 가져온 표준 글 지표를 씁니다. 비교 대상은 설명을 내놓던 앞선 방법입니다. 수치가 더 좋은데, 저자들은 비교가 정확하지 않다고 밝힙니다. 두 방법이 기준 설명을 서로 다른 방식으로 만들었기 때문입니다.
논문 표 3
Table 3은 복원 결과를 사진이 아니라 뇌에 대해 채점합니다. 복원 결과를 시각 체계 모델에 보여 주고 기록을 예측합니다. 그 예측이 실제 측정과 얼마나 맞는지 봅니다. 흥미롭게도 여기서는 다듬지 않은 판이 가장 좋습니다. 그림을 자연스럽게 만드는 일이 뇌와의 정렬을 깎는다는 뜻입니다.
논문 표 4
Table 4는 같은 모델의 이전 판과 비교한 제거 실험입니다. 각 행이 저자들이 더한 것을 하나씩 빼거나 바꿉니다. 아래쪽 검색 수치가 가장 분명한 사례입니다. 정방향 97.4%이고 이전 판은 84.9%입니다. 맞추기가 더 싸진 모델치고는 큰 향상입니다.
논문 표 5
Table 5가 제가 가장 꼼꼼히 읽을 표입니다. 세 갈래의 조합을 달리해 모델을 학습합니다. 사전확률만, 사전확률과 저수준, 사전확률과 검색, 그리고 셋 다입니다. 갈래들이 서로에게 얼마나 손해를 주는지 보려는 것입니다. 답은 네 설정 중 어느 것도 모든 곳에서 이기지 않는다는 것입니다.
표 5 읽기
Table 5의 검색 행을 보고 그다음 복원 행들을 보겠습니다. 검색은 검색 갈래만 따로 학습했을 때 가장 좋습니다. 복원은 세 갈래를 함께 학습했을 때 가장 좋습니다. 앞서 말한 대로 목표들이 실제로 서로를 당깁니다. 저자들은 그래도 셋을 다 두고, 이유를 한 문장으로 밝힙니다.
마무리 전에 지난 편이 끝난 지점과 이어 보겠습니다
마무리 전에 지난 편이 끝난 지점과 이어 보겠습니다. 스캐너는 머리가 조금만 움직여도 아주 민감하게 반응합니다. 읽히고 싶지 않은 사람은 그냥 움직이면 됩니다. 세 번째 논문의 저자들은 이 점에서 언어 연구를 직접 인용합니다. 다른 생각을 하는 것은 이미지 해독에도 통합니다. 그리고 첫 선형 단계는 여전히 특정한 한 사람에게 맞춰집니다.
세 논문이 기여라고 내세우는 것을 모아 보겠습니다
세 논문이 기여라고 내세우는 것을 모아 보겠습니다. 첫 논문은 빌려 온 생성 모델과 선형 적합이면 충분함을 보였습니다. 그리고 두 뇌 영역이 그 생성 모델의 서로 다른 두 부분을 공급함을 찾았습니다. 둘째는 사진과 설명, 뇌 패턴을 한 공유 공간에 넣었습니다. 그리고 모델을 그리는 갈래와 찾는 갈래로 나눴습니다. 셋째는 새 사람의 촬영을 40시간에서 1시간으로 줄였습니다.
한계는 감춰져 있지 않고, 전부 말할 가치가 있습니다
한계는 감춰져 있지 않고, 전부 말할 가치가 있습니다. 사진의 세부는 어느 논문에서도 복원되지 않습니다. 전부 한 공개 모음의 평범한 사진입니다. 7테슬라 장비 안에서의 그 한 번도 가벼운 일정이 아닙니다. 첫 단계는 여전히 사람마다 맞추고 옮겨지지 않습니다. 그리고 조금 움직이거나 다른 생각을 하면 멈춥니다.
논문 셋과 3년을 지나고 나면 무엇으로 남을까요?
논문 셋과 3년을 지나고 나면 무엇으로 남을까요? 나오는 그림은 들어간 사진이 아닙니다. 나오는 것은 맞는 장면이, 있던 대로 대략 배치되어, 혈류에서 끌려 나온 것입니다. 그것을 가능하게 한 것은 더 좋은 스캐너나 전극이 아닙니다. 다른 어딘가에서 이미지 모델이 빌려 쓸 만큼 좋아졌다는 것입니다. 그리고 당신 것으로 남는 부분은 가만히 있기로 동의한 그 한 시간입니다. 봐 주셔서 감사합니다.
이 강에서 다룬 것
- 언어에서 이미지로 넘어가며 평가가 어려워진다는 점
- 7테슬라로 1만 장씩 40시간을 찍은 데이터셋
- 확산 모델이 잡음을 걷어 내는 과정
- 512×512를 64×64로 48배 줄이는 이유
- 초기 시각 피질과 상위 시각 피질의 두 갈래
- 확산 모델은 얼려 두고 선형 모델만 맞춘다는 점
- 여덟 가지 평가 지표와 CLIP 공간
- 7명으로 미리 학습해 새 사람을 1시간으로 줄인 방법