제로 챕터 · 왕초보 FAQ
어떤 AI는 왜 이미지를 「못 알아볼까요」?
이런 경험 있으실 거예요: AI에게 사진을 보냈더니 「죄송해요, 글로 설명해 주세요」라는 답이 온 것. 반면 사진 속 레시피까지 다 읽어내는 AI도 봤죠. 같은 AI인데 뭐가 다를까요?
한 줄 답변
「말하기」와 「보기」는 서로 독립적인 두 가지 능력이기 때문이에요. 언어 모델은 태생적으로 글만 알아봐요. 사진을 보게 하려면 「눈」을 따로 달아 줘야 하죠 — 단 것은 멀티모달 모델이라 부르고, 안 단 것은 사진 앞에서 죄송하다는 말밖에 못 해요.
작은 실험 · 두 모델에게 고양이 사진을 하나씩 보내 보세요
모델 A · 텍스트 전용 모델(눈이 없음)
🖼️ 고양이사진.jpg
「죄송해요, 저는 이미지를 볼 수 없어요. 사진 내용을 설명해 주시면 분석을 도와드릴게요.」
「죄송해요, 저는 이미지를 볼 수 없어요. 사진 내용을 설명해 주시면 분석을 도와드릴게요.」
모델 B · 멀티모달 모델(눈이 달림)
🖼️ 고양이사진.jpg
「치즈 고양이 한 마리가 창가에 엎드려 햇볕을 쬐고 있고, 오른쪽 앞발로 털실 뭉치를 누르고 있네요. 체형을 보아하니… 이 친구는 식단 조절이 좀 필요할지도요 😄」
「치즈 고양이 한 마리가 창가에 엎드려 햇볕을 쬐고 있고, 오른쪽 앞발로 털실 뭉치를 누르고 있네요. 체형을 보아하니… 이 친구는 식단 조절이 좀 필요할지도요 😄」
원리 · 「눈」은 어떻게 달아 줄까요
1단계: 그림을 잘게 자르기
「눈」(비전 인코더)이 이미지를 수많은 작은 조각으로 자르고, 조각마다 모델이 아는 「단어」로 번역해요 — 사진 한 장이 특별한 「글」 한 단락으로 바뀌는 거예요.
2단계: 말처럼 이어받기
번역이 끝나면, 모델에게 이미지는 글 한 단락과 다를 게 없어요. 평소처럼 「말을 이어받으면」 되죠. 그러니 이미지를 보는 능력의 본질도 결국 그 말 이어받기 기계예요.
왜 전부 달지 않을까요?
눈을 달려면 방대한 「이미지 + 글」 짝 데이터로 다시 훈련해야 해서 비용이 크고, 모델도 더 크고 비싸져요. 이미지를 볼 일이 없는 시나리오도 많아서, 텍스트 전용 모델이 오히려 더 빠르고 저렴해요.
자주 헷갈리는 것 하나를 짚고 갈게요: 「이미지를 알아보는 것」과 「이미지를 그려내는 것」도 별개의 일이에요. 이미지를 보는 모델이 꼭 이미지를 생성할 수 있는 건 아니에요 — 전자는 「눈」이고, 후자는 완전히 다른 「그림 그리는 손」이거든요(다음 페이지에서 왜 그렇게 비싼지 다뤄요). 여러분이 쓰는 AI 앱이 보고 그리는 걸 다 한다면, 무대 뒤에서 서로 다른 모델 여러 개를 함께 연결해 둔 거예요.
✅ 이 페이지에서 나누고 싶은 것
- 말하기 ≠ 보기: 이미지를 보려면 별도의 「눈」(비전 인코더)이 필요해요
- 눈의 원리: 그림을 잘게 잘라 「특별한 글」로 번역한 뒤, 평소처럼 말을 이어받아요
- 눈이 없다고 뒤처진 게 아니에요: 더 빠르고 저렴해서, 많은 시나리오에 충분해요
- 보기와 그리기는 별개: 만능 앱 뒤에는 여러 모델이 분업하고 있어요