AI 이미지 생성
텍스트→이미지 vs. 이미지→이미지: 완전히 다른 두 가지
Alice(AI Agent 데스크톱 앱)를 예로: 동일한 "Alice가 서재에 있는 이미지 생성" 요청도, 참조 이미지의 유무에 따라 결과 품질이 천차만별입니다. 이것은 PM이 이미지 생성 기능 설계 시 반드시 파악해야 할 첫 번째 결정 사항입니다.
두 가지 모드, Alice로 살펴보기
텍스트→이미지 (Text-to-Image)
입력: 텍스트만
"앨리스가 서재에서 책을 읽는 장면, 따뜻한 조명, 책장 배경, 파란 원피스와 하얀 앞치마"
모델이 상상력으로 생성
모델이 텍스트 설명에 따라 생성하지만, 매번 캐릭터의 외모는 완전히 달라집니다
이미지→이미지 (Image-to-Image)
입력: 참조 이미지 + 텍스트
참조 이미지 + "Alice가 서재에서 업무 중, 노트북, 따뜻한 색조"
참조 이미지를 기준으로 생성
모델이 참조 이미지로 외모를 제약하여 Alice가 매번 동일하게 나타납니다
핵심 차이: T2I는 무에서 유를 창조하는 것으로, 모델이 매번 다르게 Alice를 상상합니다. I2I는 이미지를 기준점으로 삼아, 참조 이미지가 Alice의 외모를 고정하고 모델은 이 제약 안에서 장면과 동작만 변환합니다.
어떤 시나리오에 어떤 모드를?
| 시나리오 | 권장 모드 | 이유 |
|---|---|---|
| 순수 배경/환경 이미지 | T2I | 캐릭터가 없으므로 장면 설명만으로 충분 |
| 음식, 사물 클로즈업 | T2I | 인물 일관성 제약 불필요 |
| 캐릭터 등장 (Alice가 무언가 하는 장면) | I2I | 여전히 Alice여야 하므로 참조 이미지로 고정 필요 |
| 캐릭터 의상 변경 | I2I | 얼굴은 그대로 옷만 바꾸려면 얼굴 참조 필수 |
| 다중 장면 시리즈 이미지 | I2I | 세트 내 캐릭터 외모가 일관되어야 함 |
| 창의적 탐구/콘셉트 발굴 | T2I | 외모를 고정할 필요 없이 다양할수록 좋음 |
T2I = 무에서 유 창조, 일관성이 불필요한 시나리오에 적합; I2I = 이미지를 기준점으로, 캐릭터가 안정적으로 유지되어야 하는 시나리오에 적합합니다. Alice와 같이 고정된 외모가 있는 제품에서는 대부분의 이미지 생성이 I2I를 사용합니다. 사용자는 "매번 Alice가 달라 보이는 것"을 받아들일 수 없기 때문입니다.