AI 이미지 생성

텍스트→이미지 vs. 이미지→이미지: 완전히 다른 두 가지

Alice(AI Agent 데스크톱 앱)를 예로: 동일한 "Alice가 서재에 있는 이미지 생성" 요청도, 참조 이미지의 유무에 따라 결과 품질이 천차만별입니다. 이것은 PM이 이미지 생성 기능 설계 시 반드시 파악해야 할 첫 번째 결정 사항입니다.

두 가지 모드, Alice로 살펴보기

텍스트→이미지 (Text-to-Image)

입력: 텍스트만
"앨리스가 서재에서 책을 읽는 장면, 따뜻한 조명, 책장 배경, 파란 원피스와 하얀 앞치마"
모델이 상상력으로 생성
T2I 결과: 앨리스가 서재에서

모델이 텍스트 설명에 따라 생성하지만, 매번 캐릭터의 외모는 완전히 달라집니다

이미지→이미지 (Image-to-Image)

입력: 참조 이미지 + 텍스트
Alice 캐릭터 참조 시트
참조 이미지 + "Alice가 서재에서 업무 중, 노트북, 따뜻한 색조"
참조 이미지를 기준으로 생성
I2I 결과: Alice가 서재에서 업무 중

모델이 참조 이미지로 외모를 제약하여 Alice가 매번 동일하게 나타납니다

핵심 차이: T2I는 무에서 유를 창조하는 것으로, 모델이 매번 다르게 Alice를 상상합니다. I2I는 이미지를 기준점으로 삼아, 참조 이미지가 Alice의 외모를 고정하고 모델은 이 제약 안에서 장면과 동작만 변환합니다.
어떤 시나리오에 어떤 모드를?
시나리오 권장 모드 이유
순수 배경/환경 이미지 T2I 캐릭터가 없으므로 장면 설명만으로 충분
음식, 사물 클로즈업 T2I 인물 일관성 제약 불필요
캐릭터 등장 (Alice가 무언가 하는 장면) I2I 여전히 Alice여야 하므로 참조 이미지로 고정 필요
캐릭터 의상 변경 I2I 얼굴은 그대로 옷만 바꾸려면 얼굴 참조 필수
다중 장면 시리즈 이미지 I2I 세트 내 캐릭터 외모가 일관되어야 함
창의적 탐구/콘셉트 발굴 T2I 외모를 고정할 필요 없이 다양할수록 좋음
T2I = 무에서 유 창조, 일관성이 불필요한 시나리오에 적합; I2I = 이미지를 기준점으로, 캐릭터가 안정적으로 유지되어야 하는 시나리오에 적합합니다. Alice와 같이 고정된 외모가 있는 제품에서는 대부분의 이미지 생성이 I2I를 사용합니다. 사용자는 "매번 Alice가 달라 보이는 것"을 받아들일 수 없기 때문입니다.