Gemini·Grok·GPT Image 2.0에서 2개 참조 이미지로 일관된 캐릭터 시트 생성하는 팁
두 장의 참조 이미지를 결합하여 4방향 전신 뷰, 8가지 표정, 6가지 포즈가 담긴 고해상도 캐릭터 시트를 생성하는 프롬프트 구조와 워크플로우 팁을 정리합니다.
AI 이미지 크리에이터 소아이마(@Soaima_Ai)가 2026년 10월 5일, 두 장의 레퍼런스 이미지를 결합해 인물 얼굴과 스타일의 시각적 일관성을 유지하면서 4방향 전신 뷰, 8가지 표정, 6가지 포즈를 한 장의 시트에 담아내는 캐릭터 레퍼런스 시트 생성 프롬프트를 공개했습니다.

이미지 출처: @Soaima_Ai / X
생성형 AI로 웹툰, 게임 원화, 3D 모델링, 영상 제작을 위한 캐릭터를 기획할 때 가장 큰 장벽은 각도와 표정이 바뀔 때마다 인물의 얼굴과 복장이 미묘하게 달라지는 '정체성 드리프트(identity drift)' 문제입니다. 이번에 공유된 워크플로우는 첫 번째 이미지에서 인물의 얼굴 아이덴티티와 우아한 비주얼 스타일을 가져오고, 두 번째 이미지에서 전문적인 멀티 섹션 레이아웃 구조를 가져와 결합하는 방식으로, Gemini, Grok, GPT Image 2.0 등 최신 비전·이미지 생성 모델에서 일관된 캐릭터 턴어라운드 시트를 손쉽게 구축할 수 있도록 설계되었습니다.
2장 참조 이미지 기반 워크플로우와 생성 단계
원작자가 제시한 워크플로우는 매우 직관적인 4단계 파이프라인으로 구성되어 있습니다.
- 모델 환경 준비: 다중 이미지 참조 입력과 고화질 이미지 생성을 지원하는 Gemini, Grok, 또는 GPT Image 2.0 웹 인터페이스를 실행합니다.
- 참조 이미지 2장 업로드: 인물의 고유한 얼굴과 외모 특징을 정의하는 증명사진 성격의 첫 번째 레퍼런스 이미지와, 원하는 분할 배치 및 섹션 디자인을 담고 있는 두 번째 레이아웃 레퍼런스 이미지를 함께 첨부합니다.
- 통합 프롬프트 입력: 인물의 동일성 유지 규칙과 패널별 요구사항이 명시된 프롬프트를 입력창에 붙여넣습니다.
- 이미지 및 영상 생성: 캐릭터 시트 이미지를 생성하고, 필요할 경우 이를 기반으로 일관된 캐릭터 영상 클립 생성 단계로 확장합니다.
이 방식의 핵심은 두 장의 이미지 역할을 명확히 분리하여 모델에 지시하는 점입니다. 첫 번째 이미지는 갈색 눈, 길고 어두운 갈색 웨이브 머리, 자연스러운 메이크업 등 고유한 인물 식별자 역할을 하고, 두 번째 이미지는 얇은 구분선과 베이지/크림 배경, 검은색 헤딩 텍스트를 가진 구조적 레이아웃의 기준점 역할을 수행합니다.
캐릭터 레퍼런스 시트 통합 프롬프트 전문
원작자가 공개한 영문 프롬프트 전문은 다음과 같습니다. 실무에서는 복사하여 그대로 사용할 수 있으며, 필요에 따라 인물의 기본 외모(헤어스타일, 눈 색상, 의상 컬러) 묘사 부분을 프로젝트에 맞게 수정하여 적용할 수 있습니다.
Create one unified, high-resolution character reference sheet by combining both provided reference images into a single cohesive design. Use the same woman and the same ID-photo facial identity consistently across every image, keeping her facial features, brown eyes, long dark-brown wavy hair, natural makeup, and overall appearance unchanged.
Show her in a clean white outfit, with front, 3/4, side, and back full-body views, plus close-up face and identity details, eight facial expressions, six body poses, and detailed clothing/accessory close-ups. Preserve the elegant visual style of the first reference while using the structured multi-section layout of the second reference, with clean black headings, thin dividers, neutral beige/cream backgrounds, soft natural lighting, realistic skin texture, sharp facial details, and professional character-sheet presentation.
Make all views look like the exact same person, with consistent face, hairstyle, body proportions, outfit, accessories, and lighting throughout. Do not change the identity or facial structure between panels, and do not introduce any unrelated person or different face.
프롬프트는 인물의 일관성을 강제하기 위해 엄격한 부정적 제약(Negative constraint)을 자연어로 명시하고 있습니다. 각 패널 간에 인물의 정체성이나 안면 골격 구조가 바뀌지 않도록 명시하고, 전혀 다른 인물이나 낯선 얼굴이 혼입되는 것을 원천 차단하는 지시를 포함하고 있습니다. 이러한 프롬프트 문맥은 단일 이미지 프롬프트보다 모델의 주의 집중 영역(attention map)을 좁혀주어 얼굴 변형 가능성을 대폭 낮춥니다.
프롬프트 세부 구조와 해상도 트레이드오프
이 프롬프트가 효과적인 결과를 도출하는 이유는 인물의 일관성 확보와 시각적 레이아웃 제어를 결합한 3가지 핵심 규칙에 기반하기 때문입니다.
- 정체성 앵커링(Identity Anchoring): 'ID-photo facial identity'라는 표현을 통해 기준이 되는 증명사진 수준의 정확한 이목구비를 모든 패널의 공통 앵커로 고정합니다.
- 체계적인 턴어라운드 구성: 정면(Front), 3/4 측면(3/4 view), 완전 측면(Side), 후면(Back)의 4방향 전신 뷰와 함께 8가지 표정 변화, 6가지 신체 동작 포즈, 의상 디테일을 한 시트에 체계화하여 3D 모델링이나 원화 작업에 필요한 모든 기준 정보를 한 번에 제공합니다.
- 레이아웃과 스타일의 분리 결합: 첫 번째 참조의 우아한 분위기와 두 번째 참조의 깔끔한 베이지색 그리드 레이아웃을 모델이 명확히 구분하여 학습·적용하도록 지시합니다.
동시에 실무 적용 시 주의해야 할 점도 있습니다. 단일 캔버스 안에 4방향 전신 뷰, 8개 표정, 6개 포즈, 의상 디테일까지 수십 개의 서브 패널을 밀집 배치할 경우, 이미지 생성 모델의 최대 출력 해상도(예: 1024x1024 또는 2048x2048) 한계로 인해 개별 서브 패널의 얼굴 선명도나 텍스처 해상도가 낮아질 수 있다는 점입니다. 따라서 고화질 결과물이 필요한 프로덕션 환경이라면 이 시트를 콘셉트 기획 및 턴어라운드 가이드로 먼저 활용한 뒤, 확정된 캐릭터의 개별 클로즈업 뷰를 별도로 업스케일하거나 분할 생성하는 보완 워크플로우를 권장합니다.
원문 출처
- Soaima 공식 X 포스트: Soaima_Ai (2026-10-05) - Character Reference Sheet Prompt