AI 영상에 여러 캐릭터 넣기: 한 샷에 모두 담는 방법
모델에 모든 캐릭터를 주세요. 전원이 담긴 스틸 한 장을 첫 프레임으로 쓰거나, 여러 장을 받는 모델에 캐릭터마다 레퍼런스 이미지를 한 장씩 보냅니다.

여러 캐릭터가 나오는 AI 영상을 만들려면, 생성을 시작하기 전에 영상 모델에 모든 캐릭터를 주세요. 등장인물 전원을 스틸 한 장에 담아 클립의 첫 프레임으로 쓰거나, 여러 장을 받는 모델에 캐릭터마다 사진을 별도의 레퍼런스 이미지로 보내면 됩니다. 어느 방법도 클립 내내 모두를 알아볼 수 있게 유지된다고 보장하지 않으므로, 쓰기 전에 직접 보고 확인하세요.
내용은 2026-09-28에 확인한 Sume의 영상 생성 (영문), Video Router (영문), Image API (영문) 문서에서 가져왔습니다. 레퍼런스 개수 상한은 API가 현재 적용하는 검사 기준입니다. 코드 없이 하려면 에이전트 탭에서 장면을 설명하세요. 에이전트가 모델을 고르고, 비용을 쓰기 전에 먼저 확인을 받습니다.
AI 영상 하나에 여러 캐릭터를 어떻게 넣나요?
POST /v1/videos에는 문서화된 입력이 두 가지 있으며, 쓰임새가 서로 다릅니다.
- 첫 프레임으로 쓰는 스틸 한 장. 레퍼런스를 여러 장 받는 이미지 모델(ChatGPT Image 2.5는 최대 16장)로 캐릭터들을 이미지 한 장에 합쳐 확인한 뒤,
frame_type: "first_frame"과 함께frame_images에 담아 보내세요. 그러면 클립의 첫 프레임은 여러분이 승인한 단체 장면이 됩니다. 스틸 만드는 방법은 AI로 사진 두 장을 한 장으로 합치는 방법에서 다룹니다. - 캐릭터마다 레퍼런스 한 장. 각 사진을
input_references에type: "image_url"항목으로 보내고, 프롬프트에 장면을 설명하세요. 모델은 레퍼런스를 정확한 프레임이 아니라 시각적 가이드로 사용합니다. - 한 요청에 둘을 함께 쓰지는 마세요. 요청에
frame_images가 있으면 그쪽이 우선하고 요청은 이미지로 영상 만들기로 처리되며, 현재 코드에서는 이때 레퍼런스가 모델에 전달되지 않습니다. - 공개 HTTPS URL만 받습니다. 서명된 URL이나 비공개 URL은 생성 입력으로 거부되는데 Image API의 결과 URL은 서명된 URL이므로, 쓰기로 한 스틸은 먼저 여러분의 공개 HTTPS URL에 올려 두세요.
캐릭터 이미지를 여러 장 받는 영상 모델은 무엇인가요?
레퍼런스 지원은 모델마다 다릅니다. 아래 모델은 모두 첫 프레임을 받으므로, 합친 스틸은 모든 모델에서 쓸 수 있는 방법입니다.
| 모델 | 이미지 레퍼런스 | 프롬프트에서 개별 지칭 |
|---|---|---|
gemini-omni-flash-1.1 | 최대 10장 | 예: 목록 순서대로 <IMAGE_REF_0>, <IMAGE_REF_1>, … |
wan-3.0 | 최대 10장 | 문서에 없음 |
minimax-h3, minimax-h3-max | 최대 9장(모든 종류를 합쳐 레퍼런스 12개) | 문서에 없음 |
seedance-2.5, seedance-2, seedance-2-fast, seedance-2-mini | 예. 문서화된 상한은 없고, 레퍼런스가 모두 합쳐 12개를 넘으면 API가 거부 | 문서에 없음 |
kling-3, grok-imagine-video-1.5 | 없음 | 합친 스틸 한 장을 첫 프레임으로 사용 |
어느 캐릭터가 누구인지 모델에 어떻게 알려 주나요?
Gemini Omni Flash 1.1에서는 위치로 각 레퍼런스를 가리키세요. <IMAGE_REF_0>은 input_references의 첫 번째 이미지, <IMAGE_REF_1>은 두 번째 이미지이며, 목록 순서대로 0부터 셉니다. 문서는 이 토큰을 이 모델에 대해서만 설명합니다. 다른 모델에서는 옷차림이나 서 있는 위치로 각 캐릭터를 말로 묘사하고, 캐릭터마다 분명한 동작을 하나씩 주세요.
curl -X POST https://api.sume.com/v1/videos \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: two-characters-001" \
-d '{
"model": "gemini-omni-flash-1.1",
"prompt": "<IMAGE_REF_0> and <IMAGE_REF_1> sit across a cafe table. <IMAGE_REF_0> slides a cup of coffee over and <IMAGE_REF_1> laughs. Static medium shot, warm window light",
"input_references": [
{ "type": "image_url", "image_url": { "url": "https://example.com/character-a.png" } },
{ "type": "image_url", "image_url": { "url": "https://example.com/character-b.png" } }
],
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": 8
}'캐릭터끼리 대화하게 할 수 있나요?
생성된 클립 아래에 목소리를 까는 방식으로는 안 됩니다. Sume 문서에 따르면 영상 모델은 생성된 음성(TTS)이나 나중에 넣은 보이스오버에 립싱크하지 않습니다. 말하는 샷은 대신 립싱크 클립으로 만듭니다. 예를 들어 VEED Fabric 1.0(veed/fabric-1.0)은 스틸 한 장과 오디오 트랙 하나를 말하는 클립으로 바꿉니다. 대화라면 차례마다 말하는 클립을 하나씩 만들어 순서대로 이어 붙이세요. AI 아바타 대화 영상 API: 두 화자가 주고받는 대화가 아바타 영상으로 이 방법을 보여 줍니다.
모든 캐릭터를 끝까지 알아볼 수 있나요?
보장되지 않습니다. 첫 프레임은 시작 화면만 고정하고 그 뒤는 모두 생성되며, 레퍼런스는 모델을 가이드할 뿐입니다. 클립 전체를 보고, 캐릭터가 바뀌거나 사라지면 다시 생성하세요. 여러 샷에 걸쳐 같은 캐릭터를 유지하려면 여러 AI 영상 샷에서 캐릭터 일관성 유지하기를 참고하세요.
어떤 제한이 있나요?
- 모델별 레퍼런스 상한은 위 표에 있으며,
kling-3와grok-imagine-video-1.5는 레퍼런스를 받지 않습니다. - 클립 길이는 모델에 따라 다릅니다.
gemini-omni-flash-1.1은 3–10초,seedance-2.5와wan-3.0은 최대 30초, 나머지 모델은 최대 15초입니다. - 모든 이미지 URL은 공개 HTTPS여야 합니다.
- 클립은 모델별로 공급사 정가 × 1.25로 과금되며 제출 시 예약됩니다. 모델별 요율은
GET /v1/videos/models의pricing_skus에 있습니다.
출처
관련 글
모델 카테고리의 다른 글
- AI로 이미지 속 물체 색상 바꾸는 방법
사진을 AI 이미지 모델에 보내고, 물체와 새 색상을 지정하고, 그대로 둘 것을 나열하세요. 색상마다 요청을 하나씩 보내고, 결과는 원본과 비교해 확인하세요.
- AI로 영상 배경 바꾸는 방법
video-to-video AI 모델에 클립과 함께, 새 배경과 그대로 둘 부분을 적은 프롬프트를 보내세요. Sume에서 하는 방법과 확인할 점을 정리했습니다.
- AI로 낮 영상을 밤으로 바꾸기: 편집, 생성, 색보정
낮 영상을 밤으로 바꾸려면 video-to-video AI 편집을 쓰거나, 스틸 두 장으로 낮에서 밤으로 바뀌는 클립을 생성하거나, 색보정으로 어둡게 만드세요.
- AI 영상 만드는 방법: 텍스트나 사진으로 만들기
AI 영상을 만들려면 출발점을 고르고, 샷을 설명하고, 길이와 화면 비율을 정한 뒤 생성해서 검토하세요. Sume에서 각 단계를 하는 방법을 설명합니다.
작성자 Sume