AI 영상에 여러 캐릭터 넣기: 한 샷에 모두 담는 방법

모델에 모든 캐릭터를 주세요. 전원이 담긴 스틸 한 장을 첫 프레임으로 쓰거나, 여러 장을 받는 모델에 캐릭터마다 레퍼런스 이미지를 한 장씩 보냅니다.

읽는 시간 5분Sume
전체 글

여러 캐릭터가 나오는 AI 영상을 만들려면, 생성을 시작하기 전에 영상 모델에 모든 캐릭터를 주세요. 등장인물 전원을 스틸 한 장에 담아 클립의 첫 프레임으로 쓰거나, 여러 장을 받는 모델에 캐릭터마다 사진을 별도의 레퍼런스 이미지로 보내면 됩니다. 어느 방법도 클립 내내 모두를 알아볼 수 있게 유지된다고 보장하지 않으므로, 쓰기 전에 직접 보고 확인하세요.

내용은 2026-09-28에 확인한 Sume의 영상 생성 (영문), Video Router (영문), Image API (영문) 문서에서 가져왔습니다. 레퍼런스 개수 상한은 API가 현재 적용하는 검사 기준입니다. 코드 없이 하려면 에이전트 탭에서 장면을 설명하세요. 에이전트가 모델을 고르고, 비용을 쓰기 전에 먼저 확인을 받습니다.

AI 영상 하나에 여러 캐릭터를 어떻게 넣나요?

POST /v1/videos에는 문서화된 입력이 두 가지 있으며, 쓰임새가 서로 다릅니다.

  • 첫 프레임으로 쓰는 스틸 한 장. 레퍼런스를 여러 장 받는 이미지 모델(ChatGPT Image 2.5는 최대 16장)로 캐릭터들을 이미지 한 장에 합쳐 확인한 뒤, frame_type: "first_frame"과 함께 frame_images에 담아 보내세요. 그러면 클립의 첫 프레임은 여러분이 승인한 단체 장면이 됩니다. 스틸 만드는 방법은 AI로 사진 두 장을 한 장으로 합치는 방법에서 다룹니다.
  • 캐릭터마다 레퍼런스 한 장. 각 사진을 input_references에 type: "image_url" 항목으로 보내고, 프롬프트에 장면을 설명하세요. 모델은 레퍼런스를 정확한 프레임이 아니라 시각적 가이드로 사용합니다.
  • 한 요청에 둘을 함께 쓰지는 마세요. 요청에 frame_images가 있으면 그쪽이 우선하고 요청은 이미지로 영상 만들기로 처리되며, 현재 코드에서는 이때 레퍼런스가 모델에 전달되지 않습니다.
  • 공개 HTTPS URL만 받습니다. 서명된 URL이나 비공개 URL은 생성 입력으로 거부되는데 Image API의 결과 URL은 서명된 URL이므로, 쓰기로 한 스틸은 먼저 여러분의 공개 HTTPS URL에 올려 두세요.

캐릭터 이미지를 여러 장 받는 영상 모델은 무엇인가요?

레퍼런스 지원은 모델마다 다릅니다. 아래 모델은 모두 첫 프레임을 받으므로, 합친 스틸은 모든 모델에서 쓸 수 있는 방법입니다.

영상 생성 (영문)과 Video Router (영문) 기준, 2026-09-28 확인. 상한은 API가 현재 적용하는 검사 기준이며, GET /v1/videos/models는 모델별로 받는 레퍼런스 종류를 나열할 뿐 상한은 알려 주지 않습니다.
모델이미지 레퍼런스프롬프트에서 개별 지칭
gemini-omni-flash-1.1최대 10장예: 목록 순서대로 <IMAGE_REF_0>, <IMAGE_REF_1>, …
wan-3.0최대 10장문서에 없음
minimax-h3, minimax-h3-max최대 9장(모든 종류를 합쳐 레퍼런스 12개)문서에 없음
seedance-2.5, seedance-2, seedance-2-fast, seedance-2-mini예. 문서화된 상한은 없고, 레퍼런스가 모두 합쳐 12개를 넘으면 API가 거부문서에 없음
kling-3, grok-imagine-video-1.5없음합친 스틸 한 장을 첫 프레임으로 사용

어느 캐릭터가 누구인지 모델에 어떻게 알려 주나요?

Gemini Omni Flash 1.1에서는 위치로 각 레퍼런스를 가리키세요. <IMAGE_REF_0>은 input_references의 첫 번째 이미지, <IMAGE_REF_1>은 두 번째 이미지이며, 목록 순서대로 0부터 셉니다. 문서는 이 토큰을 이 모델에 대해서만 설명합니다. 다른 모델에서는 옷차림이나 서 있는 위치로 각 캐릭터를 말로 묘사하고, 캐릭터마다 분명한 동작을 하나씩 주세요.

curl -X POST https://api.sume.com/v1/videos \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: two-characters-001" \
  -d '{
    "model": "gemini-omni-flash-1.1",
    "prompt": "<IMAGE_REF_0> and <IMAGE_REF_1> sit across a cafe table. <IMAGE_REF_0> slides a cup of coffee over and <IMAGE_REF_1> laughs. Static medium shot, warm window light",
    "input_references": [
      { "type": "image_url", "image_url": { "url": "https://example.com/character-a.png" } },
      { "type": "image_url", "image_url": { "url": "https://example.com/character-b.png" } }
    ],
    "aspect_ratio": "16:9",
    "resolution": "720p",
    "duration": 8
  }'

캐릭터끼리 대화하게 할 수 있나요?

생성된 클립 아래에 목소리를 까는 방식으로는 안 됩니다. Sume 문서에 따르면 영상 모델은 생성된 음성(TTS)이나 나중에 넣은 보이스오버에 립싱크하지 않습니다. 말하는 샷은 대신 립싱크 클립으로 만듭니다. 예를 들어 VEED Fabric 1.0(veed/fabric-1.0)은 스틸 한 장과 오디오 트랙 하나를 말하는 클립으로 바꿉니다. 대화라면 차례마다 말하는 클립을 하나씩 만들어 순서대로 이어 붙이세요. AI 아바타 대화 영상 API: 두 화자가 주고받는 대화가 아바타 영상으로 이 방법을 보여 줍니다.

모든 캐릭터를 끝까지 알아볼 수 있나요?

보장되지 않습니다. 첫 프레임은 시작 화면만 고정하고 그 뒤는 모두 생성되며, 레퍼런스는 모델을 가이드할 뿐입니다. 클립 전체를 보고, 캐릭터가 바뀌거나 사라지면 다시 생성하세요. 여러 샷에 걸쳐 같은 캐릭터를 유지하려면 여러 AI 영상 샷에서 캐릭터 일관성 유지하기를 참고하세요.

어떤 제한이 있나요?

  • 모델별 레퍼런스 상한은 위 표에 있으며, kling-3와 grok-imagine-video-1.5는 레퍼런스를 받지 않습니다.
  • 클립 길이는 모델에 따라 다릅니다. gemini-omni-flash-1.1은 3–10초, seedance-2.5와 wan-3.0은 최대 30초, 나머지 모델은 최대 15초입니다.
  • 모든 이미지 URL은 공개 HTTPS여야 합니다.
  • 클립은 모델별로 공급사 정가 × 1.25로 과금되며 제출 시 예약됩니다. 모델별 요율은 GET /v1/videos/models의 pricing_skus에 있습니다.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume