Sume Avatar 1.0

다중 장면 아바타 영상 API: 순서 있는 장면으로 영상 하나 만들기

스크립트 하나 대신 순서 있는 video_inputs를 보내 말하는 장면과 무음 장면을 4-60초 아바타 영상 하나로 합성하세요. 장면 필드, 규칙, 제한을 다룹니다.

읽는 시간 5분Sume
전체 글

Sume의 다중 장면 아바타 영상은 단일 script 대신 순서 있는 video_inputs 배열로 계획해 합성한, 말하는 아바타 영상 하나입니다. 각 항목은 장면 하나이며 voice 비트는 말하기나 무음 중 하나입니다. 그래서 계획된 전체 길이가 4-60초 범위에 들어오기만 하면 요청 하나에 훅, 무음 데모, 콜투액션을 함께 담을 수 있습니다.

아래 내용은 모두 아바타 영상 생성 문서의 다중 장면 섹션에서 가져왔습니다.

언제 스크립트 대신 video_inputs를 써야 하나요?

POST /v1/avatar-1.0/talking-video는 script와 video_inputs 중 정확히 하나를 받습니다. 합성된 영상 하나에 장면 훅, 데모, 무음 비트가 필요하다면 순서 있는 video_inputs를 사용하세요. 단일 스크립트라면 말하는 아바타 영상 API를 참고하세요.

다중 장면 요청은 어떤 형태인가요?

아래 요청은 문서 예시를 따르되, handle은 자리 표시용 값으로 바꾸고 대사는 새로 썼습니다. 말하는 훅, 무음 데모 비트, 말하는 콜투액션으로 이루어집니다. 각 장면에는 background도 지정합니다.

curl -X POST https://api.sume.com/v1/avatar-1.0/talking-video \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: avatar-video-multi-001" \
  -d '{
    "avatar_handle": "product_host",
    "aspect_ratio": "9:16",
    "quality": "plus",
    "video_inputs": [
      {
        "id": "hook",
        "voice": { "type": "text", "script": "Three things to know before you buy a travel mug.", "duration": 3 },
        "background": { "type": "prompt", "prompt": "Casual kitchen framing, natural light" }
      },
      {
        "id": "demo",
        "voice": { "type": "silence", "duration": 4 },
        "background": { "type": "prompt", "prompt": "Casual kitchen framing, natural light" }
      },
      {
        "id": "cta",
        "voice": { "type": "text", "input_text": "Tap the link to see the Acme mug in every color.", "duration": 5 },
        "background": { "type": "prompt", "prompt": "Casual kitchen framing, natural light" }
      }
    ]
  }'

장면마다 어떤 필드를 받나요?

아바타는 최상위 avatar_handle로 참조하세요. 문서는 video_inputs 안에 장면별 캐릭터 필드를 두는 것도 허용합니다. 예시는 aspect_ratio와 quality를 video_inputs와 나란히 최상위에 설정합니다.

아바타 영상 생성 기준, 2026-09-25 확인.
장면 필드문서 설명
id장면 id입니다. 문서 예시는 hook, demo, cta를 씁니다.
voice.type: "text"말하는 장면입니다. script와 input_text 중 정확히 하나를 받습니다.
voice.type: "silence"말하지 않는 비트입니다. duration이 필수이며 script와 input_text는 허용되지 않습니다.
voice.duration무음 비트에서는 필수입니다. 문서 예시는 말하는 장면에도 이 값을 설정합니다.
background{ "type": "prompt", "prompt": "..." } 같은 장면 연출입니다. 현재 실행은 배경이 하나의 공유 장면으로 해석되기를 기대합니다.

다중 장면 계획에는 어떤 제한이 있나요?

  • 계획된 전체 길이는 4-60초 범위에 들어와야 합니다.
  • 요청에는 script와 video_inputs 중 정확히 하나만 담습니다.
  • 현재 실행은 최종 영상 하나당 해석된 아바타 하나를 지원합니다.
  • 현재 실행은 장면 배경이 하나의 공유 장면으로 해석되기를 기대합니다.
  • aspect_ratio는 1:1, 3:4, 9:16, 4:3, 16:9를 지원하며(기본값 9:16), resolution은 현재 720p입니다.
  • 미디어 필드는 가져올 수 있는 공개 HTTPS URL이어야 합니다.

다중 장면 영상에 자막을 넣거나 프리뷰를 만들 수 있나요?

네. 선택 필드 captions는 생성이 끝난 뒤 video_inputs 텍스트를 사용해 깨끗한 최종 MP4에 스타일을 입혀 새깁니다. 기본 스타일은 slam입니다. 자막 단계의 실패는 소프트 실패입니다. 이 경우에도 아바타 Job은 깨끗한 기본 video_url과 captions.status=failed로 성공할 수 있습니다.

전체 렌더 비용을 내기 전에 첫 프레임 스틸을 검토하려면 아바타 영상 프리뷰를 만든 다음 프리뷰 id로 generate-video를 호출하세요. 완료된 결과에는 preview_image_url과 scene_previews가 포함될 수 있습니다. 장면별 스틸은 아바타 영상 프리뷰: 첫 프레임 승인하기에서 다룹니다.

다중 장면 아바타 영상의 비용은 얼마인가요?

다중 장면 계획은 단일 스크립트와 같은 Avatar Video 엔드포인트와 quality 등급을 씁니다. 등급은 standard, plus(기본값), max입니다. 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준이며, 여기에 기본 5.5% 에이전트 수수료가 더해집니다. 제품 이미지가 있을 때의 요율은 API 요금에 있습니다.

출처

관련 글

작성자 Sume