AI 아바타 대화 영상 API: 두 화자가 주고받는 대화
Sume 아바타 영상 Job은 아바타 하나만 해석하므로, 두 사람의 대화는 차례마다 Job을 하나씩 만들어 Timeline 1.0으로 말하는 순서대로 이어 붙입니다.
Sume API로 두 사람이 대화하는 AI 아바타 영상을 만들려면 각 화자의 차례를 Job 하나에 아바타 하나씩, 별도의 POST /v1/avatar-1.0/talking-video Job으로 렌더링한 다음, POST /v1/timeline-1.0/render로 말하는 순서대로 이어 붙이세요. 아바타 영상 하나에 두 화자를 모두 담을 수는 없습니다.
아래 규칙은 2026-09-26에 확인한 Sume의 아바타 영상 생성, 타임라인 오디오, Timeline 1.0, 타임라인 합성 문서를 따릅니다.
왜 아바타 영상 하나에 두 화자를 담을 수 없나요?
현재 실행은 최종 영상 하나당 해석된 아바타 하나를 지원합니다. 다중 장면 video_inputs에서는 장면마다 아바타를 지정할 수 있지만, 장면마다 서로 다른 아바타는 거부되며, 현재 API는 "Use one avatar for the full video."(영상 전체에 아바타 하나를 쓰라는 뜻)와 함께 400을 반환합니다. 장면은 진행자 한 명을 위한 기능이며, 그런 경우는 다중 장면 아바타 영상 API를 참고하세요.
대화 차례는 어떻게 계획하나요?
대화를 번갈아 말하는 차례로 쓰고, 화자마다 준비된 아바타 handle을 하나씩 정하세요. 직접 만든 아바타여도 되고, 아바타 카탈로그 검색으로 찾은 공개 아바타여도 됩니다. 그런 다음 길이 범위에 맞춰 Job을 구성하세요.
- 각 Job의 추정 길이는 4-60초여야 합니다. 한 화자가 연달아 하는 대사는 Job 하나로 합치세요.
- 아주 짧은 대답은 4초가 안 될 수 있습니다. 더 긴 차례에 합치거나,
voice.type: "silence"비트를 하나 더 넣은 다중 장면video_inputs로 렌더링하세요. 이 비트에는duration이 필수입니다. - 모든 슬롯의 프레임 모양이 같아지도록 두 화자 모두 같은
aspect_ratio를 보내세요.
차례들은 어떻게 이어 붙이나요?
Timeline은 오디오 스파인 하나 위에 완성 MP4를 만들므로, 대화 오디오부터 준비합니다.
- 각 차례의 오디오를
POST /v1/audio-detach로 분리하세요. 기본 출력은 샘플 단위로 정확한 wav입니다. - 타임라인 오디오의
operation: "concat"으로 차례들을 말하는 순서대로 이어 붙이세요. 파트는 1-20개이며 모두 같은 채널 레이아웃이어야 합니다. 결과는audio_url하나와segments[]이며,segments[]의start값이video[].start에 넣을 오프셋입니다. - 그 파일을
audio.url로 두고, 차례마다video[]슬롯을 하나씩 두어 화자를 번갈아 배치한 뒤 렌더링하세요. 뒤쪽 슬롯에transition을 넣거나, 그냥 컷으로 둬도 됩니다.
curl -X POST https://api.sume.com/v1/timeline-1.0/render \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: dialogue-assemble-01" \
-d '{
"audio": {
"url": "https://media.sume.com/artifacts/artf_demo/dialogue.wav",
"duration_seconds": 31
},
"video": [
{ "source_url": "https://media.sume.com/artifacts/artf_demo/host-1.mp4", "start": 0, "duration": 12 },
{ "source_url": "https://media.sume.com/artifacts/artf_demo/guest-1.mp4", "start": 12, "duration": 9 },
{ "source_url": "https://media.sume.com/artifacts/artf_demo/host-2.mp4", "start": 21, "duration": 10 }
]
}'두 화자를 한 화면에 동시에 띄울 수 있나요?
문서에 나온 도구로는 말하는 클립 두 개를 동시에 띄울 수 없습니다. 한 화면에 소스 두 개를 올리는 유일한 표면인 타임라인 합성은 스틸 하나와 영상 하나를 한 프레임에 넣습니다. 그래서 가장 가까운 레이아웃은 말하는 사람의 클립 옆이나 위, 아래에 듣는 사람의 스틸을 두는 것입니다. 영상 프레임으로 스틸을 뽑아 operation: "stack"과 함께 image.url로 보내고, 합성된 MP4를 video[] 슬롯에 넣으세요. 오디오는 조립할 때 Timeline 스파인이 공급합니다.
어떤 제한이 있나요?
이 단계들에 쓰는 모든 URL은 워크스페이스의 media.sume.com 아티팩트나 에셋이어야 하며, 완료된 아바타 영상 결과에는 공개 media.sume.com 영상 아티팩트가 포함될 수 있습니다.
| 단계 | 한도 |
|---|---|
| 아바타 영상 Job | 해석된 아바타 하나, 추정 4-60초. |
| 타임라인 오디오 concat | 같은 채널 레이아웃을 쓰는 파트 1-20개. |
| Timeline 렌더 | video[] 슬롯 1-200개, 출력 1-1,800초. |
| 타임라인 합성 | 스틸 하나와 영상 하나, 출력 최대 300초. |
대화 영상의 비용은 얼마인가요?
각 차례는 길이와 등급에 따라 아바타 영상 요율로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 오디오 분리, concat, 합성은 오디오 분리, 타임라인 오디오, 타임라인 합성 페이지에 나온 Job당 정액 요율입니다. 렌더는 API 요금에 출력 분당 $0.10로 나와 있습니다. 이 모든 항목에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.
출처
관련 글
작성자 Sume