토킹 헤드 영상 API: 아바타 vs 립싱크 vs 모션 컨트롤
가진 입력으로 Sume 토킹 헤드 경로를 고르세요. 스크립트와 준비된 아바타, 직접 만든 오디오와 스틸, 또는 드라이빙 영상입니다. 제한과 초당 가격도 다룹니다.
Sume 토킹 헤드 경로는 이미 가진 입력으로 고르세요. 준비된 아바타와 스크립트가 있으면 Avatar 1.0(POST /v1/avatar-1.0/talking-video)을, Sume에 호스팅된 오디오와 스틸이 있으면 립싱크(POST /v1/veed/fabric-1.0, 오디오가 5–14.8초라면 POST /v1/minimax/h3-max/lip-sync)를, 드라이빙 영상이 있으면 Kling 3.0 Motion Control(POST /v1/kling/3.0/motion-control)을 쓰세요.
아래 내용은 2026-09-27에 확인한 아바타 영상 생성과 Models 개요 (영문) 문서, 그리고 Sume API 레퍼런스의 요청 스키마를 바탕으로 하며, 가격은 Sume의 가격 코드에서 읽었습니다. 경로마다 가이드가 따로 있습니다. 말하는 아바타 영상, 립싱크, 모션 컨트롤을 참고하세요.
어떤 입력에 어떤 경로가 맞나요?
모델 이름이 아니라 이미 가진 입력에서 출발하세요. Avatar 1.0에는 준비된 아바타가 필요하고, 립싱크와 모션 컨트롤은 image_url에 넣은 공개 스틸이나 avatar_id / avatar_handle로 지정한 준비된 아바타를 받습니다. 일반 영상 모델은 네 번째 선택지가 아닙니다. Sume의 모델 가이드에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 립싱크하지 않습니다.
| 경로 | 준비할 입력 | 얼굴을 움직이는 것 | Job당 길이 | 가격 |
|---|---|---|---|---|
| Avatar 1.0 말하는 영상 | 준비된 아바타와 대사 | script, 또는 장면별 video_inputs | 4–60초, 스크립트로 추정 | 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준 |
| 립싱크: VEED Fabric 1.0 또는 MiniMax H3 Max | Sume 미디어 호스트에 있는 오디오, 그리고 스틸이나 아바타 | audio_url에 넣은 녹음 | Fabric은 오디오 1–300초, H3 Max는 5–14.8초 | Fabric: 오디오 초당(720p) $0.1875. H3 Max: 립싱크 가이드 참고 |
| Kling 3.0 Motion Control | 드라이빙 영상, 그리고 스틸이나 아바타 | motion_video_url에 담긴 움직임 | 드라이빙 영상 최대 30초, 출력 길이는 드라이빙 영상을 따름 | 출력 초당 $0.1575 |
Avatar 1.0 말하는 영상은 언제 써야 하나요?
대사는 있지만 녹음이 없을 때입니다. 이 경로는 준비된 아바타를 스크립트 기반의 말하는 영상으로 바꿉니다. 아바타의 avatar_handle과 함께 script와 video_inputs 중 정확히 하나를 보내면, Sume가 추정한 영상 길이가 4–60초일 때 Job을 접수합니다. quality, aspect_ratio, 그리고 선택 사항인 제품·장면 입력은 말하는 아바타 영상 가이드에서 다룹니다.
- 전체 렌더 비용을 내기 전에 첫 프레임 스틸을 확인하려면 아바타 영상 프리뷰를 만든 다음, 그 id로
generate-video를 호출하세요. - 자막은
POST /v1/video-captions로 완성된 영상에 입히세요.
립싱크가 더 나은 선택일 때는 언제인가요?
TTS로 만든 대사처럼 목소리가 이미 녹음으로 있을 때입니다. 립싱크는 스크립트 없이 그 오디오에 맞춰 얼굴을 움직입니다. Fabric은 Job당 최대 300초의 오디오를 받고, H3 Max Lip Sync는 5–14.8초 범위 안에서 명시적으로 고를 수 있는 대안입니다. 두 요청 본문과 각각의 가격은 립싱크 가이드에서 다룹니다.
모션 컨트롤은 무엇이 다른가요?
직접 제공한 드라이빙 영상의 움직임으로 스틸을 움직이므로, 연기가 스크립트나 오디오 파일이 아니라 촬영된 영상에서 나옵니다. motion_video_url(공개 HTTPS, 최대 30초), 그 길이를 담은 duration_seconds, 그리고 시각 소스 하나를 보내세요. 출력 길이는 드라이빙 영상을 따릅니다.
keep_original_sound는 false로 설정하지 않는 한 드라이빙 영상의 오디오 트랙을 유지하며, prompt는 외형 세부만 조정합니다. 나머지 필드는 모션 컨트롤 가이드에서 다룹니다.
영상이 더 길거나 화자가 두 명이면 어떻게 하나요?
그때는 Job당 한도가 계획을 정합니다.
- 스크립트가 60초를 넘으면 Avatar 1.0에는 Job이 여러 개 필요합니다. 문서는 더 긴 스크립트를 나누라고 안내하며, 60초보다 긴 AI 아바타 영상을 만드는 방법에서 파트를 이어 붙입니다.
- 완성된 오디오는 최대 300초까지 Fabric Job 하나에 들어가고, 드라이빙 영상은 최대 30초까지 모션 컨트롤 Job 하나에 들어갑니다.
- 현재 Avatar 1.0 실행은 최종 영상 하나당 해석된 아바타 하나만 지원하므로, 화자가 두 명이면 Job도 두 개 필요합니다. AI 아바타 대화 영상에서 각 차례를 이어 붙입니다.
- 무음 구간은 Avatar 1.0 Job 하나 안에 둘 수 있습니다.
voice.type: "silence"인video_inputs장면은 말하지 않는 비트입니다.
가격은 어떻게 비교되나요?
모든 경로가 초 단위로 과금되고 기본적으로 5.5% 에이전트 수수료가 더해지지만, 초를 세는 방식은 다릅니다. 립싱크는 오디오 초를, 모션 컨트롤은 드라이빙 영상 초를 세며, 둘 다 초 단위로 올림합니다. Avatar 1.0은 quality 등급으로 정해지는 요율로 과금되고, 제품 이미지가 있으면 요율이 올라갑니다. 제품 이미지가 있을 때의 요율은 API 요금에 있습니다.
이 경로들에는 어떤 공통점이 있나요?
모두 같은 Job 계약을 따르므로, 경로를 바꿔도 달라지는 것은 요청 본문이지 폴링 코드가 아닙니다.
- 모든 생성 요청은 Job으로 실행됩니다.
Idempotency-Key를 보내고, Job id를 저장하고, 상태를 폴링한 뒤, 결과에서 Sume가 호스팅하는 아티팩트를 읽으세요. - 호스팅 MCP에서는 Avatar 1.0이
avatar-videos_create, Fabric이avatar-image-to-video_create, 모션 컨트롤이kling-motion-control_create입니다. 문서의 호스팅 도구 목록에는 H3 Max Lip Sync 도구가 없습니다. - 대신 기존 영상에 아바타 얼굴을 입히는 페이스 스왑은 베타입니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- Sume Avatar 1.0을 소개합니다
Sume Avatar 1.0은 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다.
- Avatar Face Swap API(베타): 영상에 아바타 얼굴 입히기
Avatar Face Swap 1.0은 준비된 아바타의 얼굴을 짧은 공개 소스 영상에 입히는 Sume의 베타 엔드포인트입니다. 필수 필드, 제한, 폴링을 다룹니다.
- 아바타 영상 프리뷰: 렌더링 전에 첫 프레임 승인하기
아바타 영상 프리뷰를 만들어 첫 프레임 스틸을 받고, 필요하면 다시 생성한 뒤, 프리뷰 id로 generate-video를 호출해 최종 영상을 렌더링하세요.
- 다중 장면 아바타 영상 API: 순서 있는 장면으로 영상 하나 만들기
스크립트 하나 대신 순서 있는 video_inputs를 보내 말하는 장면과 무음 장면을 4-60초 아바타 영상 하나로 합성하세요. 장면 필드, 규칙, 제한을 다룹니다.
작성자 Sume