모델

립싱크 API: 이미지와 오디오로 말하는 클립 만들기

스틸 이미지와 Sume에 호스팅된 오디오를 VEED Fabric 1.0이나 MiniMax H3 Max Lip Sync로 보내 말하는 클립을 받으세요. 입력, 제한, 초당 요금을 다룹니다.

읽는 시간 5분Sume
전체 글

Sume API로 스틸 이미지를 오디오에 맞춰 립싱크하려면 image_url에 이미지를, audio_url에 Sume에 호스팅된 오디오를, duration_seconds에 측정한 오디오 길이를 담아 POST /v1/veed/fabric-1.0을 보내세요. 오디오가 5–14.8초라면 POST /v1/minimax/h3-max/lip-sync도 같은 본문을 받습니다. 둘 다 Job으로 실행되며 말하는 클립을 반환합니다.

이 글의 내용은 Models 개요 (영문)와 Sume API 레퍼런스의 요청 스키마에서 가져왔으며, 2026-09-26에 확인했습니다. 가격은 Sume의 가격 코드에서 읽었고, 그중 Fabric 요율은 API 요금 페이지를 만드는 코드에서 읽었습니다. 오디오가 아니라 스크립트가 있다면 말하는 아바타 영상 API가 준비된 아바타와 스크립트를 바로 받습니다.

립싱크 요청에는 어떤 입력이 필요한가요?

두 엔드포인트는 같은 입력을 받습니다.

  • 시각 소스 하나: image_url에 넣은 공개 HTTPS 스틸, 또는 avatar_id나 avatar_handle로 지정한 준비된 아바타입니다. 아바타는 서버에서 해당 아바타의 아이덴티티 스틸로 변환됩니다. 둘은 함께 쓸 수 없습니다.
  • 모델 가이드는 생성한 뒤 검사까지 마친, 포즈를 잡은 스틸을 image_url로 쓰는 쪽을 권장하며, avatar_handle은 사용자가 그 아바타를 이름으로 지정했을 때만 쓰라고 안내합니다.
  • Sume 미디어 호스트에 있는 오디오로, 보통 TTS 세그먼트입니다. 다른 호스트는 거부되며, 파일은 최대 10 MB입니다. 텍스트 음성 변환 API로 문장마다 클립을 하나씩 만들 수 있습니다.
  • duration_seconds에는 측정한 오디오 길이를 넣습니다.

립싱크 요청은 어떤 형태인가요?

재시도할 때 두 번째 Job을 만들지 않고 원래 Job을 돌려받도록 Idempotency-Key를 보내세요. 아래 요청은 발표자 사진을 음성 한 줄에 맞춰 720p로 립싱크합니다.

curl -X POST https://api.sume.com/v1/veed/fabric-1.0 \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: fabric-line-001" \
  -d '{
    "image_url": "https://example.com/presenter.png",
    "audio_url": "https://media.sume.com/artifacts/example/line-1.wav",
    "duration_seconds": 7.6,
    "resolution": "720p"
  }'

VEED Fabric 1.0과 H3 Max Lip Sync는 어떻게 다른가요?

MiniMax H3 Max Lip Sync는 오디오가 5–14.8초 범위에 들 때 명시적으로 고를 수 있는 Fabric의 대안입니다. 이 범위를 벗어난 오디오에는 1–300초를 받는 Fabric을 쓰세요.

Models 개요 (영문)와 Sume API 레퍼런스의 요청 스키마 기준, 2026-09-26 확인.
항목VEED Fabric 1.0MiniMax H3 Max Lip Sync
엔드포인트POST /v1/veed/fabric-1.0POST /v1/minimax/h3-max/lip-sync
모델 IDveed/fabric-1.0minimax/h3-max/lip-sync
duration_seconds1–3005–14.8. 범위 밖 요청은 잘라 맞추지 않고 거부
resolution480p 또는 720p(기본값)480p, 768p(기본값), 1080p 중 하나. 2K 없음
speed_tierstandard(기본값) 또는 fast받지만 무시함
image_url공개 HTTPS 스틸화면 비율 0.4–2.5의 공개 HTTPS 스틸
가격오디오 초당(720p) $0.1875. 480p 요율은 API 요금에 있음오디오 초당(768p) $0.10. 공급사 정가 × 1.25, 다른 해상도는 GET /v1/catalog에 있음

대신 영상 모델이 내 보이스오버에 립싱크할 수 있나요?

할 수 없습니다. Sume의 모델 가이드에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 립싱크하지 않으므로, 말하는 얼굴을 영상 모델 클립에 내레이션을 깔아 만드는 일은 없습니다. 가이드는 말하는 샷을 승인된 스틸과 TTS로 Fabric에서 만들고, 대사 없는 장면, B-roll, 제품 모션은 이미지·영상 생성에 맡깁니다.

음성 대신 드라이빙 영상의 움직임으로 스틸을 움직이려면 모션 컨트롤 API 가이드를 참고하세요.

립싱크 비용은 얼마인가요?

VEED Fabric 1.0의 요금은 오디오 초당(720p) $0.1875이며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 오디오 길이를 초 단위로 올림해 과금하므로, 위의 7.6초짜리 대사는 8초로 청구되어 720p 기준 수수료 전 $1.50입니다. 제출 시 이 금액을 예약하는 값이 duration_seconds입니다.

MiniMax H3 Max Lip Sync의 요금은 오디오 초당(768p) $0.10이며, 같은 에이전트 수수료가 더해집니다. 이 요율은 공급사 정가 × 1.25이고 오디오 길이를 초 단위로 올림해 과금하며, 480p와 1080p 요율은 GET /v1/catalog에 있습니다. 실패한 Job과 생성이 시작되기 전에 취소된 Job은 확정 전에 환불됩니다.

어떤 제한이 있나요?

스키마와 모델 가이드에 정해진 규칙은 다음과 같습니다.

  • 요청마다 시각 소스는 정확히 하나여야 하고, audio_url은 Sume 미디어 호스트에 있는 최대 10 MB 파일이어야 합니다.
  • Fabric은 1–300초 오디오를 받습니다. H3 Max Lip Sync는 5–14.8초를 받으며, 출력 길이는 오디오를 따릅니다.
  • 공급사 큐 ID는 Sume가 고르며, 어느 본문에도 넣을 수 없습니다.
  • POST /v1/avatar-1.0/image-to-video와 POST /v1/models/sume/avatar-1.0/image-to-video/runs는 지원 중단되어 은퇴 예정인 별칭이며, 지금도 같은 본문을 받습니다. URL만 POST /v1/veed/fabric-1.0이나 POST /v1/models/veed/fabric-1.0/runs로 바꾸면 옮길 수 있습니다.
  • 호스팅 MCP에서는 Fabric 본문을 avatar-image-to-video_create 도구의 payload 안에 넣습니다.

출처

관련 글

작성자 Sume