Text-to-Video API 오디오 생성: 소리를 만드는 영상 모델
Sume의 POST /v1/videos는 카탈로그에 generate_audio가 설정된 모델에서 소리를 만듭니다. 모델별 오디오 생성 방식(항상·선택·없음)과 거부되는 값을 정리했습니다.

Sume의 텍스트로 영상 만들기 API에서 소리가 있는 영상을 받으려면, 카탈로그 항목에 generate_audio: true가 있는 모델로 POST /v1/videos를 보내세요. Seedance 2.x, kling-3, wan-3.0 모델은 오디오를 선택적으로 만들고, MiniMax H3 모델 두 개와 Gemini Omni Flash 1.1은 항상 만들며, grok-imagine-video-1.5는 오디오를 만들지 않습니다.
요청 필드는 영상 생성 문서 (영문)에서 가져왔고, 모델별 오디오 동작은 GET /v1/videos/models가 제공하는 카탈로그와 POST /v1/videos가 실행하는 검사에서 2026-09-26에 확인했습니다.
어떤 영상 모델이 오디오를 생성하나요?
GET /v1/videos/models에서 generate_audio는 모델이 오디오 트랙을 생성할 수 있는지를 나타냅니다. 오디오가 있는 모델의 설명에는 그 종류가 “with optional audio”(선택적 오디오), “with native stereo audio”(네이티브 스테레오 오디오), “with native synced audio”(네이티브 동기화 오디오) 중 하나로 적혀 있습니다.
| 모델 ID | 오디오 | 보낼 값 |
|---|---|---|
seedance-2.5, seedance-2, seedance-2-fast, seedance-2-mini | 선택 | 소리가 필요하면 필드 생략 또는 true, 필요 없으면 false |
kling-3 | 선택 | 소리가 필요하면 필드 생략 또는 true, 필요 없으면 false |
wan-3.0 | 선택 | 소리가 필요하면 필드 생략 또는 true, 필요 없으면 false |
minimax-h3, minimax-h3-max | 항상, 네이티브 스테레오 | 필드 생략. false는 거부됨 |
gemini-omni-flash-1.1 | 항상, 네이티브 동기화 | 필드 생략. false는 거부됨 |
grok-imagine-video-1.5 | 없음 | 필드 생략. true는 거부됨 |
소리가 있는 클립은 어떻게 요청하나요?
generate_audio는 POST /v1/videos의 선택적 불리언 필드이며, 기본값은 모델의 오디오 기능을 따릅니다. 오디오가 선택 사항인 모델에서는 이 필드를 빼도 되고, true를 보내면 선택을 명시적으로 드러낼 수 있습니다. 아래는 문서의 제출 예제에 이 필드를 추가한 것입니다.
curl -X POST https://api.sume.com/v1/videos \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: t2v-audio-001" \
-d '{
"model": "seedance-2",
"prompt": "A golden retriever playing fetch on a sunny beach with waves crashing in the background",
"generate_audio": true
}'어떤 generate_audio 값이 거부되나요?
POST /v1/videos는 모델이 따를 수 없는 값을 무시하지 않고 400과 오류 코드 unsupported_capability로 거부합니다. 거부되는 경우는 다음과 같습니다.
- 오디오가 없는 모델에 보낸
true: “grok-imagine-video-1.5 does not support generate_audio.” minimax-h3나minimax-h3-max에 보낸false: “… always produces native stereo audio; omit generate_audio.”gemini-omni-flash-1.1에 보낸false: “… always produces native synced audio; omit generate_audio.”
오디오가 있으면 가격이 달라지나요?
카탈로그에서 한 모델만 그렇습니다. kling-3 모델은 pricing_skus에 초당 요율 두 가지, per-video-second와 per-video-second-audio를 나열합니다. 그래서 소리가 있는 클립과 무음 클립에 각각 다른 초당 요율이 적용됩니다. Kling 자체의 직접 요금은 Sume vs Kling에서 비교합니다. 별도의 오디오 요율을 나열한 다른 모델은 없습니다.
모든 모델은 공급사 정가 × 1.25로 청구되고 제출 시 워크스페이스 USD 잔액에서 예약되며, 기본 5.5% 에이전트 수수료가 더해집니다. 모델별 요율은 GET /v1/videos/models에서 확인하거나 API 요금을 참고하세요.
영상 모델이 보이스오버에 맞춰 립싱크할 수 있나요?
할 수 없습니다. Models 개요 문서에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 맞춰 립싱크하지 않습니다. 말하는 얼굴이 필요할 때를 위해, 문서에는 스틸 이미지와 오디오 트랙을 말하는 클립으로 바꾸는 경로가 나와 있습니다. VEED Fabric 1.0(veed/fabric-1.0)이 그 예입니다. 사진과 오디오로 립싱크하기를 참고하세요.
오디오를 입력으로 넣을 수도 있습니다. 이를 받는 모델에서는 타입이 audio_url인 input_references 항목이 생성의 레퍼런스가 됩니다. 이 내용은 Reference-to-Video API에서 다룹니다.
출처
관련 글
작성자 Sume