음성과 배경 음악을 파일 하나로 믹싱하는 방법
음성과 배경 음악을 합치려면 음악을 음성보다 낮게 깔고, 말소리 아래에서 더킹하고, 페이드아웃한 뒤 파일 하나로 내보내세요. Sume에서는 렌더한 다음 오디오를 분리합니다.

음성과 배경 음악을 믹싱하려면 음악을 두 번째 트랙에 음성보다 충분히 낮게 깔고, 음성이 나오는 동안 더 낮추고(더킹), 끝에서 페이드아웃한 뒤, 두 트랙을 오디오 파일 하나로 내보내세요. Sume API에서는 Timeline 1.0 렌더가 믹서 역할을 합니다. 음성이 오디오 스파인, 음악이 soundtrack이 되고, Sume에 호스팅된 스틸 이미지 하나가 화면을 채웁니다. 그다음 오디오 분리가 MP4에서 믹싱된 트랙을 WAV나 MP3로 뽑아냅니다.
내용은 2026-09-28에 확인한 Timeline 1.0, 오디오 분리, 타임라인 오디오 문서와 Sume API 레퍼런스의 Timeline 필드 설명에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 음악 설정 하나하나가 영상의 소리에 어떤 영향을 주는지는 API로 영상에 배경 음악 넣기에서 다루며, 이 글은 오디오 파일을 만드는 데서 끝납니다.
이미 녹음한 오디오에 배경 음악을 넣을 수 있나요?
멀티트랙 오디오 편집기라면 어느 것이든 가능합니다. 음성을 한 트랙에, 음악을 다른 트랙에 두고, 음악을 낮추고, 말소리 아래에서 더 낮추고, 페이드한 뒤 한 번에 내보내면 됩니다.
Sume의 경로는 이미 Sume에 있는 파일로 동작합니다. 렌더에 들어가는 모든 URL은 앞서 실행한 Sume Job의 출력처럼 워크스페이스의 media.sume.com 아티팩트나 에셋이어야 하며, Sume는 생성 결과를 자체 미디어 URL로 미러링합니다. AI 보이스오버 만드는 방법에서처럼 텍스트 음성 변환으로 만든 음성, 그리고 Sume 음악 생성으로 만든 배경 음악이 여기에 들어맞습니다. 음악 생성의 프롬프트 가이드 (영문)는 브리프를 “Instrumental, no vocals.”(연주곡, 보컬 없음)로 마무리하고, 내레이션 아래에 깔 때는 “no spoken word”(말소리 없음)를 더하라고 안내합니다.
음성 아래 배경 음악은 얼마나 크게 깔아야 하나요?
모든 단어가 또렷하게 들릴 만큼 낮아야 합니다. 얼마나 낮출지는 믹스마다 판단할 문제이므로, 청중이 쓸 스피커나 이어폰과 같은 종류로 들어 보세요. Sume의 기본 배경 음악 레벨은 −16 dB이며, API 레퍼런스는 이를 스파인 아래에 까는 배경 음악 레벨이라고 설명합니다. duck_db(0–20)는 음성이 나오는 동안 배경 음악을 더 낮춥니다. 더킹과 배경 음악의 다른 설정인 loop, fade_out_seconds는 API로 영상에 배경 음악 넣기에서 설명합니다.
Sume API로는 어떻게 믹싱하나요?
음성을 audio.url로, 음악을 soundtrack으로, 스틸 이미지 하나를 video[]에 넣어 렌더를 한 번 보내세요.
audio.duration_seconds를 음성의 길이로 설정하세요. 출력은 항상 정확히 그 길이만큼 이어집니다. 현재 코드에서는 단어별 타임스탬프를 요청한 TTS 결과가 길이를duration_seconds로 알려 줍니다.video[]에는 슬롯이 하나 이상 있어야 하고 스틸 이미지는 정지 화면으로 유지되므로, Sume에 호스팅된 이미지 하나를 0부터 끝까지 두면 화면이 채워집니다.- 믹스는 음성 파일의 샘플 레이트와 채널 수를 그대로 이어받으므로, 유지하고 싶은 품질로 음성을 보내세요.
- 렌더는 Job으로 실행됩니다.
GET /v1/jobs/:id/status를 폴링한 다음,GET /v1/jobs/:id/result에서 MP4의video_url을 읽으세요.
curl -X POST https://api.sume.com/v1/timeline-1.0/render \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: intro-mix-001" \
-d '{
"audio": {
"url": "https://media.sume.com/artifacts/artf_demo/voice.wav",
"duration_seconds": 42
},
"soundtrack": {
"url": "https://media.sume.com/artifacts/artf_demo/music.mp3",
"loop": true,
"duck_db": 8,
"fade_out_seconds": 4
},
"video": [
{ "source_url": "https://media.sume.com/artifacts/artf_demo/cover.png", "start": 0, "duration": 42 }
]
}'믹스는 MP3나 WAV 파일로 어떻게 받나요?
렌더의 video_url을 POST /v1/audio-detach로 보내세요. 새 오디오 파일을 반환하며, 영상은 건드리지 않습니다. 아래 인트로처럼 믹스를 다시 이어 붙일 예정이라면 WAV를 유지하세요. MP3는 파일이 더 작습니다. 두 형식은 WAV vs MP3에서 비교합니다.
| 필드 | 값 | 생략 시 |
|---|---|---|
format | wav(pcm_s16le) 또는 mp3(128 kbps) | wav |
sample_rate | 16000, 44100, 48000 중 하나 | 원본의 샘플 레이트 |
channels | source 또는 mono | source |
range | 초 단위 { start, end? } | 트랙 전체 |
| 길이 상한 | 원본 최대 1,800초, Job당 출력 최대 900초 | 더 긴 믹스는 Job마다 range가 필요 |
curl -X POST https://api.sume.com/v1/audio-detach \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: intro-mix-mp3-001" \
-d '{
"video_url": "https://media.sume.com/artifacts/artf_demo/mix.mp4",
"format": "mp3",
"sample_rate": 44100
}'음성이 시작되기 전이나 끝난 뒤에도 음악이 나오게 할 수 있나요?
soundtrack만으로는 할 수 없습니다. 시작 시각 필드가 없어서 출력과 함께 시작하고, 페이드는 스파인의 마지막 몇 초 동안 진행됩니다. 팟캐스트 오프닝처럼 음악만 나오는 인트로나 아웃트로가 필요하다면 AI 징글 생성기에서처럼 짧은 스팅을 만든 뒤, 타임라인 오디오 concat으로 스팅, 믹스, 스팅을 순서대로 이어 붙이세요. concat은 Sume에 호스팅된 part 1–20개를 이음새에 무음을 넣지 않고 이어 붙입니다. 모든 part는 채널 레이아웃이 같아야 하며, 그렇지 않으면 이어 붙이기가 audio_parts_channel_mismatch로 실패합니다.
음성과 음악을 믹싱하는 비용은 얼마인가요?
API 요금에 나온 렌더의 공개 요율은 출력 분당 $0.10이며, ceil(audio.duration_seconds / 60)분으로 예약됩니다. 분리 요금은 Job당 $0.01로, 오디오 분리 문서 페이지에 나온 요율입니다. 그 페이지는 요율을 GET /v1/catalog에서 확인하라고 안내합니다. 음성과 음악을 만드는 작업, 그리고 concat을 쓴다면 concat도 각자의 요율로 과금되는 별도 Job이며, 모든 Job에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.
출처
관련 글
미디어 도구 카테고리의 다른 글
- MP4 소리는 나는데 화면이 안 나오나요? 영상 스트림 확인하기
소리는 나는데 화면이 안 나오는 MP4는 플레이어가 디코딩하지 못하는 영상 스트림이 있거나, 영상 스트림이 아예 없습니다. 코덱과 픽셀 형식을 프로브한 뒤 재인코딩하세요.
- Roku 광고 규격: Roku Ads Manager 영상·오디오 규칙
Roku 광고는 16:9, 6–92초, 최대 1 GB의 .mov 또는 .mp4, 23.98, 25, 29.97 fps, 6 Mbps 이상이어야 하며, 오디오는 48 kHz 2채널 스테레오입니다.
- SNS 영상 사이즈: 플랫폼 8곳 규격을 표 하나로 정리
세로 9:16은 대부분의 플랫폼이 제시하는 영상 형태입니다. TikTok, Instagram, Facebook, YouTube, Snapchat, X, LinkedIn, Pinterest의 영상 크기를 정리합니다.
- 영상을 용량별로 나누는 방법: 재인코딩 없이 분할하기
영상을 용량별로 나누려면 영상 길이에 한도 ÷ 파일 크기를 곱해 조각 길이를 구하고, 그 길이로 재인코딩 없이 자른 뒤 각 조각의 크기를 확인하세요.
작성자 Sume