AI 라디오 광고 생성기: 대본, 음성, 배경 음악

AI 라디오 광고는 길이에 맞춘 대본, AI 음성, 배경 음악을 오디오 파일 하나로 믹싱한 것입니다. Sume API로 각 부분을 생성하는 방법을 설명합니다.

읽는 시간 5분Sume
전체 글

AI 라디오 광고 생성기는 오디오 광고를 세 부분으로 만듭니다. 광고 슬롯 길이에 맞춘 대본, 그 대본을 읽는 AI 음성, 그리고 음성 아래에 깔아 오디오 파일 하나로 믹싱하는 배경 음악입니다. Sume API에서는 텍스트 음성 변환(TTS)이 대본을 음성으로 만들고, Music Router가 글로 쓴 브리프로 연주곡 배경 음악을 만들고, Timeline 1.0 렌더가 음악을 음성 아래로 더킹해 둘을 믹싱하며, 오디오 분리가 완성된 광고를 WAV나 MP3로 반환합니다.

단계는 2026-09-28에 확인한 Sume의 Music Router (영문), Music 1.0 (영문), Timeline 1.0, 오디오 분리 문서와 Sume API 레퍼런스의 TTS 스키마를 따릅니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서, 가격은 API 요금 페이지를 만드는 코드에서 확인했습니다. 방송국과 광고 플랫폼은 길이, 음량, 파일 형식에 관한 자체 규정을 정하므로, 광고를 내보낼 곳에 확인하세요.

30초 라디오 광고에는 몇 단어가 들어가나요?

음성과 속도에 따라 달라지므로, 어떤 단어 수든 출발점으로만 삼으세요. 현재 코드에서 Sume의 아바타 영상 플래너는 초당 2.8단어로 추정하며, 이를 광고에 적용하면 아래와 같은 대략적인 분량이 나옵니다. 이는 아바타 클립용으로 만든 추정치이며, 어떤 음성에서 잰 속도도 아니고 규칙도 아닙니다.

그다음 실제로 읽은 길이를 재세요. 텍스트 음성 변환에 단어별 타임스탬프를 요청하면, 현재 코드에서는 결과가 파일의 duration_seconds를 알려 줍니다. 광고가 길거나 짧으면 단어를 빼거나 더하고, 또는 0.6에서 1.5 사이의 배수인 generation_config.speed를 설정한 뒤 다시 재세요. 길이를 맞추는 방법은 TTS 시간 계산기에서 다룹니다.

초당 2.8단어(Sume의 현재 아바타 영상 코드에 있는 추정치) 기준 대본 분량. 실제 길이는 Sume API 레퍼런스의 TTS 필드로 재세요. 2026-09-28 확인.
광고 길이대본 분량
15초약 42단어
30초약 84단어
60초약 168단어

대본은 어떻게 음성으로 만드나요?

대본을 음성과 함께 POST /v1/tts-1.0/generate로 보내세요. 음성은 목소리가 준비된 아바타의 avatar_id나 avatar_handle, 또는 Voices 라이브러리의 음성 같은 voice.id로 지정합니다. 영어가 아닌 대본에는 language를 지정하세요. 생략하면 영어가 기본값입니다. 믹스는 음성 파일의 샘플 레이트와 채널 수를 이어받으므로, 유지하고 싶은 품질로 음성을 만드세요. 클론한 목소리는 목소리 주인의 허락을 받은 경우에만 쓰세요. 클론하는 방법은 내 목소리로 AI 보이스오버 만들기에서 다룹니다. 전체 요청은 AI 보이스오버 만드는 방법에서 보여 줍니다.

배경 음악은 어떻게 만드나요?

POST /v1/music-router/generate에 보내는 프롬프트로 배경 음악을 설명하세요. 요청에 길이 필드가 없으므로 길이는 프롬프트에 넣습니다. 음악 문서는 감정, 장르, BPM으로 적은 템포, 조성, 악기 두 개에서 네 개, 구체적으로 짚은 순간 하나, 시대나 프로덕션을 적고 “Instrumental, no vocals.”로 마무리하며, 위에 목소리가 얹힐 때는 “no spoken word”를 더하는 브리프를 권합니다. 문서는 이를 보장되는 설정이 아니라 창작 방향이라고 부르므로, 믹싱하기 전에 들어 보세요. 배경 음악이 짧게 나오면 믹스에서 반복 재생할 수 있습니다.

curl -X POST https://api.sume.com/v1/music-router/generate \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: radio-bed-001" \
  -d '{
    "prompt": "Bright, friendly acoustic pop, 104 BPM, G major. Strummed acoustic guitar, light hand claps, warm upright bass. Steady and uncluttered, with a small lift at 0:20. Clean modern production. A 30-second track. Instrumental, no vocals, no spoken word."
  }'

음성과 음악을 광고 하나로 어떻게 믹싱하나요?

Timeline 1.0에서 렌더를 한 번 하세요. 음성은 audio.url로 넣고, audio.duration_seconds는 음성의 길이로 설정하고, 음악은 말소리 아래에서 낮추는 duck_db와 최대 10초의 fade_out_seconds 페이드를 더해 soundtrack으로 넣고, Sume에 호스팅된 스틸 이미지 하나를 video[]에 넣습니다. 그다음 MP4를 오디오 분리로 보내 WAV(기본값)나 128 kbps MP3를 받으세요. 광고의 길이는 음성 파일과 같습니다. 출력은 audio.duration_seconds만큼 이어지고, 배경 음악은 스파인의 마지막 몇 초 동안 페이드됩니다. 두 호출은 모두 음성과 배경 음악을 파일 하나로 믹싱하는 방법에 나와 있습니다.

AI 라디오 광고 비용은 얼마인가요?

Job 네 개가 들며, 각각 기본적으로 5.5% 에이전트 수수료가 더해져 과금됩니다.

  • 음성: 1,000자당 $0.0475, 공백과 문장 부호 포함. 새 테이크마다 다시 과금됩니다.
  • 배경 음악: 오디오 1건당 $0.125로, 생성 한 번마다 매겨지는 고정 가격입니다.
  • 믹스: 출력 분당 $0.10, ceil(audio.duration_seconds / 60)분으로 예약되므로 60초 이하의 광고는 일 분이 예약됩니다.
  • 오디오 파일: Job당 $0.01, 오디오 분리 문서 페이지에 나온 요율이며, 그 페이지는 GET /v1/catalog에서 확인하라고 안내합니다.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume