AI 보이스오버 만드는 방법: 대본에서 오디오 파일까지

AI 보이스오버는 대본 쓰기, 목소리 고르기, 음성 생성, 길이 확인, 파일 내려받기의 다섯 단계로 만듭니다. Sume API로 하는 방법을 설명합니다.

읽는 시간 5분Sume
전체 글

AI 보이스오버(내레이션)를 만들려면 소리 내어 읽을 대본을 쓰고, 목소리를 고르고, 텍스트 음성 변환(TTS) 도구로 대본을 음성으로 바꾸고, 오디오 길이를 확인한 뒤, 파일을 내려받아 영상, 슬라이드, 광고 밑에 까세요. Sume에서는 음성을 만드는 단계가 대본과 사용할 음성을 지정한 POST /v1/tts-1.0/generate 요청 하나입니다. 이 요청은 Job으로 실행되며, 보이스오버를 기본적으로 MP3로 반환하고, 요청하면 WAV로 반환합니다.

요청 필드는 Sume API 레퍼런스의 TTS 스키마에서, 폴링 단계는 Job과 결과 (영문) 문서에서 가져왔으며, 모두 2026-09-28에 확인했습니다. Sume API 레퍼런스는 API 레퍼런스 문서의 바탕이 되는 OpenAPI 문서입니다. 현재 동작이라고 설명한 세부 사항은 Sume의 코드에서, 가격은 API 요금 페이지를 만드는 코드에서 확인했습니다. 요청의 모든 필드는 텍스트 음성 변환(TTS) API에서 다룹니다.

AI 보이스오버 대본은 어떻게 쓰나요?

눈으로 읽을 글이 아니라 귀로 들을 말로 쓰세요. 음성은 transcript로 보낸 텍스트를 말하므로, 무엇을 말할지 정할 수 있는 곳은 대본뿐입니다.

  • 문장은 짧게 쓰고 한 문장에는 생각 하나만 담으세요. 생성하기 전에 대본을 한 번 소리 내어 읽어 보세요.
  • 숫자, 약어, 이름은 소리 나야 하는 대로 쓰세요. 잘못 읽히는 단어를 고치는 방법은 TTS 발음 교정에서 다룹니다.
  • 지문이나 메모는 빼세요. 대본에 들어간 내용은 모두 소리 내어 읽힙니다.
  • 요청 하나는 최대 20,000자를 받으며, 공백과 문장 부호도 사용량에 포함됩니다. 더 긴 대본은 긴 텍스트 TTS·오디오북 만들기에서처럼 나누세요.

어떤 음성을 써야 하나요?

톤이 콘텐츠에 어울리고 언어가 대본과 같은 음성을 고르세요. Sume의 TTS는 음성을 다음 두 가지 방법 중 하나로 받습니다.

  • 준비된 아바타의 음성: 그 아바타의 avatar_id나 avatar_handle을 보내세요. GET /v1/avatar-1.0/avatars가 내 아바타 목록을 반환하며, voice.status가 ready인 아바타라면 어느 것이든 쓸 수 있습니다. API 자체에서 찾아볼 수 있는 음성은 이것입니다. 현재 코드에서 아바타의 음성은 언어가 영어로 설정된 채 클론됩니다.
  • 이미 가진 음성 ID를 voice.id로 보내기: 음성 UUID나 Voices 라이브러리 ID(voi_ 뒤에 hex 문자 32개)를 넣습니다. 현재 코드에서 라이브러리 음성은 API가 아니라 Sume 앱에서 클론하거나 디자인합니다. 내 목소리로 AI 보이스오버 만들기와 텍스트 설명으로 AI 음성 만들기를 참고하세요. 사용 허락을 받은 목소리만 클론하세요.

보이스오버는 어떻게 생성하나요?

대본과 음성을 보내세요. 영어가 아닌 대본에는 language를 지정하세요. 생략하면 영어가 기본값입니다. 아래 요청은 WAV 파일과 단어별 타이밍을 요청합니다.

  • 기본 async 모드는 status_url과 result_url을 담아 바로 응답합니다. terminal이 true가 될 때까지 GET /v1/jobs/{id}/status를 폴링하고, sume_status가 completed이면 GET /v1/jobs/{id}/result를 읽으세요. 실패하거나 취소된 Job에는 결과가 없으며, /result는 409 job_not_completed로 응답합니다.
  • 완료된 결과는 Sume에 호스팅된 오디오 아티팩트를 제공합니다. 현재 코드에서는 결과의 audio_url이 media.sume.com에 있는 보이스오버 파일입니다.
  • 클라이언트가 타임아웃되면 요청을 다시 보내지 말고 계속 폴링하세요. 같은 Idempotency-Key와 같은 본문으로 재시도하면 두 번째 Job을 과금하는 대신 원래 Job이 반환됩니다.
curl -X POST https://api.sume.com/v1/tts-1.0/generate \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: mug-voiceover-001" \
  -d '{
    "transcript": "Meet the new travel mug. It fits every cup holder.",
    "avatar_handle": "product_host",
    "language": "en",
    "generation_config": { "speed": 1.0 },
    "output_format": { "container": "wav", "encoding": "pcm_s16le", "sample_rate": 44100 },
    "timestamps": { "words": true }
  }'

속도를 바꾸거나 길이를 확인하려면 어떻게 하나요?

generation_config.speed는 0.6에서 1.5 사이의 속도 배수이고, generation_config.volume은 0.5에서 2.0 사이의 볼륨 배수입니다. timestamps.words: true를 보내면 결과에 각 단어의 시작과 끝을 초 단위로 담은 words[]가 들어가고, 현재 코드에서는 파일 길이인 duration_seconds도 들어갑니다. 음성에 맞춰 화면을 편집하기 전에 이 값을 확인하세요. 대본을 15초, 30초, 60초 슬롯에 맞추는 방법은 TTS 시간 계산기에서 보여 줍니다.

보이스오버 파일로는 무엇을 하나요?

audio_url에서 내려받아 편집 도구에 넣거나, 파일이 이미 호스팅되어 있는 Sume에서 작업을 이어 가세요. 영상에 넣으면서 영상의 원래 소리를 살리거나, 배경 음악과 믹싱해 오디오 파일 하나로 만들 수 있습니다.

AI 보이스오버 비용은 얼마이고, 제한은 무엇인가요?

텍스트 음성 변환 요금은 1,000자당 $0.0475이며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 사용량은 대본 글자 수로 계산합니다. 새 테이크는 모두 같은 방식으로 과금되는 새 Job이므로, 긴 대본을 다시 생성하기 전에 바꾼 줄만 따로 테스트해 보세요.

Sume API 레퍼런스의 TTS 1.0 요청 스키마와 API 요금 페이지를 만드는 코드 기준, 2026-09-28 확인.
한도값
대본 길이요청당 1–20,000자. 공백과 문장 부호도 포함
오디오 길이1,200초를 넘으면 tts_duration_exceeded로 실패하며, 크레딧은 확정되지 않음
속도generation_config.speed, 0.6–1.5
볼륨generation_config.volume, 0.5–2.0
파일기본값은 44,100 Hz, 128 kbps MP3. output_format으로 wav나 raw 선택 가능
전달 방식폴링이나 웹훅을 쓰는 비동기 Job. 스트리밍 아님
가격1,000자당 $0.0475

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume