ChatGPT 텍스트 음성 변환(TTS): MCP로 오디오 파일 만들기

ChatGPT Voice는 답변을 소리 내어 들려줍니다. 내 대본을 오디오 파일로 받으려면 개발자 모드에서 MCP로 ChatGPT에 텍스트 음성 변환 도구를 추가하세요.

읽는 시간 5분Sume
전체 글

ChatGPT는 대화 중에 답변을 음성으로 들려줍니다. OpenAI 도움말 페이지에 따르면 ChatGPT Voice로 ChatGPT와 말로 대화하고 음성 응답을 들을 수 있습니다. 내 대본을 내려받아 다시 쓸 수 있는 오디오 파일로 만들려면 ChatGPT가 텍스트 음성 변환(TTS) 도구를 쓸 수 있게 하세요. 개발자 모드를 켜고, 그런 도구가 있는 원격 MCP 서버를 추가한 뒤, ChatGPT에게 대본을 읽어 달라고 요청하면 됩니다. https://mcp.sume.com/mcp의 Sume 호스팅 MCP 서버에서는 그 도구가 tts_create이며, ChatGPT는 완성된 파일의 링크를 돌려줍니다. WAV를 요청하지 않으면 파일은 MP3입니다.

ChatGPT 쪽 내용은 OpenAI의 ChatGPT Voice 도움말 페이지와 ChatGPT 개발자 모드 가이드에서, Sume 쪽 내용은 MCP 도구와 게이트, MCP OAuth와 API 키, Sume API 레퍼런스의 TTS 1.0 스키마에서 가져왔습니다. 모두 2026-09-28에 확인했습니다. Sume 기초 페이지는 호스팅 MCP가 여전히 동작하지만 현재 주 경로는 아니라고 설명합니다. 백엔드에서는 텍스트 음성 변환 API를 직접 호출하세요.

ChatGPT에 텍스트 음성 변환 도구를 어떻게 연결하나요?

개발자 모드로 연결합니다. OpenAI는 개발자 모드가 "full Model Context Protocol (MCP) client support for all tools, both read and write"(읽기와 쓰기를 가리지 않고 모든 도구에 대한 MCP 클라이언트 기능 완전 지원)를 제공한다고 설명하며, 이 모드에 Elevated risk(위험도 높음) 라벨을 붙입니다. 웹에서 Pro, Plus, Business, Enterprise, Education 계정이 쓸 수 있습니다. Settings → Security and login에서 개발자 모드를 켜고, https://mcp.sume.com/mcp에 OAuth로 연결하는 개발자 모드 앱을 만든 뒤, Sume 동의 페이지에서 Write를 켜세요. Write는 기본적으로 꺼져 있으며, 읽기 전용 세션은 tts_create 같은 유료 도구에서 insufficient_scope를 받습니다. Sume에는 ChatGPT 전용 커넥터가 없습니다. 화면별 단계는 ChatGPT에 MCP 서버를 추가하는 방법에서 차례로 안내합니다.

오디오 파일을 만들려면 ChatGPT에게 뭐라고 요청하나요?

플러스 메뉴에서 Developer mode를 고르고 대화에 쓸 Sume 앱을 선택하세요. OpenAI는 명시적으로 요청하라고 권합니다. 앱과 도구 이름을 직접 말하고, ChatGPT가 엉뚱한 도구를 쓰지 않도록 다른 도구는 쓰지 말라고 하세요. 예를 들면 다음과 같습니다.

Use the Sume app's tts_create tool to voice the script below
with my narrator avatar. Only use the Sume app.
Run it with dry_run first and show me the cost.

Welcome to the tour. First, open the dashboard.

ChatGPT는 어떤 음성을 쓰나요?

여러분이 지정한 Sume 음성을 씁니다. tts_create에는 음성이 꼭 필요하며, 찾아서 쓸 수 있는 음성은 목소리가 준비된 Sume 아바타의 음성입니다. ChatGPT는 읽기 전용 도구인 avatars_list로 내 아바타를 찾을 수 있고, 이미 Sume 음성 ID가 있다면 대신 voice.id를 써도 됩니다. 다른 서비스의 음성 이름은 거부되므로, Juniper 같은 ChatGPT Voice 자체 음성은 그대로 가져올 수 없습니다. 영어가 아닌 대본에는 language를 지정하세요. 언어를 생략하면 영어가 기본값입니다. 요청 필드는 모두 텍스트 음성 변환 API에 나와 있습니다.

어떤 도구 호출에 내 승인이 필요한가요?

드라이 런을 포함한 tts_create 호출입니다. OpenAI에 따르면 쓰기 작업은 기본적으로 확인이 필요하고, ChatGPT는 readOnlyHint 도구 어노테이션을 따릅니다. 현재 코드에서 Sume는 avatars_list, jobs_wait, jobs_result를 읽기 전용으로, tts_create를 쓰기로 표시하므로, ChatGPT는 기본적으로 드라이 런 전에 한 번, 실제 제출 전에 다시 한 번 묻습니다. 매번 보여 주는 입력에서 대본, 음성, dry_run을 확인하세요.

OpenAI ChatGPT 개발자 모드 가이드, MCP 도구와 게이트, Job과 결과 (영문) 기준, 2026-09-28 확인. 읽기 전용과 쓰기 표시는 Sume의 현재 코드 기준입니다.
호출하는 일승인
avatars_list내 아바타를 나열해 ChatGPT가 목소리가 준비된 아바타를 고를 수 있게 함읽기 전용
dry_run: true를 넣은 tts_create비용을 미리 보여 줌. Job은 제출되지 않음쓰기: 기본적으로 확인 필요
tts_create필수 값인 idempotency_key와 함께 Job을 제출하고, 오디오가 아니라 Job ID를 반환쓰기: 기본적으로 확인 필요
jobs_wait호출당 최대 55초 대기. Job이 실행 중이면 다음 단계는 같은 ID로 다시 기다리는 것이며, 두 번째 제출은 하지 않음읽기 전용
jobs_result파일의 audio_url이 담긴 완료된 Job을 반환(현재 코드)읽기 전용

Job이 끝나면 오디오 파일은 어디에 있나요?

jobs_result 출력에 있습니다. OpenAI 가이드에 따르면 각 도구 호출을 펼치면 JSON 입력과 출력 전체를 볼 수 있으므로, ChatGPT의 답변에서 빠졌더라도 audio_url은 거기에 있습니다. 이 URL은 media.sume.com의 공개 아티팩트를 가리키며, 채팅 밖에서도 열거나 내려받을 수 있습니다.

비용은 얼마이고, 한도는 어떻게 되나요?

tts_create는 1,000자당 $0.0475로 과금되며 기본적으로 5.5% 에이전트 수수료가 더해지고, dry_run은 Job을 제출하지 않고 비용을 미리 보여 줍니다. 호출 하나는 최대 20,000자를 받으며, 1,200초를 넘는 오디오는 tts_duration_exceeded로 실패하고 크레딧은 확정되지 않습니다. 이 파일은 실시간 음성이 아니며, Job이 완료되어야 생깁니다. 나머지 규칙은 어느 MCP 클라이언트에서든 같습니다. Claude 텍스트 음성 변환을 참고하세요.

출처

관련 글

에이전트 카테고리의 다른 글

에이전트 글 전체 보기

작성자 Sume