의료 분야 AI 아바타: 환자 교육 영상 만들기
의료 분야에서는 AI 아바타를 일반적인 환자 교육에 쓰세요. 의료진이 검토한 짧은 영상에 대기실용 자막을 넣고, 환자 데이터는 담지 않습니다.
의료 분야에서 AI 아바타는 녹화된 일반 환자 교육에 적합합니다. 진료 전 준비 방법, 사후 관리 단계, 병원 안내, 대기실 설명 영상 같은 것입니다. 아바타는 의료진이 쓰거나 검토한 스크립트를 말하므로, 영상 하나에는 주제 하나만 담고, 특정 환자에 관한 정보는 빼고, 소리를 꺼 둔 공간을 위해 자막을 넣으세요. Sume에서는 주제 하나가 최대 60초 길이의 Avatar 1.0 말하는 영상 하나이며, 다른 언어는 TTS 1.0과 립싱크를 거칩니다.
Sume 관련 사실은 2026-09-28에 확인한 아바타 영상 생성과 아바타 영상 프리뷰 문서, Sume API 레퍼런스에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 이 글은 제작 워크플로를 다루며 의료, 법률, 컴플라이언스 조언이 아닙니다. 임상적 정확성과 개인정보 보호 규정은 여러분의 기관이 책임집니다.
어떤 환자 교육 영상이 AI 아바타에 맞나요?
모든 환자에게 같은 내용을 전하는 영상입니다.
- 의료진이 승인한 진료 전 준비, 사후 관리 단계, 방법 설명 영상.
- 접수 절차나 병원이 제공하는 서비스처럼 접수처와 대기실에서 전하는 안내.
- 진단, 검사 결과, 환자 한 명에 관한 내용은 맞지 않습니다. 아바타는 질문에 실시간으로 답할 수도 없습니다. 영상 하나하나가 제출하고, 폴링하고, 결과를 읽는 Job입니다.
AI 아바타로 환자 교육 영상은 어떻게 만드나요?
영상 하나에 주제 하나씩, 작은 라이브러리를 만드세요.
- 프롬프트, 프로필, 사진 중 하나로 병원에서 쓸 진행자를 한 명 만들고, 모든 영상에 같은 얼굴이 나오도록 그
avatar_handle을 재사용하세요. 요청은 재사용 가능한 AI 아바타 만들기에 나와 있습니다. - 스크립트마다 주제는 하나만 담으세요. Sume는 추정 4–60초를 받으며, 현재 기준으로 최대 약 165단어입니다. 단어 수 계산은 60초에 들어가는 단어 수에서 설명합니다.
- 대기실 화면에는
16:9를 고르고, 휴대폰용이라면 기본값9:16을 그대로 두세요. captions를 넣어 프리뷰를 만들고, 검토자가 첫 프레임 스틸을 승인하게 한 다음generate-video를 호출하세요. 저장된 자막은 그 단계에서 입혀집니다. 현재 코드에서 talking-video 경로를 직접 호출하면captions필드가 거부됩니다.- 각
Idempotency-Key에 주제와 버전을 넣으세요. 문서는 같은 작업과 페이로드에만 키를 재사용하라고 안내하므로, 수정한 스크립트에는 새 키를 씁니다.
curl -X POST https://api.sume.com/v1/avatar-video-previews \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: clinic-check-in-v1" \
-d '{
"avatar_handle": "clinic_host",
"script": "Welcome to our clinic. Please check in at the front desk and have your photo ID ready. We will call your name when your room is ready.",
"scene": { "type": "prompt", "prompt": "Calm clinic reception, soft daylight" },
"aspect_ratio": "16:9",
"captions": { "enabled": true, "style": "slam" }
}'영상을 스페인어나 다른 언어로 만들 수 있나요?
같은 요청으로는 만들 수 없습니다. 현재 코드에서 Avatar 1.0 말하는 영상은 영어로만 말합니다. 다른 언어라면 번역한 스크립트를 의료진이 검토하게 한 뒤, AI 아바타는 어떤 언어로 말할 수 있나요?에 나온 대로 TTS 1.0으로 음성을 만들고 VEED Fabric 1.0으로 같은 진행자를 립싱크하세요. Fabric은 아바타의 아이덴티티 스틸에서 시작하므로, 그 버전에는 말하는 영상의 장면이 이어지지 않습니다.
환자 정보는 어떻게 보호하나요?
영상에 넣지 마세요. Sume는 아바타 영상을 공개 media.sume.com 아티팩트로 반환하므로, 모든 파일은 링크를 가진 사람이라면 누구나 볼 수 있다고 생각하세요.
- 이름, 생년월일, 진료 기록 번호, 그 밖에 개인에 관한 세부 정보가 없는 스크립트를 쓰세요.
- 완성된 파일은 환자 포털이나 대기실 플레이어처럼 기관이 관리하는 호스팅으로 복사하고, 그 사본을 공유하세요.
- API 키는 서버에 두세요. Sume 문서는 프론트엔드 JavaScript나 모바일 앱에 API 키를 넣지 말라고 안내하므로, 환자가 쓰는 페이지나 앱에는 완성된 파일만 전달됩니다.
대기실 루프 영상은 어떻게 만드나요?
먼저 클립마다 자막을 넣고, Timeline 1.0으로 클립들을 파일 하나로 이어 붙인 뒤, 화면의 플레이어를 반복 재생으로 설정하세요. 현재 자막 Job은 60초보다 긴 소스를 거부하므로, 자막은 이어 붙이기 전에 넣어야 합니다. 현재 코드에서 렌더는 각 클립 자체의 소리를 버리므로, 60초보다 긴 AI 아바타 영상을 만드는 방법에 나온 대로 각 클립에서 분리한 음성을 오디오 스파인으로 쓰세요.
어떤 제한이 있나요?
아바타 영상은 품질 등급별로 초 단위로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준이고 기본적으로 5.5% 에이전트 수수료가 더해집니다. 그 밖의 상한은 다음과 같습니다.
| 구성 요소 | 한도 |
|---|---|
| 아바타 영상 하나 | 추정 4–60초, 아바타 하나, 공유 장면 하나. 현재 코드에서는 영어 음성 |
| 형태와 크기 | 1:1, 3:4, 9:16(기본값), 4:3, 16:9 중 하나. 문서에 나온 해상도는 720p |
| 자막 | 인라인 자막은 추정 60초까지. 단독 Job은 현재 오디오 스트림이 있고 60초 이하여야 함 |
| 번역 버전 | TTS는 요청당 최대 20,000자. Fabric은 Sume에 호스팅된 1–300초 오디오를 받으며 최대 10 MB |
| 대기실 루프 영상 | 1–1,800초 스파인, 최대 200개 슬롯과 20개 오디오 파트, 모두 Sume 호스팅 |
출처
관련 글
활용 사례 카테고리의 다른 글
- 웹사이트용 AI 아바타: 홈페이지에 넣는 말하는 환영 영상
웹사이트용 AI 아바타는 짧은 진행자 영상입니다. 페이지 형태에 맞춰 자막을 입힌 말하는 클립을 렌더링한 뒤, 포스터 이미지와 함께 MP4를 임베드하세요.
- AI B-roll 생성기: 프롬프트로 컷어웨이 클립 만들기
AI B-roll 생성기는 텍스트 프롬프트나 스틸로 컷어웨이 클립을 만듭니다. 편집본의 화면 비율에 맞추고, 모델이 허용하는 길이를 고르고, 소리는 빼세요.
- 사진으로 AI 생일 축하 영상 만들기: 움직임·음악·문구
사진 몇 장을 짧은 클립으로 움직이고, 새로 만든 연주곡 위에 이어 붙인 뒤, 메시지를 화면에 입혀 AI 생일 영상을 만드세요.
- AI 동화책 삽화 만들기: 모든 페이지에 같은 캐릭터
주인공을 그림 한 장으로 확정하고, 모든 페이지에서 레퍼런스로 재사용하고, 페이지마다 글 넣을 자리를 남겨 인쇄 크기로 생성하세요.
작성자 Sume