의료 분야 AI 아바타: 환자 교육 영상 만들기

의료 분야에서는 AI 아바타를 일반적인 환자 교육에 쓰세요. 의료진이 검토한 짧은 영상에 대기실용 자막을 넣고, 환자 데이터는 담지 않습니다.

읽는 시간 5분Sume
전체 글

의료 분야에서 AI 아바타는 녹화된 일반 환자 교육에 적합합니다. 진료 전 준비 방법, 사후 관리 단계, 병원 안내, 대기실 설명 영상 같은 것입니다. 아바타는 의료진이 쓰거나 검토한 스크립트를 말하므로, 영상 하나에는 주제 하나만 담고, 특정 환자에 관한 정보는 빼고, 소리를 꺼 둔 공간을 위해 자막을 넣으세요. Sume에서는 주제 하나가 최대 60초 길이의 Avatar 1.0 말하는 영상 하나이며, 다른 언어는 TTS 1.0과 립싱크를 거칩니다.

Sume 관련 사실은 2026-09-28에 확인한 아바타 영상 생성과 아바타 영상 프리뷰 문서, Sume API 레퍼런스에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 이 글은 제작 워크플로를 다루며 의료, 법률, 컴플라이언스 조언이 아닙니다. 임상적 정확성과 개인정보 보호 규정은 여러분의 기관이 책임집니다.

어떤 환자 교육 영상이 AI 아바타에 맞나요?

모든 환자에게 같은 내용을 전하는 영상입니다.

  • 의료진이 승인한 진료 전 준비, 사후 관리 단계, 방법 설명 영상.
  • 접수 절차나 병원이 제공하는 서비스처럼 접수처와 대기실에서 전하는 안내.
  • 진단, 검사 결과, 환자 한 명에 관한 내용은 맞지 않습니다. 아바타는 질문에 실시간으로 답할 수도 없습니다. 영상 하나하나가 제출하고, 폴링하고, 결과를 읽는 Job입니다.

AI 아바타로 환자 교육 영상은 어떻게 만드나요?

영상 하나에 주제 하나씩, 작은 라이브러리를 만드세요.

  • 프롬프트, 프로필, 사진 중 하나로 병원에서 쓸 진행자를 한 명 만들고, 모든 영상에 같은 얼굴이 나오도록 그 avatar_handle을 재사용하세요. 요청은 재사용 가능한 AI 아바타 만들기에 나와 있습니다.
  • 스크립트마다 주제는 하나만 담으세요. Sume는 추정 4–60초를 받으며, 현재 기준으로 최대 약 165단어입니다. 단어 수 계산은 60초에 들어가는 단어 수에서 설명합니다.
  • 대기실 화면에는 16:9를 고르고, 휴대폰용이라면 기본값 9:16을 그대로 두세요.
  • captions를 넣어 프리뷰를 만들고, 검토자가 첫 프레임 스틸을 승인하게 한 다음 generate-video를 호출하세요. 저장된 자막은 그 단계에서 입혀집니다. 현재 코드에서 talking-video 경로를 직접 호출하면 captions 필드가 거부됩니다.
  • 각 Idempotency-Key에 주제와 버전을 넣으세요. 문서는 같은 작업과 페이로드에만 키를 재사용하라고 안내하므로, 수정한 스크립트에는 새 키를 씁니다.
curl -X POST https://api.sume.com/v1/avatar-video-previews \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: clinic-check-in-v1" \
  -d '{
    "avatar_handle": "clinic_host",
    "script": "Welcome to our clinic. Please check in at the front desk and have your photo ID ready. We will call your name when your room is ready.",
    "scene": { "type": "prompt", "prompt": "Calm clinic reception, soft daylight" },
    "aspect_ratio": "16:9",
    "captions": { "enabled": true, "style": "slam" }
  }'

영상을 스페인어나 다른 언어로 만들 수 있나요?

같은 요청으로는 만들 수 없습니다. 현재 코드에서 Avatar 1.0 말하는 영상은 영어로만 말합니다. 다른 언어라면 번역한 스크립트를 의료진이 검토하게 한 뒤, AI 아바타는 어떤 언어로 말할 수 있나요?에 나온 대로 TTS 1.0으로 음성을 만들고 VEED Fabric 1.0으로 같은 진행자를 립싱크하세요. Fabric은 아바타의 아이덴티티 스틸에서 시작하므로, 그 버전에는 말하는 영상의 장면이 이어지지 않습니다.

환자 정보는 어떻게 보호하나요?

영상에 넣지 마세요. Sume는 아바타 영상을 공개 media.sume.com 아티팩트로 반환하므로, 모든 파일은 링크를 가진 사람이라면 누구나 볼 수 있다고 생각하세요.

  • 이름, 생년월일, 진료 기록 번호, 그 밖에 개인에 관한 세부 정보가 없는 스크립트를 쓰세요.
  • 완성된 파일은 환자 포털이나 대기실 플레이어처럼 기관이 관리하는 호스팅으로 복사하고, 그 사본을 공유하세요.
  • API 키는 서버에 두세요. Sume 문서는 프론트엔드 JavaScript나 모바일 앱에 API 키를 넣지 말라고 안내하므로, 환자가 쓰는 페이지나 앱에는 완성된 파일만 전달됩니다.

대기실 루프 영상은 어떻게 만드나요?

먼저 클립마다 자막을 넣고, Timeline 1.0으로 클립들을 파일 하나로 이어 붙인 뒤, 화면의 플레이어를 반복 재생으로 설정하세요. 현재 자막 Job은 60초보다 긴 소스를 거부하므로, 자막은 이어 붙이기 전에 넣어야 합니다. 현재 코드에서 렌더는 각 클립 자체의 소리를 버리므로, 60초보다 긴 AI 아바타 영상을 만드는 방법에 나온 대로 각 클립에서 분리한 음성을 오디오 스파인으로 쓰세요.

어떤 제한이 있나요?

아바타 영상은 품질 등급별로 초 단위로 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준이고 기본적으로 5.5% 에이전트 수수료가 더해집니다. 그 밖의 상한은 다음과 같습니다.

아바타 영상 생성, 영상 캡션, Timeline 1.0, Sume API 레퍼런스 기준, 2026-09-28 확인.
구성 요소한도
아바타 영상 하나추정 4–60초, 아바타 하나, 공유 장면 하나. 현재 코드에서는 영어 음성
형태와 크기1:1, 3:4, 9:16(기본값), 4:3, 16:9 중 하나. 문서에 나온 해상도는 720p
자막인라인 자막은 추정 60초까지. 단독 Job은 현재 오디오 스트림이 있고 60초 이하여야 함
번역 버전TTS는 요청당 최대 20,000자. Fabric은 Sume에 호스팅된 1–300초 오디오를 받으며 최대 10 MB
대기실 루프 영상1–1,800초 스파인, 최대 200개 슬롯과 20개 오디오 파트, 모두 Sume 호스팅

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume