AI 아바타란 무엇인가요? 하는 일과 할 수 없는 일
AI 아바타는 얼굴과 목소리를 갖춘 디지털 진행자로, 직접 쓴 스크립트를 영상 속에서 말합니다. 하는 일, 만드는 방법, 한계를 정리했습니다.
AI 아바타는 AI로 움직이는 얼굴과 목소리로 이루어진 디지털 진행자로, 직접 쓴 스크립트를 영상 속에서 말하므로 사람을 촬영할 필요가 없습니다. 대사를 바꾸면 다시 촬영하지 않아도 새 영상이 나옵니다. 같은 이름이 AI 프로필 사진이나 게임 캐릭터에도 쓰이지만, 이 글은 화면에서 말하는 진행자를 다룹니다.
Sume에서 아바타는 텍스트 프롬프트, 짧은 프로필, 사진 중 하나로 한 번 만들어 두고, 이후 4–60초 길이의 말하는 영상에서 handle로 불러 쓰는 재사용 가능한 아이덴티티입니다. 아바타가 만드는 것은 영상 파일이며, 말을 걸면 대답하는 실시간 캐릭터가 아닙니다. Sume 관련 세부 내용은 2026-09-28에 확인한 Models 개요 (영문), 아바타 만들기, 아바타 영상 생성 문서와 Sume API 레퍼런스에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다.
AI 아바타는 무엇을 하나요?
진행자 역할을 합니다. 대사를 주면 아바타가 카메라 앞에서 그 대사를 말합니다. 제품 설명 영상, 강의 세그먼트, UGC 스타일 광고, 고객이 자꾸 묻는 질문에 대한 답변 같은 것입니다.
Sume에서는 두 단계 워크플로입니다. 먼저 아바타를 만듭니다. 생성은 Job이며, Job이 끝나면 아바타가 워크스페이스의 재사용 가능한 리소스가 됩니다. 그다음 스크립트, 또는 video_inputs에 담은 여러 장면을 아바타의 handle과 함께 보냅니다. 말하는 영상도 하나하나가 별도의 Job입니다. 요청을 제출하고, 폴링하거나 완료를 기다린 다음, 결과 URL을 읽습니다.
AI 아바타는 어떻게 생겼나요?
영상 통화 속 사람과 비슷합니다. 카메라를 향한 얼굴과 어깨가 말을 하고, 거기에 어울리는 목소리가 나옵니다. 얼마나 실제 사람처럼 보이는지는 아바타를 만든 도구에 따라 다릅니다.
Sume 아바타는 사진에서 시작하더라도 생성된 인물입니다. 현재 코드에서 사진 아바타는 사진 그 자체가 아니라, 사진을 바탕으로 새로 그린 이미지입니다. 아바타가 준비되면 preview_image_url이 그 인물을 Sume가 호스팅하는 공개 이미지로 보여 주므로, 아바타로 무엇이든 렌더링하기 전에 얼굴을 확인할 수 있습니다. 또 현재 코드에서는 아바타를 만들 때 목소리도 함께 만들어지며, 아바타는 그 목소리의 상태를 processing, ready, failed 중 하나로 알려 줍니다. 얼굴과 목소리가 만들어지는 방식은 AI 아바타는 어떻게 작동하나요?에서 설명합니다.
AI 아바타는 어떻게 만드나요?
인물을 글로 설명하거나, 짧은 프로필을 주거나, 사진에서 시작하세요. Sume에서는 이 세 가지가 POST /v1/avatar-1.0/generate의 입력이며, 전체 요청은 재사용 가능한 AI 아바타 만들기에 나와 있습니다. API 요금에는 생성 요금이 아바타당 $0.95로 나와 있고, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 이미 쓰이고 있는 handle은 409 avatar_handle_taken을 반환하므로, 다시 만들려는 아바타에는 새 handle이 필요합니다.
AI 아바타가 실시간으로, 또는 어떤 언어로든 말할 수 있나요?
현재 Sume 아바타는 할 수 없습니다. 모든 말하는 영상은 Job으로 렌더링됩니다. mode: sync도 최대 30초만 기다리며, 이 상한은 Job이 아니라 HTTP 대기 시간에 걸리므로 아바타는 실시간 대화를 이어 갈 수 없습니다.
또한 현재 코드에서 말하는 영상은 영어로만 말하며, 각 아바타의 목소리도 영어로 클론됩니다. 다른 언어가 필요하면 TTS 1.0과 그 language 필드로 음성을 만든 다음, VEED Fabric 1.0으로 아바타를 그 오디오에 립싱크하세요. AI 아바타는 어떤 언어로 말할 수 있나요?에서 단계별로 설명합니다.
어떤 제한이 있나요?
아래 제한은 모든 Avatar 1.0 말하는 영상에 적용됩니다. 더 긴 영상이 필요하면 스크립트를 줄이거나 여러 Job으로 나누라고 문서는 안내합니다.
| 제한 | Avatar 1.0 말하는 영상 |
|---|---|
| 길이 | 추정 4–60초(양 끝 포함) |
| 인물 | 영상 하나에 아바타 하나, 장면 배경은 하나의 공유 장면으로 해석됨 |
| 화면 비율 | 1:1, 3:4, 9:16, 4:3, 16:9, 기본값 9:16 |
| 해상도 | 문서에 나온 해상도는 720p |
| 음성 | 영어만 |
| 대화 | 없음. 영상마다 폴링하는 Job이며 실시간 스트림이 아님 |
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- Sume Avatar 1.0을 소개합니다
Sume Avatar 1.0은 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다.
- Avatar Face Swap API(베타): 영상에 아바타 얼굴 입히기
Avatar Face Swap 1.0은 준비된 아바타의 얼굴을 짧은 공개 소스 영상에 입히는 Sume의 베타 엔드포인트입니다. 필수 필드, 제한, 폴링을 다룹니다.
- 아바타 영상 프리뷰: 렌더링 전에 첫 프레임 승인하기
아바타 영상 프리뷰를 만들어 첫 프레임 스틸을 받고, 필요하면 다시 생성한 뒤, 프리뷰 id로 generate-video를 호출해 최종 영상을 렌더링하세요.
- 다중 장면 아바타 영상 API: 순서 있는 장면으로 영상 하나 만들기
스크립트 하나 대신 순서 있는 video_inputs를 보내 말하는 장면과 무음 장면을 4-60초 아바타 영상 하나로 합성하세요. 장면 필드, 규칙, 제한을 다룹니다.
작성자 Sume