AI 아바타는 어떻게 작동하나요? 얼굴, 목소리, 영상 단계별로
AI 아바타 영상은 얼굴, 그 얼굴에 맞는 목소리, 얼굴이 스크립트를 말하게 하는 움직임을 조합해 만듭니다. Sume에서 각 단계가 어떻게 작동하는지 설명합니다.
AI 아바타는 얼굴, 그 얼굴에 어울리는 목소리, 얼굴이 스크립트를 말하게 만드는 움직임을 조합해 진행자를 만드는 방식으로 작동합니다. 도구에 따라 얼굴과 목소리는 사진, 녹음, 텍스트 설명에서 시작하며, 결과물은 새로 촬영한 영상이 아니라 직접 쓴 글로 렌더링한 영상입니다.
현재 Sume에서는 아바타를 만들면 프롬프트, 프로필, 사진 중 하나로 아이덴티티 이미지를 생성하고, 그 얼굴에 어울리는 목소리도 함께 만듭니다. 이후 말하는 영상마다 스크립트를 말하는 데 걸리는 시간을 추정하고, 첫 프레임을 렌더링하고, 대사를 짧은 클립으로 만든 뒤, 클립들을 영상 하나로 합성합니다. 자막과 음악은 추가할 경우 마지막에 들어갑니다. 아래 단계는 2026-09-28에 확인한 아바타 영상 생성과 아바타 영상 프리뷰 문서, Sume API 레퍼런스에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다.
AI 아바타는 어떻게 만들어지나요?
아바타 생성은 Job 하나이며, 결과는 얼굴과 목소리 두 가지입니다.
- 얼굴. 현재 코드에서 이 단계는 9:16 인물 이미지 한 장을 출력하는 이미지 생성 단계입니다. 사진 아바타는 "Photo of this person"(이 인물의 사진)이라는 프롬프트로 사진을 다시 그려 만들고, 프롬프트 아바타와 프로필 아바타는 보낸 텍스트나
ethnicity,sex,age값을 바탕으로 그립니다. 아바타가 준비되면preview_image_url에서 결과를 볼 수 있습니다. - 목소리. 이 역시 현재 코드 기준으로, Sume는 인물의 외모와 나이에 맞춘 목소리로 말하는 샘플을 생성한 뒤 그 목소리를 클론합니다. 아바타는 목소리 자체의 상태를
processing,ready,failed중 하나로 알려 줍니다. - 둘의 연결. 현재 코드에서는 목소리가 준비되기 전에 요청한 말하는 영상이
409 avatar_not_ready("Avatar voice is not ready for video generation.")로 거부됩니다. 목소리가ready가 되면 아바타의 handle을 넘길 때 TTS 1.0도 그 목소리로 말할 수 있습니다.
아바타는 어떻게 말하나요?
말하는 영상은 준비된 아바타와 스크립트, 또는 video_inputs에 담은 여러 장면에서 시작해 다음 단계로 진행됩니다.
- 추정. 현재 코드에서 Sume는 초당 2.8단어로 세어 스크립트를 말하는 데 걸리는 시간을 추정하며, 계획된 길이는 4–60초(양 끝 포함) 안에 들어와야 합니다. 계산 방법은 AI 아바타 영상의 스크립트 길이에서 다룹니다.
- 첫 프레임. 장면 속 아바타의 스틸 한 장으로 렌더가 시작됩니다. 여러 장면이 하나의 장면을 공유하면, 뒤쪽 장면의 스틸은 그 첫 프레임의 포즈를 이어받은 연속 이미지입니다. 아바타 영상 프리뷰는 이 단계만 실행하므로, 전체 렌더 비용을 내기 전에 구도를 승인할 수 있습니다.
- 클립. 대사는 짧은 클립으로 렌더링되며, 현재 코드에서 클립 하나는 4–12초이고 영어로만 말합니다.
- 합성. 클립들이 합성된 영상 하나가 됩니다. 영상 하나에는 아바타 하나와 공유 장면 하나가 들어갑니다.
자막과 음악은 어느 단계에서 들어가나요?
토킹 헤드가 만들어진 뒤, 그리고 요청했을 때만 들어갑니다. 요청은 아바타 영상 프리뷰에서 하세요. 프리뷰는 자막과 패키지 의도를 저장해 두었다가 generate-video가 실행될 때 적용합니다. 현재 코드에서는 레퍼런스에 나와 있는데도 POST /v1/avatar-1.0/talking-video 자체가 captions와 package를 400 invalid_request로 거부합니다.
둘 다 설정하면 서버는 이 순서로 처리합니다. 먼저 깨끗한 토킹 헤드를 만들고, 그 깨끗한 영상에 자막을 입힌 다음, 프롬프트로 생성하거나 링크한 트랙에서 가져온 음악을 그 아래에 믹싱합니다. 자막이나 음악 단계가 실패하면 가장 멀리까지 성공한 영상이 남습니다. 자막 단계가 성공했다면 자막이 들어간 영상, 아니면 깨끗한 영상입니다.
각 단계는 내 영상에 어떤 의미가 있나요?
각 단계가 실제로 의미하는 바는 다음과 같습니다.
| 단계 | Sume가 만드는 것 | 실제 의미 |
|---|---|---|
| 아바타 이미지 | 프롬프트, 프로필, 사진으로 만든 9:16 인물 이미지 한 장 | 사진 아바타는 새 이미지. preview_image_url로 확인 |
| 목소리 | 얼굴에 어울리게 만든 뒤 클론한 목소리 | voice.status가 ready가 될 때까지 영상은 409 avatar_not_ready로 거부됨 |
| 추정 | 초당 2.8단어 | 영상마다 추정 길이가 4–60초여야 함 |
| 첫 프레임 | 장면 속 아바타의 스틸 | 프리뷰로 전체 렌더 전에 확인 가능 |
| 클립 | 각 4–12초, 영상 하나로 합성 | 영상 하나에 아바타 하나와 공유 장면 하나 |
| 후반 작업 | 자막, 그다음 음악 | 단계가 실패하면 가장 멀리까지 성공한 영상이 남음 |
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- AI 아바타 프롬프트 작성법: 말하는 진행자 묘사하기
영상용 AI 아바타 프롬프트는 한 사람의 나이, 외모, 머리, 옷차림, 표정을 묘사합니다. 무엇을 쓸지, Sume가 무엇을 더하는지, 무엇은 정할 수 없는지 설명합니다.
- 립싱크와 더빙의 차이: 어느 쪽이 필요한가요?
더빙은 영상 속 음성을 바꾸고, 립싱크는 입 모양을 오디오에 맞춥니다. 립싱크 더빙은 둘 다 합니다. 각각의 뜻과 어느 쪽이 필요한지 정리했습니다.
- 토킹 헤드와 B-roll의 차이는 무엇인가요?
토킹 헤드는 카메라를 보고 말하는 사람의 샷이고, B-roll은 그 사람의 목소리가 계속 나오는 동안 잘라 넣는 영상입니다. 둘이 어떻게 맞물리는지 설명합니다.
- AI 아바타 UGC 영상 프롬프트: 필드마다 무엇을 쓰나요?
AI 아바타의 UGC 영상 프롬프트는 입력 하나가 아니라 세 개입니다. 크리에이터의 대사, 장소와 조명을 정하는 장면 프롬프트, 그리고 제품 이미지입니다.
작성자 Sume