토킹 헤드 영상이란 무엇인가요? 뜻과 만드는 방법
토킹 헤드 영상은 한 사람이 가슴 위쯤부터 잡힌 화면에서 카메라를 보고 말하는 영상입니다. 뜻과 쓰임새, AI로 만드는 방법을 정리했습니다.

토킹 헤드 영상은 한 사람이 가슴 위쯤부터 잡힌 화면에서 카메라를 똑바로 보고 말하며, 그 말이 영상을 이끌어 가는 영상입니다. 설명 영상, 공지, 강의, 브이로그, UGC 스타일 광고 모두 토킹 헤드 영상이 될 수 있습니다. 직접 촬영할 수도 있고, 카메라 없이 만들 수도 있습니다. 스크립트를 말하는 AI 아바타를 쓰거나, 스틸 사진을 녹음한 음성이나 생성한 음성에 립싱크하면 됩니다.
Sume에서는 두 가지 경로가 있습니다. 스크립트와 준비된 아바타로 만드는 4–60초 길이의 Avatar 1.0 말하는 영상, 또는 스틸 이미지나 아바타 하나를 Sume에 호스팅된 최대 300초 길이의 오디오에 맞춰 움직이는 VEED Fabric 1.0입니다. Sume 관련 사실은 2026-09-28에 확인한 아바타 영상 생성과 Models 개요 (영문) 문서, Sume API 레퍼런스에서 가져왔고, 정의는 일반적인 설명입니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다.
영상에서 토킹 헤드는 무슨 뜻인가요?
샷을 가리키는 이름입니다. 머리와 어깨가 나오고, 말을 하는 샷입니다. 인터뷰에서 토킹 헤드는 답하는 사람이고, 진행자 영상에서는 진행자입니다. 편집에서 토킹 헤드는 화자를 담은 주 영상으로 A-roll이라고도 부르며, 목소리가 계속되는 동안 잘라 넣는 영상은 B-roll입니다. 둘이 어떻게 맞물리는지는 토킹 헤드와 B-roll의 차이는 무엇인가요?에서 다룹니다.
이 형식은 화자의 말 자체가 콘텐츠일 때 잘 맞습니다. 변경 사항을 발표하는 창업자, 수업을 차근차근 진행하는 교사, 자주 묻는 질문에 답하는 고객 지원 리드, 제품을 리뷰하는 크리에이터 같은 경우입니다.
촬영 없이 토킹 헤드 영상을 어떻게 만드나요?
가진 것에서 시작하세요. 스크립트만 있다면 AI 아바타가 그 스크립트를 말할 수 있습니다. 음성이 오디오 파일로 있다면 스틸 사진이나 아바타를 그 음성에 립싱크할 수 있습니다. Sume에서는 이 오디오가 TTS 1.0으로 만든 음성처럼 Sume에 호스팅된 파일이어야 합니다. 생성한 영상 클립 아래에 내레이션을 까는 방법은 통하지 않습니다. Sume의 모델 가이드에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 립싱크하지 않습니다. Sume의 경로는 토킹 헤드 영상 API: 아바타 vs 립싱크 vs 모션 컨트롤에서 자세히 비교합니다.
| 만드는 방법 | 필요한 것 | Sume에서 |
|---|---|---|
| 직접 촬영 | 사람, 카메라, 조용한 방 | Sume 기능 아님 |
| 스크립트로 만드는 AI 아바타 | 대사와 진행자 | Avatar 1.0 말하는 영상: 추정 4–60초, 영어 음성 |
| 스틸을 음성에 립싱크 | 사진이나 아바타, 그리고 오디오로 된 음성 | VEED Fabric 1.0: TTS 1.0 출력 같은 Sume 호스팅 오디오 1–300초, 최대 10 MB |
토킹 헤드 영상은 어떤 화면 비율로 만들어야 하나요?
영상이 재생되는 곳을 따릅니다. 휴대폰 피드라면 세로, 웹사이트나 슬라이드 덱이라면 16:9입니다. Sume 아바타 영상은 기본값이 세로 9:16이며, 그 밖에 네 가지 화면 비율을 더 지원합니다. 화면 비율, 크기, 파일은 토킹 헤드 영상 포맷에서 다룹니다.
Sume의 AI 토킹 헤드에는 어떤 제한이 있나요?
Avatar 1.0 토킹 헤드는 추정 4–60초 길이에 아바타 하나와 공유 장면 하나로 구성되고, 현재 코드에서는 영어로만 말하며, 실시간이 아니라 폴링하는 Job으로 렌더링됩니다. 이 제한은 AI 아바타란 무엇인가요?에 정리되어 있고, 60초보다 긴 AI 아바타 영상을 만드는 방법은 여러 파트를 영상 하나로 이어 붙입니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- AI UGC란 무엇인가요? 뜻, 만드는 방법, 차이점
AI UGC는 AI로 만든 UGC 스타일 영상입니다. 생성된 진행자가 크리에이터가 휴대폰으로 찍듯 카메라를 보며 스크립트를 말합니다. 무엇이 다른지 정리했습니다.
- Sume Avatar 1.0을 소개합니다
Sume Avatar 1.0은 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다.
- Avatar Face Swap API(베타): 영상에 아바타 얼굴 입히기
Avatar Face Swap 1.0은 준비된 아바타의 얼굴을 짧은 공개 소스 영상에 입히는 Sume의 베타 엔드포인트입니다. 필수 필드, 제한, 폴링을 다룹니다.
- 아바타 영상 프리뷰: 렌더링 전에 첫 프레임 승인하기
아바타 영상 프리뷰를 만들어 첫 프레임 스틸을 받고, 필요하면 다시 생성한 뒤, 프리뷰 id로 generate-video를 호출해 최종 영상을 렌더링하세요.
작성자 Sume