립싱크와 더빙의 차이: 어느 쪽이 필요한가요?
더빙은 영상 속 음성을 바꾸고, 립싱크는 입 모양을 오디오에 맞춥니다. 립싱크 더빙은 둘 다 합니다. 각각의 뜻과 어느 쪽이 필요한지 정리했습니다.

더빙은 영상이 하는 말을 바꾸는 것입니다. 원래 음성은 예를 들어 다른 언어로 된 새 녹음으로 바뀌고, 화면은 그대로 남습니다. 립싱크는 화자의 입과 소리가 맞는 것으로, 입술이 말에 맞춰 움직입니다. 립싱크 더빙은 둘 다 합니다. 새 음성과 입 모양이 맞아서 화자가 새 대사를 실제로 말하는 것처럼 보입니다.
Sume는 두 가지를 따로 처리합니다. TTS 1.0이 새 대사를 읽고, VEED Fabric 1.0이 스틸 이미지나 아바타를 그 오디오에 립싱크합니다. Fabric은 영상 입력을 받지 않으므로, Sume는 이미 가진 영상 속 입 모양의 타이밍을 다시 맞출 수 없습니다. Sume 관련 사실은 2026-09-28에 확인한 Models 개요 (영문)와 Timeline 1.0 문서, Sume API 레퍼런스에서 가져왔고, 정의는 일반적인 설명입니다. 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인한 것입니다.
더빙이란 무엇이고, 보이스오버와는 어떻게 다른가요?
더빙은 새 음성을 화자의 자리에 넣습니다. 시청자가 새 목소리를 화면 속 인물의 목소리로 듣게 하는 것입니다. 보이스오버는 화면 속 인물이 아닌 내레이터를 더하며, 소리를 줄인 원래 음향 위에 겹쳐 재생될 수도 있습니다. 둘 다 오디오만 바꿉니다. 어느 쪽도 누군가의 입술을 움직이지 않으므로, 말하는 얼굴이 화면에 있으면 더빙이나 보이스오버를 해도 입은 예전 말의 모양대로 움직입니다.
립싱크란 무엇인가요?
립싱크는 입의 움직임과 소리를 맞추는 것입니다. 공연자는 녹음에 맞춰 입만 움직이는 방식으로 립싱크하고, 더빙 팀은 이미 화면에 있는 입술에 맞춰 새 음성의 타이밍을 조정하며, AI 립싱크는 오디오 자체에서 입의 움직임을 생성합니다. 그래서 AI 립싱크에는 음성이 먼저 있어야 합니다.
Sume에서 립싱크는 VEED Fabric 1.0입니다. 스틸 이미지나 준비된 아바타와 Sume에 호스팅된 오디오를 넣으면 말하는 클립이 나옵니다. 영상 모델이 만든 영상 아래에 내레이션을 까는 것은 립싱크가 아닙니다. Sume의 모델 가이드에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 립싱크하지 않습니다. 요청과 제한은 립싱크 API: 이미지와 오디오로 말하는 클립 만들기에서 다룹니다.
립싱크 더빙이란 무엇인가요?
새 음성이 화자의 입 모양과 맞는 더빙이며, 여기에 이르는 방법은 두 가지입니다. 전통적인 립싱크 더빙은 말을 화면에 맞춥니다. 이미 화면에 있는 입술 움직임에 맞도록 번역문을 쓰고 연기하며, 화면은 손대지 않습니다. AI 립싱크 더빙은 화면을 말에 맞춥니다. 새 음성이 먼저 나오고 그에 맞춰 입 모양을 생성하므로, 번역문을 예전 입술 움직임에 맞춰 억지로 비틀 필요가 없습니다.
내 프로젝트에는 어느 쪽이 필요한가요?
화면에 무엇이 나오는지부터 보세요. 누구의 입도 보이지 않는다면 더빙으로 충분합니다. 말하는 얼굴이 화면을 채운다면 말과 입 모양이 맞아야 하므로 립싱크 더빙이 필요합니다.
| 더빙 | 립싱크 | AI 립싱크 더빙 | |
|---|---|---|---|
| 바뀌는 것 | 음성 | 입의 움직임 | 둘 다 |
| 화면 속 말하는 얼굴 | 예전 말에 맞춰 계속 움직임 | 넣어 준 오디오에 맞춰 움직임 | 새 말에 맞춰 움직임 |
| 맞는 경우 | 내레이션, 화면 녹화, 입 모양을 알아보기엔 너무 작은 얼굴 | 말을 해야 하는 스틸 사진이나 아바타 | 화면을 채우는 화자의 얼굴 |
| Sume로 하는 방법 | 대본, 직접 한 번역, TTS 1.0, 그다음 Timeline 1.0 | VEED Fabric 1.0 | 직접 한 번역, TTS 1.0, 그다음 VEED Fabric 1.0 |
Sume로 각각 어떻게 하나요?
각각 단계별로 설명한 글이 있습니다. 이미 Sume 워크스페이스에 있는 영상의 음성을 바꾸려면 API로 영상 보이스오버 번역하기를 보세요. 대본에서 번역, TTS 1.0을 거쳐 Timeline 1.0 렌더까지 이어집니다. 현재 코드에서 이 렌더는 오디오 스파인과 선택 사항인 사운드트랙만 재생하므로, 원래 목소리는 영상에 있던 음악이나 현장 소리와 함께 빠집니다.
아바타 영상을 립싱크 더빙하려면 아바타 영상을 더빙하는 방법을 보세요. 새 대사를 TTS 1.0으로 읽히고, 같은 아바타를 Fabric으로 그 대사에 맞춰 움직입니다. Avatar 1.0 말하는 영상은 스스로 목소리를 바꿀 수 없습니다. 현재 코드에서 이 영상은 영어로만 말합니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- 토킹 헤드와 B-roll의 차이는 무엇인가요?
토킹 헤드는 카메라를 보고 말하는 사람의 샷이고, B-roll은 그 사람의 목소리가 계속 나오는 동안 잘라 넣는 영상입니다. 둘이 어떻게 맞물리는지 설명합니다.
- AI 아바타 UGC 영상 프롬프트: 필드마다 무엇을 쓰나요?
AI 아바타의 UGC 영상 프롬프트는 입력 하나가 아니라 세 개입니다. 크리에이터의 대사, 장소와 조명을 정하는 장면 프롬프트, 그리고 제품 이미지입니다.
- 토킹 헤드 영상이란 무엇인가요? 뜻과 만드는 방법
토킹 헤드 영상은 한 사람이 가슴 위쯤부터 잡힌 화면에서 카메라를 보고 말하는 영상입니다. 뜻과 쓰임새, AI로 만드는 방법을 정리했습니다.
- AI UGC란 무엇인가요? 뜻, 만드는 방법, 차이점
AI UGC는 AI로 만든 UGC 스타일 영상입니다. 생성된 진행자가 크리에이터가 휴대폰으로 찍듯 카메라를 보며 스크립트를 말합니다. 무엇이 다른지 정리했습니다.
작성자 Sume