AI 아바타 영상 편집: 렌더링 후에 바꿀 수 있는 것
AI 아바타 영상 편집: 트림, 자막, 음악, B-roll, 이어 붙이기는 완성된 MP4에서 할 수 있고, 새 대사, 새 목소리, 새 외모는 다시 렌더링해야 합니다.
AI 아바타 영상 편집은 무엇을 바꾸고 싶은지에 따라 달라집니다. 앞이나 뒤 자르기, 크롭, 자막이나 배경 음악이나 B-roll 컷어웨이 추가, 클립 이어 붙이기는 완성된 MP4에서 하는 편집입니다. 새 대사, 새 목소리, 새 아바타나 장소, 더 넓은 화면은 영상 안에 이미 고정되어 들어가 있으므로 다시 렌더링해야 합니다. Sume에서는 편집이 미디어 도구를 통해 영상 자체의 media.sume.com URL을 대상으로 실행되며, 다시 렌더링할 때는 프리뷰에서 시작해 먼저 확인할 수 있습니다.
Sume 관련 사실은 2026-09-28에 확인한 아바타 영상 생성, 영상 트림, Timeline 1.0 문서에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 모든 편집 엔드포인트를 한눈에 보려면 영상 편집 API: 편집 작업별로 쓸 Sume 엔드포인트를 참고하세요.
어떤 변경이 편집이고, 어떤 변경에 새 렌더가 필요한가요?
먼저 변경을 분류하세요. 중간을 잘라 내는 렌더는 API로 영상 일부 잘라내기에 나와 있습니다.
| 변경 | 편집 또는 재렌더링 | Sume에서 하는 방법 |
|---|---|---|
| 앞이나 뒤 자르기 | 편집 | start와 end 또는 duration을 담은 POST /v1/video-trim |
| 중간에 있는 대사 하나 빼기 | 편집 | 남길 구간으로 만드는 Timeline 1.0 렌더 |
| 자막 입히기 | 편집 | 완성된 URL에 POST /v1/video-captions |
| 음악이나 B-roll 컷어웨이 추가 | 편집 | Timeline 1.0: soundtrack, 그리고 음성 위에 놓는 슬롯 |
| 더 좁은 화면으로 크롭하거나 어둡게 하기 | 편집 | crop 또는 dim op을 담은 POST /v1/video-filter |
| 여러 클립 이어 붙이기 | 편집 | Timeline 1.0 |
| 새 대사, 새 아바타, 새 장소 | 재렌더링 | 프리뷰로 먼저 확인한 새 말하는 영상 |
| 다른 목소리 | 재렌더링 | TTS 1.0 음성, 그다음 아바타 스틸을 VEED Fabric 1.0으로 립싱크. 원래 장면은 빠짐 |
| 9:16에서 16:9처럼 더 넓은 형태 | 재렌더링 | 새 aspect_ratio로 만드는 새 말하는 영상 |
완성된 아바타 영상은 어떻게 편집하나요?
영상 자체의 URL을 쓰세요. 완료된 결과는 공개 media.sume.com 아티팩트이며, 미디어 도구는 이전 Job의 출력처럼 워크스페이스의 media.sume.com 파일만 읽습니다. 각 도구는 새 파일을 반환하고 소스는 건드리지 않으므로 도구를 연달아 쓸 수 있습니다.
- 트림은
video_url,start, 그리고end와duration중 정확히 하나를 받습니다. 잘라 내는 구간은 0.2–900초이며, 기본적으로 오디오를 유지합니다. - 자막은
POST /v1/video-captions로 넣으세요. 현재 이 Job은 60초보다 긴 소스나 오디오 스트림이 없는 소스를 거부하므로, 클립들을 더 긴 영상으로 이어 붙이기 전에 클립마다 자막을 넣으세요. - 모든 편집은 Job입니다. Job이 종료 상태가 될 때까지
GET /v1/jobs/{id}/status를 폴링하고, 완료되었다면GET /v1/jobs/{id}/result에서 새 파일의 URL을 읽으세요.
curl -X POST https://api.sume.com/v1/video-trim \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: welcome-v1-trim-001" \
-d '{
"video_url": "https://media.sume.com/artifacts/artf_demo/welcome.mp4",
"start": 0,
"end": 12.5
}'Timeline 편집에서 아바타의 목소리는 왜 사라지나요?
현재 코드에서 Timeline 렌더는 오디오 스파인과 선택 사항인 사운드트랙에서만 소리를 가져오며, 각 클립 자체의 오디오는 버립니다. 음악이나 B-roll을 넣기 전에 POST /v1/audio-detach로 아바타의 목소리를 분리하고(기본 출력은 wav), 그 파일을 스파인으로 쓰세요. 그러면 말하는 아바타 영상에 B-roll 넣기에서처럼 대사가 계속 재생되는 동안 슬롯이 아바타와 B-roll 사이를 오갈 수 있습니다.
음악은 같은 렌더에 Sume에 호스팅된 soundtrack 배경 음악으로 들어갑니다. 레벨, 페이드, 더킹은 토킹 헤드 영상 배경 음악에서 다룹니다.
단어 하나를 고치거나 스크립트를 바꾸려면 어떻게 하나요?
다시 렌더링하세요. 아바타 영상 경로는 완성된 영상을 나열하고 읽기만 하며, Sume의 립싱크는 영상이 아니라 스틸이나 아바타를 받으므로, 대사를 그 자리에서 바꿀 수는 없습니다. 비용을 내기 전에 새 버전을 확인하려면 다음과 같이 하세요.
- 새 스크립트로 아바타 영상 프리뷰를 만들고 첫 프레임 스틸을 승인한 다음
generate-video를 호출하세요. - 프리뷰에서
quality는generate-video단계에서 바꿀 수 있지만,script,video_inputs,avatar_handle,scene,aspect_ratio를 바꾸려면 새 프리뷰가 필요합니다. - 여러 파트를 이어 붙인 긴 영상이라면 실수가 있는 파트만 다시 렌더링하고, 그 자리에 새 파일을 넣어 이어 붙이기를 다시 실행하세요.
- 새 요청에는 새
Idempotency-Key를 쓰세요. 같은 키에 다른 본문을 보내면409 idempotency_conflict가 돌아옵니다.
편집 비용은 얼마인가요?
트림, 오디오 분리, 자막 Job은 Job 단위로 가격이 매겨지므로 GET /v1/catalog에서 확인하세요. Timeline 렌더는 출력 분당 $0.10로 나와 있습니다. 다시 렌더링하면 영상 초 단위로 다시 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 모든 항목에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.
출처
관련 글
Sume Avatar 1.0 카테고리의 다른 글
- AI 아바타는 어떻게 작동하나요? 얼굴, 목소리, 영상 단계별로
AI 아바타 영상은 얼굴, 그 얼굴에 맞는 목소리, 얼굴이 스크립트를 말하게 하는 움직임을 조합해 만듭니다. Sume에서 각 단계가 어떻게 작동하는지 설명합니다.
- AI 아바타 프롬프트 작성법: 말하는 진행자 묘사하기
영상용 AI 아바타 프롬프트는 한 사람의 나이, 외모, 머리, 옷차림, 표정을 묘사합니다. 무엇을 쓸지, Sume가 무엇을 더하는지, 무엇은 정할 수 없는지 설명합니다.
- 립싱크와 더빙의 차이: 어느 쪽이 필요한가요?
더빙은 영상 속 음성을 바꾸고, 립싱크는 입 모양을 오디오에 맞춥니다. 립싱크 더빙은 둘 다 합니다. 각각의 뜻과 어느 쪽이 필요한지 정리했습니다.
- 토킹 헤드와 B-roll의 차이는 무엇인가요?
토킹 헤드는 카메라를 보고 말하는 사람의 샷이고, B-roll은 그 사람의 목소리가 계속 나오는 동안 잘라 넣는 영상입니다. 둘이 어떻게 맞물리는지 설명합니다.
작성자 Sume