AI 아바타 영상 편집: 렌더링 후에 바꿀 수 있는 것

AI 아바타 영상 편집: 트림, 자막, 음악, B-roll, 이어 붙이기는 완성된 MP4에서 할 수 있고, 새 대사, 새 목소리, 새 외모는 다시 렌더링해야 합니다.

읽는 시간 5분Sume
전체 글

AI 아바타 영상 편집은 무엇을 바꾸고 싶은지에 따라 달라집니다. 앞이나 뒤 자르기, 크롭, 자막이나 배경 음악이나 B-roll 컷어웨이 추가, 클립 이어 붙이기는 완성된 MP4에서 하는 편집입니다. 새 대사, 새 목소리, 새 아바타나 장소, 더 넓은 화면은 영상 안에 이미 고정되어 들어가 있으므로 다시 렌더링해야 합니다. Sume에서는 편집이 미디어 도구를 통해 영상 자체의 media.sume.com URL을 대상으로 실행되며, 다시 렌더링할 때는 프리뷰에서 시작해 먼저 확인할 수 있습니다.

Sume 관련 사실은 2026-09-28에 확인한 아바타 영상 생성, 영상 트림, Timeline 1.0 문서에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 모든 편집 엔드포인트를 한눈에 보려면 영상 편집 API: 편집 작업별로 쓸 Sume 엔드포인트를 참고하세요.

어떤 변경이 편집이고, 어떤 변경에 새 렌더가 필요한가요?

먼저 변경을 분류하세요. 중간을 잘라 내는 렌더는 API로 영상 일부 잘라내기에 나와 있습니다.

영상 트림, 영상 캡션, 영상 필터, Timeline 1.0, 아바타 영상 생성 기준, 2026-09-28 확인.
변경편집 또는 재렌더링Sume에서 하는 방법
앞이나 뒤 자르기편집start와 end 또는 duration을 담은 POST /v1/video-trim
중간에 있는 대사 하나 빼기편집남길 구간으로 만드는 Timeline 1.0 렌더
자막 입히기편집완성된 URL에 POST /v1/video-captions
음악이나 B-roll 컷어웨이 추가편집Timeline 1.0: soundtrack, 그리고 음성 위에 놓는 슬롯
더 좁은 화면으로 크롭하거나 어둡게 하기편집crop 또는 dim op을 담은 POST /v1/video-filter
여러 클립 이어 붙이기편집Timeline 1.0
새 대사, 새 아바타, 새 장소재렌더링프리뷰로 먼저 확인한 새 말하는 영상
다른 목소리재렌더링TTS 1.0 음성, 그다음 아바타 스틸을 VEED Fabric 1.0으로 립싱크. 원래 장면은 빠짐
9:16에서 16:9처럼 더 넓은 형태재렌더링새 aspect_ratio로 만드는 새 말하는 영상

완성된 아바타 영상은 어떻게 편집하나요?

영상 자체의 URL을 쓰세요. 완료된 결과는 공개 media.sume.com 아티팩트이며, 미디어 도구는 이전 Job의 출력처럼 워크스페이스의 media.sume.com 파일만 읽습니다. 각 도구는 새 파일을 반환하고 소스는 건드리지 않으므로 도구를 연달아 쓸 수 있습니다.

  • 트림은 video_url, start, 그리고 end와 duration 중 정확히 하나를 받습니다. 잘라 내는 구간은 0.2–900초이며, 기본적으로 오디오를 유지합니다.
  • 자막은 POST /v1/video-captions로 넣으세요. 현재 이 Job은 60초보다 긴 소스나 오디오 스트림이 없는 소스를 거부하므로, 클립들을 더 긴 영상으로 이어 붙이기 전에 클립마다 자막을 넣으세요.
  • 모든 편집은 Job입니다. Job이 종료 상태가 될 때까지 GET /v1/jobs/{id}/status를 폴링하고, 완료되었다면 GET /v1/jobs/{id}/result에서 새 파일의 URL을 읽으세요.
curl -X POST https://api.sume.com/v1/video-trim \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: welcome-v1-trim-001" \
  -d '{
    "video_url": "https://media.sume.com/artifacts/artf_demo/welcome.mp4",
    "start": 0,
    "end": 12.5
  }'

Timeline 편집에서 아바타의 목소리는 왜 사라지나요?

현재 코드에서 Timeline 렌더는 오디오 스파인과 선택 사항인 사운드트랙에서만 소리를 가져오며, 각 클립 자체의 오디오는 버립니다. 음악이나 B-roll을 넣기 전에 POST /v1/audio-detach로 아바타의 목소리를 분리하고(기본 출력은 wav), 그 파일을 스파인으로 쓰세요. 그러면 말하는 아바타 영상에 B-roll 넣기에서처럼 대사가 계속 재생되는 동안 슬롯이 아바타와 B-roll 사이를 오갈 수 있습니다.

음악은 같은 렌더에 Sume에 호스팅된 soundtrack 배경 음악으로 들어갑니다. 레벨, 페이드, 더킹은 토킹 헤드 영상 배경 음악에서 다룹니다.

단어 하나를 고치거나 스크립트를 바꾸려면 어떻게 하나요?

다시 렌더링하세요. 아바타 영상 경로는 완성된 영상을 나열하고 읽기만 하며, Sume의 립싱크는 영상이 아니라 스틸이나 아바타를 받으므로, 대사를 그 자리에서 바꿀 수는 없습니다. 비용을 내기 전에 새 버전을 확인하려면 다음과 같이 하세요.

  • 새 스크립트로 아바타 영상 프리뷰를 만들고 첫 프레임 스틸을 승인한 다음 generate-video를 호출하세요.
  • 프리뷰에서 quality는 generate-video 단계에서 바꿀 수 있지만, script, video_inputs, avatar_handle, scene, aspect_ratio를 바꾸려면 새 프리뷰가 필요합니다.
  • 여러 파트를 이어 붙인 긴 영상이라면 실수가 있는 파트만 다시 렌더링하고, 그 자리에 새 파일을 넣어 이어 붙이기를 다시 실행하세요.
  • 새 요청에는 새 Idempotency-Key를 쓰세요. 같은 키에 다른 본문을 보내면 409 idempotency_conflict가 돌아옵니다.

편집 비용은 얼마인가요?

트림, 오디오 분리, 자막 Job은 Job 단위로 가격이 매겨지므로 GET /v1/catalog에서 확인하세요. Timeline 렌더는 출력 분당 $0.10로 나와 있습니다. 다시 렌더링하면 영상 초 단위로 다시 과금되며, 요율은 초당 $0.184(standard), $0.245(plus), $0.55(max), 제품 이미지 없음 기준입니다. 모든 항목에는 기본적으로 5.5% 에이전트 수수료가 더해집니다.

출처

관련 글

Sume Avatar 1.0 카테고리의 다른 글

Sume Avatar 1.0 글 전체 보기

작성자 Sume