AI B-roll 생성기: 프롬프트로 컷어웨이 클립 만들기

AI B-roll 생성기는 텍스트 프롬프트나 스틸로 컷어웨이 클립을 만듭니다. 편집본의 화면 비율에 맞추고, 모델이 허용하는 길이를 고르고, 소리는 빼세요.

읽는 시간 5분Sume
전체 글

AI B-roll 생성기는 텍스트 프롬프트나 스틸 이미지로 짧은 컷어웨이 클립을 만들어 줍니다. 그래서 촬영하거나 스톡 영상을 찾지 않고도 내레이션이나 인터뷰 위에 덮을 화면을 마련할 수 있습니다. 프롬프트 하나에 샷 하나씩, 편집본의 화면 비율(가로 편집은 16:9, 세로 편집은 9:16)과 모델이 지원하는 길이로 생성하세요. B-roll 위로는 여러분의 오디오가 흐르므로, 모델이 허용한다면 클립 자체의 소리는 끄세요.

Sume 관련 내용은 2026-09-28에 확인한 영상 생성 (영문)과 Video Router (영문) 문서에서 가져왔고, 모델별 소리와 길이는 GET /v1/videos/models가 제공하는 카탈로그와 POST /v1/videos가 실행하는 검사에서 가져왔습니다. 두 종류의 영상은 토킹 헤드와 B-roll의 차이는 무엇인가요?에서 설명합니다.

AI로 B-roll을 어떻게 만드나요?

  • 프롬프트 하나에 샷 하나를 쓰세요. 피사체, 동작, 카메라, 빛을 적습니다. Sume 문서는 움직임, 카메라 앵글, 조명, 장면 구성을 자세히 적으라고 권합니다.
  • 텍스트로: 프롬프트를 POST /v1/videos로 보내세요. model: "sume/auto"를 쓰면 Sume가 모델을 고릅니다. Auto의 기본값은 720p, 8초이며, 16:9 또는 9:16으로 3–10초 클립을 만듭니다.
  • 스틸로: 샷에 실제 제품이나 장소가 나와야 한다면 그 사진을 frame_images의 first_frame으로 보내세요. Sume의 자체 모델 가이드도 B-roll을 Auto 이미지로 만들고, 확인한 뒤 Auto 영상으로 움직입니다.
  • 모든 요청에 같은 aspect_ratio와 resolution을 보내, 모든 컷어웨이가 편집본의 화면 비율과 크기로 요청되게 하세요.
  • 소리가 선택 사항인 모델을 지정하고, 아래처럼 generate_audio: false를 보내세요.
curl -X POST https://api.sume.com/v1/videos \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: broll-kneading-001" \
  -d '{
    "model": "kling-3",
    "prompt": "Slow push-in on hands kneading dough on a floured wooden table, warm morning light, shallow depth of field",
    "aspect_ratio": "16:9",
    "resolution": "720p",
    "duration": 6,
    "generate_audio": false
  }'

텍스트 프롬프트로 B-roll을 만들 수 있는 모델은 무엇인가요?

첫 프레임이 필요한 grok-imagine-video-1.5를 뺀, 표의 모든 모델이 가능합니다. 나머지 모델은 모두 16:9와 9:16을 둘 다 지원 목록에 올려 두었고, Grok은 aspect_ratio를 받지 않습니다.

영상 생성 (영문), Video Router (영문), GET /v1/videos/models가 제공하는 카탈로그 기준, 2026-09-28 확인.
모델텍스트만으로클립 길이소리
seedance-2.5예4–30초선택 사항
seedance-2, seedance-2-fast, seedance-2-mini예4–15초선택 사항
wan-3.0예2–30초선택 사항
kling-3예4–15초선택 사항
minimax-h3, minimax-h3-max예5–15초항상 켜짐. false는 거부
gemini-omni-flash-1.1예3–10초항상 켜짐. false는 거부
grok-imagine-video-1.5아니요, 첫 프레임 필요4–15초없음

B-roll 클립에 소리가 있어야 하나요?

대개는 필요 없습니다. 보이스오버나 인터뷰가 사운드트랙이기 때문입니다. Sume에서 편집한다면 Timeline 1.0이 오디오 스파인 하나와 순서 있는 영상 슬롯으로 MP4 하나를 만드는데, 현재 코드에서는 소리를 그 스파인과 선택 사항인 사운드트랙에서만 가져오므로 각 클립 자체의 오디오는 빠집니다. 다른 편집기에서는 소리가 항상 켜지는 모델의 클립을 음소거하면 됩니다. Timeline 편집은 얼굴 없는 영상 API: 보이스오버, B-roll, 음악, 자막에서 보여 줍니다.

AI B-roll 비용은 얼마인가요?

무료 스톡 영상이 아닙니다. 클립은 하나하나 여러분을 위해 생성되고 모델별로 공급사 정가 × 1.25로 과금되며, 제출 시 예약되고 기본적으로 5.5% 에이전트 수수료가 더해집니다. 소리에 따라 요율이 달라지기도 합니다. kling-3는 소리 없이 초당 $0.14, 소리를 넣으면 초당 $0.21입니다. 모든 모델의 요율은 GET /v1/videos/models의 pricing_skus에 있으며, AI 영상 생성 비용은 얼마인가요?에서 비교합니다.

클립을 편집기로 어떻게 가져오나요?

상태가 completed가 될 때까지 GET /v1/videos/{id}를 폴링한 다음, API 키로 GET /v1/videos/{id}/content에서 내려받으세요. 이 경로는 파일로 리디렉션하므로 curl이 리디렉션을 따라가도록 -L을 붙이세요. Sume에서 편집한다면 대신 GET /v1/jobs/{id}/result에서 각 클립의 media.sume.com URL을 읽으세요. Timeline은 이 워크스페이스에 호스팅된 Sume 파일만 받기 때문입니다.

어떤 제한이 있나요?

  • 클립 하나의 길이는 모델에 따라 2–30초이며, 더 긴 컷어웨이는 클립 두 개로 만듭니다.
  • 프레임으로 보내는 스틸은 공개 HTTPS URL이어야 합니다.
  • 첫 프레임 이후의 모든 프레임은 생성되므로, 편집에 넣기 전에 클립마다 어색한 부분이 없는지 확인하세요.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume