AI 영상 만드는 방법: 텍스트나 사진으로 만들기

AI 영상을 만들려면 출발점을 고르고, 샷을 설명하고, 길이와 화면 비율을 정한 뒤 생성해서 검토하세요. Sume에서 각 단계를 하는 방법을 설명합니다.

읽는 시간 5분Sume
전체 글

AI 영상을 만들려면 클립의 출발점(텍스트만 쓸지, 사진을 첫 프레임으로 쓸지)을 정하고, 샷을 설명하는 프롬프트를 쓰고, 모델이 지원하는 길이, 화면 비율, 해상도를 고른 뒤, 클립을 생성해 검토하세요. 생성 한 번으로 나오는 것은 짧은 클립이므로, 더 긴 영상은 클립 여러 개를 이어 붙여 만듭니다.

Sume에서 클립 하나는 모델에 따라 2초에서 30초까지입니다. 이 모든 과정은 에이전트(Agents) 탭에서 에이전트와 채팅하며 할 수도 있고, 같은 선택을 영상 API로 보내서 할 수도 있습니다. 내용은 2026-09-28에 확인한 Sume의 빠른 시작, 영상 생성 (영문), Timeline 1.0 문서에서 가져왔습니다.

텍스트나 내 사진으로 AI 영상을 만들 수 있나요?

둘 다 가능합니다. 보내는 필드가 모드를 정하며, 프레임과 레퍼런스를 함께 보내면 프레임이 우선합니다. 차이는 Image-to-Video와 Reference-to-Video의 차이에서 설명합니다.

영상 생성 (영문), 미디어 입력 기준, 2026-09-28 확인.
시작점보내는 것모델이 하는 일
텍스트만(텍스트로 영상 만들기)prompt 필드설명대로 샷을 생성
내 사진(이미지로 영상 만들기)frame_images의 first_frame으로 넣은 사진의 공개 HTTPS URL과 프롬프트사진을 클립의 첫 프레임으로 사용. last_frame으로 끝 장면도 지정 가능
레퍼런스 이미지(레퍼런스로 영상 만들기)input_references와 프롬프트정확한 프레임이 아니라 시각적 가이드로 사용

프롬프트에는 무엇을 써야 하나요?

샷 하나를 설명하세요. 화면에 무엇이 있고 무슨 일이 일어나는지, 카메라, 빛, 프레이밍을 적습니다. Sume 문서는 “details about motion, camera angles, lighting, and scene composition”(움직임, 카메라 앵글, 조명, 장면 구성에 관한 세부 사항)을 요구하며, 문서의 예제는 “A golden retriever playing fetch on a sunny beach with waves crashing in the background.”(파도가 부서지는 화창한 해변에서 공 물어 오기 놀이를 하는 골든 리트리버)입니다. 길이, 화면 비율, 해상도는 프롬프트에 쓰는 말이 아니라 요청 설정입니다. 템플릿은 AI 영상 생성 프롬프트 작성법에 있습니다.

AI 영상 하나는 얼마나 길게 만들 수 있나요?

Sume가 모델을 고르게 하면(sume/auto) 클립은 기본 720p, 8초이며, 16:9 또는 9:16에서 3–10초 길이로 만들 수 있습니다. 모델을 고정하면 범위가 달라집니다. seedance-2.5와 wan-3.0은 30초까지 가고, 나머지는 15초 이하에서 멈춥니다. 모델별 범위는 모델별 AI 영상 길이 제한에 정리되어 있습니다.

더 긴 영상은 클립 여러 개를 생성해 이어 붙이세요. 예를 들어 Timeline 1.0 렌더 한 번으로 합칠 수 있습니다. 이때 소리는 직접 넣은 오디오 트랙과 선택 사항인 사운드트랙에서만 나오며, 현재 코드에서는 각 클립에 있던 소리가 빠집니다.

코드 없이 AI 영상을 만들 수 있나요?

네. 에이전트 탭은 Sume의 채팅 UI입니다. 브리프를 쓰고, 지출을 승인하고, 에이전트가 만든 결과물을 확인합니다. Sume의 빠른 시작 문서는 이를 “Describe the deliverable, not the tool calls. The agent picks the models, and asks before it spends.”(도구 호출이 아니라 결과물을 설명하세요. 모델은 에이전트가 고르고, 지출 전에 먼저 물어봅니다)라고 표현합니다. 클립 하나를 넘어 무엇을 만들 수 있는지는 영상 에이전트란 무엇인가요?에서 다룹니다.

API로 AI 영상은 어떻게 만드나요?

문서에 따르면 네 단계입니다. POST /v1/videos에 제출하고, Job ID와 폴링 URL을 받고, 상태가 completed가 될 때까지 GET /v1/videos/{jobId}를 폴링한 뒤, API 키로 GET /v1/videos/{jobId}/content에서 내려받습니다. sume/auto는 Sume가 모델을 고르게 하며, 어떤 모델이 실행됐는지는 알려 주지 않습니다. 첫 호출은 Sume API 빠른 시작에서 차근차근 설명합니다.

curl -X POST https://api.sume.com/v1/videos \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: first-video-001" \
  -d '{
    "model": "sume/auto",
    "prompt": "A vertical UGC-style product clip on a desk, natural light",
    "aspect_ratio": "9:16",
    "duration": 5
  }'

시간은 얼마나 걸리고, 비용은 얼마인가요?

문서에 따르면 영상 생성은 모델과 파라미터에 따라 보통 30초에서 몇 분까지 걸리며, 해상도가 높을수록 더 오래 걸리고 비용도 더 듭니다. 클립마다 공급사 정가 × 1.25로 가격이 매겨져 제출할 때 워크스페이스 잔액에서 예약되며, 기본적으로 5.5% 에이전트 수수료가 더해집니다. 모델별 요율은 AI 영상 생성 비용은 얼마인가요?에 있습니다.

출처

관련 글

모델 카테고리의 다른 글

모델 글 전체 보기

작성자 Sume