AI 포옹 영상 만들기: 사진 두 장으로 허그 클립 하나

AI 포옹 영상은 두 단계로 만듭니다. 두 사람을 스틸 한 장에 합쳐 확인한 뒤, 포옹을 설명하는 프롬프트로 그 스틸을 움직이세요.

읽는 시간 5분Sume
전체 글

AI 포옹 영상 생성기는 두 사람의 사진을 두 사람이 포옹하는 짧은 클립으로 바꿉니다. 과정은 두 단계입니다. 먼저 이미지 모델로 두 사람을 스틸 한 장에 합쳐 확인하고, 그 스틸을 이미지로 영상 만들기 클립의 첫 프레임으로 삼아 프롬프트에 포옹을 설명해 움직입니다. 두 사진을 레퍼런스 이미지로 영상 모델에 바로 보내는 한 단계 방법도 있지만, 레퍼런스는 화면을 가이드할 뿐이라 얼굴이 달라질 수 있습니다.

내용은 2026-09-28에 확인한 Sume의 Image API (영문), 영상 생성 (영문), 미디어 입력 문서에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 API 코드에서 확인한 것입니다. 코드 없이 하려면 에이전트 탭에서 클립을 설명하세요. 에이전트가 모델을 고르고, 비용을 쓰기 전에 먼저 확인을 받습니다.

사진 두 장으로 AI 포옹 영상을 어떻게 만드나요?

  • POST /v1/images로 두 사람을 스틸 한 장에 합치세요. 두 사진을 모두 input_references에 넣고, 한 장소에서 두 사람이 마주 보도록 배치하는 프롬프트를 씁니다. 이 호출과 사진 두 장을 받는 이미지 모델은 AI로 사진 두 장을 한 장으로 합치는 방법에서 다룹니다.
  • 스틸을 확인하세요. 두 얼굴, 두 사람의 손, 배경을 봅니다. 이 스틸이 클립의 첫 프레임이 되므로, 제대로 나올 때까지 다시 생성하세요.
  • 고른 스틸은 공개 HTTPS URL에 올리세요. Image API의 결과 URL은 서명된 URL인데, 서명된 URL이나 비공개 URL은 생성 입력으로 거부됩니다.
  • 스틸을 움직이세요. 스틸을 POST /v1/videos의 frame_images에 first_frame으로 보내고, 포옹은 prompt에 적습니다.
curl -X POST https://api.sume.com/v1/videos \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: hug-clip-001" \
  -d '{
    "model": "gemini-omni-flash-1.1",
    "prompt": "The two people turn toward each other, step closer and share a warm hug, holding it for a moment before they lean back and smile. Static medium shot, soft daylight",
    "frame_images": [
      { "type": "image_url", "image_url": { "url": "https://example.com/both-together.jpg" }, "frame_type": "first_frame" }
    ],
    "aspect_ratio": "9:16",
    "resolution": "720p",
    "duration": 6
  }'

AI 포옹 영상 프롬프트에는 무엇을 써야 하나요?

인물의 외모는 첫 프레임에 맡기고, 프롬프트는 일어나는 일에 쓰세요. Sume 문서는 움직임, 카메라 앵글, 조명, 장면 구성을 자세히 적으라고 권합니다.

  • 누가 어떻게 움직이는지: "the woman on the left steps forward and wraps her arms around the man"(왼쪽 여성이 앞으로 나와 남성을 팔로 감싸 안음).
  • 얼마나 이어지는지: "they hold the hug for a moment, then lean back and smile"(잠시 포옹한 채로 있다가 몸을 떼고 미소 지음).
  • 카메라: 두 사람이 화면 안에 머물도록 "static medium shot"(고정 미디엄 샷).
  • 빛과 분위기: "soft window light"(창으로 드는 부드러운 빛) 또는 "golden hour"(골든아워).

합친 스틸 없이 할 수 있나요?

네, 레퍼런스로 영상 만들기로 할 수 있습니다. 두 사진을 input_references에 type: "image_url" 항목으로 보내고, 프롬프트에 포옹을 설명하세요. 레퍼런스는 정확한 프레임이 아니라 시각적 가이드이므로 어느 얼굴도 고정되지 않습니다. 이 요청에는 frame_images를 넣지 마세요. 프레임이 우선하며, 현재 코드에서는 이때 레퍼런스가 모델에 전달되지 않습니다.

Gemini Omni Flash 1.1에서는 Gemini Omni Flash 1.1 영상 API에서 설명하듯, 프롬프트가 위치로 각 사진을 가리킬 수 있습니다. 첫 번째 사진은 <IMAGE_REF_0>, 두 번째 사진은 <IMAGE_REF_1>입니다. 모델별로 받는 이미지 수는 Reference-to-Video API에 정리되어 있습니다.

영상 생성 (영문), Video Router (영문), Image API (영문), GET /v1/videos/models가 제공하는 카탈로그 기준, 2026-09-28 확인.
스틸 먼저사진을 레퍼런스로
호출POST /v1/images 다음 POST /v1/videosPOST /v1/videos
영상 필드frame_type: "first_frame"을 넣은 frame_imagestype: "image_url"을 넣은 input_references
고정되는 것클립의 첫 프레임(여러분이 승인한 것)없음: 정확한 프레임이 아닌 시각적 가이드
모델supported_frame_images에 first_frame이 나열된 모든 모델레퍼런스를 받지 않는 kling-3와 grok-imagine-video-1.5를 뺀 전체

두 사람이 본인과 닮게 나오나요?

보장되지 않습니다. 첫 프레임은 여러분이 승인한 스틸이지만 이후 프레임은 모두 생성되며, 사람들이 몸을 돌려 포옹하는 동안 얼굴이 바뀔 수 있습니다. 클립을 확인하고, 얼굴이 달라지면 다시 생성하세요. 동의한 사람의 사진이나 사용 허락을 받은 사진을 쓰세요.

사진 중 하나가 오래된 인화 사진이라면 먼저 스캔하세요. 스캔 방법과 기대할 수 있는 결과는 AI로 옛날 사진을 움직일 수 있나요?에서 다룹니다.

어떤 제한이 있나요?

  • 클립 하나의 길이는 모델에 따라 2–30초입니다.
  • 사진, 스틸, 프레임 URL은 공개 HTTPS여야 합니다.
  • 두 단계이므로 청구도 두 번입니다. 이미지 생성은 전부 아니면 전무 방식이라 이미지가 완성될 때만 청구되고, 클립은 GET /v1/videos/models가 pricing_skus에 나열한 요율로 모델별로 청구됩니다.

출처

관련 글

활용 사례 카테고리의 다른 글

활용 사례 글 전체 보기

작성자 Sume