AI 포옹 영상 만들기: 사진 두 장으로 허그 클립 하나
AI 포옹 영상은 두 단계로 만듭니다. 두 사람을 스틸 한 장에 합쳐 확인한 뒤, 포옹을 설명하는 프롬프트로 그 스틸을 움직이세요.

AI 포옹 영상 생성기는 두 사람의 사진을 두 사람이 포옹하는 짧은 클립으로 바꿉니다. 과정은 두 단계입니다. 먼저 이미지 모델로 두 사람을 스틸 한 장에 합쳐 확인하고, 그 스틸을 이미지로 영상 만들기 클립의 첫 프레임으로 삼아 프롬프트에 포옹을 설명해 움직입니다. 두 사진을 레퍼런스 이미지로 영상 모델에 바로 보내는 한 단계 방법도 있지만, 레퍼런스는 화면을 가이드할 뿐이라 얼굴이 달라질 수 있습니다.
내용은 2026-09-28에 확인한 Sume의 Image API (영문), 영상 생성 (영문), 미디어 입력 문서에서 가져왔습니다. 현재 동작이라고 설명한 내용은 Sume의 API 코드에서 확인한 것입니다. 코드 없이 하려면 에이전트 탭에서 클립을 설명하세요. 에이전트가 모델을 고르고, 비용을 쓰기 전에 먼저 확인을 받습니다.
사진 두 장으로 AI 포옹 영상을 어떻게 만드나요?
POST /v1/images로 두 사람을 스틸 한 장에 합치세요. 두 사진을 모두input_references에 넣고, 한 장소에서 두 사람이 마주 보도록 배치하는 프롬프트를 씁니다. 이 호출과 사진 두 장을 받는 이미지 모델은 AI로 사진 두 장을 한 장으로 합치는 방법에서 다룹니다.- 스틸을 확인하세요. 두 얼굴, 두 사람의 손, 배경을 봅니다. 이 스틸이 클립의 첫 프레임이 되므로, 제대로 나올 때까지 다시 생성하세요.
- 고른 스틸은 공개 HTTPS URL에 올리세요. Image API의 결과 URL은 서명된 URL인데, 서명된 URL이나 비공개 URL은 생성 입력으로 거부됩니다.
- 스틸을 움직이세요. 스틸을
POST /v1/videos의frame_images에first_frame으로 보내고, 포옹은prompt에 적습니다.
curl -X POST https://api.sume.com/v1/videos \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: hug-clip-001" \
-d '{
"model": "gemini-omni-flash-1.1",
"prompt": "The two people turn toward each other, step closer and share a warm hug, holding it for a moment before they lean back and smile. Static medium shot, soft daylight",
"frame_images": [
{ "type": "image_url", "image_url": { "url": "https://example.com/both-together.jpg" }, "frame_type": "first_frame" }
],
"aspect_ratio": "9:16",
"resolution": "720p",
"duration": 6
}'AI 포옹 영상 프롬프트에는 무엇을 써야 하나요?
인물의 외모는 첫 프레임에 맡기고, 프롬프트는 일어나는 일에 쓰세요. Sume 문서는 움직임, 카메라 앵글, 조명, 장면 구성을 자세히 적으라고 권합니다.
- 누가 어떻게 움직이는지: "the woman on the left steps forward and wraps her arms around the man"(왼쪽 여성이 앞으로 나와 남성을 팔로 감싸 안음).
- 얼마나 이어지는지: "they hold the hug for a moment, then lean back and smile"(잠시 포옹한 채로 있다가 몸을 떼고 미소 지음).
- 카메라: 두 사람이 화면 안에 머물도록 "static medium shot"(고정 미디엄 샷).
- 빛과 분위기: "soft window light"(창으로 드는 부드러운 빛) 또는 "golden hour"(골든아워).
합친 스틸 없이 할 수 있나요?
네, 레퍼런스로 영상 만들기로 할 수 있습니다. 두 사진을 input_references에 type: "image_url" 항목으로 보내고, 프롬프트에 포옹을 설명하세요. 레퍼런스는 정확한 프레임이 아니라 시각적 가이드이므로 어느 얼굴도 고정되지 않습니다. 이 요청에는 frame_images를 넣지 마세요. 프레임이 우선하며, 현재 코드에서는 이때 레퍼런스가 모델에 전달되지 않습니다.
Gemini Omni Flash 1.1에서는 Gemini Omni Flash 1.1 영상 API에서 설명하듯, 프롬프트가 위치로 각 사진을 가리킬 수 있습니다. 첫 번째 사진은 <IMAGE_REF_0>, 두 번째 사진은 <IMAGE_REF_1>입니다. 모델별로 받는 이미지 수는 Reference-to-Video API에 정리되어 있습니다.
| 스틸 먼저 | 사진을 레퍼런스로 | |
|---|---|---|
| 호출 | POST /v1/images 다음 POST /v1/videos | POST /v1/videos |
| 영상 필드 | frame_type: "first_frame"을 넣은 frame_images | type: "image_url"을 넣은 input_references |
| 고정되는 것 | 클립의 첫 프레임(여러분이 승인한 것) | 없음: 정확한 프레임이 아닌 시각적 가이드 |
| 모델 | supported_frame_images에 first_frame이 나열된 모든 모델 | 레퍼런스를 받지 않는 kling-3와 grok-imagine-video-1.5를 뺀 전체 |
두 사람이 본인과 닮게 나오나요?
보장되지 않습니다. 첫 프레임은 여러분이 승인한 스틸이지만 이후 프레임은 모두 생성되며, 사람들이 몸을 돌려 포옹하는 동안 얼굴이 바뀔 수 있습니다. 클립을 확인하고, 얼굴이 달라지면 다시 생성하세요. 동의한 사람의 사진이나 사용 허락을 받은 사진을 쓰세요.
사진 중 하나가 오래된 인화 사진이라면 먼저 스캔하세요. 스캔 방법과 기대할 수 있는 결과는 AI로 옛날 사진을 움직일 수 있나요?에서 다룹니다.
어떤 제한이 있나요?
- 클립 하나의 길이는 모델에 따라 2–30초입니다.
- 사진, 스틸, 프레임 URL은 공개 HTTPS여야 합니다.
- 두 단계이므로 청구도 두 번입니다. 이미지 생성은 전부 아니면 전무 방식이라 이미지가 완성될 때만 청구되고, 클립은
GET /v1/videos/models가pricing_skus에 나열한 요율로 모델별로 청구됩니다.
출처
관련 글
활용 사례 카테고리의 다른 글
- AI 아이콘 생성기: 프롬프트로 1024 × 1024 앱 아이콘 아트워크
프롬프트로 앱 아이콘 아트워크를 생성하세요. 가운데 심볼 하나, 글자 없음, 호출당 여러 안, 1024 × 1024 크기입니다. 그다음 크기를 조정하고 배경을 잘라 내 마무리하세요.
- 프레젠테이션용 AI 이미지 생성기: 16:9 PPT 슬라이드 이미지
프레젠테이션용 AI 이미지는 슬라이드 모양에 맞춰 만드세요. PowerPoint 기본값은 16:9입니다. 정확한 픽셀 크기, 모든 슬라이드에 같은 스타일, 글자 넣을 공간까지 다룹니다.
- AI 인포그래픽 만들기: 레이아웃은 AI로, 숫자는 직접
이미지 모델은 인포그래픽의 레이아웃, 아이콘, 색은 그려도 믿을 만한 숫자는 그리지 못합니다. 세로로 긴 프레임을 생성한 뒤 데이터는 직접 넣으세요.
- AI 초대장 만들기: 세부 정보 넣을 자리를 남긴 카드 아트
초대장 아트는 카드 모양으로 생성하세요. 예를 들어 5 × 7인치 카드는 320 DPI에서 1600 × 2240입니다. 이름, 날짜, 주소는 직접 입력하세요.
작성자 Sume