AI ASMR 영상 만드는 법: 화면과 소리를 프롬프트로
화면과 함께 소리를 생성하는 영상 모델을 쓰고, 프롬프트에 클로즈업 동작과 그 소리를 설명하세요. 모델, 프롬프트, 길이를 정리했습니다.

AI ASMR 영상을 만들려면 화면과 함께 소리를 생성하는 영상 모델을 쓰고, 클로즈업 동작(칼로 써는 모습, 손가락으로 두드리는 모습, 바삭한 것을 한 입 베어 무는 모습)과 그 동작이 내야 할 소리를 모두 설명하는 프롬프트를 쓰세요. 그리고 올리기 전에 직접 들어 보세요. 소리는 클립과 함께 생성되며, 프롬프트와 맞는다는 보장은 없습니다.
내용은 2026-09-28에 확인한 Sume의 영상 생성 (영문), Video Router (영문), 오디오 분리, Timeline 1.0 문서와 GET /v1/videos/models가 제공하는 카탈로그에서 가져왔습니다.
ASMR 소리를 만드는 AI 영상 생성기는 무엇인가요?
Sume에서는 MiniMax H3, MiniMax H3 Max, Gemini Omni Flash 1.1이 항상 소리를 생성합니다. Seedance, Wan 3.0, Kling 3 모델은 generate_audio: false를 보내지 않는 한 소리를 생성하고, Grok Imagine Video 1.5는 소리를 만들지 않습니다. generate_audio 필드와 모델별로 거부하는 값은 소리를 생성하는 영상 모델에서 다룹니다.
| 모델 | 소리 | 클립 길이 |
|---|---|---|
minimax-h3, minimax-h3-max | 항상, 네이티브 스테레오 | 5–15초 |
gemini-omni-flash-1.1 | 항상, 네이티브 동기화 | 3–10초 |
seedance-2.5 | 선택 사항, 기본값은 켜짐 | 4–30초 |
seedance-2, seedance-2-fast, seedance-2-mini | 선택 사항, 기본값은 켜짐 | 4–15초 |
wan-3.0 | 선택 사항, 기본값은 켜짐 | 2–30초 |
kling-3 | 선택 사항, 기본값은 켜짐 | 4–15초 |
grok-imagine-video-1.5 | 없음 | 4–15초 |
AI ASMR 영상은 어떻게 만드나요?
- 표에서 소리를 내는 모델을 고르고, 세로 영상이라면
aspect_ratio: "9:16"을 보내세요. - 화면을 설명하세요. 익스트림 클로즈업이나 매크로 샷, 고정된 카메라, 소재와 그 질감, 느린 동작 하나를 적습니다.
- 같은 프롬프트에 소리를 설명하세요. 어떤 소리가 나야 하는지, 방이 조용하다는 것, 그리고 물체 소리만 원한다면 음악이나 목소리가 없다는 것을 적습니다.
- 특정 물체를 보여 주려면 그 사진을 공개 HTTPS URL에 올려
frame_images의first_frame으로 보내세요.
curl -X POST https://api.sume.com/v1/videos \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: asmr-glass-kiwi-001" \
-d '{
"model": "gemini-omni-flash-1.1",
"prompt": "Extreme close-up of a knife slowly slicing a glass kiwi on a wooden board. Static macro shot, soft studio light. Each cut makes a crisp glassy crunch; quiet room, no music, no voice",
"aspect_ratio": "9:16",
"resolution": "720p",
"duration": 8
}'AI ASMR 프롬프트에는 무엇을 써야 하나요?
샷, 물체, 동작, 소리를 이 순서대로 적으세요. 상황에 맞게 고쳐 쓸 수 있는 출발점 세 가지입니다.
- 자르기: “Extreme close-up of a knife slicing a glass apple on a marble counter, slow even cuts, a crisp glassy crackle with each slice, quiet room, no music.”(대리석 조리대 위에서 칼이 유리 사과를 써는 익스트림 클로즈업, 느리고 고른 칼질, 썰 때마다 나는 바삭한 유리 소리, 조용한 방, 음악 없음)
- 음식: “Macro shot of a fork breaking into a crunchy honeycomb bar, honey dripping, a loud crisp crunch and a sticky pull, no music, no voice.”(포크가 바삭한 허니콤 바를 깨고 들어가는 매크로 샷, 흘러내리는 꿀, 크고 바삭한 소리와 끈적하게 늘어나는 소리, 음악 없음, 목소리 없음)
- 두드리기: “Close-up of fingernails tapping slowly on a wooden box, then a glass jar, soft hollow taps and gentle clinks, static camera, warm light.”(손톱으로 나무 상자를, 이어서 유리병을 천천히 두드리는 클로즈업, 부드럽고 속이 빈 듯한 두드림 소리와 가볍게 부딪히는 소리, 고정된 카메라, 따뜻한 빛)
소리를 잃지 않고 더 긴 ASMR 영상을 만들려면 어떻게 하나요?
클립 여러 개를 이어 붙이되, 그 소리는 직접 옮겨 오세요. 현재 코드에서 Timeline 1.0 렌더는 소리를 오디오 스파인과 선택 사항인 사운드트랙에서만 가져오므로, 각 클립 자체의 오디오는 빠집니다. 먼저 POST /v1/audio-detach로 각 클립의 오디오를 분리하세요. 기본적으로 새 WAV 파일과 그 duration_seconds를 반환합니다. 그런 다음 그 파일들을 순서대로 audio.parts[]에 나열하고(최대 20조각, 틈 없이 이어짐), video[]에는 짝이 맞는 클립을 넣으세요. 각 part의 길이를 합하면 audio.duration_seconds 이상이어야 합니다.
curl -X POST https://api.sume.com/v1/timeline-1.0/render \
-H "Authorization: Bearer $SUME_API_KEY" \
-H "Content-Type: application/json" \
-H "Idempotency-Key: asmr-join-001" \
-d '{
"audio": {
"duration_seconds": 16,
"parts": [
{ "url": "https://media.sume.com/artifacts/artf_demo/cut-1.wav" },
{ "url": "https://media.sume.com/artifacts/artf_demo/cut-2.wav" }
]
},
"video": [
{ "source_url": "https://media.sume.com/artifacts/artf_demo/cut-1.mp4", "start": 0, "duration": 8 },
{ "source_url": "https://media.sume.com/artifacts/artf_demo/cut-2.mp4", "start": 8, "duration": 8 }
]
}'어떤 제한이 있고, 비용은 얼마인가요?
- 생성된 소리가 프롬프트를 얼마나 충실히 따르는지에 대해 문서는 아무것도 약속하지 않습니다.
- 오디오 분리와 Timeline은 Sume가 생성해 준 클립처럼 이 워크스페이스의
media.sume.com파일만 읽습니다. - 렌더 한 번의 길이는 1–1,800초이며, 기본 출력은 1080×1920입니다.
- 클립은 모델별로 공급사 정가 × 1.25로 과금되며, 기본적으로 5.5% 에이전트 수수료가 더해집니다.
kling-3에서는 소리를 넣으면 요율이 초당 $0.14에서 $0.21로 오릅니다. - 오디오 분리는 Job당 $0.01이고, 렌더는 출력 분당 $0.10 기준으로 분 단위로 올림해 예약합니다. API 요금을 참고하세요.
출처
관련 글
활용 사례 카테고리의 다른 글
- AI 보이스오버 만드는 방법: 대본에서 오디오 파일까지
AI 보이스오버는 대본 쓰기, 목소리 고르기, 음성 생성, 길이 확인, 파일 내려받기의 다섯 단계로 만듭니다. Sume API로 하는 방법을 설명합니다.
- 회의 녹음 파일로 회의록 만드는 방법
녹음으로 회의록을 만드는 과정은 두 단계입니다. 오디오를 전사한 뒤, 언어 모델이 요약, 결정 사항, 액션 아이템 초안을 쓰게 하세요.
- 제품 영상 프롬프트 예시: 템플릿과 샷 6개
제품 영상 프롬프트는 샷 하나를 설명합니다. 동작, 카메라 움직임 하나, 빛, 배경입니다. 템플릿과 예시 여섯 개, 필드에 넣을 항목을 정리했습니다.
- AI로 옛날 사진 복원하기: 손상 복구 후 업스케일
AI로 옛날 사진을 복원하려면 고칠 손상을 나열한 프롬프트와 함께 스캔본을 보낸 뒤, 최대 4배까지 업스케일하세요. 결과는 스캔본과 비교하세요.
작성자 Sume