AI 아바타 UGC 영상 프롬프트: 필드마다 무엇을 쓰나요?

AI 아바타의 UGC 영상 프롬프트는 입력 하나가 아니라 세 개입니다. 크리에이터의 대사, 장소와 조명을 정하는 장면 프롬프트, 그리고 제품 이미지입니다.

읽는 시간 5분Sume
전체 글

AI 아바타의 UGC 영상 프롬프트는 텍스트 한 덩어리가 아닙니다. 말하는 UGC 클립에는 서로 다른 곳에 들어가는 세 부분이 있습니다. 크리에이터가 말하는 대사, 장소와 조명, 그리고 제품입니다. Sume의 Avatar 1.0 API에서 대사는 script(또는 장면마다의 voice)에, 장소는 scene 프롬프트나 사진에, 제품은 product_image에 들어갑니다. 인물의 외모는 아바타를 만들 때 이미 정해졌습니다.

필드 규칙은 2026-09-28에 확인한 Sume의 아바타 영상 생성 문서와 Sume API 레퍼런스에서 가져왔으며, 현재 동작이라고 설명한 내용은 Sume의 코드에서 확인했습니다. 대사 자체는 AI 아바타 영상용 UGC 광고 스크립트를, 인물은 AI 아바타 프롬프트 작성법을 참고하세요.

UGC 아바타 프롬프트의 각 부분에는 무엇이 들어가나요?

입력창 하나짜리 생성기라면 입력했을 내용을 하나씩 해당 필드에 대응시키세요.

아바타 영상 생성과 Sume API 레퍼런스 기준, 2026-09-28 확인.
클립의 부분필드쓸 내용
인물avatar_handle쓸 것 없음. 외모는 만들어 둔 아바타에서 옴
대사script, 또는 type: "text"인 장면의 voice크리에이터가 말하는 대사만
데모를 위한 멈춤type: "silence"와 duration을 담은 장면의 voice대사 없음. 이어지는 시간(초)만
장소와 조명scene(프롬프트 또는 사진), 또는 각 장면의 background어디서 찍고 조명은 어떤지
제품product_image공개 HTTPS 이미지 URL. 제품이 없으면 생략
화면aspect_ratio기본값 9:16. 1:1, 3:4, 4:3, 16:9도 가능

장면 프롬프트는 어떻게 쓰나요?

장소, 조명, 구도를 짧은 구절 하나로 적으세요. 문서의 UGC 예시는 "Casual bedroom framing, native UGC lighting"(편안한 침실 구도, 자연스러운 UGC 조명)을 씁니다. 같은 스타일의 다른 구절은 다음과 같습니다.

  • "Kitchen counter, morning window light, close framing"(주방 조리대, 아침 창가 빛, 가까운 구도).
  • "Parked car interior, daylight through the windshield"(주차한 차 안, 앞유리로 들어오는 햇빛).
  • "Bathroom mirror, warm vanity light, chest-up framing"(욕실 거울, 따뜻한 화장대 조명, 가슴 위로 잡은 구도).
  • 영상 하나에는 장소를 하나만 쓰세요. 현재 코드에서는 배경이 서로 다른 장면을 400으로 거부하므로, 장면마다 같은 프롬프트를 반복하세요. 실제 방을 scene에 공개 HTTPS 사진으로 넣어도 됩니다.

UGC 아바타 요청 전체는 어떤 모습인가요?

말로 하는 훅, 말없는 데모 비트, 말로 하는 콜 투 액션을 모두 같은 배경으로 두고, 제품을 더한 요청입니다.

curl -X POST https://api.sume.com/v1/avatar-1.0/talking-video \
  -H "Authorization: Bearer $SUME_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Idempotency-Key: ugc-serum-v1" \
  -d '{
    "avatar_handle": "ugc_creator",
    "product_image": "https://example.com/serum.png",
    "video_inputs": [
      { "id": "hook",
        "voice": { "type": "text", "script": "Okay, this is the serum everyone keeps asking me about." },
        "background": { "type": "prompt", "prompt": "Casual bedroom framing, native UGC lighting" } },
      { "id": "demo",
        "voice": { "type": "silence", "duration": 4 },
        "background": { "type": "prompt", "prompt": "Casual bedroom framing, native UGC lighting" } },
      { "id": "cta",
        "voice": { "type": "text", "script": "The link is below if you want to try it." },
        "background": { "type": "prompt", "prompt": "Casual bedroom framing, native UGC lighting" } }
    ]
  }'

프롬프트로 톤, 제스처, 카메라 움직임을 정할 수 있나요?

아니요, 정할 수 없습니다. 현재 코드에서 talking-video 생성 요청에는 톤, 제스처, 카메라 움직임을 위한 필드가 없고, 짧은 허용 목록 밖의 필드는 모두 400으로 거부합니다. script에도 말할 대사만 넣으세요. 현재 코드에서는 클립마다 여러분이 쓴 대사를 정확히 그대로 말하도록 요청하므로, "(laughs)" 같은 지문도 말할 대사로 들어갑니다. 다른 스크립트 규칙은 60초에 들어가는 단어 수에서 다룹니다.

톤과 속도를 정하려면 AI 아바타 감정 표현과 말하는 속도에서처럼 TTS 1.0으로 대사를 음성으로 만들고 Fabric으로 아바타를 립싱크하세요. 정해진 제스처가 필요하다면 AI 아바타 손동작을 참고하세요.

텍스트로 영상을 만드는 프롬프트 하나에 보이스오버를 입히면 왜 안 되나요?

입 모양이 맞지 않기 때문입니다. Sume의 모델 가이드에 따르면 영상 모델은 생성된 TTS나 나중에 입힌 보이스오버에 립싱크하지 않으므로, 말하는 얼굴은 결코 영상 모델 클립 아래에 내레이션을 까는 방식으로 만들지 않습니다. 말하는 장면은 아바타 경로에서 만들거나, VEED Fabric 1.0으로 스틸을 TTS에 립싱크해 만듭니다. 각 경로는 토킹 헤드 영상 API 비교에서 따져 봅니다. 대사가 없는 B-roll은 여전히 영상 프롬프트로 만들 수 있습니다.

어떤 제한이 있나요?

  • 계획 전체의 추정 길이가 4–60초여야 하며, video_inputs는 장면을 최대 20개까지 받습니다.
  • 영상 하나에는 아바타 하나와 공유 장면 하나만 들어갑니다.
  • 현재 코드에서는 영어 음성만 지원합니다. 클립 프롬프트가 영어 대사를 요청합니다.
  • 미디어 필드는 공개 HTTPS URL이어야 합니다. 시간 범위 안에 드는 요청이라도 프로바이더가 생성된 콘텐츠를 거부하면 content_policy_rejected로 실패할 수 있습니다.

출처

관련 글

Sume Avatar 1.0 카테고리의 다른 글

Sume Avatar 1.0 글 전체 보기

작성자 Sume