Sume Avatar 1.0

Sume Avatar 1.0을 소개합니다

Sume Avatar 1.0은 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다.

읽는 시간 7분David Im, Co-Founder & CEO
전체 글

오늘 Sume Avatar 1.0을 공개합니다. 단일 아바타 모델로 제공되는 멀티 에이전트 오케스트레이션 시스템입니다. Avatar 1.0은 최대 60초 길이의 일관된 아바타 영상을 생성하면서 프런티어 수준의 아바타 영상 성능을 내도록 설계되었습니다.

Orchestration Is All You Need: 프런티어 영상 생성의 핵심이 규모가 아니라 오케스트레이션인 이유

지금까지 영상 생성의 발전은 개별 영상 모델의 규모를 키우는 데서 나왔습니다. 그러나 프런티어 수준의 성능에 도달하려면 이미지, 오디오, 장면 이해에 걸친 여러 전문 모델을 조합해야 합니다. 영상 모달리티는 텍스트보다 훨씬 고차원의 공간을 차지하므로, 파운데이션 모델마다 고유한 강점과 가장 잘 맞는 용도가 있습니다.

Sume의 핵심 가설은 이러한 전문화가 현 세대 모델의 일시적인 산물이 아니라 이 분야의 지속적인 특성이라는 것입니다. 파운데이션 모델은 앞으로도 서로 다른 역량의 프런티어를 따라 계속 갈라질 것입니다. 따라서 최적의 성능은 독립적으로 개발된 이질적인 전문 모델들을 원칙에 따라 조합할 때에만 얻을 수 있습니다.

중요한 점은 이것이 성능만의 문제가 아니라 도입의 문제이기도 하다는 것입니다. 여러 파운데이션 모델을 오가며 프로덕션 수준의 결과물을 끌어내는 능력은 전문가 수준의 프롬프트 지식이 있어야만 쓸 수 있습니다. 전문가가 아닌 사용자는 프로덕션 프런티어에 도달하지 못합니다. 그리고 그 실패의 원인은 추상화 계층의 부재가 아니라 사용자에게 잘못 돌려집니다.

오케스트레이션 모델은 두 문제를 동시에 해결합니다. 사용자가 어떤 프롬프트를 입력하든, 오케스트레이션 계층은 이를 전문 모델들의 적절한 조합에 매핑하고 결과를 프로덕션 프리미티브로 돌려줍니다. 그 끝없는 반복 작업을 모두 추상화해 감추는 것입니다.

프로덕션 API가 갖춰야 할 모습

에이전트 네이티브 영상 생성 API는 두 가지를 해내야 합니다. 예측 가능한 결과를 돌려주는 것, 그리고 그 결과를 기본적으로 바로 프로덕션에 쓸 수 있는 상태로 돌려주는 것입니다.

첫째, 생성은 자유 형식 프롬프트가 아니라 샷의 촬영 요소, 즉 아바타, 스크립트, 조명, 구도, 프레이밍에 대응하는 필드로 구조화되어야 합니다. 각 필드는 화면에 무엇이 나타날지에 관한 구체적인 결정을 고정해, 출력 분포를 예측 가능한 결과 쪽으로 좁힙니다.

둘째, 엔드포인트는 모델이 아니라 출력으로 정의되어야 합니다. 각 엔드포인트는 그 아래에서 돌아가는 모델만이 아니라, “talking head video of an Avatar”(아바타가 말하는 영상)처럼 반환하는 결과물의 형태로 분류됩니다. 에이전트는 이런 단위로 계획을 세우므로, 에이전트가 추론하는 단위가 곧 API가 바로 내보낼 수 있는 상태로 돌려주는 단위가 됩니다.

Sume Avatar 1.0

Sume Avatar 1.0은 단일 엔드포인트처럼 동작하는 멀티 모델 시스템입니다. 요청을 보내면 나머지는 Avatar 1.0이 처리합니다. 작업의 각 부분을 어떤 모델이 맡을지 정하고, 그 모델들을 실행하고, 프로덕션에 바로 쓸 수 있는 클립을 완성합니다. 라우팅과 조율은 모두 엔드포인트 뒤에서 일어나므로, 그 복잡성이 사용자에게 전해지지 않습니다.

이 일이 어려운 이유는 쓸 만한 토킹 헤드 영상이 여러 요소를 한꺼번에 제대로 맞춰야 하는데, 그 모두를 갖춘 단일 모델은 없기 때문입니다. 정체성, 프레이밍, 움직임은 단일 프롬프트 생성이 흐트러지기 시작하는 약 15초를 훨씬 넘어서까지 일관되게 유지되어야 합니다. 목소리는 처음부터 끝까지 같아야 하고, 화면 속 제품은 샷이 바뀌어도 같은 물건이어야 하며, 아바타는 인종, 성별, 나이와 관계없이 자연스러워 보여야 합니다. 이런 제약을 모델 하나로 밀어붙이면 가장 약한 제약이 무너질 때까지 서로 충돌합니다. Avatar 1.0은 각 제약을 가장 잘 처리하는 모델로 보내고, 그 결과를 예측 가능한 클립 하나로 맞춰 냅니다. 사용자는 엔드포인트 하나를 호출하고, 작업은 조율된 전문 모델 시스템이 수행합니다.

앞으로의 계획

Avatar 1.0은 앞으로 이어질 많은 것 중 첫 번째입니다. 저희는 각각 프로덕션에 바로 쓸 수 있는 영상을 돌려주는 오케스트레이션 모델 API의 전체 라이브러리를 만들고 있습니다. 각 API는 그 아래의 모델이 아니라 반환하는 결과물로 정의될 것입니다. API에서 멈추지도 않을 것입니다. 그 위에 이러한 프리미티브를 완전한 워크플로로 조합하고 필드를 설정하는 방법을 담은 에이전트 스킬을 제공하여, 에이전트가 엔드포인트를 한 번에 하나씩 호출하는 데 그치지 않고 제작 전체를 계획할 수 있게 합니다.

최종 목표는 말하기는 쉽고 만들기는 어렵습니다. 한 번에 프로덕션 수준의 영상을 얻는 것입니다. 프롬프트 호핑도, 반복 루프도, 과정에 개입하는 전문가도 없습니다. 원하는 것을 설명하면, 조율된 전문 모델 시스템이 바로 내보낼 수 있는 결과물을 돌려줍니다. 더 큰 모델이 아니라, 마침내 이 분야 전체를 쓸 수 있게 만드는 오케스트레이션 계층입니다.

작성자 David Im, Co-Founder & CEO