CPU3DИИ-инструменты для 3D, видео и звука

AnyTalk генерирует 3D-анимацию речи для произвольных персонажей без анимационных данных

Исследователи представили AnyTalk — метод генерации 3D-анимации речи для произвольных персонажей, которому не нужны ни данные анимации, ни ручной риггинг. Вместо этого авторы дообучают готовую video diffusion model на рендерах целевого персонажа с «нулевыми» аудиоэмбеддингами, а затем поднимают полученное talking-head видео в 3D через оптимизацию blendshape-параметров. Код обещан на странице проекта, но на момент публикации заметки авторы его не выложили. Подробности — в статье на arXiv.

Что это значит

AnyTalk напрямую не конкурирует с генераторами видео из нашего раздела AI-видео: он решает задачу 3D-анимации речи, а не генерации роликов по тексту или изображению. Однако метод опирается на video diffusion model как на источник motion prior — то есть на тот же класс моделей, к которому относятся LTX-Video, CogVideoX и Pyramid Flow. В паспортах этих инструментов нет сведений о дообучении под конкретного персонажа или о подъёме видео в 3D-анимацию: их задачи — text-to-video и image-to-video. AnyTalk показывает, что video diffusion model можно адаптировать под узкую задачу синхронизации губ с минимальными данными, но для практического применения потребуется код, которого пока нет. Если авторы выложат реализацию, станет понятно, насколько метод применим к открытым моделям из нашего справочника и какие требования он предъявляет к железу.
AnyTalk: 3D-анимация речи без анимационных данных Видео-диффузия как источник motion prior для произвольных персонажей Вход Рендеры персонажа Аудио с речью Без риггинга Дообучение Video diffusion model Нулевые аудиоэмбеддинги Минимум данных Генерация Talking-head видео Синхронизация губ Motion prior 3D Blend- shape Оптими- зация Результат 3D-анимация речи Произвольный персонаж Ограничения Код не выложен Требования к железу неизвестны Связь с AI-видео LTX-Video, CogVideoX, Pyramid Flow Тот же класс моделей — video diffusion AnyTalk адаптирует video diffusion model под синхронизацию губ с минимальными данными Практическое применение зависит от публикации кода
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также