AnyTalk генерирует 3D-анимацию речи для произвольных персонажей без анимационных данных
Исследователи представили AnyTalk — метод генерации 3D-анимации речи для произвольных персонажей, которому не нужны ни данные анимации, ни ручной риггинг. Вместо этого авторы дообучают готовую video diffusion model на рендерах целевого персонажа с «нулевыми» аудиоэмбеддингами, а затем поднимают полученное talking-head видео в 3D через оптимизацию blendshape-параметров. Код обещан на странице проекта, но на момент публикации заметки авторы его не выложили. Подробности — в статье на arXiv.
Что это значит
AnyTalk напрямую не конкурирует с генераторами видео из нашего раздела AI-видео: он решает задачу 3D-анимации речи, а не генерации роликов по тексту или изображению. Однако метод опирается на video diffusion model как на источник motion prior — то есть на тот же класс моделей, к которому относятся LTX-Video, CogVideoX и Pyramid Flow.
В паспортах этих инструментов нет сведений о дообучении под конкретного персонажа или о подъёме видео в 3D-анимацию: их задачи — text-to-video и image-to-video. AnyTalk показывает, что video diffusion model можно адаптировать под узкую задачу синхронизации губ с минимальными данными, но для практического применения потребуется код, которого пока нет.
Если авторы выложат реализацию, станет понятно, насколько метод применим к открытым моделям из нашего справочника и какие требования он предъявляет к железу.Как устроен метод. Схема нарисована по этой заметке.