CPU3DИИ-инструменты для 3D и видео

MoRoute предложила динамическую маршрутизацию слоёв для мультимодальной видеогенерации

Исследователи из MoRoute опубликовали работу, в которой предлагают объединять замороженную визуально-языковую модель (VLM) и предобученный видео diffusion transformer (DiT) через динамическую маршрутизацию слоёв. Подход позволяет каждому блоку DiT выбирать наиболее релевантный слой VLM для текущего этапа генерации, а также встраивать изображения и видео напрямую в последовательность токенов. Подробности изложены в статье на arXiv.

Что это значит

Работа MoRoute касается фундаментальной архитектуры мультимодальных видеогенераторов, а не конкретных продуктов. Ни один из инструментов нашего справочника — LTX-Video, CogVideoX или Pyramid Flow — не использует описанный метод динамической маршрутизации между VLM и DiT. Все три генератора решают более узкие задачи (text-to-video или image-to-video) и не заявляют о поддержке произвольных комбинаций текста, изображений и видео в качестве условий в одной модели. В паспортах наших инструментов нет сведений ни о применении VLM для понимания контекста, ни о механизмах маршрутизации слоёв. LTX-Video, CogVideoX и Pyramid Flow остаются специализированными решениями, тогда как MoRoute описывает исследовательскую архитектуру, нацеленную на унификацию разноплановых задач генерации и редактирования видео. Пока метод существует в виде научной публикации, и о его появлении в пользовательских инструментах говорить рано. Раздел о генерации видео в целом доступен на странице справочника.

Смотрите также