MoRoute предложила динамическую маршрутизацию слоёв для мультимодальной видеогенерации
Исследователи из MoRoute опубликовали работу, в которой предлагают объединять замороженную визуально-языковую модель (VLM) и предобученный видео diffusion transformer (DiT) через динамическую маршрутизацию слоёв. Подход позволяет каждому блоку DiT выбирать наиболее релевантный слой VLM для текущего этапа генерации, а также встраивать изображения и видео напрямую в последовательность токенов. Подробности изложены в статье на arXiv.



