InfinityEdit представили адаптер для бесконечного потокового видеоредактирования
21 августа 2026 года на arXiv вышла работа InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter. Авторы отказываются от привычного допущения, что редактируемое видео уже существует как законченный клип, и вместо этого рассматривают открытый поток: правки применяются к будущим кадрам по мере их появления. Для этого они собрали отдельный датасет и предложили лёгкий адаптер из трёх attention-модулей — history cross-attention для опоры на предыдущие кадры, temporal causal self-attention для передачи сигнала только от ранних кадров к поздним и edit cross-attention для встраивания запроса на редактирование. Кода авторы не выкладывали.
Что это значит
В нашем справочнике по генераторам видео пока нет инструментов, которые работали бы в режиме бесконечного потокового редактирования. Ближайшие по задаче — LTX-Video, CogVideoX и Pyramid Flow — генерируют видео по текстовому или графическому запросу, но все они исходят из конечного клипа, а не из непрерывно поступающего потока кадров.
LTX-Video решает задачу image-to-video, весит 26,6 ГБ в самом большом файле и, по описанию разработчика, требует всего 1 ГБ видеопамяти. CogVideoX — text-to-video генератор с моделью на 9,2 ГБ, ориентированный на CUDA и NVIDIA H100. Pyramid Flow также работает как text-to-video, самый большой файл весов занимает 7,8 ГБ, а для запуска достаточно менее 8 ГБ видеопамяти. Ни в одном из паспортов нет упоминания потокового режима или механизма накопления правок поверх уже сгенерированных кадров.
InfinityEdit описывает именно ту нишу, которой в справочнике пока не закрыта: редактирование живого потока, где запросы приходят последовательно и должны применяться к ещё не сгенерированным кадрам. Пока это исследовательская работа без кода, и оценить её применимость к существующим генераторам нельзя — авторы не публиковали ни весов, ни репозитория.Как устроен метод. Схема нарисована по этой заметке.