Sci-VBench: бенчмарк научной достоверности видео от генеративных моделей
Авторы Sci-VBench представили бенчмарк для оценки генерации видео в научных областях. Он включает 1 253 экспертно размеченных примера по 60 дисциплинам из естественных наук, здравоохранения, гуманитарных и социальных наук, а также инженерии. Оценка идёт по рубрикам, где ключевые критерии — Prompt Grounding и Scientific and Causal Correctness. Авторы протестировали 16 проприетарных и открытых моделей и обнаружили, что при близких оценках визуального качества модели заметно расходятся в научной и причинно-следственной корректности, причём проприетарные системы опережают открытые. Код авторы не выкладывали.
Что это значит
Бенчмарк напрямую касается генераторов видео из нашего справочника, но ни один из них в статье не назван поимённо — авторы говорят о 16 моделях без списка. Поэтому сравнивать результаты конкретных инструментов по этому исследованию нельзя.
Тем не менее контекст важен для всех трёх карточек раздела AI Video. LTX-Video — открытая image-to-video модель от Lightricks, в паспорте нет сведений о том, как она справляется с научным содержанием или причинно-следственными связями. CogVideoX от Zhipu AI решает задачу text-to-video, и в его описании тоже нет данных о научной корректности генерации. Pyramid Flow — открытая text-to-video модель, в паспорте которой также не отражены способности к научному рассуждению.
Вывод авторов о разрыве между проприетарными и открытыми моделями в научной корректности стоит учитывать при выборе инструмента для задач, где важна не только визуальная правдоподобность, но и содержательная точность. При этом конкретные цифры по каждой модели в открытом доступе отсутствуют.Как устроен метод. Схема нарисована по этой заметке.