CPU3DИИ-инструменты для 3D и видео

Sci-VBench: бенчмарк научной достоверности видео от генеративных моделей

Авторы Sci-VBench представили бенчмарк для оценки генерации видео в научных областях. Он включает 1 253 экспертно размеченных примера по 60 дисциплинам из естественных наук, здравоохранения, гуманитарных и социальных наук, а также инженерии. Оценка идёт по рубрикам, где ключевые критерии — Prompt Grounding и Scientific and Causal Correctness. Авторы протестировали 16 проприетарных и открытых моделей и обнаружили, что при близких оценках визуального качества модели заметно расходятся в научной и причинно-следственной корректности, причём проприетарные системы опережают открытые. Код авторы не выкладывали.

Что это значит

Бенчмарк напрямую касается генераторов видео из нашего справочника, но ни один из них в статье не назван поимённо — авторы говорят о 16 моделях без списка. Поэтому сравнивать результаты конкретных инструментов по этому исследованию нельзя. Тем не менее контекст важен для всех трёх карточек раздела AI Video. LTX-Video — открытая image-to-video модель от Lightricks, в паспорте нет сведений о том, как она справляется с научным содержанием или причинно-следственными связями. CogVideoX от Zhipu AI решает задачу text-to-video, и в его описании тоже нет данных о научной корректности генерации. Pyramid Flow — открытая text-to-video модель, в паспорте которой также не отражены способности к научному рассуждению. Вывод авторов о разрыве между проприетарными и открытыми моделями в научной корректности стоит учитывать при выборе инструмента для задач, где важна не только визуальная правдоподобность, но и содержательная точность. При этом конкретные цифры по каждой модели в открытом доступе отсутствуют.
Sci-VBench: оценка научной достоверности видео Входные данные 1 253 примера 60 дисциплин экспертная разметка Оценка по рубрикам Prompt Grounding Scientific and Causal Correctness Тестирование 16 моделей проприетарные и открытые Результаты визуальное качество близкое у всех научная корректность сильно различается Разрыв проприетарные опережают открытые в научной и причинно-следственной Ограничения модели не названы код не выложен нет цифр по каждой модели Вывод Учитывать разрыв при выборе инструмента для задач, где важна содержательная точность
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также