Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.
Зачем в России сделали первый бенчмарк для мультимодальной нейросети

Почему нельзя было взять готовый тест
Для рынка, где нужно оценивать модель на русскоязычных договорах, чеках, схемах и рукописных пометках, готового инструмента не было.
«Наша задача была не мультимодальность ради мультимодальности, а решение проблем бизнеса, — объясняет руководитель центра разработки больших языковых моделей MWS AI Валентин Малых. — У нас есть кейсы, близкие бизнесу: работа с документами, графиками, чеками. Это то, с чем компании реально сталкиваются каждый день».
В итоге получился набор из 800 изображений и 2580 заданий пяти типов:
- постраничное распознавание текста;
- перевод страницы в структурированный текст;
- поиск нужных координат на изображении;
- извлечение конкретных данных из документа;
- ответы на вопросы по содержанию.
Половина заданий в открытом доступе, вторая половина — закрытый тест, по которому и сравнивают модели.
Как измерить то, что нельзя пощупать
Бенчмарк не оценивает, «поняла» ли нейросеть документ в человеческом смысле cлова. Вместо этого ей задают предельно конкретные вопросы: кто указан директором в этом договоре, какая сумма в графе «итого». Ответ верный — модель, скорее всего, справилась. Неверный — где-то в цепочке от картинки к смыслу что-то сломалось, а где именно, бенчмарку не важно.
«Бенчмарк — это линейка, — говорит Валентин Малых. — Представьте прыжки в длину: чтобы оценить результат, не нужно разбираться в биомеханике толчка, достаточно измерить расстояние от планки до отпечатка в песке». Дать модели рекомендации, что именно исправить, бенчмарк не может и не должен — это задач разработчиков, которые смотрят на результаты и решают, чему модель нужно доучиться.
Здесь есть тонкость: там, где алгоритм пока не может проверить ответ сам — в сложных вопросах на понимание текста, — точкой отсчета становится человек, эксперт-разметчик, чья оценка и есть эталон. Валентин Малых сравнивает эту логику с идеями философов Нового времени: чтобы что-то улучшить, нужно сначала это измерить, а измерительным прибором в конечном счете оказывается сам человек и его суждение о том, что правильно.
«Мы, разработчики моделей, на практике каждый день опираемся на вещи, которые лежат глубоко в философии, просто обычно этого не замечаем», — говорит Валентин Малых.
Разворачивает эту мысль он не только в разговоре о продукте — в октябре Малых примет участие в дискуссии о философии измерения на конференции клуба Quercus «Философия в ответе», уже безотносительно к конкретному бенчмарку.
Откуда берутся галлюцинации
Отдельный вопрос — сами галлюцинации. «Нейросеть галлюцинирует все время, просто иногда удачно, поэтому мы этого не замечаем, — объясняет эксперт. — Модель учат предсказывать следующее слово, а раз она не знает наверняка, какое слово правильное, ей приходится угадывать. Угадывание — это и есть галлюцинация, просто у нее есть точные попадания, а есть промахи».
Отличить, что именно пошло не так, — нейросеть не разглядела текст на плохом скане или придумала факт, которого в документе не было, — бенчмарку помогает конкретика вопросов: если модель не может назвать директора компании из читаемого договора, дело не в качестве скана.
У бенчмарка при этом есть врожденный срок годности: он статичен, а значит, рано или поздно его данные так или иначе просочатся в обучающие выборки будущих моделей — и он перестанет отличать хорошие модели от слабых. Тогда его придется обновлять заново.
Валентин Малых убежден: привычка сперва измерить, а потом улучшать — не техническая деталь, а способ мышления, которому стоит учиться любому инженеру.
Пока нейросети учатся не понимать, а предсказывать, вопрос, что именно мы измеряем, когда оцениваем ИИ, остается открытым.


