Зачем в России сделали первый бенчмарк для мультимодальной нейросети

Нейросеть можно попросить прочитать скан договора, найти в нем сумму сделки и назвать генерального директора — и она ответит. Проблема в том, что она с той же готовностью ответит и в том случае, если половину придумала: на глаз хорошую галлюцинацию не отличить от правильного ответа. Модель ведь не читает документ в человеческом смысле, а предсказывает наиболее вероятное продолжение.
Редакция сайта
Редакция сайта
Зачем в России сделали первый бенчмарк для мультимодальной нейросети
Magnific
Бизнес уже вовсю доверяет нейросетям чтение счетов, договоров и заявок, а инструмента, который отличал бы одно от другого, в России не было. Разработчики MWS AI решили эту неопределенность снять — и сделали MWS Vision Bench, первый в стране открытый бенчмарк для проверки мультимодальных моделей на реальных документах.

Почему нельзя было взять готовый тест

Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Для рынка, где нужно оценивать модель на русскоязычных договорах, чеках, схемах и рукописных пометках, готового инструмента не было.

«Наша задача была не мультимодальность ради мультимодальности, а решение проблем бизнеса, — объясняет руководитель центра разработки больших языковых моделей MWS AI Валентин Малых. — У нас есть кейсы, близкие бизнесу: работа с документами, графиками, чеками. Это то, с чем компании реально сталкиваются каждый день».

В итоге получился набор из 800 изображений и 2580 заданий пяти типов:

  • постраничное распознавание текста;
  • перевод страницы в структурированный текст;
  • поиск нужных координат на изображении;
  • извлечение конкретных данных из документа;
  • ответы на вопросы по содержанию.
Продолжение ниже Продолжение

Половина заданий в открытом доступе, вторая половина — закрытый тест, по которому и сравнивают модели.

тест для нейросети
Magnific
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Как измерить то, что нельзя пощупать

Бенчмарк не оценивает, «поняла» ли нейросеть документ в человеческом смысле cлова. Вместо этого ей задают предельно конкретные вопросы: кто указан директором в этом договоре, какая сумма в графе «итого». Ответ верный — модель, скорее всего, справилась. Неверный — где-то в цепочке от картинки к смыслу что-то сломалось, а где именно, бенчмарку не важно.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

«Бенчмарк — это линейка, — говорит Валентин Малых. — Представьте прыжки в длину: чтобы оценить результат, не нужно разбираться в биомеханике толчка, достаточно измерить расстояние от планки до отпечатка в песке». Дать модели рекомендации, что именно исправить, бенчмарк не может и не должен — это задач разработчиков, которые смотрят на результаты и решают, чему модель нужно доучиться.

Здесь есть тонкость: там, где алгоритм пока не может проверить ответ сам — в сложных вопросах на понимание текста, — точкой отсчета становится человек, эксперт-разметчик, чья оценка и есть эталон. Валентин Малых сравнивает эту логику с идеями философов Нового времени: чтобы что-то улучшить, нужно сначала это измерить, а измерительным прибором в конечном счете оказывается сам человек и его суждение о том, что правильно.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

«Мы, разработчики моделей, на практике каждый день опираемся на вещи, которые лежат глубоко в философии, просто обычно этого не замечаем», — говорит Валентин Малых.

Разворачивает эту мысль он не только в разговоре о продукте — в октябре Малых примет участие в дискуссии о философии измерения на конференции клуба Quercus «Философия в ответе», уже безотносительно к конкретному бенчмарку.

галлюцинация нейросети
Magnific
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Откуда берутся галлюцинации

Отдельный вопрос — сами галлюцинации. «Нейросеть галлюцинирует все время, просто иногда удачно, поэтому мы этого не замечаем, — объясняет эксперт. — Модель учат предсказывать следующее слово, а раз она не знает наверняка, какое слово правильное, ей приходится угадывать. Угадывание — это и есть галлюцинация, просто у нее есть точные попадания, а есть промахи».

Отличить, что именно пошло не так, — нейросеть не разглядела текст на плохом скане или придумала факт, которого в документе не было, — бенчмарку помогает конкретика вопросов: если модель не может назвать директора компании из читаемого договора, дело не в качестве скана.

Российские разработчики уже собрали для себя отдельную категорию таких ошибок и используют ее, чтобы оценивать модели по новой шкале — насколько именно они склонны додумывать за документ.

У бенчмарка при этом есть врожденный срок годности: он статичен, а значит, рано или поздно его данные так или иначе просочатся в обучающие выборки будущих моделей — и он перестанет отличать хорошие модели от слабых. Тогда его придется обновлять заново.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Валентин Малых убежден: привычка сперва измерить, а потом улучшать — не техническая деталь, а способ мышления, которому стоит учиться любому инженеру.


Пока нейросети учатся не понимать, а предсказывать, вопрос, что именно мы измеряем, когда оцениваем ИИ, остается открытым.

Загружаем