Слово как интерфейс: как общение с моделями тренирует человеческую ясность мысли

Языковые модели первыми среди всех технологий заговорили с нами на обычном языке – без кнопок и команд. Если умеешь четко формулировать задачу словами, то можешь все. У меня двое совсем маленьких детей, и многие их слова и фразы мне непонятны. А вот большие языковые модели с ними проблем не испытывают: малыши вовсю болтают с голосовыми помощниками. Машины – верные друзья моих детей. Но чем дальше, тем больше возникает вопросов. Самый главный – о памяти. В поисках ответов на эти вопросы я и обратился к Антону Фролову, руководителю блока «Развитие генеративного ИИ» Сбера. Мы обсудили, почему у моделей до сих пор нет долгой памяти, чем агент отличается от языковой модели, кто отвечает за его ошибки, есть ли у ИИ совесть и какие профессии переживут эпоху мультиагентных систем.
Александр Грек
Александр Грек
АнтонФролов
Старший вице-президент, руководитель блока «Развитие генеративного ИИ» в Сбере. Курирует развитие фундаментальных моделей генеративного ИИ, платформ машинного обучения и нейросети ГигаЧат

Недолгая память

Первым делом мы упираемся в эту тему. Я мечтал об искусственном интеллекте уровня моей жены: она помнит всю мою жизнь, каждый эпизод, с ней всегда можно поговорить и посоветоваться. Но модели словно страдают склерозом.

Антон с этим соглашается: «Память — это, наверное, одна из самых фундаментальных нерешенных проблем в современном ИИ. То, что мы привыкли называть памятью у людей, у моделей — контекстное окно». Сейчас такое окно имеет размер около миллиона токенов (токен — не слово, а кусочек слога). Миллиона хватает на несколько диалогов, но не на всю жизнь».

Затем он объясняет на пальцах: «Модель держит в голове только то, что вы сказали прямо сейчас. Если дадите задачу по программированию с объемным кодом, она полчаса поработает, а потом забудет начало и начнет задавать уточняющие вопросы. Это сильно ограничивает автономность». Однако прогресс есть. «Через год будет 10 млн токенов, через два придумают новую архитектуру. Я уверен: мы доживем до момента, когда ИИ станет другом, который знает о нас почти все», – добавляет мой собеседник.

Фото: Олег Зотов

АГЕНТ И МОДЕЛЬ

Я не сдаюсь и вспоминаю мой любимый лайфхак. Часто пишу моделям: «Почитай работы Хокинга и представь, что ты Хокинг». И она реально начинает рассуждать как великий физик.

Антон в ответ смеется: «Это зашито в мозгах нейросети на этапе обучения. Она читала про Хокинга все, что было на тот момент в интернете. Но новых статей она не знает. Модели пока не дообучаются в реальном времени».

Это вопрос непрерывного обучения. Нехватку актуальной информации частично компенсируют инструменты: например, ГигаЧат умеет искать данные в интернете и использовать статьи в контексте. Но «зашитое» в память модели работает лучше.

Перехожу к главному: что такое агент и чем он отличается от языковой модели?

Антон: «Модель – это уравнение с параметрами. Она работает синхронно: получает на вход вопрос – дает на выход ответ. Агент – это модель плюс упряжка инструментов, позволяющая действовать асинхронно и обращаться к другим сервисам. Вы дали задание – он ушел работать на три часа, сам разбил большую задачу на более мелкие и решает их по отдельности. Скажем, агент может не просто резюмировать отчет, а написать скрипт на Python, посчитать статистику и отправить результат коллеге на почту. LLM так не умеет – она только отвечает на вопросы».

Кто заплатит за ошибки? Можно ли доверить агенту подписать контракт или купить машину?

Антон: «Сейчас вся ответственность лежит на пользователе. Модель может ошибаться. Но в будущем, когда агенты будут решать чувствительные задачи, потребуется новый контракт между поставщиком ИИ и человеком. Появятся зафиксированные правила, верификация, распределение ответственности. Скоро ваш личный агент получит субъектность и начнет подписывать документы от вашего имени».

В Сбере агенты обрабатывают документы, готовят презентации, находят ошибки в отчетах. У Антона есть агент, который просматривает все входящие презентации, замечает нестыковки и отправляет правки авторам.

Фото: Олег Зотов
Фото: Олег Зотов
Есть ли у модели совесть? Вспоминаю принцип деловой журналистики: у репортера не должно быть своей позиции — только факты. Должна ли модель иметь позицию?

Антон отвечает: «У модели ее нет, но есть фаза настройки, где ей показывают – с учетом законодательства и этики – что такое хорошо и что такое плохо. Если не заложить эти принципы, модель просто запомнит всю информацию из интернета, а там попадаются самые разные мнения. Правильная позиция – делать максимум в интересах пользователя, предупреждать, если он ошибается».

ИНТЕРФЕЙС, КОТОРЫЙ РОДИТСЯ ЗАНОВО

Мы привыкли к ИИ только внутри приложений, но, кажется, скоро все изменится. Антон предсказывает революцию: «В будущем ИИ станет работать на уровне операционной системы, а не отдельным приложением. Он будет генерировать интерфейсы на лету под конкретную задачу. Продукты перестанут конкурировать дизайном и начнут конкурировать моделью. У каждого человека появится свой уникальный интерфейс таких нейросетей».

Как же агент запомнит все мои предпочтения, если память у него короткая?

«Персональные предпочтения – мелочь, пара килобайт, они всегда могут быть в контексте. А все остальное о вас хранится в долгосрочной памяти, отдельном текстовом файле. Модель редко к нему обращается, но хранит все», – отвечает Антон.

Фото: Олег Зотов

МИФИЧЕСКАЯ ПРОФЕССИЯ

Я вечно мучаюсь с презентациями. Как современный ИИ мне поможет?

Антон дает совет: «Просите верстать не в PowerPoint, а в HTML. Большие языковые модели хорошо работают с текстом, но могут допускать ошибки в распознавании изображений, верстка для них также требует дополнительных усилий. Можно направить модель: "Задай мне вопросы, если непонятно"».

И тут он переворачивает мой мир, заявляя, что профессия промпт-инженера уже ушла в прошлое: «Если вы не умеете писать промпт, скажите нейросети: "Напиши мне промпт". Она сделает это лучше любого специалиста. Сложность не в том, как обратиться к ИИ, а в том, как привести в порядок собственную голову и четко сформулировать задачу – по сути так же, как и при общении с другими людьми».

Общение с моделями тренирует человеческую ясность мысли. Может, мы не тупеем, а учимся решать новый класс задач?

БУДУЩЕЕ: КОМАНДА АГЕНТОВ

Напоследок спрошу: каково будущее ИИ?

Антон говорит о двух вызовах: это увеличение времени автономной работы (упирается в память) и компьютерное зрение (у больших языковых моделей с ним пока бывают сложности). Но самое интересное – переход к мультиагентным системам. «Один агент не может удержать сложную задачу, – объясняет мой собеседник. – Нужна команда: планировщик, исполнитель, контролер. Как в программировании: если один агент пишет код и тесты, он скажет: "Тесты плохие" – и примет свое решение без проверки. А когда один агент пишет код, второй проводит тесты, а третий принимает результат, итог получается качественнее. В ГигаЧат это происходит "под капотом", а для создания собственных агентов у нас есть отдельные технологии».

Фото: Олег Зотов
Вспоминаю наш неудачный эксперимент в редакции: год назад мы пытались заменить редактора агентом — вышло хуже.

Антон успокаивает: «Вы просто не научили модель пользоваться долгосрочной памятью. Правильно обученный агент вполне способен разгрузить редактора, сняв с него часть рутинных задач. С текущим темпом развития ИИ передовые модели будут решать почти любую задачу человека – только быстрее и эффективнее. Вопрос не в том, смогут ли они, а в том, как мы перераспределим роли».

Задали вопрос ГигаЧату в режиме «Исследование»: Какие профессии будут актуальны для людей в эпоху мультиагентных систем?

1. Архитектор и оркестратор мультиагентных систем. Менеджер-архитектор, управляющий целой системой из 5–50 автономных агентов.

2. Инженер по мультиагентным системам (AI Agent Engineer). Специалист, создающий связки из нескольких нейросетей.

3. Инженер по этике ИИ (AI Ethicist). Специалист, отвечающий за соблюдение этических норм в автоматизированных системах.

4. AI-тренер. Специалист, обучающий нейросети и корректирующий их поведение.

5. AI-аудитор. Поскольку агенты будут ошибаться, потребуются люди для проверки их решений.

6. «Кентавры». Профессионалы в любой области (медицина, юриспруденция, инженерия, образование), которые эффективно взаимодействуют с ИИ-агентами.

Загружаем