Одержимость индустрии наполнением больших языковых моделей (LLM) огромными массивами данных столкнулась с эффектом убывающей отдачи. Долгое время мы исходили из предположения, что галлюцинации вызваны дефицитом знаний — своего рода пустыми полками на складе модели. Однако новое исследование Нитая Кальдерона и Гал Йоны из Google Research показывает, что кризис на самом деле носит логистический характер. В своей работе «Пустые полки или потерянные ключи? Извлечение знаний как узкое место фактической точности» исследователи доказывают: передовые модели обычно владеют фактами, но им не хватает механической надежности для их извлечения во время генерации. Смещение акцента с кодирования на извлечение (recall) означает, что дальнейшее масштабирование обучающих данных — это попытка решить тонкую хирургическую проблему грубой силой.
Выявление узкого места при извлечении знаний Чтобы доказать эту гипотезу, команда Google Research создала WikiProfile — бенчмарк из более чем 2000 фактов из Википедии, протестированных через десять различных задач. Цель состояла в том, чтобы определить, действительно ли модель знает факт (этап кодирования) или может лишь идентифицировать его в тесте с вариантами ответов, не имея возможности воспроизвести по запросу (этап извлечения). Результаты неутешительны для сторонников подхода «чем больше, тем лучше». Даже когда факт заложен в параметрические веса, модели часто не могут получить к нему доступ при прямом вопросе. Исследование подчеркивает странную асимметрию: модель может правильно указать место рождения человека в контексте предварительного обучения, но провалить тот же запрос при изменении формулировки промпта. Проблема не в невежестве модели, а в том, что путь вывода к конкретной точке данных нарушен.
Многие фактические ошибки в передовых LLM правильнее трактовать как «потерянные ключи» (ошибки извлечения), а не как «пустые полки» (ошибки кодирования).
Классифицировав факты по пяти различным профилям — от полного провала кодирования до извлечения через размышление, — Кальдерон и Йона объяснили, почему RAG и дообучение часто кажутся лишь временными мерами. Если знания уже заложены, добавление их избыточного объема через дообучение не исправит фундаментальную структурную неспособность их извлечь. Это осознание заставляет пересмотреть методы оценки моделей. Мы должны измерять не только объем поглощенных данных, но и их доступность при различных геометриях промптов.
Рассуждение как инструмент поиска знаний Пожалуй, самый ценный практический вывод отчета касается роли рассуждения (thinking) как механизма извлечения. Исследователи обнаружили, что некоторые факты, классифицированные как неизвлекаемые в стандартных условиях, внезапно всплывали, когда модель использовала цепочку рассуждений (chain-of-thought). Это подразумевает, что мышление нужно не только для логики — это своего рода поисковый запрос к собственным весам модели. Выстраивая промежуточные шаги, модели могут эффективнее перемещаться по своему внутреннему латентному пространству, открывая факты, которые были упущены при прямом вопросе. Для руководителей R&D-подразделений это подтверждает перспективность вычислений во время вывода (inference-time compute): для достижения точности не обязательно нужна более крупная модель, нужно позволить текущей искать усерднее то, что она уже знает.
Ошибки кодирования требуют масштабирования модели или расширения охвата данных, тогда как ошибки извлечения указывают на необходимость развития методов постобучения и оптимизации вывода.
Последствия для корпоративной стратегии в области ИИ очевидны. Если узким местом является извлечение, то гонка за созданием проприетарных датасетов для обучения становится вторичной по отношению к совершенствованию постобучения и оптимизации инференса. Мы движемся к парадигме, где метрики доступности данных вытеснят показатели сырой точности. Будущие архитектуры, вероятно, отойдут от монолитного масштабирования в пользу слоев, оптимизированных специально для поиска. Цель больше не в том, чтобы просто заполнить склад, а в том, чтобы модель никогда не теряла ключи от входной двери. Масштабирование грубой силой — это тактика прошлого; будущее за теми, кто сможет заставить существующие знания работать.