Автономные исследовательские агенты достигли коварного плато: они штампуют манускрипты, которые не отличить от человеческих, пока не начнешь копать глубже. Как отмечают Руи Мэн и Томас Пфистер из Google Cloud, нынешнее поколение «ИИ-ученых» — от хайпового AI-Scientist компании Sakana до AutoResearchClaw — страдает от критического дефицита верификации. Эти системы без зазрения совести выдумывают цитаты, рисуют красивые графики, которые невозможно воспроизвести по их же коду, и описывают методологии, не имеющие ничего общего с реально запущенными алгоритмами. В итеративном конвейере ошибки не исправляются, а множатся, превращая научную работу в полированную «липу». Для руководителя R&D это не просто технический сбой, а юридическая и репутационная мина.

The Architecture of Science One

В Google Cloud решили покончить с этим, представив Science One — протокол, где отсутствие галлюцинаций заложено в архитектуру, а не прикручено сверху в виде костылей. В основе лежит концепция Chain-of-Evidence (CoE), работающая по аналогии с ACID в базах данных: она жестко регламентирует, что считать достоверным артефактом. Каждое утверждение, будь то цифра в таблице или ссылка на источник, обязано иметь непрерывную цепочку доказательств. Science One приземляет литературу в реальность, исключая возможность модели полагаться на свою дырявую внутреннюю память.

Фреймворк Science One демонстрирует полное отсутствие фантомных ссылок и стопроцентную верификацию результатов, сохраняя при этом топовые показатели в бенчмарках MLE-Bench и Parameter-Golf.

Auditing Integrity via CoE

Главный сдвиг здесь — переход от оценки качества текста к аудиту самого процесса. Пока конкуренты просто «генерируют науку», протокол CoE Audit от Google вскрывает внутренние механизмы. Сравнение показало, что базовые LLM-системы галлюцинируют в 21% ссылок. Science One же создает своего рода «черный ящик» для каждого исследования. Если в тексте заявлен один алгоритм, а код реализует другой, аудит моментально выявит разрыв цепи. Это превращает процесс рецензирования из чтения сказок в криминалистическую экспертизу.

Verifiable Claims Over Model Fancy

На финальном этапе Science One связывает каждый факт с конкретным артефактом в рабочем пространстве через теги доказательств. Это блокирует типичный для языковых моделей «дрейф», когда в процессе доработки текста выводы становятся всё более категоричными, при этом всё сильнее отрываясь от данных.

Система требует, чтобы каждая цепочка доказательств не просто существовала «для галочки», а содержательно подтверждала прикрепленное к ней утверждение.

Переход к автономному R&D сейчас тормозит не отсутствие интеллекта у моделей, а тотальный кризис доверия. Google доказывает, что безгаллюцинаторные исследования возможны, но только если мы перестанем воспринимать ИИ как генератор текстов и начнем относиться к нему как к системе, где код и текст неразрывно спаяны. Урок для CTO прост: не смотрите на то, насколько «человечно» написана статья. Проверяйте, пройдет ли она CoE-аудит. Пока Science One — лишь протокол, и он вряд ли оценит гениальность интуитивного прорыва, но он гарантирует чистоту данных. Если агент не может «показать работу» через прозрачный лог доказательств, его находкам не место в вашем IP-пайплайне.

ИИ-агентыБезопасность ИИGoogle CloudМашинное обучение