Существующие системы автономных исследований страдают от фундаментального архитектурного изъяна, который превращает их научную деятельность скорее в творческую лотерею, чем в строгое исследование. Хотя большие языковые модели с легкостью генерируют гипотезы и черновики рукописей, они печально известны бездоказательными утверждениями и внутренними противоречиями. Этот системный сбой, выявленный исследователями из Института автоматизации Академии наук Китая (CAS) и Гонконгского баптистского университета (HKBU), связан не с отсутствием интеллекта, а является побочным продуктом последовательных конвейеров. В таких устаревших архитектурах исследование движется по линейной цепочке команд. Проблема заключается в том, что система не способна поддерживать структурную связь между пробелом в знаниях, экспериментом для его устранения и итоговым утверждением. Без явного управления состояниями гипотеза неизбежно отклоняется от первоначальной мотивации, что приводит к финальным выводам, которые беззастенчиво преувеличивают то, что на самом деле доказывают данные.
Типизированный граф доказательств как операционное состояние
Чтобы положить конец эпохе логического дрейфа, команда CAS и HKBU представила EviGraph. Этот фреймворк заменяет хрупкие линейные рабочие процессы типизированным графом доказательств, который выступает в качестве центрального операционного состояния агента, а не просто пассивного журнала действий. Он явно связывает шесть различных объектов исследования: Проблему, Пробел, Гипотезу, Эксперимент, Результат и Утверждение. Рассматривая их как взаимозависимые узлы, EviGraph может в реальном времени проверять весь жизненный цикл исследования на наличие отсутствующих зависимостей или семантических несоответствий. Если измененный эксперимент больше не проверяет текущую гипотезу, система немедленно фиксирует разрыв, предотвращая распространение ошибок на этап подготовки черновика статьи.
EviGraph формирует научную работу только тогда, когда каждое включенное в нее утверждение обосновано полной и подтвержденной цепочкой доказательств.
Такая структурная строгость служит логическим страховочным поясом. Когда EviGraph обнаруживает слабый узел — например, результат, который противоречит протоколам выполнения — он не просто накладывает поверхностную заплатку. Вместо этого система отслеживает последующие зависимости и заново генерирует затронутый подграф в строгом топологическом порядке. Такая ревизия с учетом зависимостей гарантирует, что любые изменения в экспериментальных результатах принудительно отражаются в выводах. Это эффективно излечивает логическую амнезию, характерную для ИИ-агентов, которые теряют нить собственных ограничений к моменту начала написания текста.
Тестирование логической связности и обоснованности выводов
Эффективность фреймворка EviGraph была протестирована в сравнении со стандартными сквозными исследовательскими агентами на бенчмарках ARC-Bench-ML и NanoResearch-20. Результаты подчеркивают огромный разрыв в надежности: EviGraph продемонстрировал показатель согласованности экспериментальных данных 87,73% — метрику, измеряющую, насколько точно финальный текст отражает необработанные данные. Что еще более важно, система улучшила показатель обоснованности утверждений на 40,19% по сравнению с лучшими существующими аналогами. Эти цифры указывают на то, что узким местом в автономных открытиях являются не генеративные возможности, а отсутствие протоколов структурированной проверки, которые заставляют агента отвечать за собственные доказательства.
Для обеспечения целостности EviGraph использует механизм создания контрольных точек графа. Это предотвращает ситуацию, когда неудачные попытки исправления повреждают ранее проверенные разделы исследовательской цепочки. Если новая гипотеза не закрывает пробел в знаниях, система откатывается к последнему известному чистому состоянию. Генерация финальной рукописи строго ограничена: агент приступает к написанию только после того, как внутренняя логика графа будет полностью разрешена и верифицирована. Хотя это значительно снижает уровень галлюцинаций в отчетах, эффективность метода по-прежнему ограничена способностью базовой модели интерпретировать многомерные данные. В областях, где синтез данных остается субъективным, даже идеальная структура графа не может компенсировать нехватку мультимодальных нюансов. Следующим этапом для EviGraph станет работа со сложными междисциплинарными противоречиями, где доказательства не всегда носят бинарный характер.