Корпоративный сектор долгое время приравнивал число параметров модели к ее практической эффективности, вынуждая R&D-подразделения по умолчанию внедрять массивные и дорогостоящие универсальные базовые системы. Однако когда дело доходит до строгой специализированной верификации, простое наращивание параметров все чаще демонстрирует убывающую отдачу. Это устоявшееся представление начинает рушиться: вертикальные архитектуры доказывают, что целевое обучение легко превосходит универсальные монолитные системы на сложных бенчмарках валидации.

Лондонский стартап Inherent, основанный выходцами из Google DeepMind, показал, что его специализированный ИИ-агент Faraday превзошел ведущие флагманские модели в автономном воспроизведении опубликованных научных результатов без предварительного доступа к решениям тестов. Работая на базе компактной открытой модели всего на 27 миллиардов параметров, Faraday продемонстрировал такие результаты вскоре после выхода Inherent из скрытого режима с посевными инвестициями в размере $50 млн. Как отметил сооснователь и научный руководитель Inherent Эдвард Хьюз, воспроизведение научных статей служит идеальным стресс-тестом именно потому, что именно на этой задаче верификации оттачивают навыки исследователи уровня PhD.

Архитектура и обучение с подкреплением

Вместо обучения на описательных паттернах научной литературы Inherent применяет обучение с подкреплением, ориентированное на результат. Такой подход формирует у агента структурированную исследовательскую интуицию, помогая выделять перспективные гипотезы, писать воспроизводимый код для тестов и отсекать тупиковые направления до того, как на них будут потрачены вычислительные ресурсы.

«Самым интересным для нас стал даже не сам факт победы над флагманскими агентами — хотя это, безусловно, приятно, — а метод, с помощью которого мы построили систему».

По словам Хьюза, этот архитектурный сдвиг заменяет простое предсказание токенов на целенаправленный поиск и автономную проверку гипотез.

Масштабирование цифровых исследователей

Для технических директоров и руководителей R&D вывод предельно ясен: внедрение вертикальных специализированных напарников для эмпирической проверки и патентного анализа обеспечивает значительно более высокую точность аудита при скромных расходах на API. Главный вопрос теперь заключается в том, смогут ли подобные узкоспециализированные агентные архитектуры сохранить свое преимущество при переходе от воспроизведения уже известных публикаций к совершению принципиально новых научных открытий.

ИИ-агентыGoogle DeepMindИнвестиции в ИИОпенсорс ИИБольшие языковые модели