Корпоративный сектор долгое время приравнивал число параметров модели к ее практической эффективности, вынуждая R&D-подразделения по умолчанию внедрять массивные и дорогостоящие универсальные базовые системы. Однако когда дело доходит до строгой специализированной верификации, простое наращивание параметров все чаще демонстрирует убывающую отдачу. Это устоявшееся представление начинает рушиться: вертикальные архитектуры доказывают, что целевое обучение легко превосходит универсальные монолитные системы на сложных бенчмарках валидации.
Лондонский стартап Inherent, основанный выходцами из Google DeepMind, показал, что его специализированный ИИ-агент Faraday превзошел ведущие флагманские модели в автономном воспроизведении опубликованных научных результатов без предварительного доступа к решениям тестов. Работая на базе компактной открытой модели всего на 27 миллиардов параметров, Faraday продемонстрировал такие результаты вскоре после выхода Inherent из скрытого режима с посевными инвестициями в размере $50 млн. Как отметил сооснователь и научный руководитель Inherent Эдвард Хьюз, воспроизведение научных статей служит идеальным стресс-тестом именно потому, что именно на этой задаче верификации оттачивают навыки исследователи уровня PhD.
Архитектура и обучение с подкреплением
Вместо обучения на описательных паттернах научной литературы Inherent применяет обучение с подкреплением, ориентированное на результат. Такой подход формирует у агента структурированную исследовательскую интуицию, помогая выделять перспективные гипотезы, писать воспроизводимый код для тестов и отсекать тупиковые направления до того, как на них будут потрачены вычислительные ресурсы.
«Самым интересным для нас стал даже не сам факт победы над флагманскими агентами — хотя это, безусловно, приятно, — а метод, с помощью которого мы построили систему».
По словам Хьюза, этот архитектурный сдвиг заменяет простое предсказание токенов на целенаправленный поиск и автономную проверку гипотез.
Масштабирование цифровых исследователей
Для технических директоров и руководителей R&D вывод предельно ясен: внедрение вертикальных специализированных напарников для эмпирической проверки и патентного анализа обеспечивает значительно более высокую точность аудита при скромных расходах на API. Главный вопрос теперь заключается в том, смогут ли подобные узкоспециализированные агентные архитектуры сохранить свое преимущество при переходе от воспроизведения уже известных публикаций к совершению принципиально новых научных открытий.