За создание сложных исследовательских систем часто берутся с размахом, упираясь в колоссальные счета за железо и архитектурную боль. Прохор, лид команды агента «Исследовать» (режима глубокого исследования в Алисе AI), поделился практикой вывода тяжелого агентного пайплайна в промышленную эксплуатацию. За продуктовой стороной стоял продакт-менеджер Руслан Илиев: он очертил цели, собрал набор инструментов и подготовил валидационный датасет, протащив запуск от закрытого вейтлиста до продакшена. Разработка стартовала весной, когда рынок захлестнула волна ризонинг-моделей и команда выкатила режим «Рассуждать».

Отказ от обучения с нуля

Агентные сценарии по определению жгут ресурс: система делает сотни поисковых запросов, лопатит динамический контент на JS и гоняет Python-код для расчетов. В первых итерациях время генерации ответа достигало получаса. Чтобы не разориться на инфраструктуре, инженеры осознанно отказались от дообучения крупных базовых моделей с нуля.

«Я обучал модели с нуля для извлечения информации и семантического поиска. Потом появились GPT-3 и FLAN-T5 — и мои модели в одночасье утратили актуальность».

Эту вечную технологическую дилемму формулируют одинаково во всех зрелых командах. Вместо того чтобы переписывать веса под каждую задачу, разработчики сделали ставку на оркестрацию, контекстный инжиниринг и вспомогательные модели.

Смена архитектуры и результаты

Первый прототип собрали по схеме CodeAgent, где модель вызывает инструменты через генерацию кода на Python. Цифры на бенчмарках выглядели прилично: 75 на FRAMES, 81 на SimpleQA и 26 на GAIA (низкий балл объяснялся тем, что агент изначально не умел работать с файлами). Но в продакшен эту конструкцию не пустила безопасность. Исполнение кода в изолированной песочнице с доступом в интернет требовало проброса вызовов наружу, что выглядит как минное поле для инфобеззопасности.

Ситуация изменилась после релиза опенсорс-моделей с нормальным function calling. Всего за две недели инженеры переписали агента на классический цикл вызова функций. Метрики предыдущего CodeAgent были перебиты через неделю, инфраструктура упростилась в разы, а вопросы безопасности перестали вызывать ночные кошмары у команды.

Главное: Кейс Яндекса наглядно демонстрирует, что экономия вычислительных мощностей и ускорение вывода сложных агентов в прод достигаются инженерной обвязкой и оркестрацией, а не сжиганием бюджета на дообучение тяжелых LLM.

ИИ-агентыБольшие языковые моделиСнижение затратАвтоматизацияЯндекс