Платформа Artificial Analysis представила Search Index — специализированный бенчмарк для оценки фактической точности, задержки ответов и реальной стоимости веб-поисковых API, используемых автономными агентами. Тестирование проводится на базе открытого фреймворка Stirrup в идентичных условиях на сложных датасетах DeepSearchQA и BrowseComp. В оценку вошли профильные провайдеры: Parallel, Exa, Firecrawl, You.com, Tavily, Keenable и Brave.

Для команд, разрабатывающих многоэтапные агентные сценарии, веб-поиск превратился из вспомогательного сервиса в основную статью инфраструктурных расходов. Бенчмарк наглядно показал: номинальная цена вызова API вводит в заблуждение. Высокое качество извлечения фактов напрямую снижает общие затраты на инференс, устраняя избыточный контекст. В сравнительных тестах Parallel Search (advanced) сократил потребление токенов базовой LLM более чем на 40% по сравнению с тарифом Basic, снизив итоговую стоимость задачи с $0,11 до $0,084, несмотря на более высокую цену самого поискового запроса.

Более того, минимальная задержка API не гарантирует быстрого решения задачи. Хотя Parallel Search (turbo) отвечает за 0,51 секунды против 1,03 секунды у базовой конфигурации, снижение точности (67 баллов против 73) заставляет агентов уходить в повторные циклы поиска. В итоге общее время выполнения задачи не сокращается. Выбор поисковых сервисов на основе маркетинговых заявлений, а не сквозной юнит-экономики многошаговых процессов, остается дорогостоящей архитектурной ошибкой.

ИИ-агентыRAG и векторный поискБольшие языковые моделиСнижение затратИИ-инструменты