Эпоха «универсальных» малых моделей подходит к концу. С релизом Gemini 3.6 Flash, 3.5 Flash-Lite и узкоспециализированной Flash Cyber компания Google окончательно сворачивает игру в общие задачи, переходя к сегментации по скорости и выносливости. Для архитекторов AI-систем это сигнал: точность ответов больше не является единственным мерилом. На первый план выходят три операционные метрики: эффективность расхода токенов, латентность и надежность вызова инструментов (tool-calling). Google пытается нащупать тот самый «золотой стандарт», который позволит AI-агентам наконец-то выйти из стадии вечных пилотов в реальный продакшен, не разорив при этом бизнес.
Экономика токенов: новая арифметика эффективности
Главная финансовая дыра в агентских системах — это не цена за миллион токенов, а их избыточное количество в циклах «рассуждений» (reasoning loops). Gemini 3.6 Flash бьет именно по этой боли. По данным Artificial Analysis Index, модель потребляет на 17% меньше выходных токенов, чем версия 3.5 Flash при выполнении тех же задач. В специфических бенчмарках вроде DeepSWE от Datacurve этот показатель доходит до 65%.
Модель 3.6 Flash требует меньше шагов и вызовов инструментов для завершения многоэтапных воркаутов. Сокращая количество итераций, Google фактически снижает совокупную стоимость владения (TCO) еще до применения прайс-листа. При цене в $1.50 за 1 млн входных и $7.50 за 1 млн выходных токенов модель становится основным «рабочим мулом» для кодинга и сложной аналитики.
Скорость как драйвер масштабируемости
Задержка ответа остается главным барьером для внедрения автономных агентов в реальном времени. Google выкатил 3.5 Flash-Lite — на текущий момент это самая быстрая модель в серии, выдающая 350 токенов в секунду. Такая скорость позволяет архитекторам выстраивать многоуровневые системы: отдавать массовые задачи на откуп Lite-версии, подключая тяжелые модели только для финальной оркестрации.
В бенчмарке OSWorld-Verified модель Gemini 3.6 Flash набрала 83,0% против 78,4% у предыдущей версии. Это подтверждает: «сырая» мощность параметров вторична по сравнению с умением модели точно выполнять действия в программной среде, не проваливаясь в бесконечные циклы исполнения.
Специализация вместо универсальности: удар по конкурентам
Google методично заходит на территорию, где раньше доминировали малые модели OpenAI и Anthropic. Релиз Gemini 3.5 Flash Cyber, интегрированной в агент безопасности CodeMender, нацелен на решение критических задач в кибербезопасности, где галлюцинации стоят слишком дорого. В общих задачах по программированию 3.6 Flash также демонстрирует уверенный рост: в бенчмарке DeepSWE производительность подскочила с 37% до 49%, а в MLE Bench — с 49,7% до 63,9%.
Нам обещали, что серия Flash обеспечит баланс скорости и качества для масштабирования агентов. И хотя 17% экономии токенов — это ощутимая победа для бюджета, настоящий экзамен впереди: на подходе Gemini 4, которая обещает стать самым амбициозным проектом Google. Рынок ждал упрощения внедрения AI, но реальность оказалась сложнее: вместо одной «волшебной таблетки» мы получили целый флот специализированных инструментов, требующих от архитекторов еще более глубокой экспертизы.