Эпоха бездонных и всезнающих LLM уступает место клинической реальности: масштабируется только то, что эффективно. Свежий релиз Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber — это не просто обновление линейки, а разворот к холодному расчету совокупной стоимости владения (TCO). Для тех, кто строит рабочие нейросетевые агенты, узким местом давно стала не «сырая» эрудиция модели, а трение из-за задержек и непомерные счета за токены. Google садится на диету и отсекает лишний «жир», определяя качество через минимизацию шагов рассуждения и лишних вызовов инструментов.

Экономика лаконичности

Gemini 3.6 Flash становится главной рабочей лошадкой этой стратегии, исправляя ошибки многословности эпохи 3.5. Главная цифра здесь — сокращение объема выходных токенов на 17% согласно Artificial Analysis, а в узкоспециализированных бенчмарках вроде DeepSWE от Datacurve экономия достигает внушительных 65%. Это не косметическая оптимизация, а фундаментальный сдвиг в маржинальности агентских сервисов. Потребляя меньше токенов для достижения того же результата, модель снижает барьер для внедрения сложных многошаговых циклов, которые раньше «съедали» бюджет на этапе тестов.

Google делает ставку на то, что Gemini 3.6 Flash радикально снизит стоимость выполнения агентских задач, превращая ИИ-автоматизацию из дорогой игрушки в рентабельный инструмент.

Агрессивный прайсинг ($1,50 за миллион входных токенов и $7,50 за миллион выходных) явно нацелен на то, чтобы выбить почву из-под ног конкурентов. При этом точность не принесена в жертву: показатели в DeepSWE выросли с 37% до 49%, а в MLE Bench — с 49,7% до 63,9%. Даже в навыках управления интерфейсом (OSWorld-Verified) зафиксирован скачок до 83%. Важно, что этот рост происходит на фоне отказа от «мусорных» правок кода и бесконечных циклов исполнения. Эра болтливых и избыточных ассистентов заканчивается — Google выбирает тактику бесшумного и хирургически точного оператора.

Специализированная скорость и вертикальная безопасность

Скорость — второй столп этой инфраструктурной перестройки. Gemini 3.5 Flash-Lite выходит на рынок как самый быстрый игрок в серии, выдавая 350 токенов в секунду по замерам Artificial Analysis. Это решение для высоконагруженного продакшена, где субсекундный отклик — вопрос выживания, будь то агентский поиск или мгновенная обработка документов. Такая производительность позволяет разработчикам гибко распределять нагрузку, отдавая рутину модели Lite, а сложные задачи — старшим версиям.

Связка 3.5 Flash Cyber и агента CodeMender демонстрирует, что специализированные решения на границе возможностей безопасности эффективнее универсальных комбайнов.

Вертикализация становится финальным ходом в текущей партии Google. Вместо того чтобы заставлять универсальную LLM вникать в нюансы кибербезопасности, компания выкатывает 3.5 Flash Cyber. Модель спроектирована под специфическую оркестрацию и жесткие требования ИБ-инфраструктуры. Пока руководство Google грезит о «самом амбициозном претрейне» Gemini 4, реальный бизнес здесь и сейчас получает тактические инструменты для снижения издержек. Обещанный шаг вперед в соотношении цены и качества выглядит убедительно, но главной проверкой станет практика: смогут ли эти проценты сэкономленных токенов компенсировать хаос и непредсказуемость реальных мультиагентных систем.

ИИ-агентыСнижение затратПроизводительностьGoogle DeepMind