Команда Frontier Red Team компании Anthropic разработала специализированные наборы тестов для оценки возможностей ИИ в задачах тактической разведки, целеуказания и проектирования конвенционального оружия. Вместо проверки абстрактных рассуждений бенчмарки измеряют способность передовых моделей выполнять конкретные прикладные задачи: вычислять геолокацию, идентифицировать людей по фрагментарным потокам данных и оптимизировать аэродинамику дронов для перехвата движущихся целей без генерации галлюцинаций.
В специализированных сценариях военной разведки современные модели начинают сравниваться по эффективности с редкими профильными экспертами. Как отметили представители Frontier Red Team:
«В ряде военных и разведывательных задач модели способны выполнять работу, которая исторически требовала привлечения дефицитных, высококлассных экспертов-людей».
Исторически именно высокая стоимость ручной корреляции данных защищала от создания систем автоматизированной массовой слежки и кинетического наведения. Однако параллельное исследование группы Threat Intelligence подтверждает, что злоумышленники уже тестируют эти архитектуры для ускорения сбора разведывательных данных и оптимизации конструкций обычных боеприпасов.
Корреляция данных и классификаторы двойного назначения
Чтобы зафиксировать пороги возможностей систем, Anthropic сформировала бенчмарки вокруг задач сопоставления личностей, синтеза разрозненных сигналов и инженерных расчетов для аппаратных систем.
Сравнительные тесты показали, что открытые архитектуры от китайских разработчиков демонстрируют впечатляющую точность в задачах целеуказания и калибровки вооружений, пусть и уступая ведущим проприетарным моделям. На оценочных графиках Anthropic такие открытые системы устойчиво занимают место между стандартными коммерческими решениями и экспериментальными внутренними версиями. Чтобы снизить риски нецелевого применения через свой API, Anthropic развернула защитные классификаторы, блокирующие запросы о слежке и разработке оружия. Однако ужесточение таких фильтров неизбежно повышает долю ложных срабатываний и блокировок в легитимных корпоративных сценариях — например, в аэрокосмической отрасли, картографии и промышленной телеметрии.
Методология тестирования подтверждает: базовые модели уже способны автоматизировать сложный разведывательный анализ, но фундаментальные технические ограничения сохраняются. Текущие результаты Anthropic получены на синтетических данных высокого качества. Смогут ли эти алгоритмы работать столь же надежно в условиях зашумленной и неполной полевой информации в реальной обстановке — вопрос пока открытый.