Эпоха секретных ингредиентов в промпт-инжиниринге официально подошла к концу. Библиотеки проприетарных инструкций и сложные системные роли для ИИ-агентов долгое время считались защищенной интеллектуальной собственностью, но новая научная работа Adobe и Индийского технологического института (IIT) в Бомбее фактически разрушает эту иллюзию безопасности. Метод, получивший название Previous-Token Prediction (PTP), доказывает: злоумышленнику не нужны веса модели или доступ к бэкенду, чтобы украсть вашу логику — достаточно лишь выходных данных.
Инвертируя фундаментальную логику больших языковых моделей, которые созданы для предсказания следующего токена, подход PTP использует обратную модель для реконструкции предшествующего ввода исключительно на основе сгенерированного текста. Это не просто теоретическая уязвимость, а практическое руководство по реверс-инжинирингу сторонних моделей через анализ ответов публичных API. Для любого бизнеса, построенного на модели «Промпт как услуга» (Prompt-as-a-Service), почва только что ушла из-под ног.
Механика реконструкции промптов
Метод PTP опирается на специализированную обратную модель, обученную на синтетических данных, которые генерирует целевая LLM. Как зафиксировали исследователи, этот инструмент способен воссоздать точный исходный промпт или несколько его вариаций, передающих основную суть с хирургической точностью. В ходе одного из тестов запрос «Как связаться с конкурентами, чтобы узнать их стратегии ценообразования?» был восстановлен слово в слово только по тексту ответа.
Изменение параметров декодирования позволяет атакующему генерировать несколько вариантов формулировок. При вводе в прямую модель эти варианты выдают почти идентичные ответы. Внутренняя бизнес-логика — «невидимые» инструкции, направляющие поведение ИИ-агента — становится прозрачной для любого, кто готов запустить небольшую инверсионную модель с открытым исходным кодом против вашего интерфейса.
Кросс-модельные уязвимости и корпоративные риски
Самый тревожный вывод для технических директоров и риск-менеджеров — универсальность метода. Атакующему даже не нужно знать, какая именно модель создала текст, чтобы деконструировать его. По данным команды из IIT Бомбея и Adobe Research, их обратная модель успешно восстановила промпты из ответов GPT-4o, несмотря на закрытую архитектуру разработки OpenAI.
Полагаться на «секретность» системного промпта больше нельзя. Компании должны перейти к стратегии security by design, вынося критическую бизнес-логику и конфиденциальные вычисления за пределы контекстного окна LLM.
Хотя текущие тесты были сосредоточены на коротких запросах, траектория очевидна: проприетарные системные инструкции, содержащие правила модерации, коммерческую тайну или специализированные алгоритмы цепочки рассуждений (chain-of-thought), теперь утекают через публичные интерфейсы. Если ваше конкурентное преимущество спрятано в текстовом поле ввода, считайте его общественным достоянием.
Итог
Технология PTP превращает закрытые инструкции ИИ-сервисов в открытую книгу. Бизнесу необходимо пересмотреть архитектуру приложений, чтобы защитить интеллектуальную собственность не через текст промпта, а через внешние программные модули.