Исследователи из Amazon Web Services (AWS) и Университета Центральной Флориды (UCF) представили XKV — протокол взаимодействия в латентном пространстве на базе двойного кэша, который связывает разнородные большие языковые модели напрямую через их KV-кэши (ключ-значение). Разработанная группой ученых (Цзияо Лю, Ци Чжан, Яои Цзя, Цзывэнь Кан и Сун Ван) система полностью исключает авторегрессионное декодирование и повторную токенизацию между агентами. Это позволяет моделям обмениваться непрерывными внутренними представлениями вместо привычного генеративного текста.
Архитектура оставляет обе LLM полностью замороженными, требуя обучения лишь легковесного моста-транслятора. В отличие от предыдущих методов латентной коммуникации — таких как C2C, требующий идентичных входных данных, или LCF-X, который лишь сжимает кэш отправителя, — XKV объединяет кэши источника и получателя с помощью механизма внимания с обучаемыми запросами (learned-query attention). Протокол связывает их в единую память сквозь различное количество слоев благодаря обучаемой карте соответствия. Это позволяет позициям принимающей модели извлекать нативные обновления KV-кэша даже при несовпадении архитектурных семейств, глубины сетей, числа голов внимания и токенизаторов.
Тестирование на 45 комбинациях наборов данных и моделей показало, что XKV занял первое место по общему баллу и среднему рангу среди протестированных латентных протоколов. Решение превзошло традиционную передачу текстовых сообщений на четырех из пяти датасетов, а также опередило LCF-X на бенчмарке ROPES на 4,6 пункта по метрике Exact Match. Трансляция пар кэшей занимает всего 5,8 миллисекунды против 59,9 миллисекунды у LCF-X при сокращении числа обучаемых параметров на 76%. В итоге сквозное ускорение коммуникации достигает 6,8 раза по сравнению с обменом обычным текстом, открывая практический путь к созданию быстрых конвейеров из разнородных специализированных моделей.