Библиотека Sentence Transformers версии 6.0 получила четвёртый класс моделей — MultiVectorEncoder. Это нововведение нативно интегрирует архитектуры позднего взаимодействия (late interaction) напрямую в стандартный стек информационного поиска. Как отметили мейнтейнеры проекта Том Аарсен, Антуан Шаффен и Рафаэль Сурти, релиз объединяет чекпоинты Stanford ColBERT, PyLate и colpali-engine под единым унифицированным API, который ранее предназначался только для плотных векторов, разреженных представлений и кросс-энкодеров.
Для корпоративных конвейеров RAG это обновление устраняет давнюю инженерную дилемму. Традиционные плотные би-энкодеры агрессивно сжимают весь фрагмент текста в один фиксированный вектор размерностью от 384 до 1024 параметров, теряя мелкие смысловые нюансы, критичные для сложных многоэтапных запросов. Кросс-энкодеры возвращают утраченную точность за счёт совместной обработки пар запрос-документ, однако их вычислительная сложность делает полномасштабный поиск в реальном времени непомерно медленным. Мультивекторные архитектуры преодолевают это противоречие: они индексируют представления на уровне токенов в фоновом режиме и вычисляют релевантность на лету с помощью оператора MaxSim, объединяя низкую задержку предрассчитанных индексов с детализацией токенов.
Фреймворк также получил прямую поддержку визуального поиска документов ColPali, который сопоставляет исходные текстовые запросы пользователей напрямую с изображениями страниц, полностью исключая нестабильный этап оптического распознавания символов (OCR). Для команд разработки практический вывод очевиден: модернизация корпоративного поиска и извлечения данных больше не требует поддержки самодельной и хрупкой инфраструктурной обвязки ради запуска ColBERT в продакшене.