Токенизация раньше была второстепенной задачей — незначительной рутинной процедурой перед началом основных вычислений. Но по мере того как модели поглощают огромные окна контекста и справляются с колоссальными параллельными нагрузками, этот подход полностью себя исчерпал. Когда вы обслуживаете бесконечные параллельные запросы или обрабатываете бесконечно длинные входные данные, неэффективный токенизатор перестает быть мелким неудобством и начинает лишать ваши дорогие графические процессоры данных.

Как объяснили Артур Цукер, Саймон Брандейс и Люк Жорж в своем техническом обновлении, главная мотивация рефакторинга конвейера в tokenizers v1 была предельно жесткой: обеспечить полную загрузку оборудования. Если говорить прямо: ваши шестизначные графические процессоры никогда не должны простаивать в ожидании, пока центральный процессор закончит нарезку строк.

"Ваши графические процессоры никогда не должны простаивать в ожидании, пока центральный процессор завершит токенизацию.

Опенсорс-сообщество четко показало, что головокружительная скорость вполне достижима. Такие библиотеки, как tiktoken и fastokens, за последний год доказали, что обработку текста можно сделать агрессивно быстрой. Чтобы сделать tokenizers v1 надежным на любом оборудовании, инженеры из IBM, NVIDIA и команды ExecuTorch засучили рукава, чтобы внести исправления и провести стресс-тестирование релиза на бескомпромиссном спектре чипов.

Четыре этапа и ключевые архитектурные изменения

Стандартный токенизатор преобразует необработанный текст в последовательности целых чисел, которые модели действительно понимают, через четыре четких этапа: нормализацию, претокенизацию, этап модели и постобработку. Согласно бенчмаркам из репозитория tokbench, tokenizers v1 отсекает лишнее за счет безжалостного устранения трения распределителей памяти и накладных расходов на регулярные выражения, перенаправляя обработку текста прямо в SIMD-ускоренные битовые операции и предварительно выделенные буферы.

Для инженерных команд это не просто абстрактное обновление библиотеки; это прямой путь к сокращению задержек инференса и снижению аппаратных накладных расходов. Вы можете — и должны — запустить пакет tokbench на собственных конфигурациях оборудования, чтобы точно увидеть, за какое простаивание данных в ожидании центрального процессора вы платите в данный момент.

ПроизводительностьБольшие языковые моделиСнижение затратNVIDIAМашинное обучение