Опенсорсная утилита Vomit отражает прагматичный сдвиг в инженерии инференса: разработчики начали внедрять легковесные локальные модели специально для фильтрации и сжатия избыточных потоков токенов, генерируемых флагманскими LLM. Написанный на Go инструмент перехватывает сырой вывод моделей и очищает его от словесного шума до того, как контекстное окно передадут сторонним агентам или операторам.
Согласно репозиторию проекта, Vomit работает полностью локально без телеметрии, изолирует временные файлы в директории TMPDIR и подключается к бэкендам вроде Ollama, Llama.app, а также OpenAI-совместимым эндпоинтам. Автор прямо рекомендует объединять утилиту с локальной моделью GPT-OSS 20B через Llama.app, чтобы вынести санитизацию данных за пределы тарифицируемых облачных сервисов.
Проект предлагает неинвазивную архитектуру фильтрации рабочих процессов. Разработчики могут запускать команды вроде `vomit scrub` для прямого перехвата потока токенов либо использовать `vomit tail` и `vomit list` для проверки и парсинга изолированных идентификаторов сессий без остановки активных конвейеров. При этом экосистемные инструменты, такие как AgentsView, сохраняют совместимость и позволяют получать исходные аудиторские логи, если требуется несжатый вывод.
Использование специализированных микрофильтров несет понятные компромиссы: рост задержек при обработке, риск небольших галлюцинаций при суммаризации и полное отсутствие контроля над вызовами внешних инструментов или файловой системой. Тем не менее с точки зрения чистой юнит-экономики отсечение разговорного мусора и раздутых цепочек рассуждений перед кэшированием или передачей контекста агентам быстро превращает многоуровневую архитектуру моделей в новый индустриальный стандарт.