Лучиан Гинде устроил недельный тест-драйв в реальном продакшене Ruby on Rails, столкнув специализированного кодинг-агента Codex с универсальной моделью Claude. Эксперимент вскрыл жесткие компромиссы между узкопрофильной автоматизацией и гибкими LLM.
В чистой генерации кода Codex показал себя превосходно: выдавал лаконичные, компактные реализации без лишнего мусора. Claude, напротив, тяготел к избыточному усложнению, громоздкой типизации через Sorbet и сложным абстракциям на всякий случай.
Однако интеграция с рабочими инструментами и эргономика процесса быстро уравняли шансы. Codex безупречно справлялся с аутентификацией по протоколу Model Context Protocol (MCP) через CLI-запросы, но его автономность терпела крах на рутинных операциях в Git. Агент раз за разом делал rebase в ветку main вместо целевых веток, раздувая пул-реквесты до чудовищных 4000+ строк. Claude же уверенно держал контекст ветвления и задач в Jira, поэтому инженеры рефлекторно переключались на него при любом сложном сбое.
Высокая скорость генерации Codex оказалась иллюзией. Он быстрее предлагал первые правки, но всё преимущество сгорало, когда агент уходил в бесконечный цикл повторных прогонов тестов и ревью. Вывод для техлидов однозначен: автономность агентов бессмысленна без предсказуемости пайплайнов и удобства интеграции. Пока специализированные агенты не освоят командную Git-гигиену, инженеры будут использовать их лишь как экспериментальные акселераторы, держа проверенные LLM под рукой для решения критических проблем.