Thomson Reuters потратила $40 млн за два года на создание собственной специализированной юридической модели под названием Thomson, разработанной на базе открытой архитектуры Qwen от Alibaba. Вместо того чтобы выписывать безлимитные чеки на оплату API-токенов OpenAI или Anthropic, медиагигант решил построить собственный стек. Расчет предельно прагматичен: снизить долгосрочные операционные расходы на инференс, сохранить полный суверенитет над данными и автоматизировать сложные процессы проверки документов без отправки конфиденциальных данных клиентов на сторонние серверы.
Чтобы преодолеть разрыв между базовыми весами и юридическим рассуждением корпоративного уровня, Thomson Reuters объединила усилия с Имперским колледжем Лондона для выравнивания промежуточной модели Snowdon. Затем этот чекпоинт дообучили на закрытых архивах Westlaw, Practical Law, Checkpoint и Reuters с привлечением сотен отраслевых экспертов. Примечательно, что, по заявлениям команды, на данный момент в обучении задействовано менее 10% собственного массива данных компании.
Однако сырые технические результаты вскрывают главное узкое место современного корпоративного ИИ: доменная архитектура бесполезна без закрытых данных. Эндрю Бин, руководитель направления оценки качества моделей, сообщил, что во внутреннем бенчмарке Deep Research при стандартном доступе к вебу Thomson заметно отставала, показав фактическую точность 0,53 против 0,65 у GPT-5.4. Кастомная модель вырвалась вперед лишь тогда, когда ее подключили напрямую к закрытым базам данных Thomson Reuters — с минимальным отрывом 0,83 против 0,82. Для корпоративных лидеров, присматривающихся к разработке собственных моделей, урок очевиден: контроль над весами не спасет проект, если у вас уже нет безоговорочной монополии на уникальные данные.