Эпоха дешевой рабочей силы на платформах вроде Mechanical Turk в обучении искусственного интеллекта окончательно подошла к концу. Четырехлетний поставщик данных Micro1 увеличил совокупный годовой объем выручки (gross run rate) со $100 млн до $500 млн всего за восемь месяцев, согласно данным источника, знакомого с финансовыми показателями компании. Привлекая дипломированных специалистов — включая практикующих врачей, корпоративных юристов и научных исследователей — для верификации цепочек рассуждений и тонкой настройки передовых моделей, платформа удерживает внушительную комиссию в 60–70%. В пересчете на чистый годовой доход это приносит стартапу от $150 млн до $200 млн.
Лаборатории, создающие передовые модели, испытывают острый дефицит проверяемых экспертных знаний. Это превратило высококвалифицированную разметку данных и специализированную валидацию в одно из самых прибыльных и узких мест во всей цепочке поставок ИИ. Наряду с созданием индивидуальных сред для обучения с подкреплением (RLHF), Micro1 продает готовые пакеты данных для предварительного обучения и генерирует автоматические синтетические описания видео, что обеспечивает валовую маржинальность пакетных датасетов на уровне 80–90%, как сообщает TechCrunch.
Даже на фоне агрессивного масштабирования конкурентов — валовой оборот Handshake достиг $1 млрд, а Mercor перешагнул отметку в $2 млрд — цепочка поставок элитных обучающих данных начинает разделяться по геополитическому признаку. Основатель Micro1 Али Ансари публично заявил в X, что компания принципиально отказывается продавать данные китайским разработчикам, открыто дистанцируясь от конкурентов, чьи датасеты, по имеющимся сведениям, использовались для обучения таких архитектур, как Kimi K3.