Экосистема открытого ПО столкнулась с техническим параличом, который угрожает самому существованию публичных инструментов для разработчиков. Михал Гурны, один из ведущих разработчиков Gentoo, недавно был вынужден отключить сервис Gentoo Bugzilla. Причина? Агрессивный сбор данных для обучения больших языковых моделей (LLM) сделал платформу непригодной для использования людьми. Это не просто технический сбой, а вопиющая экономическая асимметрия: ИИ-гиганты перекладывают свои расходы на инфраструктуру — трафик, электричество и серверные мощности — на волонтерские проекты, данные которых они одновременно эксплуатируют для своих моделей.

По словам Гурны, сервис рухнул под весом скраперов, использующих тысячи ротируемых IPv4-адресов без каких-либо закономерностей. Это не традиционная индексация веб-страниц; это высокоинтенсивная модель извлечения данных, которая работает как распределенная атака типа отказ в обслуживании (DDoS), прикрытая тонкой завесой исследовательских целей.

Кризис субсидирования инфраструктуры

Для некоммерческих организаций стоимость субсидирования информационного голода бигтеха стала непосильной. Сэм, разработчик Gentoo, отметил: хотя критики предлагают использовать статическое кеширование, внедрение такой системы для динамического баг-трекера превращается в кошмар. Перестройка всей архитектуры только ради того, чтобы избежать перегрузки базы данных во время набега ботов, требует сотен человеко-часов, которых у волонтерских проектов просто нет. Марк Рошко из проекта KiCad подтвердил этот тренд, отметив, что его ресурсы находятся в осаде бот-ферм уже больше месяца. Пока KiCad защищается за Cloudflare, более мелкие проекты без бюджета на дорогостоящую безопасность вынуждены выбирать между банкротством и уходом в тень.

Я не системный администратор, и у меня нет времени разбираться с этим дерьмом. Я просто пытаюсь делать полезную работу.

Как прямо заявил Гурны, бремя управления этим хаосом ложится на плечи людей, которые вызвались писать код, а не вести изнурительные инфраструктурные войны. Это спровоцировало тотальный кризис доверия. Проекты, которые раньше придерживались политики открытых дверей, теперь воспринимают любой анонимный трафик как враждебный акт. Мы наблюдаем фрагментацию сети: публичные ресурсы прячутся за стенами авторизации, превращая открытый интернет в череду закрытых сообществ.

Долгосрочная деградация данных

Этот защитный маневр в сторону доступа «только для зарегистрированных пользователей» — стратегическая ошибка для самой индустрии ИИ. Если высококачественные структурированные данные из репозиториев вроде Gentoo станут недоступны, модели ИИ в конечном итоге столкнутся с коллапсом или деградацией. Они будут вынуждены обучаться на собственных синтетических выводах или низкокачественном мусоре из открытой сети. Сэм из Gentoo допустил, что проект может ограничить доступ к трекеру только для зарегистрированных пользователей — это мнение разделяют многие разработчики, которые чувствуют, что их заставляют вырезать динамический контент ради выживания.

Это медленно уничтожает проекты, которые держатся на волонтерах, и мне не нравится такой сценарий.

Как заметил Эрвин, участник сообщества Mastodon, такая траектория угрожает волонтерскому фундаменту современных технологий. Переход от открытой экосистемы к стратегии эшелонированной обороны — это не выбор, а тактика выживания. Когда мейнтейнеры уровня Михала Гурны уходят, потому что административные расходы на борьбу с ботами превышают радость от программирования, источники данных для ИИ начинают иссякать. Кремниевая долина сжигает общественное достояние, чтобы согреться, игнорируя тот факт, что дрова скоро закончатся. Если ценнейшие технические датасеты спрячутся за пейволлами, следующему поколению моделей будет не на чем учиться, кроме как имитировать собственное эхо.

Итог

Агрессивный скрапинг данных для ИИ превращает открытый интернет в закрытую экосистему. Волонтерские проекты, не способные оплачивать бесконечные серверные счета за роботов Big Tech, закрывают доступ к своим ресурсам. В долгосрочной перспективе это приведет к дефициту качественных данных для обучения самих нейросетей.

Искусственный интеллектБольшие языковые моделиБезопасность ИИОблачные вычисления