Поддержка масштабного притока пользователей создает инфраструктурные трудности, которые выходят далеко за рамки обучения моделей и вычислений для инференса. Каждое взаимодействие пользователя с продуктами OpenAI — от входа в учетную запись до запуска беседы в ChatGPT — порождает запросы к данным, которые должны обрабатываться стабильно и без задержек интерфейса. Чтобы справиться с этим слоем онлайн-данных, компания OpenAI разработала Habitat — платформу прикладного хранения, предназначенную для управления доступом к пользовательским данным во всем продуктовом портфеле организации.
Как подробно рассказали Джон Ли (Jon Lee), Чаомин Ю (Chaomin Yu) и Бен Рис (Ben Ries), члены технического штата OpenAI, в технической публикации от 11 сентября 2026 года, архитектуре Habitat пришлось адаптироваться под непрекращающийся продуктовый спрос.
"Habitat впервые задействовали для поддержки GPTs на конференции DevDay в качестве простой клиентской библиотеки Python, подключенной к единственной базе данных".
На самом раннем этапе Habitat работала как небольшая библиотека, сопоставляющая операции с Azure Cosmos DB, но стремительное расширение вынудило инженерную команду полностью пересобрать стек. Масштабирование платформы выявило критические инженерные узкие места, в том числе задержки из-за асинхронного ввода-вывода (asyncio) и сложное управление пулами соединений в условиях экстремальной параллельности.
Выживание на масштабе
Эксплуатация распределенного хранилища на таком уровне потребовала превратить Habitat из базовой клиентской библиотеки в выделенный сервис. Главная сложность проистекала из темпов привлечения пользователей, а не из чистой архитектурной сложности. Как отметили инженеры, системы обычно строятся с расчетом на десятикратный рост в перспективе нескольких лет, однако OpenAI регулярно опережает эти показатели благодаря непрерывному расширению из года в год.
Такой рост заставил инженерную группу выжимать производительность из нетипичного для серверной части стека Python и одновременно готовиться к фундаментальным сдвигам. Сегодня Habitat управляет более чем 500 петабайтами данных, обрабатывает свыше 70 миллионов запросов в секунду и поддерживает продукты, которыми еженедельно пользуются более миллиарда человек почти в 40 географических регионах. Поддержание таких постоянных пользовательских сессий и рабочих нагрузок с дополненной генерацией (RAG) требует постоянного переосмысления архитектуры серверных баз данных и экономики стоимости каждого запроса.