OpenAI
ИИ-чатOpenAIHabitatChatGPTинфраструктурахранение данных

Habitat: как OpenAI выстроила хранилище для миллиарда пользователей

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения
Habitat: как OpenAI выстроила хранилище для миллиарда пользователей

От одной базы данных до планетарной инфраструктуры

Два года назад внутри OpenAI существовала небольшая Python-библиотека, которая просто оборачивала вызовы к Azure Cosmos DB. Никакой архитектурной магии - продуктовые команды дергали ее, чтобы сохранить или прочитать данные, и шли дальше. Сегодня эта же система называется Habitat, работает в почти 40 регионах по всему миру и обрабатывает более 70 миллионов запросов в секунду. Для сравнения: весь глобальный DNS-трафик по оценкам исследователей составляет порядка 10-15 млн запросов в секунду. То есть одна внутренняя платформа OpenAI работает с нагрузкой, которая кратно превышает одну из базовых служб интернета.

Опубликованный 11 сентября инженерный пост за авторством Джона Ли, Чаомина Ю и Бена Риса - это первая часть из двух запланированных. И уже первая часть содержит цифры, от которых у любого инженера по хранению данных слегка едет крыша.

Что такое Habitat и зачем он вообще нужен

Каждый раз, когда вы открываете ChatGPT, система делает десятки обращений к хранилищу еще до того, как вы увидите интерфейс: проверить авторизацию, загрузить настройки, найти историю переписки, применить политики доступа. Если хотя бы одно из этих обращений зависает - вы видите крутящийся кружок. Если падает - видите ошибку.

Habitat решает именно эту проблему. Продуктовый инженер не думает о том, в каком регионе живут данные пользователя, как работает шардирование в Cosmos DB или что такое CDC (Change Data Capture). Он просто пишет код уровня "сохрани это" и "дай мне то". Все остальное - маршрутизация, кеширование через Valkey, шифрование, мультиарендность, соответствие требованиям по резидентности данных - берет на себя Habitat.

Сейчас под капотом у платформы живет более 500 петабайт данных. Для понимания масштаба: 500 петабайт - это примерно 500 миллионов гигабайт. Если бы вы записывали это на DVD, стопка дисков достала бы до Луны.

Почему Python, и почему это важно

Здесь начинается самое интересное с технической точки зрения. Habitat написан на Python - языке, который в мире высоконагруженных систем хранения обычно не упоминают всуе. Go, Rust, C++ - да. Python - нет.

Инженеры OpenAI прямо говорят: это "нестандартный стек для serving-инфраструктуры". Они не переписали все на Go, хотя очевидно могли. Вместо этого они выжали из Python максимум, одновременно покупая время для более фундаментальных изменений. Это редкая честность в инженерном блоге - обычно компании пишут о том, как они все сделали правильно с первого раза.

Такой подход говорит о том, что скорость итераций и знакомство команды с инструментом часто важнее теоретически оптимального выбора технологии. За три года подряд рост был больше чем 10x год к году - в такой ситуации тратить полгода на переписывание ядра просто некогда.

Рост, который не дает передышки

Обычная инженерная мудрость звучит примерно так: проектируй систему с запасом на 10x, это даст тебе пару лет до следующего цикла переработки. OpenAI прожила три таких цикла подряд, и каждый занял не два года, а один.

Авторы поста описывают это как постоянное балансирование между тактическими решениями - "выжать максимум из того, что есть" - и стратегическими инвестициями в фундамент. Это не героизм, это скорее хроническое состояние команды, которая строит мост, по которому уже едут поезда.

В таком режиме особенно ценна правильная последовательность приоритетов. Сначала Habitat стал достаточно надежным для критически важного трафика. Потом достаточно быстрым для глобальной аудитории. И только потом - управляемым при масштабе в миллиард пользователей. Пропусти любой из этих шагов - и система либо падает, либо не масштабируется, либо становится неуправляемым хаосом.

Что это значит для индустрии

OpenAI публикует такие посты не из альтруизма. Это найм, репутация, демонстрация зрелости инженерной культуры. Но конкретные цифры и честный рассказ о трудностях делают материал полезным независимо от мотивации.

Для сравнения: Meta в свое время описывала TAO - систему хранения социального графа - как работающую с нагрузкой около 1 млрд запросов в секунду на пике. Но TAO разрабатывалась годами специализированной командой под конкретную задачу. Habitat за два года дошел до 70 млн запросов в секунду, стартовав с нуля и обслуживая при этом постоянно расширяющийся зоопарк продуктов - от ChatGPT до Codex и внутренних сервисов.

Антропик, Google с Gemini, Mistral - все они сталкиваются с похожими инфраструктурными вызовами по мере роста аудитории. Но никто из них пока не публиковал настолько детальный разбор внутренней кухни хранения данных. Это либо говорит о том, что у OpenAI здесь есть чем гордиться, либо о том, что они сознательно формируют нарратив "мы строим инфраструктуру планетарного масштаба". Скорее всего, и то и другое одновременно.

Что будет во второй части

Авторы анонсировали продолжение, в котором обещают разобрать мультиарендность при таком масштабе, послойную стратегию оптимизации чтения и детали партнерства с Azure Cosmos DB. Последнее особенно любопытно: Cosmos DB - управляемый сервис Microsoft, и держать его под контролем при нагрузке в 70 млн RPS без специальных договоренностей с вендором физически невозможно. Что именно OpenAI и Microsoft сделали вместе - это, пожалуй, самая интересная часть истории.

Для российских разработчиков и архитекторов, которые строят собственные высоконагруженные системы: Habitat не доступен как продукт или open-source проект, это внутренняя платформа OpenAI. Но инженерные подходы, описанные в посте, применимы к любому стеку. Вторую часть стоит дождаться - там будут практические детали.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости