OpenAIが10億人以上・40ペタバイト超えのユーザーデータを扱う自社製ストレージシステム「Habitat」について解説

OpenAIはChatGPTやCodexといったサービスを展開しており、ユーザー数は2026年7月末時点で10億人に達しています。OpenAIは10億人を超えるユーザーのデータを自社製オンラインストレージシステム「Habitat」で管理しているとのこと。このHabitatの詳細がOpenAIの公式ブログで解説されています。
Rapidly scaling online storage to serve over 1 billion ChatGPT users | OpenAI
https://openai.com/index/scaling-storage-one-billion-users-part-one/
Habitatの初期バージョンは2023年11月に開催されたDevDayで発表されました。初期のHabitatは小さなPythonライブラリであり、検索・暗号化・シリアル化といった処理をMicrosoftのデータベースサービス「Azure Cosmos DB」の各種機能にマッピングすることを主目的としていました。OpenAIは「Habitatを優先的に使用せよ」といった業務命令を出ませんでしたが、エンジニアたちは自然とHabitatを好んで使うようになったそうです。
その後、HabitatはOpenAIのサービスの規模拡大に合わせてアップデートされ、2026年9月時点では「毎秒7000万以上のリクエスト」「毎週10億以上のアクティブユーザー」「500ペタバイト以上のデータ」を扱う重要なシステムとなっています。OpenAIは「このような規模のインフラストラクチャーを構築・運用することは容易ではないが、特別難しいというわけではない。しかし、OpenAIは毎年10倍以上の成長を遂げており、前例のないスピードで成熟したプラットフォームを構築する必要に迫られた」と述べ、急速に増加するユーザーやデータに対応することの困難さを強調しています。
Habitatはクライアント側で動作するPythonライブラリとしてアップデートされていましたが、OpenAIのサービス増加に伴って実装が複雑化していき、2025年中頃には後方互換を保つことが困難となりました。この状況に対応するべく、Habitatは独立したサービスとして分離され、クライアント側の事情に左右されずにアップデートなどを展開できるようになりました。

Habitatをサービス化する際はPythonから別の低級言語への移行も検討されたとのこと。しかし「現時点では言語の移行よりも喫緊の課題への対処を優先する。将来的に低級言語への移行が必須となる頃には『CodexやGPTを用いて低級言語に移行する』というフローが実用的になっているだろう」という「計算された賭け」に出て、Pythonでの開発を続行したそうです。
OpenAIはHabitatの並行処理を実現するために標準ライブラリの「asyncio」を活用していました。しかし、asyncioではCPUの各スレッドで同時に1つの処理しか実行できないため、CPU負荷の高いタスクでは遅延が大きくなってしまいます。OpenAIは遅延をなるべく抑えるためにCPU・メモリ・ストレージ・ネットワークの利用率を監視して最適化を進めました。

最適化によって毎秒2000万件以上の膨大なリクエストを処理できるようになりました。しかし、OpenAIはHabitatのさらなる効率向上のためにPythonからRustへの移行を決断。2026年第2四半期に「2人の人間エンジニア」「Codex」「GPT-5.5」を用いてHabitatのサービス全体をRustで書き直すことに成功しました。Rust版HabitatはPython版Habitatと比べてCPU効率が6倍、メモリ効率が15倍に向上し、レイテンシが大幅に低くなったとのこと。2026年9月時点でRust版Habitatがリクエストの95%を処理しており、Python版Habitatは数週間以内に廃止される予定です。
・関連記事
Z.aiが中国製AIインフラで「GLM-5.3-Flash」の本番サービスを提供したノウハウを共有、AIエージェントでインフラを管理してNVIDIA GPUと同等まで効率化 - GIGAZINE
AppleはNVIDIAのNVLink Fusionを介して接続されたM8 Ultraチップを使用したAIサーバーを開発しており外部に販売することも計画中 - GIGAZINE
AIトレーニングでGPUが無駄に待機状態になってしまっている理由とAdobeが行った対処とは? - GIGAZINE
Metaが100万GPU規模を想定した新通信プロトコル「MetaRoCE」を発表、パケットロスを前提にEthernetでAIクラスタを高速接続 - GIGAZINE
AI開発の新たなボトルネックは「ガスタービン不足」 - GIGAZINE
・関連コンテンツ
in AI, Posted by log1o_hf
You can read the machine translated English article OpenAI explains its proprietary storage ….







