AIのデータニーズに応えるScality ADIの仕組みに迫る

エンタープライズ アーキテクチャにおいて、AI、サイバーレジリエンス、データ主権への対応は、すべてデータレイヤーで集約的に実行されますが、企業で使用されているストレージ アーキテクチャのほとんどはこれをサポートする設計にはなっていません。この課題を解決するためにScalityによって開発されたのが、Scality ADI(自律型データインフラストラクチャ)です。Scality ADIは、個々のワークロードごとに適切なストレージメディア、パフォーマンス、データ保護を自律的に調節する新しいオペレーティングモデルを採用しています。GPU対応の高速フラッシュストレージからディープアーカイブまで、非集約型のアーキテクチャに単一プラットフォームの単一ネームスペースで対応します。
本稿では、この「新しいオペレーティングモデル」について詳しく見ていきます。どのような問題を解決できるのか、Scality ADIとは具体的に何なのか、マルチペタバイトからエクサバイト規模のデータを管理するインフラストラクチャ チームにとって、なぜこれが重要なのか、さまざまな角度から新時代のデータインフラストラクチャのあり方を探っていきます。
AIは単一ワークロードではない
ストレージに関する議論は近年、大きく変化してきています。ほんの数年前まで、AIと言えば、モデルのトレーニングであり、システム要件としては巨大データセットを読み込むシーケンシャルI/Oが最大の争点でした。これは非常にわかりやすいスループットの問題でしたが、今は状況が根本的に異なります。
モデルのトレーニングは今でも重要ですが、同時に、推論、検索拡張生成(RAG)、分散推論、KVキャッシュ、マルチモーダル パイプライン、そしてガバナンスと監査のための長期データリテンションも重視されるようになりました。これらを実行するための個々のワークロードにおいて、ストレージ スループット、レイテンシ、並行処理、データ保護、さらにはコスト面でそれぞれ異なる独自の要件が生じています。
前述のとおり、モデルのトレーニングには相当なシーケンシャル帯域幅が必要ですが、一方、RAGアプリケーションは小さいデータオブジェクトに対する低レイテンシのランダムな読み取りが必要になります。KVキャッシュでは、実行中のワーキングセットに1ミリ秒未満でのアクセスが必要になり、規制対象のアーカイブデータには低コスト低燃費でイミュータブルな長期リテンションが必要になります。
これらすべてのニーズにオールフラッシュ ストレージだけで対応するか、個々に異なるプラットフォームを用意するか(多くの企業は後者を選択していますが)で頭を悩ませている企業は多いようです。その悩みを解決するために設計されたのが、Scality ADIです。
個々のプラットフォームがサイロ化の悪循環
大企業のほとんどは、まるで都市開発で道路を舗装するかのように、ストレージ インフラストラクチャを膨張させています。喫緊のニーズに応えるために、一つひとつ目の前のプロジェクトをこなし続け、便利になると同時に環境や運用上の負荷も増えています。しかも、完成した道路は誰かがずっとメンテンナンスし続けなければなりません。
企業は、これと同じようなサイクルで、プラットフォームを次々と構築しています。高パフォーマンスのワークロード用に一つ、汎用ファイルとオブジェクト用に一つ、バックアップ用に一つ、アーカイブ用に一つ、といった具合です。それぞれの導入プロセスが一大プロジェクトであり、個々に管理用のインターフェース、アップグレード サイクル、データ保護ポリシー、コストの管理、運用チームの編成が必要になります。プラットフォーム間でデータの移行が必要になった場合(AIを活用している多くの企業が今まさに直面している課題ですが)、移行そのものがまた新しい一大プロジェクトとなります。
AIが複雑化を加速
AIはこの状況をさらに複雑化させています。なぜなら、データのニーズが目まぐるしく移り変わるからです。たとえば、データセットは当初、高パフォーマンスのフラッシュ ストレージに保存されるアクティブなトレーニング データとして導入され、その後、容量が最適化されたストレージにリファレンスセットとして収まります。それが、RAGや推論パイプラインにフィードされるようになり、いずれは保管用のテープやクラウドストレージに長期リテンション目的で保存されます。これらの各フェーズが別個のプラットフォームで扱われたら、真のデータライフサイクル管理は不可能です。データライフサイクルの管理ではなく、データ移行バックログの管理に追われ、費用も嵩むようになります。
さらに問題なのは、同じチームがこれをやり続けなければならない点です。データは日々拡大しますが、ストレージの台数がそれにともなって増えていくことは通常あり得ません。インフラストラクチャ チームが容量とパフォーマンスをスケーリングして、データ保護を強化し、コンプライアンスを徹底しなければなりません。多くの場合、チームの人員はそのままに、負担だけが膨張していくことになります。
Scalityの新しい挑戦
今、求められているのは、AIパフォーマンス、サイバーレジリエンス、データ主権への対応、そして従来のストレージ モデルでは処理できないレベルの効率性です。このニーズは、この2年で急拡大しました。決してインフラストラクチャが古いからではなく、当初は想定していなかった要件が生じてきたことにより、現行のアーキテクチャが持たなくなっているのが現実です。
スケーリング ニーズの拡大は想定を超えています。Scalityは現在、12エクサバイト以上の顧客データを本番環境で管理し、中には単独の顧客でエクサバイト規模のデプロイメントと障害ドメイン250ペタバイトの利用可能領域を管理しているところもあります。世界70か国で6兆以上の顧客オブジェクトがScalityのインフラストラクチャに依存し、そこには世界トップ20の通信事業者のうちの10社、トップ15の銀行のうちの7行が含まれています。政府機関の機密ワークロードもペタバイトレベルでサポートされています。
業界でのこの優位性を活用して、Scalityはストレージ プロダクトをより速く、より安く、より安全に進化させることに成功しました。業界リーダーとして、これまで一般的だったやり方を踏襲してストレージ サービスをそのまま強化する道も選べたはずですが、あえて違う方向へと踏み出したことに大きな意義があります。
なぜなら、企業が必要としているのは、単により良いストレージ プロダクトではなく、データインフラストラクチャのための新しいオペレーティングモデルだからです。適正なパフォーマンス、データ保護、そしてデータライフサイクルの各ステージに最適化された効率性が求められており、それはAIパフォーマンス、サイバーレジリエンス、データ主権管理を単一のプラットフォームで実現するものでなければなりません。さらには、スケーリングのために業務を中断して移行プロジェクトに臨まなくて済むような、柔軟かつ堅牢なプラットフォームが求められています。
そのニーズに応えるために開発されたのが、Scality ADIというわけです。

Scality ADIとは
Scality ADIとは、Scality RINGを基盤に、新しいオペレーティングモデルを、GPU対応の高速フラッシュストレージからディープアーカイブまで、データライフサイクル全般にわたって提供できるように設計された単一プラットフォームの統合ソフトウェア アプライアンスです。
Scality ADIのアーキテクチャ
Scality ADIのアーキテクチャについて詳しく見ていきましょう。
Scality ADIは、Scality RINGやScalityOSだけでは提供されない以下の機能を可能にするプラットフォーム レイヤーです。
■ Scality Guardianを介したAI駆動の自律型オペレーションとインテリジェンス
■ MCP(モデル コンテクスト プロトコル)を介したワークフローによるAI拡張型オペレーション
■ NVMeフラッシュからテープやクラウドまで各種用途別メディアに柔軟に対応するメディア選別機能
■ ポリシー主導のライフサイクル マネジメント
■ アウトカムベースのサービスコミットメント
Scality Guardianは、Scality ADIのオペレーショナル インテリジェンス エンジンの役割を果たします。システムの状態をモニタリングし、予測型メンテンナンス、プラットフォーム ヘルス、消費電力、サイバー脅威検出などにわたる、ワークロードに沿った分析情報を提供します。Scality独自の運用ケースに加え、実際のインフラストラクチャ パターンにもとづく推奨事項でトレーニングされており、一般的なAIレスポンスにとどまらない幅広い情報を提供します。ただし、読み取りのみの設計で、判断はするけど実行はしない枠組みを遵守しています。
Scality RINGは、非集約型アーキテクチャを基盤とする分散型オブジェクト ストレージ エンジンです。世界中のもっとも要件の厳しい本番環境でマルチペタバイトからエクサバイト規模のデータを管理してきた十数年の実績があります。
ScalityOSは、複数のノード、サイト、ソフトウェアバージョンにわたって一貫したアプライアンス式のオペレーショナル エクスペリエンスを提供する標準ランタイムです。ScalityOSによって、ソリューションが単なる各種機能の集合体ではなく、本番プラットフォームとしてデプロイし、管理することが可能になります。
アウトカムベースのカスタマーエクスペリエンス ― Scality ADIはアウトカムベースのコマーシャルモデルを採用し、ユーザーがもっとも重視する「結果」、たとえば、可用性、スループット、データ保護体制、サービス保証に沿ってSLAコミットメントをカスタマイズできる仕組みになっています。ミッションクリティカルなワークロードを処理する各種企業が、独自のニーズに合わせて一歩進んだカスタマーサポートを受けられるScale Care Serviceを提供している点が、Scality ADIの最大の特長の一つです。
Scality ADIのアーキテクチャは、自動車にたとえるとわかりやすいです。Scality RINGがエンジン、ScalityOSが車台、Scality Guardianがダッシュボードおよび各種電子機器、そして、それらを全部含めた自動車がScality ADIであり、そのディーラーシップ サービスが結果重視のカスタマーエクスペリエンスで提供されます。
Scality RINGの既存のユーザーは、Scality ADIを導入することで、既存のデータ、デバイスなどへの投資、運用履歴などは一切失わず、そのまま引き継ぐことができます。何も失わないどころか、むしろそれらをより効果的にまとめるプラットフォームが利用できるようになります。

超高速アクセスのデータからディープアーカイブまで一つのネームスペースで
Scality ADIには、各種用途別のメディアにデータを柔軟に配置する機能があり、これが最大の特長の一つでもあります。具体的には、以下の仕組みで機能します。
単一のオペレーティングモデルとネームスペースでさまざまなタイプのストレージメディアに対応
Scality ADIは、たとえば、GPUDirectのワークロード(50ミリ秒未満のレイテンシ)にはNVMe SSDを、高スループット(TB/秒)のデータ表現にはQLCやニアラインフラッシュを、RAGやAIデータレイクなど、キャパシティ最適化ワークロードにはHDDを、長期リテンションやアーカイブにはテープやコールド クラウド ストレージを割り当てます。
データをどこに配置し、いつ移動すべきかは、ポリシー主導のライフサイクル マネジメントによって決定されます。
そして、このポリシーは不透明な自動化によって定義されるのではなく、ユーザー(顧客)自身が透明性をもって定義することができ、各ワークロードの実際の要件(パフォーマンス ニーズ、データ保護体制、コスト、消費電力など)をポリシーに反映させることができます。
つまり(前述の比喩を再度取り上げると)Scality ADIは完全な自動運転の自動車ではありません。顧客定義のポリシーにもとづいて自律的に実行される、監査可能で透明性のあるオペレーティングモデルです。
目標は、すべてを最速メディアで実行するのではなく、対象となるワークロードに対して、パフォーマンス、データ保護、経済性、電力の効率性といった各要素のベストのバランスを考慮し、データを最適な場所に配置することです。
特にAIデータに関しては、その配置が時間とともに移り変わります。トレーニング中は特別なスループットが必要だったデータセットが、6か月後にはRAGパイプライン用の参照コーパスとなったり、コンプライアンス重視のリテンション用に保存されたりして、当初のストレージ要件とは異なる要件をともなうようになります。このようなニーズにライフサイクル全般で対応し、インフラストラクチャ チームが別々のプラットフォームをつなぎ合わせたり、サイロ化されたメディア間でデータを手動で移動させたりすることなく、一貫して管理できるようにするのが、Scality ADIの強みです。
人間が管理する自律型オペレーション
「自律型インフラストラクチャ」という用語を最近よく耳にしますが、かなり幅広い意味で使われているようです。しかし、Scalityの意味する「自律型インフラストラクチャ」には厳密な意味があります。
Scality ADIにおいて、自律型とは、ポリシーによるガバナンスが確保されたオペレーショナル インテリジェンスによって処理を実行することを意味します。ブラックボックスの中での実行でもなければ、完全な自動運転でもありません。
そのアーキテクチャは複数のレイヤーで構成されます。まず、AIアシストのインテリジェンス レイヤーとして、Scality Guardianがシステムの状態をモニタリングし、予測型メンテンナンス、プラットフォーム ヘルス、消費電力、サイバー脅威検出などにわたる、ワークロードに沿った分析情報を提供します。Scality独自の運用ケースに加え、実際のインフラストラクチャ パターンに基づく推奨事項でトレーニングされており、一般的なAIレスポンスにとどまらない情報を提供します。ただし、読み取りのみの設計で、判断はするけど実行はしない枠組みを遵守しています
実際のアクションは、エージェント型オペラビリティを通じて実行されます。ユーザーがMCP(モデル コンテクスト プロトコル)経由で独自のAIツールをScality ADIのオペレーショナル ワークフローに接続できる仕組みになっています。それにより、AIがアカウントを作成したり、アラートに対応したり、容量の割り当てを管理したり、オペレーターがUIで実行するようなあらゆるタスクを代わりに実行したりできるようになります。これらはすべてユーザー定義のポリシーによる厳正なガバナンス下で行われます。
処理の主体によって管理に差が出ることもありません。人間が処理しようが、AIが処理しようが、すべてのアクションは監査可能なポリシーによる厳密な管理下で行われます。未承認のアクションが実行されることはありません。
データ主権にかかわる場合や、規制対象のミッションクリティカルなインフラストラクチャに対して、インサイト、アクション、ガバナンスの境界線は決して曖昧にせず、完全に信頼できるプラットフォームなのか、そもそもデプロイできないプラットフォームなのかの明確な区別が適用されます。

GPUの生産性を保つには特別なデータパスが必要
AIのパフォーマンスに問題がある場合、それはGPUの問題とは限らないことは、最近ようやく認知され始めました。データの到着に時間がかかり、GPUがアイドリング状態になる場合、ボトルネックはコンピューティング ティアではなく、ストレージとネットワークパスです。AIのワークロードはバッチ処理のトレーニングからリアルタイムの推論やエージェント ワークフローへと進化するので、データパスが何より重要になります。
Scality ADIは、まさにこの課題に真っ正面から取り組んでいます。GPUDirectティアでは50ミリ秒未満のレイテンシでS3がRDMA経由で適用され、トレーニング、分散推論、KVキャッシュなど、ミリ秒単位のデータアクセスの遅れがGPUサイクルの無駄につながるような高デマンドのワークロードに最適な機能性を発揮します。同時に、マルチテラバイト/秒の集中的なスループットで、トレーニングやデータ準備パイプラインの大規模なデータ移動にも対応できます。
このアーキテクチャが、専用の並列ファイルシステムやオールフラッシュのアプライアンスと大きく異なる点は、AIパフォーマンスと他の処理の二択の決断をユーザーに迫らない点です。
データはアクセス頻度でホットからコールドまでの段階を温度で表しますが、Scality ADIは一つのプラットフォームにおいて、もっとも熱いGPUワークロードはもちろん、温かいデータレイクも管理でき、ガバナンス用のアーカイブや長期リテンションなどのコールドデータまで、すべて単一のポリシー、オペレーティングモデル、データ保護フレームワークで対応します。
確かなデータ保護体制の証明
サイバーレジリエンスは今や、バックアップの取り方を担当者レベルで悩む問題ではなく、経営陣が総合的な企業管理の観点から悩むべき問題です。データ保護体制はサイバー保険会社に対して実証できるものでなければならないし、規制当局には監査証跡を提示できなければなりません。また、AI時代の今、トレーニング パイプラインと推論ワークロードにデータをフィードするのと同一のインフラストラクチャで、データのイミュータビリティと復元性、そして監査可能性を維持しなければなりません。
Scality ADIには、CORE5にもとづくサイバーレジリエンスの原則が、プラットフォームのすべての階層にScalityネイティブな特性として深く組み込まれています。それは、オブジェクトレベルのイミュータビリティ、多要素認証(MFA)、アクセス制御、転送時と保存時の暗号化、分散イレージャーコーディング、メタデータ保護、マルチサイト レプリケーションと、それらを支えるオペレーティングシステムの堅牢化によって成り立っています。このデータ保護モデルは、データがフラッシュ ストレージにあるときも、HDDあるいはテープにあるときも、そしてAIワークロードにアクティブに対応していようが、長期リテンションで静かに眠っていようが、常に適用されます。
データ主権もこの枠組みで確保されます。Scality ADIのソフトウェア定義オンプレミス デプロイメント モデルとオープンコードの「検査可能性」が、データがどこにあり、誰がアクセスでき、インフラストラクチャでどのように運用されるのかを明確にし、データ主権の要件とシステムのコンプライアンス要件を満たす高度な透明性を確保しています。
また、Scality ADIでは、自律型AIにおいて「ヒューマン イン ザ ループ(human-in-the-loop)」の原則を厳守し、ユーザーがポリシーを管理し、アクションを承認し、監査証跡を保持できるように徹底しています。
インフラストラクチャ設計に立ちはだかる電力の制約
エンタープライズ データ インフラストラクチャにおいて「電力の制約」が、しばしば話題にのぼるようになりました。しかも、気候変動や国際情勢も相まって、その緊急性が予想を上回るスピードで高まっています。企業がデプロイできるAIキャパシティは、否応なく電力供給量に左右されるし、冷却のための費用にも限度があります。かつてインフラストラクチャ チームにとってデータの保管や移動は当然の作業であり、費用のことはそれほど気にしなくてよかったのですが、そんな時代は終わりました。
Scality ADIは、システム、ノード、ワークロード単位でリアルタイムのパワーテレメトリーを可視化しています。つまり、インフラストラクチャ チームは、データの配置にともなう実際の電力消費量を知ることができ、パフォーマンス、キャパシティ、エネルギー効率のバランスを考慮する際にインフォームド ディシジョン(十分な情報にもとづいた意思決定)を実践できます。
この仕組みの実用性をさらに高めているのが、Scality ADIの異種メディア横断型データ配置機能です。前述のとおり、Scality ADIでは、ホットからコールドまで、異なる用途の複数ストレージにまたがるデータ保存をサポートしますが、それによって、ニーズに合わせた効率化が確保されます。たとえば、フラッシュレベルの電力消費を必要としないデータをフラッシュ ストレージに置くのは不経済であり、コールドデータはテープやクラウド アーカイブに移動したほうが費用効率が最適化されます。これはエネルギー効率の最適化でもあります。
データセンターの電力消費に対する制約が高まるにつれ、ワークロードの要件を実際の制約に合わせて調整できる機能は、単なるサステナビリティのトレンドに沿った取り組みではなく、実用的なオペレーショナル アドバンテージとして今後ますます重要性が増してくるはずです。
効率重視だからこそ結果に完全コミット
企業のインフラストラクチャ チームはデプロイしたデータ量で評価されるのではなく、いかにアプリケーションが効率よく機能しているか、データが守られているか、システムが使用可能な状態に維持されているか、運用チームが予算内で効率性を維持しているかで評価されるべきです。
その点、Scality ADIによるアウトカムベースのサービスコミットメントは、この運用上の現実に即した仕組みです。顧客は容量を購入して、それを要件に合わせてどう使うか検討するのではなく、本番環境の指標(スループット、データ保護体制、消費電力、運用効率)に適したサービスレベル アグリーメントを結ぶことができます。
これは、ベンダーリレーションシップが単なるハードウェアの売買からインフラストラクチャ パートナーシップへと進化してきた表れでもあります。顧客企業が実現しなければならない結果に対して、プラットフォームが責任を持つ仕組みが今後、業界の主流になっていくでしょう。Scality ADIはそのさきがけとも言えます。
次世代エンタープライズ データのニーズに対応
エンタープライズ データの未来を形成する動向は、決して一過性のものではありません。AIワークロードは引き続き拡大し、多様化していくはずです。サイバーレジリエンスへの要求度もますます強まっていきます。データ主権の要件もさらに厳しくなっていくでしょう。エネルギー効率の要件も厳格化の一途をたどっています。そして、運用チームは同じリソースでこれまで以上の仕事を求められ続けています。
この現実に対応するには、Scality ADIのような新しいオペレーティングモデルが必要です。単にパフォーマンスの優れたストレージ プロダクトではなく、パフォーマンス、データ保護、経済性の最適バランスを測りながら、エンタープライズ データのフルライフサイクルをマルチペタバイトからエクサバイトの規模で管理できるソリューションです。
Scality ADIのさらなる詳細や、導入へのガイダンスについては、クライムまでお問い合わせください。


RSSフィードを取得する
