現代産業と最先端の研究開発が毎回進歩するたびに、その裏には高性能計算ソフトウェアの規模が広がっており、その下には非常に計算リソースを消費し、回避できない核心的な計算モードであるStencilテンプレート計算があります。天気予報や地震探査、電磁シミュレーション、材料シミュレーションなど、すべてはグリッドポイントの重み付き組み合わせを使って繰り返しグリッドを更新することです。この種の計算はメモリアクセスが密で、メモリ帯域幅によって制限され、アプリケーション全体の多くを占める実行時間となり、その速さは国が持つ重要な産業および研究ソフトウェアの効率を直接決定します。

過去にStencilをハードウェアの物理的限界まで最適化するには、極めて珍しいHPC専門家が必要でした。コンパイラやコード生成器、自動チューニングシステムは自動的にコードを作成し、パラメータを探せますが、最適化アルゴリズム自体は設計と統合を行う必要があり、シーンやShape、ハードウェアが変更になると再び手動で接続しなければならず、スケーラビリティがありませんでした。今ではこの状況に新たな突破口が生まれました。面壁インテリジェンスとOpenBMBオープンソースコミュニティは、世界初のStencilを自動的に研究・配置できるAI最適化システムForgeStencilを発表し、直接オープンソースとして公開しました。

image.png

明らかにされた情報によると、ForgeStencilはわずか1週間で100以上の実際の工業的および科学的計算ソフトウェアを自動的に最適化し、単一アプリケーションの最適化時間を時間単位に短縮し、開発効率を約100倍向上させ、計算能力のスケールに伴って並列的に拡大できました。これは、Stencil最適化が人間の制約から解放され、スケーラブルになるという初めてのことです。

最も画期的な点は、双エージェント駆動型で人工の介入がないことです。人間は最適化したいアプリケーションのソースコードを投げ込むだけで、自動分析、ホットスポットの特定、カーネルの作成、演算子の交換、正しさの検証、元のアプリケーションへの統合といったプロセスにおいて、一切専門家の判断が入ることはありません。このシステムはカーネルエージェントとアプリケーションエージェントの2つの構成要素で構成されています。前者はカーネルの創造者であり、高性能なカーネルを自主的に研究し合成し、主流のStencilタイプ、さまざまなShapeと精度要件に対応して専用の演算子マトリクスを構築し、数学的な表現をハードウェアの限界に近い美しいコードに書き換えます。後者は実務を担うエンジニアであり、各リアルなアプリケーションに独自の計画を鍛造し、ホットスポットの特定、GPUベースラインの確立、検証と統合を行い、最後にアプリケーションに備えられたテストケースでエンドツーエンドの評価を行います。

演算子対決では、ForgeStencilはHalide、Devito、EBISU、DRStencil、FlashFFTStencilなどの有名なフレームワークを引き連れて比較しました。同じ精度fp32では幾何平均2.35倍の加速を得ており、混合精度fp16の読み書きではさらに1.95倍のスピードアップを達成しました。また、有名な難易度が高い可変係数Stencilの全Shapeにおいても、最適なベースラインよりも幾何平均1.34倍の加速がありました。

image.png

さらに深刻なのは、理想化されたベンチマークにとどまらず、実際の産業シーンに深く入り込んでいることです。主流の科学ソフトウェアと権威あるベンチマークでの約42%の最適化は、実際に産業生産に該当しています:hypre構造的多重グリッドソルバー庫は3.86倍高速化され、minisweep核反応炉中性子輸送は5.78倍高速化され、gprMaxとFDTD電磁シミュレーションは2.47倍高速化され、RTM逆時偏移油田地震画像は1.81倍高速化され、道達のminimod地震mini-appは1.22倍高速化され、QuantLib債券価格は1.82倍高速化され、非カルテジアンMRI再構成は2.45倍高速化され、デジタル乳腺断層撮影の逆投影は1.63倍高速化されました。石油会社、医療機器、気象部門の実際の生産負荷を直接処理しました。

人間の専門家が自分の頭脳に知識を閉じ込め、共有することが困難なこととは異なり、ForgeStencilは多くの並列エージェントが共通の知識ベースを使用し、経験をリアルタイムで共有し、知的な集団的な同期的な進化を実現します。これは、面壁インテリジェンスが5月に発表したForgeTrainに続いて、Forge Engineeringソフトウェア開発パターンに基づいて出力した成果であり、コードの自動生成から自動研究最適化へと進化し、局部的な演算子の高速化から本物のアプリケーションへの配備へとつながっています。

短期的には、既存の産業ソフトウェアの自動最適化により、ほぼハードウェアの限界に近い実装を時間単位で得られ、計算リソースの節約と開発の圧縮を通じてコスト削減と効率向上が可能です。長期的には、CAEシミュレーション、地震画像、電磁と流体など、高級装置、エネルギー探査、チップ設計のデジタル基盤が自動最適化されることで、中国製造業のアップグレードが加速されます。現在、ForgeStencilはGitHubでオープンソース化されており、面壁インテリジェンスはHPC研究者、産業ソフトウェア従事者、オープンソース開発者に対して共同開発の呼びかけを行っています。