- 月間訪問数
- 0
- 料金
- 無料、有料
- 掲載日
- 2026-08-04
- 更新済み
- 2026-08-04
01ForgeStencilとは
ForgeStencilは、面壁智能がOpenBMBオープンソースコミュニティと共同開発した、Stencilの自動研究・自動デプロイに対応する世界初のAI最適化システムです。Kernel AgentとApp Agentによる2エージェントのクローズドループを基盤とし、最適化戦略の発見から実際の本番ソフトウェアへの統合まで、全工程を人手なしで実行します。1週間で100以上の産業・科学計算ソフトウェアをエンドツーエンド最適化し、中央値で1.41倍高速化。石油・ガス探査、電磁界シミュレーション、医用画像など、8つの主要産業分野と5つの主要科学分野をカバーしています。
02ForgeStencilの主な機能
2つのAgentによるクローズドループ最適化:Kernel Agentが高性能CUDA Kernelを自律的に研究・合成し、App Agentがホットスポット特定、演算子の鍛造、正確性検証、アプリケーション統合を行います。
自動戦略発見:Agentが固定された探索空間内で検索するのではなく、タイリング、融合、レイアウト、占有率、ホスト側の再構成などの最適化戦略を自律的に探索します。
実アプリケーションへのデプロイ:本番レベルのソフトウェアを直接最適化し、アプリケーション自身のGPUコードをベースラインとしてエンドツーエンド検証を行います。簡略化されたベンチマークではありません。
監査可能な計測プロトコル:単一の環境スイッチでオリジナル経路と最適化経路を交互に切り替え、プログラム内蔵のチェック機能とタイマーを使用することで、実際の高速化を信頼性高く測定します。
世代をまたぐGPU対応:A100/H100/B200のランタイムアーキテクチャ分岐に対応し、同一コードベースからアーキテクチャに応じて最適なKernel経路を自動選択します。
03ForgeStencilの技術原理
WeChatでフォローし「开源」と返信すると、AIオープンソースプロジェクト交流グループに参加できます。
2 Agent協調アーキテクチャ:システムはKernel AgentとApp Agentで構成されるクローズドループです。Kernel Agentは理論の発見を担い、Plan→Code→Profileのループを通じて自律的に研究し、ハードウェアの物理的限界に近づくStencil演算子を合成します。App Agentはエンジニアリングへの実装を担い、アプリケーションの性能ホットスポットを特定してGPUベースラインを構築し、Kernel Agentが構築した演算子マトリクスのナレッジベースを活用してアプリケーション専用の最適化を鍛造し、正確性検証と元アプリケーションへの統合を完了します。
演算子マトリクスとナレッジベースの進化:Kernel Agentは最適化の過程で専用の演算子マトリクスを継続的に構築し、ナレッジベースとして蓄積します。その後のApp Agentは既存の技術を再利用できます。複数の並列Agentがこのナレッジベースを共有することで、経験をリアルタイムに共有し、集団的に同期しながら進化できます。これにより、人間の専門家の経験を大規模に伝達することが難しいというボトルネックを克服します。
監査可能なエンドツーエンドプロトコル:計測ではアプリケーション自身の本番レベルGPU実装のみをベースラインとし、オリジナル経路と最適化経路は単一のUSE_OURSスイッチだけで区別します。オリジナル経路は上流版とバイト単位で一致します。プログラム内蔵の正確性チェックとタイマーを使用し、複数回の交互実行後に中央値を算出。最終的にすべての標準ケースの幾何平均高速化率を報告し、システムレベルで不正な水増しの余地を排除します。
Patchモードとソースコードの非同梱:第三者のソースコードは一切同梱せず、各アプリケーションには上流の出典記録、取得スクリプト、統合パッチのみを提供します。vendor.shで指定バージョンの上流コードを自動取得し、ライセンスの健全性と結果の再現性を確保します。
04ForgeStencilの使い方
環境準備:リポジトリをクローンし、NVIDIA GPU(A100で検証)、CUDA 12.x、C++17コンパイラ、Python 3.9以降の環境を用意します。
演算子をすぐに試す:python tools/run.py --stencil star_1 --shape 256 --gpu 0を実行すると、1分以内に単一演算子の性能を測定し、Halideベースラインと比較できます。
エンドツーエンドで再現:対象アプリケーションのディレクトリに移動して./vendor.shを実行し、上流ソースコードを取得します。アプリケーション統合パッチを適用した後、python ../../harness/run_e2e.py --app --gpu autoを実行して実アプリケーションを検証します。
Agentを動かす:agents/README.mdを参照して設定し、Kernel AgentとApp Agentの自律最適化ループを起動します。
結果レジストリを確認:results/integration_registry.jsonで、検証済み100アプリケーションの監査済み高速化データを確認できます。
05ForgeStencilの主な強み
人手ゼロ:アプリケーション分析、ホットスポット特定、Kernel鍛造から統合検証まで、全工程を自動化。HPC専門家による意思決定は不要です。
実環境重視:本番レベルの産業ソフトウェアを直接最適化し、42%が実際の産業用本番ソフトウェアです。ベースラインにはアプリケーション自身のGPUコードを使用します。
研究開発効率の飛躍的向上:1アプリケーションの最適化期間を数か月から1日以内に短縮し、1週間で100以上のアプリケーションを完了。約20~30人年相当の研究開発工数を削減できます。
高い性能:エンドツーエンドで中央値1.41倍高速化し、43%のアプリケーションで1.5倍以上を達成。演算子レベルでは幾何平均2.16倍となり、最良のオープンソースベースラインを上回ります。
世代をまたぐ持続的な対応:複数世代のNVIDIA GPUにおけるランタイム分岐に対応し、アーキテクチャの更新時にはKernelを自動的に再鍛造して新しいハードウェア特性を取り込めます。
06ForgeStencilのプロジェクトURL
GitHubリポジトリ:https://github.com/OpenBMB/ForgeStencil
07ForgeStencilの活用分野
石油・ガスの地震探査:RTM逆時間マイグレーション、Totalのmini-appなどの中核アルゴリズムを最適化し、石油探査データの処理を高速化します。
電磁界シミュレーション設計:gprMax/FDTDなどによるYee格子上のMaxwell方程式の求解効率を向上させ、レーダーやチップの電磁解析に役立てます。
医用画像再構成:非デカルトMRI再構成、デジタルマンモグラフィ断層撮影の逆投影など、医用画像計算の負荷を高速化します。
気候・天体物理学:大気力学、宇宙論シミュレーションなど、Stencilを多用する科学計算アプリケーションを最適化します。
金融クオンツ計算:QuantLibなどの金融機関向け価格評価ライブラリでStencilホットスポットを自動最適化し、取引計算のレイテンシを削減します。
© 免責事項:ドメインやリンク先のコンテンツは時間の経過とともに変更される場合があります。AIEZZは第三者のウェブサイトを管理していません。外部コンテンツとリスクはご自身で確認してください。


ユーザーレビュー0