PGAS言語XcalableMPのmulti-node GPU向け拡張仕様の実装と評価
スポンサーリンク
概要
- 論文の詳細を見る
GPU アーキテクチャの汎用化と高速化によって,GPU クラスタは高いコストパフォーマンスと演算性能,省電力化を HPC 分野にもたらしている.これまで汎用計算における GPU の高速化効果を目的とするプログラミング言語モデルの拡張やライブラリが数多く提案されてきた.しかし,これらは GPU を搭載するシングルノード環境を対象とする拡張が多く,GPU クラスタなどのメモリ分散システムを対象とするものがまだ少ない.multi-node GPU クラスタにおける高い性能プログラミングは通常の 1 ノード内のホストーGPU の拡張だけでは不十分,それぞれのノードにまたがる GPU どうしのプログラミングも意識する必要がある.そこで,現在,我々は Partitioned Global Address Space(PGAS) プログラミングモデルをベースとした並列プログラミング言語 XcalableMP を GPU クラスタに適用可能とするための拡張を行っている.本稿では,行列積計算を対象に,GPU クラスタにおける XMP-ACC 拡張のプログラミングコストと性能について調査した.その結果,4 ノードの GPU クラスタにおいて,CPU のみを用いた XcalableMP プログラムよりも,それに数行の XMP-ACC 指示文の追加したプログラムのほうが約 42 倍の速度向上が得られた.
- 2011-07-20
著者
-
佐藤 三久
筑波大学計算科学研究センター
-
佐藤 三久
筑波大学システム情報工学研究科
-
佐藤 三久
筑波大学大学院システム情報工学研究科|筑波大学計算科学研究センター
-
朴 泰祐
筑波大学 計算科学研究センター
-
小田嶋 哲哉
筑波大学情報学群情報科学類
関連論文
- クラスタをメモリ資源として利用するためのMPIに基づいた高速大容量仮想メモリ(コンピュータシステム技術,2009年並列/分散/協調処理に関する『仙台』サマー・ワークショップ(SWoPP仙台2009))
- Heterogeneous Multi-Computer System : 連続体・多粒子系融合型超並列計算機システム
- 演算加速機構を持つオンチップメモリプロセッサの電力性能評価(ARC-3 : 性能評価およびモデリング,2007年並列/分散/協調処理に関する『旭川』サマー・ワークショップ(SWoPP旭川2007))
- 大規模SMPクラスタにおけるOpenMP/MPIハイブリッドNPB,RSDFTの評価(並列/分散コンピューティング,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2009))
- 高性能・耐故障マルチリンクEthernet結合システムのNFSへの適用と評価(クラスタとグリッド技術)
- ユーザ透過に利用可能な耐故障・高性能マルチリンクEthernet結合システム(クラスタと省電力技術)
- T2K筑波システムにおけるLinpack性能評価(HPC-4:性能評価,2008年並列/分散/協調処理に関する『佐賀』サマー・ワークショップ(SWoPP佐賀2008))
- 自動プログラム領域分割を用いた実行時DVFS制御(命令実行制御,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2008))
- PCI Expressによる省電力・高信頼・高性能通信リンクのためのコミュニケータチップ:PEACH (集積回路)
- マルチパスネットワークを持つPCクラスタにおける動的経路制御システム(クラスタシステム)
- ディペンダブルな組込みシステムに適した省電力高性能通信機構(通信とグリッドII)
- tagged-VLANを用いたPCクラスタ向けマルチパスネットワークにおける動的ルーティング(HPC-13 : 通信II)
- EthernetマルチリンクによるPCクラスタ向け高バンド幅・耐故障ネットワークRI2N/UDP(ネットワーク)
- tagged-VLANとマルチリンクに基づくPCクラスタ向け高性能・耐故障ネットワークの実装と評価(Session 3:Cluster/Grid)
- VFREC-Net : ドライバ制御によるtagged-VLANを用いたPCクラスタ向けマルチパスネットワーク(ネットワーク)
- UDPによるファイアウォール越えを用いたP2Pオーバーレイネットワーク(HPC-7 : 分散環境(1))
- 超並列計算機CP-PACSにおける分子動力学法シミュレーション
- OpenMPを用いた並列ベンチマークプログラムによる組込み向けマルチコアプロセッサの評価(ARC-5:並列処理1,2008年並列/分散/協調処理に関する『佐賀』サマー・ワークショップ(SWoPP佐賀2008))
- プリフェッチ機構を持つマルチコア向けソフトウェア分散共有メモリシステム(HPC-14:分散処理,2008年並列/分散/協調処理に関する『佐賀』サマー・ワークショップ(SWoPP佐賀2008))
- オンチップメモリプロセッサでの演算加速機構の検討(プロセッサ・アーキテクチャ(2),「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- PCクラスタにおける電力実行プロファイル情報を用いたDVS制御による電力性能の最適化(クラスタシステム)
- 超低電力メガスケールシステムのプロトタイプ : MegaProto
- 大規模SMPクラスタにおけるOpenMP/MPIハイブリッドNPB,RSDFTの評価(並列/分散コンピューティング,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2009))
- オンチップメモリプロセッサでの演算加速機構の検討(プロセッサ・アーキテクチャ(2),「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- プライベートネットワーク内のノードをサーバとして外部に公開するための機構(HPC-15 : ネットワーク)
- マルチレール相互結合網における通信プロファイリングに基づく性能最適化
- Flexible Fine Grain Thread Management By StackThreads/MP Library for OpenMP Task
- トラフィック量に適応する非対称マルチリンクEthernetトランキング
- 分散メモリ向け並列言語XcalableMPコンパイラの実装と性能評価
- PCI Expressによる省電力・高信頼・高性能通信リンクのためのコミュニケータチップ: PEACH
- PCI Expressによる省電力・高信頼・高性能通信リンクのためのコミュニケータチップ: PEACH
- 匿名性と不正者の特定を両立させるP2P環境用認証方式(セキュリティ)
- 匿名相互証明書とP2P通信を用いる認証方式(OS-1: セキュリティ, 2005年並列/分散/協調処理に関する『武雄』サマー・ワークショップ(SWoPP武雄2005)-研究会・連続同時開催-)
- XcalableMPによるNAS Parallel Benchmarksの実装と評価
- 行列積を用いた古典Gram-Schmidt直交化法の並列化
- 計算素粒子物理学分野の国際データグリッドILDGと国内グリッドJLDG(グリッドI)
- PACS-CSにおける隣接通信性能の高速化(HPC-13 : 通信II)
- PACS-CSのための高性能通信ライブラリインターフェイスの設計(HPC-12 : 大規模運用システム(2))
- 仮想マシンとSpecCデバイスモデルを統合したデバイス故障エミュレータの実現
- 行列積を用いた古典Gram-Schmidt直交化の並列化手法の検討(数値計算2)
- 演算加速機構を持つオンチップメモリプロセッサの検討と電力性能評価
- 大規模並列システムにおける電力最適化実行時の消費エネルギー予測手法
- 仮想計算機環境における省電力化を目的としたサーバ資源制御
- 分散型Webサーバでの負荷変動を考慮した省電力化のためのノード状態制御
- 自動プログラム領域分割を用いた実行時DVFS制御(命令実行制御,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2008))
- 分散型Webサーバにおけるノード状態制御による省電力化の検討(クラスタと省電力技術)
- メモリ効率を考慮した組み込み向け高信頼ソフトウェア分散共有メモリの検討(分散処理とシステムソフトウェア)
- 影響の少ないインスツルメント手法と電力最適化のためのプログラム領域分割(省電力方式)
- DVFS制御を目的としたプログラムの領域分割(Session 6:低消費電力)
- MegaProto/Eにおける電力性能評価および電力性能最適化の検討(Session 6:低消費電力)
- DVS制御による負荷不均衡のある並列プログラムの電力量削減手法(クラスタシステム)
- PCクラスタにおける全体電力プロファイルを用いた電力性能最適化(ARC-1:低電力アーキテクチャ,2006年並列/分散/強調処理に関する『高知』サマー・ワークショップ(SWoPP 高知2006))
- 大規模SMPクラスタにおけるOpenMP/MPIハイブリッドNPB,RSDFTの評価 (計算機アーキテクチャ・ハイパフォーマンスコンピューティング・「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2009))
- 片方向通信の実装方式の違いによる比較
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- クラスタをメモリ資源として利用するためのMPIによる高速大容量メモリ
- マルチグリッド環境における効率的な監視システムに関する研究
- 超並列クラスタにおける3D-RISMへのVolumetric並列三次元FFTの適用と性能評価
- 分散メモリ向け並列言語XcalableMPにおけるユーザ定義データ分散機能の検討
- プログラムテスト環境を提供するクラウドコンピューティングシステムの検討
- 非対称な形状に適応する高バンド幅multi-link Ethernet
- 組込み機器向けon-chip/off-chipコア間通信機構
- 分散メモリ向け並列言語XcalableMPコンパイラの試作と評価
- 高性能・耐故障マルチリンクEthernet結合システムの性能評価
- オープンなセンサを共有するセンシングWebのための広域分散アーキテクチャ(HPC-14:分散処理,2008年並列/分散/協調処理に関する『佐賀』サマー・ワークショップ(SWoPP佐賀2008))
- ユーザ透過に利用可能な高性能・耐故障マルチリンクEthernet結合システム
- XMLデータを対象としたファセット検索インタフェースの生成(セッション1,XML応用技術特集および一般)
- Windows PCをグリッド環境で利用するための軽量Linuxバイナリ実行システム(仮想化)
- 3P-1 仮想マシンを用いた分散システムの耐故障性評価環境の検討(分散・並列システム,学生セッション,アーキテクチャ)
- オンチップメモリプロセッサでの演算加速機構の検討 (計算機アーキテクチャ・ハイパフォーマンスコンピューティング 「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- Grid RPCにおける広域データ管理レイヤの利用(グリッド)
- 分散メモリ向けデータ並列言語OpenMPDの設計と実装(コンパイラ及びツール,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- 分散メモリ向けデータ並列言語OpenMPDの設計と実装(コンパイラ及びツール,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- PGAS言語XcalableMPのmulti-node GPU向け拡張仕様の実装と評価
- 演算加速装置に基づく超並列クラスタHA-PACSによる大規模計算科学
- 並列プログラミング言語XcalableMPにおけるデータおよびループのユーザ定義分散のための拡張仕様
- 並列プログラミング言語XcalableMPによるMPI並列ライブラリインターフェースの検討
- スクリプト言語Xcryptによる格子QCDシミュレーションの最適化
- 並列言語XcalableMPのGPU向け拡張
- PGAS言語XcalableMPとUnified Parallel Cの性能比較
- PCI Expressを用いた通信リンクPEARLにおけるネットワーク管理機構
- MCAPIを用いた組込み向け耐故障分散共有メモリの実装
- MCAPIを用いた組込み向け耐故障分散共有メモリの実装
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列言語XcalableMPのアクセラレータ向け言語拡張のOpenCL実装
- JNIを用いたHadoopによる分子進化系統樹解析用プログラムTree-Puzzle並列化(数値解析,ネットワーク,クラウド及び一般)
- PCI ExpressネットワークPEARLにおける耐故障機構
- Tightly Coupled Acceleratorsアーキテクチャのための通信機構
- OmniコンパイラによるOpenACCの試作
- パーシャルメッセージロギングを改善する耐故障性実現フレームワーク
- パーシャルメッセージロギングを改善する耐故障性実現フレームワーク
- Tightly Coupled Acceleratorsアーキテクチャ向け通信機構の予備評価
- Tightly Coupled Acceleratorsアーキテクチャ向け通信機構の予備評価
- Tightly Coupled Acceleratorsアーキテクチャに基づくGPUクラスタの構築と性能予備評価