並列言語XcalableMPのアクセラレータ向け言語拡張のOpenCL実装
スポンサーリンク
概要
- 論文の詳細を見る
高い演算性能を持つ GPU や Intel MIC 等をアクセラレータデバイスとして汎用計算に用いる動きが HPC の分野で活発である,さらに,これらのアクセラレータを搭載したクラスタにおけるプログラミングも注目されている.しかし,アクセラレータを搭載したクラスタ上でプログラムを記述するためには,アクセラレータ専用の記述言語の他に,MPI に代表されるノード間通信インターフェースも用いる必要がある.このような分散並列環境におけるプログラミングの複雑さを解決する手段として,PC クラスタ向けの PGAS 言語である XcalableMP が開発されている.さらに,GPU を搭載したクラスタ向けに,CUDA を用いて XcalableMP の言語拡張も開発されている.本稿では,XcalableMP のアクセラレータ向け言語拡張を OpenCL で実装し,NVIDIA の GPU,AMD の GPU それぞれを搭載したマシンにおいて N 体問題と行列積を用いて評価を行った.その結果,元々 CUDA により実装されていた XcalableMP のアクセラレータ向け言語拡張と同等の性能が得られることを確認し,さらに,OpenCL 実装によって XcalableMP で記述したソースコードが異なる計算プラットフォーム間で可搬性を持つことを示した.
- 2012-03-19
著者
-
佐藤 三久
筑波大学計算科学研究センター
-
高橋 大介
東京大学情報基盤センター:(現)埼玉大学大学院理工学研究科
-
高橋 大介
筑波大学計算科学研究センター
-
佐藤 三久
筑波大学システム情報工学研究科
-
朴 泰祐
筑波大学 計算科学研究センター
関連論文
- HMCS-G : グリッド環境における計算宇宙物理のためのハイブリッド計算システム(グリッド応用)
- 演算加速機構を持つオンチップメモリプロセッサの電力性能評価(ARC-3 : 性能評価およびモデリング,2007年並列/分散/協調処理に関する『旭川』サマー・ワークショップ(SWoPP旭川2007))
- 大規模SMPクラスタにおけるOpenMP/MPIハイブリッドNPB,RSDFTの評価(並列/分散コンピューティング,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2009))
- 高性能・耐故障マルチリンクEthernet結合システムのNFSへの適用と評価(クラスタとグリッド技術)
- T2K筑波システムにおけるLinpack性能評価(HPC-4:性能評価,2008年並列/分散/協調処理に関する『佐賀』サマー・ワークショップ(SWoPP佐賀2008))
- Short Vector SIMD命令を用いた並列FFTの実現と評価(性能最適化)
- 大規模固有値問題のmaster-worker型並列解法(数値計算)
- OmniRPCによるグリッド環境での大規模固有値問題の並列解法(数値アルゴリズム)
- "FIRST"-第一世代天体の起源解明のための専用・汎用計算機融合型クラスタ(HPC-8: 高性能クラスタ)
- ディペンダブルな組込みシステムに適した省電力高性能通信機構(通信とグリッドII)
- EthernetマルチリンクによるPCクラスタ向け高バンド幅・耐故障ネットワークRI2N/UDP(ネットワーク)
- tagged-VLANとマルチリンクに基づくPCクラスタ向け高性能・耐故障ネットワークの実装と評価(Session 3:Cluster/Grid)
- VFREC-Net : ドライバ制御によるtagged-VLANを用いたPCクラスタ向けマルチパスネットワーク(ネットワーク)
- EthernetマルチリンクによるPCクラスタ向け耐故障ネットワークRI2N/UDP(ネットワーク,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2006))
- EthernetマルチリンクによるPCクラスタ向け耐故障ネットワークRI2N/UDP(ネットワーク, 「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2006))
- tagged-VLANに基づくPCクラスタ向け高バンド幅ツリーネットワークの開発(HPCシステム)
- Etheretによるクラスタ上での分散共有メモリOpenMP Omni/SCASHの性能評価
- OpenMPを用いた並列ベンチマークプログラムによる組込み向けマルチコアプロセッサの評価(ARC-5:並列処理1,2008年並列/分散/協調処理に関する『佐賀』サマー・ワークショップ(SWoPP佐賀2008))
- オンチップメモリプロセッサでの演算加速機構の検討(プロセッサ・アーキテクチャ(2),「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- PCクラスタにおける電力実行プロファイル情報を用いたDVS制御による電力性能の最適化(クラスタシステム)
- PCクラスタにおける電力実行プロファイル情報を用いたDVS制御による電力性能の最適化(省電力,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2006))
- PCクラスタにおける電力実行プロファイル情報を用いたDVS制御による電力性能の最適化(省電力, 「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2006))
- 高性能計算のための低電力・高密度クラスタMegaProto(HPCハードウェア)
- PCクラスタにおけるDVS制御による電力性能の最適化(ARC-3: 低電力アーキテクチャ1, 2005年並列/分散/協調処理に関する『武雄』サマー・ワークショップ(SWoPP武雄2005)-研究会・連続同時開催-)
- 高性能計算のための低電力・高密度クラスタMegaProto(クラスタと通信, 分散処理, 「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2005))
- 大規模SMPクラスタにおけるOpenMP/MPIハイブリッドNPB,RSDFTの評価(並列/分散コンピューティング,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2009))
- オンチップメモリプロセッサでの演算加速機構の検討(プロセッサ・アーキテクチャ(2),「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- 積和演算命令に向いた8基底FFTカーネルの提案
- 級数に基づく多数桁計算の演算量削減を実現する分割有理数化法
- 積和演算に向いた8基底FFT Kernelの提案
- 無限級数に基づく多数桁計算の演算量削減を実現する分割有理数化法 (数値計算における前処理の研究)
- 分散メモリ型並列計算機による円周率の515億桁計算
- 分散メモリ型並列計算機による2, 3, 5基底一次元FFTの実現と評価
- 多数桁の円周率を計算するための公式の改良 : ガウスールジャンドルの公式とボールウェインの4次の収束の公式
- 分散メモリ型並列計算機による円周率の高精度計算
- 並列計算機における二次記憶を用いた一次元FFTの実現と評価
- 分散メモリ型並列計算機による多倍長平方根の高速計算法
- 分散メモリ型並列計算機による2, 3, 5基底のFFTの実現と評価
- 分散メモリ型並列計算機による高速多倍長計算
- 多倍長平方根の高速計算法
- 分散メモリ向け並列言語XcalableMPコンパイラの実装と性能評価
- XcalableMPによるNAS Parallel Benchmarksの実装と評価
- 行列積を用いた古典Gram-Schmidt直交化法の並列化
- 計算素粒子物理学分野の国際データグリッドILDGと国内グリッドJLDG(グリッドI)
- PACS-CSにおける隣接通信性能の高速化(HPC-13 : 通信II)
- PACS-CSのための高性能通信ライブラリインターフェイスの設計(HPC-12 : 大規模運用システム(2))
- 仮想マシンとSpecCデバイスモデルを統合したデバイス故障エミュレータの実現
- 行列積を用いた古典Gram-Schmidt直交化の並列化手法の検討(数値計算2)
- 演算加速機構を持つオンチップメモリプロセッサの検討と電力性能評価
- DVFS制御を目的としたプログラムの領域分割(Session 6:低消費電力)
- MegaProto/Eにおける電力性能評価および電力性能最適化の検討(Session 6:低消費電力)
- DVS制御による負荷不均衡のある並列プログラムの電力量削減手法(クラスタシステム)
- PCクラスタにおける全体電力プロファイルを用いた電力性能最適化(ARC-1:低電力アーキテクチャ,2006年並列/分散/強調処理に関する『高知』サマー・ワークショップ(SWoPP 高知2006))
- DVS制御による負荷不均衡のある並列プログラムの電力量削減手法(省電力,「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2006))
- DVS制御による負荷不均衡のある並列プログラムの電力量削減手法(省電力, 「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2006))
- 科学技術計算用超並列クラスタPACS-CSの実装と基本性能評価(HPC-12 : 大規模運用システム(2))
- 大規模SMPクラスタにおけるOpenMP/MPIハイブリッドNPB,RSDFTの評価 (計算機アーキテクチャ・ハイパフォーマンスコンピューティング・「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2009))
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 組込み機器向けon-chip/off-chipコア間通信機構の実装と評価
- 超並列クラスタにおける3D-RISMへのVolumetric並列三次元FFTの適用と性能評価
- 組込み機器向けon-chip/off-chipコア間通信機構
- 高性能・耐故障マルチリンクEthernet結合システムの性能評価
- XMLデータを対象としたファセット検索インタフェースの生成(セッション1,XML応用技術特集および一般)
- オンチップメモリプロセッサでの演算加速機構の検討 (計算機アーキテクチャ・ハイパフォーマンスコンピューティング 「ハイパフォーマンスコンピューティングとアーキテクチャの評価」に関する北海道ワークショップ(HOKKE-2007))
- 複数グリッドジョブ実行システムの計算資源を統合・利用するGrid RPCシステムの設計と実装(グリッドシステム)
- グリッドRPCシステムOmniRPCにおける初期データの分散管理による効率化(グリッドRPC)
- オンチップRAM利用による電力性能の最適化と評価(ARC-3: 低電力アーキテクチャ1, 2005年並列/分散/協調処理に関する『武雄』サマー・ワークショップ(SWoPP武雄2005)-研究会・連続同時開催-)
- プロセッサの消費電力測定と低消費電力プロセッサによるクラスタの検討(省電力)
- 低消費電力プロセッサによるクラスタの検討(ARC-6:低消費電力化)(2003年並列/分散/協調処理に関する『松江』サマー・ワークショップ(SWoPP松江2003))
- HPC向けオンチップメモリプロセッサアーキテクチャSCIMAのSMP化の検討と性能評価
- HPC向けオンチップメモリプロセッサアーキテクチャSCIMAのSMP化の検討と性能評価
- 複数グリッドミドルウエア上で動作するGrid RPCシステムOmniRPCの設計と実装(HPC-4: グリッド)
- PGAS言語XcalableMPのmulti-node GPU向け拡張仕様の実装と評価
- 演算加速装置に基づく超並列クラスタHA-PACSによる大規模計算科学
- 並列プログラミング言語XcalableMPにおけるデータおよびループのユーザ定義分散のための拡張仕様
- 並列プログラミング言語XcalableMPによるMPI並列ライブラリインターフェースの検討
- スクリプト言語Xcryptによる格子QCDシミュレーションの最適化
- 並列言語XcalableMPのGPU向け拡張
- PGAS言語XcalableMPとUnified Parallel Cの性能比較
- PCI Expressを用いた通信リンクPEARLにおけるネットワーク管理機構
- MCAPIを用いた組込み向け耐故障分散共有メモリの実装
- MCAPIを用いた組込み向け耐故障分散共有メモリの実装
- Fibonacci数の高速計算法
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列PGASプログラミング言語XcalableMPの入出力機能とLustreファイルシステムでの性能評価
- 並列言語XcalableMPのアクセラレータ向け言語拡張のOpenCL実装
- JNIを用いたHadoopによる分子進化系統樹解析用プログラムTree-Puzzle並列化(数値解析,ネットワーク,クラウド及び一般)
- PCI ExpressネットワークPEARLにおける耐故障機構
- Tightly Coupled Acceleratorsアーキテクチャのための通信機構
- 大規模GPUクラスタにおけるN体計算コードの演算性能とスケーラビリティの評価
- OmniコンパイラによるOpenACCの試作
- パーシャルメッセージロギングを改善する耐故障性実現フレームワーク
- パーシャルメッセージロギングを改善する耐故障性実現フレームワーク
- Tightly Coupled Acceleratorsアーキテクチャ向け通信機構の予備評価
- Tightly Coupled Acceleratorsアーキテクチャ向け通信機構の予備評価
- Tightly Coupled Acceleratorsアーキテクチャに基づくGPUクラスタの構築と性能予備評価