おばんです。
RTX pro 2000 Blackwell(以下2000Bw)とNvidia A2のベンチマークを取ってみた。勉強になりました。
注意:あくまでも個人の結果ですので、参考までに。細かいところの爪が甘いのはご容赦を。
<結論>
○Blackwellはとても優秀!しかし2000Bw は70w上限のため、控えめ性能。
○A2は2000Bwの1/3程度の性能、A2中古価格も1/3程度のため、色々納得できる。60Wだがいろいろ検討していると思う。
○75wのGPUはやはり良いねー750W電源でも余裕の動作。排熱部は熱いけど、熱くない。
○公称能力よりも低い項目あり。なぜだ?
<使用PCスペック>
PC: Hp Z4 G4
CPU:W-2235 6core 12thread
RAM:128GB
SSD:2TB
Slot1: Nvidia A2+60mm fan(SANYO:9RA0612P4J001)
Slot3:Rtx Pro 2000 Blackwell
<ベンチマーク用スクリプト>
○gemini pro君たちに書いてもらいました。
○CUDA:13.2用pytorch
○Venv環境で実施
○計測内容等
-
マルチ精度演算の性能計測: CUDA CoreおよびTensor Coreを利用した各種精度(FP32, TF32, FP16, INT8)の演算速度を測定
。 -
リアルタイム監視: 演算実行中のGPU最高温度(℃)と平均消費電力(W)をバックグラウンドスレッドで自動記録
。 -
適応型動的バッチ処理: 事前に短いウォームアップを行い、指定したテスト時間(デフォルト5秒)に合わせて実行回数とバッチサイズを自動調整
。 -
正確なCUDA同期処理:
torch.cuda.Eventとsynchronize()を使用し、非同期処理による誤差を排除した正確な時間を計測 。
<訂正前の結果がオカシイ。>
○いろいろおかしいと感じたので、再度AI君と壁打ちの結果、スクリプトの修正点は以下の2点
※torch.cuda.set_device(device_id)を記載し、GPU指定を強固にした。
※A2用にRow-MajorからCol-Majorへの転置。
これはPyTorchの公式GitHubリポジトリ(Issue #165230)に記載がある模様。なお、2000BWはチップが自動で転地した模様。
<計測項目>
| 測定項目 | 計算内容 | 出力単位 | 主な利用用途・ターゲット |
| CUDA Core (FP32) |
32ビット浮動小数点 行列積 |
TFLOPS |
従来の汎用計算・グラフィックス演算 |
| Tensor Core (TF32) |
TensorFloat-32(PyTorch TF32有効化) |
TFLOPS |
Ampere世代以降のDeep Learning学習 |
| Tensor Core (FP16) |
16ビット半精度 浮動小数点行列積 |
TFLOPS |
AIモデルの高速学習・推論 |
| Tensor Core (INT8) |
8ビット整数行列積( |
TOPS |
量子化AIモデルのエッジ・高速推論 |
| VRAM Bandwidth |
要素ごとの加算処理( |
GB/s |
VRAM(GPUメモリ)の転送帯域幅 |
主要コンポーネント
-
VMLManager/NVMLMonitor: プロセス全体のNVML初期化・破棄を安全に管理し、別スレッドで0.2秒間隔で温度と電力を取得 。 -
measure_gpu_time_duration(): テスト関数を受け取り、ウォームアップ後に最適なバッチ数を算出して指定時間ループ実行 。 -
run_benchmark(): 各行列サイズ(デフォルト: 4096, 8192, 16384)ごとに全テストを実行し、計算結果を表形式で標準出力 。
<計測手順>
○GPU毎に個別計測を実施。
○GPU1テスト終了後、計測使用率低下を確認し、GPU1を実行。
<計算途中>


<結果>
NVIDIA RTX PRO 2000 Blackwell vs NVIDIA A2 性能比較表 (V5 最適化版)
GPU |
行列サイズ |
FP32(TFLOPS) |
TF32(TFLOPS) |
FP16(TFLOPS) |
INT8(TOPS) |
VRAM帯域(GB/s) |
温度(最大) |
平均電力W(最大) |
RTX PRO 2000 BW |
4096 |
9.37 |
25.95 |
37.59 |
93.75 |
252.54 |
61℃ |
70.0 |
RTX PRO 2000 BW |
6144 |
9.39 |
24.53 |
38.46 |
108.43 |
251.92 |
66℃ |
70.0 |
RTX PRO 2000 BW |
8192 |
10.61 |
23.15 |
37.89 |
103.15 |
249.80 |
72℃ |
69.9 |
A2 |
4096 |
2.77 |
8.05 |
15.71 |
29.65 |
189.62 |
55℃ |
60.4 |
A2 |
6144 |
2.77 |
8.12 |
15.80 |
30.07 |
190.19 |
60℃ |
59.8 |
A2 |
8192 |
2.76 |
8.12 |
15.85 |
30.27 |
190.36 |
63℃ |
60.2 |
<最後に>
○とても面白かった。ハードウェアの能力を使い切るのは知識が必要。思い知りました。
○同スクリプトがCUDA12.8でも動作したので、Teala P4でも試してみよう。
○(当然ながら)ぶん回せばtesla系は計算機として優秀と思う。
○パッシブGPUの冷却めっちゃ重要。数回目の正直のシュラウド設計は今回が一番良いかな。
○Z4 G4は良いPCだわ。
またこんど!













