GPUラックは置く前に計算する、電源・冷却・増設余地の事前設計

GPUサーバを搭載した高密度ラックのイメージ

GPUサーバのトラブルの多くは、機器ではなく「置き場所の条件」から始まります。

パイロットは、いきなり実機に乗りません。

旅客機のパイロットは、実際に飛ぶ前にフライトシミュレーターで何度も訓練します。現実ではやり直しのきかない状況を、先に安全な場所で経験しておくためです。GPUラックの設計もこれと同じです。機器を搬入してから「電源が足りない」「熱がこもる」と分かっても、やり直しには大きな手間がかかります。今回は、GPUラックを置く前に確かめておきたい条件を整理します。

1. なぜGPUラックは「先に計算」が必要なのか

GPUサーバは、一般的なサーバよりはるかに多くの電力を使い、そのぶん大きな熱を出します。1ラックで10kWを超える構成も珍しくありません。これまでのサーバと同じ感覚でラックに詰めると、次のような問題が起こります。

  • ラックに割り当てられた電力の上限を超え、予定した台数を載せられない
  • 冷却が追いつかず、GPUが性能を落として動く
  • 増設の余地がなく、次の機器を別のラックや別の施設に置くことになる

2. 置く前に確かめる5つの条件

条件確かめること
① 供給電力設置先のデータセンターで、ラックあたりに使える電力と電流の上限はいくらか
② 消費電力機器が実際に負荷をかけたときに、どれだけ電力を使うか(カタログの代表値ではなく実測値)
③ 冷却方式施設の冷却方式で、そのラックの発熱を処理できるか。気流の向きは合っているか
④ 配置何台をいくつのラックに分けるか。熱の偏りが出ない配置か
⑤ 増設余地数年後に増やす予定の台数を、同じ場所に置けるか

とくに⑤は、最初の設計でしか確保できない条件です。初期の台数だけでラックを埋めてしまうと、増設のたびに別の場所を探すことになり、ネットワークや運用が複雑になっていきます。

GPUの型番と台数が分かれば、必要な電力とラック本数の目安をお返しします。
対応範囲を見る →

3. 机上の計算と、実際の負荷のギャップ

たとえると

フライトシミュレーターで満点でも、実機で初めて分かることがあります。ラック設計も同じで、仕様書の数値で計算した結果と、実際に負荷をかけたときの消費電力や発熱には差が出ることがあります。だからこそ、机上の計算と実際の負荷試験は、対立するものではなく組み合わせるものです。

1
机上で計算
仕様と施設条件から構成案
→
2
実負荷で確認
搬入前にラック単位で電力をかける
→
3
実測値で確定
消費電力・発熱の記録を設計に反映

搬入前にラック単位で実際に負荷をかけて確認しておけば、現地で「計算と違った」という事態を防げます。実測値は記録として残り、稼働後の増設計画や障害対応でも参照できます。

4. 稼働中の環境に増設するときは

すでに動いている環境にラックや機器を追加するときは、稼働中の機器に影響を出さない手順を先に決めておくことが大切です。作業する時間帯、通る動線、触れてはいけない隣のラック。連休や夜間の作業枠を使う場合は、データセンターの入館手続きも含めて早めに計画します。

よくある質問

データセンターが決まっていなくても、ラック設計を相談できますか?

できます。GPUの型番と台数、想定する運用形態が分かれば、必要な電力とラック本数の目安を試算できます。設置先の候補が決まったら、その施設の条件に合わせて設計します。

負荷試験はどこで行うのですか?

グリットアーツでは、200坪・1,600A(200V)の自社テクニカルセンターで、10kWを超えるラックの負荷試験を複数同時に実施できます。

まとめ

GPUラックの設計は、「置いてから考える」ではなく「置く前に計算し、搬入前に確かめる」が鉄則です。電源、冷却、増設余地を最初の設計で押さえておくことが、GPU基盤を長く使い続けるための土台になります。

預かるのは、機器ではなく環境です

電源・冷却を含むラック環境の設計から、搬入前の負荷試験、構築、稼働後の保守と増設まで一貫して引き受けます。