
HOME / AI INFRASTRUCTURE / GPU MAINTENANCE
02 / AI Infrastructure — GPU Third-Party Maintenance
メーカーの保守が終わっても、GPUは終わらない。
GPUサーバは、導入から3年でメーカー保守の期限を迎えることがあります。 機器はまだ動いていて、現場はまだ使いたい。その間を埋めるのが、当社の第三者保守です。 メーカーも購入元も問わず、稼働中のGPU基盤をそのまま引き受けます。
Background & Scope
使えなくなったのではなく、見る人がいなくなっただけ。
GPUサーバは世代交代が速く、一般的なx86サーバより早く保守の終わりが来ます。 導入から3年で延長を断られる例も出ています。機器は正常に動いていても、 壊れたときの受け皿がない。更新予算はすぐには取れない。 当社は特定メーカーの代理店ではなく、複数の製造元と直接の取引口座を持つ独立系として、 ブランドをまたいでこの受け皿を引き受けます。
受入診断
保守契約の前に、機器の現況を確認します。構成とファーム世代、GPUの訂正エラー履歴、温度と電力の傾向を記録し、引き受けられる範囲を確定させます。当社が納入した機器でなくても構いません。
GPU健全性の記録
実負荷での検証
引受可否の判定
保守設計
診断の結果をもとに、保守レベル、対応時間帯、除外範囲、部材の手当て方法を設計します。何をどこまで約束できるかを、契約前に文書で明確にします。
対応時間・目標復旧
除外範囲の明示
部材計画
保守提供
GPU、電源ユニット、ファン、ストレージ、マザーボードの障害に対応します。全国の保守拠点網から現地へ伺い、切り分けから復旧までを一括で引き受けます。作業内容は報告書として残します。
オンサイト対応
切り分け・復旧
月次レポート
増設・移設・出口
保守の延長中に発生するラック追加、機器の入れ替え、データセンター間の移設に対応します。更新の時期を迎えた機器は、下取りと撤去まで含めてご相談いただけます。
機器の入れ替え
DC間移設
撤去・下取り
Service level
部品が出るかどうかで、約束できることは変わる。
GPUは高価で、市場に常時出回る部材ではありません。 だから当社は、どの機器にも一律で「必ず直します」とは申し上げません。 部材をどう手当てするかで保守を3つに分け、リスクを誰が持つかを契約の前に決めます。 この分け方があるから、メーカー保守が終わった機器でも現実的な条件でお引き受けできます。
LEVEL 1 / 縮退運用保守
壊れた資源を切り離し、残りで動かし続ける
故障したGPUを構成から外し、残る資源で稼働を継続させます。部材の交換を前提としないため、費用を抑えられます。ジョブ単位で資源を割り当てる研究用クラスタや、冗長構成の推論基盤に適しています。
LEVEL 2 / 預託部材保守
お客様の予備機を、当社が管理して使う
お客様が保有する予備機や予備部材をお預かりし、そこから供給して交換します。市場調達の不確実性を持ち込まずに、実質的なフル保守を提供できます。残数は月次でご報告し、規定を下回った時点で協議します。
LEVEL 3 / 調達保守
当社が部材を探し、検証してから載せる
国内外の二次市場から当社が部材を調達します。入手した部材は川口テクニカルセンターで実負荷試験を行い、確認できたものだけを現地に投入します。納期は確約ではなく目標値としてご提示します。
GPUの実装方式によって、交換の単位は大きく変わります。基板に直付けされたSXM構成では、 1基だけが故障してもGPU単体での交換ができず、ベースボード一式が交換単位になります。 この場合、費用と納期の観点からLEVEL 1が現実的な選択になることが多く、当社は それを妥協ではなく正式なメニューとして、手順と報告様式まで含めてご提供します。 対象機器がSXMかPCIeかは、ご相談の最初に確認させてください。
Assessment
素性のわからない機械を、そのまま引き受けない。
お引き受けする機器は、当社が納入したものとは限りません。 中古で調達されたGPU、増設を重ねて世代が混在した環境、購入元がすでに撤退している機器もあります。 だから保守契約の前に、必ず現況を確認します。稼働してから 「それは元からの不具合でした」と申し上げずに済むようにするためです。
現況を記録する
構成、シリアル、ファーム世代を確認し、GPUの訂正エラー履歴、代替済み領域の残量、過去の脱落記録、温度と消費電力の傾向を取得します。この記録が、後の責任範囲の基準になります。
実際に負荷をかける
200坪・1,600A(200V)の川口テクニカルセンターで、10kWを超えるラックに実負荷をかけて確認します。多GPU構成のノードを実負荷で回せる検証環境を自社で持つ保守会社は、多くありません。
引受可否を判定する
標準引受、条件付引受、引受不可の3つでお返しします。お引き受けできない場合も、その理由と、どこを手当てすれば引き受けられるかを併せてご報告します。
診断は保守契約とは独立してご依頼いただけます。更新の判断材料として、あるいは 中古で調達された機器の状態確認としてもご利用いただいています。 報告書には測定値と判定根拠を記載し、社内稟議や上位の元請け様への説明にそのままお使いいただける形式でお渡しします。
Cases
メーカーが違っても、窓口はひとつにできます。
GPU基盤は、増設を重ねるうちに製造元が混在します。契約が分かれ、対応時間が揃わず、 障害のたびにどこへ連絡するかを機種で判別することになります。 製造元をまたいで1本の契約にまとめられることが、独立系である当社の役割です。
研究用GPUクラスタ
導入から3年でメーカー保守の延長を断られた8GPU構成のサーバについて、元請けのシステム会社様経由でご相談。SXM構成であることを踏まえ、縮退運用を前提とした保守を設計しました。
研究施設 24台構成
保守終了後のGPUサーバ24台について、予備機からの部材活用を含めた保守をご相談。故障判定、記録、取り外し部材の扱い、作業報告書の様式まで、責任分界を契約書に明記しました。
調達元が異なる構成
本体とGPUの調達元が異なり、メーカー保守が付いていない機器について、商社様経由でご相談。受入診断で現況を確定させたうえで、市場調達を含む保守としてお引き受けしました。
いずれも、当社が販売した機器ではありません。他社が納入した機器を全国で保守することは、 当社が創業以来続けてきた事業そのものです。第三者保守の累計対応台数は50,000台を超えています。
Contact
保守が切れる日を、お知らせください。
メーカー名、型番、台数、保守の終了時期。この4点だけで、対応可否と保守レベルの目安をお返しします。すでに保守が切れている機器、購入元が対応できなくなった機器のご相談も承ります。