データセンター向けGPUは、半導体のなかでも信頼性の要求が特異な部類に入ります。理由は3つあります。

  • 消費電力が桁違い:1個で700Wを超える製品が珍しくない
  • 止まらない:24時間365日、数か月にわたって高負荷が続く
  • 数が多い:1つのクラスタに数千〜数万個が並ぶ

そして、この3つが揃うと単体では無視できるほど稀な故障が、確実に起きる現象に変わります。

さらに厄介なのは、出荷前の信頼性試験をすり抜ける故障が存在することです。

エラーも出さず、クラッシュもせず、計算結果だけが間違っている

本記事では、GPUに固有の信頼性課題と試験項目、使用する装置、そして試験では捕まえられない故障について整理します。

GPU固有の3つの負荷

まず、GPUが受けるストレスが他の半導体とどう違うかを押さえます。

① 電力密度

ハイエンドのAI向けGPUは、パッケージ単体で数百W〜1kW級の電力を消費します。これは発熱がそのまま信頼性の問題になることを意味します。

シリコンの経年劣化は温度に強く依存します。エレクトロマイグレーション(金属配線中の原子が電流で移動する現象)、TDDB(絶縁膜の経時破壊)、NBTI/PBTI(トランジスタ特性の経時変動)——いずれも高温で加速します。

② 熱サイクル

AIワークロードは負荷が激しく変動します。学習ジョブが走れば全コアが一斉に高負荷になり、終われば一気に下がる。これが繰り返されると、チップとパッケージ、パッケージと基板の間で熱膨張の差による応力が生じます。

素材ごとに熱膨張係数(CTE)が違うため、温度が上下するたびに接合部が引っ張られたり押されたりします。これが積み重なると、はんだ接合の疲労破壊やクラックにつながります。

③ 積層・大面積パッケージ

現代のAI向けGPUは、単体のチップではありません。HBMCoWoSのような先端パッケージで同一基板上に統合した、複合構造体です。

構造信頼性上の懸念
TSV(シリコン貫通電極)積層されたDRAM間の接続。熱応力による断線
マイクロバンプ微細な接合。数が膨大で、1点の不良が致命的になりうる
大面積インターポーザ面積が大きいほど反り(warpage)が出やすい
異種材料の積層CTEの違いによる応力集中

チップ単体が健全でも、接合部が壊れれば製品としては故障です。GPUの信頼性がパッケージ技術と不可分なのはこのためです。

出荷前に行う信頼性試験

基本となる試験項目は半導体共通で、JEDECのJESD22シリーズが土台になります。HTOL(高温動作寿命、JESD22-A108)、温度サイクル(JESD22-A104)、HAST(JESD22-A110)などです。個別の内容は信頼性試験の基本で整理しています。

そのうえで、GPUでは次の点が特に重視されます。

試験GPUでの意味
バーンイン初期故障の除去。高温かつ高電力で通電する必要があり、電源容量と冷却能力が要る
パワーサイクル通電のON/OFFを繰り返す。実運用の負荷変動に近い。JESD22-A105
温度サイクル接合部の疲労を見る。積層構造では特に重要
高温動作寿命(HTOL)経年劣化の加速評価
実負荷試験実際のワークロードを流し、電力・温度・性能の変動を確認する

試験に使う装置

装置はストレスを与える側測る側に分かれます。GPUの場合、前者に強い制約がかかります。

  • バーンイン装置:加熱しながら通電する。GPUでは1台あたりの消費電力が大きく、大電流電源と強力な排熱が必須になる
  • 恒温恒湿器・温度サイクル試験装置:温度ストレスを与える。大型のチャンバーが要る
  • 冷熱衝撃装置:急激な温度変化で接合部を評価する
  • 電源・負荷装置:数百Aクラスの電流を安定供給する
  • 冷却系:試験中の熱を逃がす。近年は液冷を前提とした試験環境も必要になる

測る側では、LSIテスターによる電気的特性の測定に加え、X線・超音波探傷(SAT)による非破壊での接合部観察が使われます。積層構造の内部は分解せずに見るしかないため、これらの検査装置の役割が大きくなります。

GPUの信頼性試験は、「試験装置側の電力と冷却が足りるか」という物理的な制約とセットで語られる。

【核心】試験をすり抜ける故障 — SDC

ここからが本題です。上記の試験をすべて通過した個体でも、運用中に検出されない誤りを出すことがあります。これがSDC(Silent Data Corruption:サイレントデータ破損)です。

研究論文では次のように定義されています。

ハードウェアが明示的な故障信号なしに、間違った計算を無言のうちに出力するエラー

クラッシュもせず、エラーログにも残らず、ただ計算結果だけが間違っている。異常として観測されないため、発生した事実にすら気づけないのが最大の問題です。

実際にどれくらい起きているのか

大規模な学習で観測された報告があります。

事例観測結果
Meta(Llama 3 405B の訓練)54日間の事前学習期間中、SDCが原因とされる計画外のジョブ中断が6件
Google(Gemini の訓練)SDCイベントが1〜2週間ごとに1回発生していたと推定

注目すべきは、これが「中断として観測できた分」にすぎない点です。学習が止まらずに進んだSDCは、そもそもカウントできません。

なぜ既存の検出機構で捕まえられないのか

メモリのECCがあるではないか、と思われるかもしれません。しかしECCが守るのは記憶されたデータであって、演算そのものの誤りではありません。

ソフトウェア側でも、ABFT(Algorithm-Based Fault Tolerance:アルゴリズムに検算を組み込む手法)という対策が研究されてきました。しかし前掲の論文は、LLM訓練において実用的な検出率に達しなかったとし、理由を次のように整理しています。

  • SDCによる誤差が浮動小数点の誤差範囲に収まってしまうため、正常な計算誤差と区別できない
  • 計算の外側で発生するSDCがある(検算の対象にならない)
  • bfloat16のような低精度データ型ではABFTの理論的前提が崩れる

低精度演算はAI向けGPUの性能を支える技術ですが、誤りの検出を難しくする側面も持つということです。

なぜ大規模化すると顕在化するのか

SDCは新しい現象ではありません。変わったのは規模と時間です。

1個あたりの発生確率が極めて低くても
  × 数万個のGPU
  × 数か月の連続稼働
  = 必ず遭遇する

従来、1台のサーバーで数日動かす用途なら、生涯遭遇しない確率の事象でした。ところが数万個を数か月止めずに回すとなれば話が変わります。稀な事象が、運用上の日常になります。

これは信頼性工学の考え方そのものです。個体の信頼性が同じでも、システム全体の信頼性は個数が増えるほど下がる。GPUクラスタはその極端な例といえます。

数字で見ると分かりやすい

1台でも止まれば学習ジョブに影響が出る構成(直列システム)では、全体の平均故障間隔は個数で割り算になります。

システムのMTBF = 1個あたりのMTBF ÷ 台数

仮にGPU 1個のMTBF(平均故障間隔)を100万時間——およそ114年に1回しか壊れない、極めて高信頼な部品だとして計算してみます。

台数システム全体で見た故障間隔
1個約114年に1回
1,000個約41日に1回
10,000個約4.2日に1回
50,000個約20時間に1回

部品としては114年に1回しか壊れないのに、1万個並べれば4日に1回、5万個なら1日1回近く「どこかが壊れる」ことになります。※MTBFは仮定値で、実際の値は製品や条件で異なります。

大規模クラスタでチェックポイントと自動復旧が必須とされるのは、この算術が理由です。故障を防ぎきることはできない以上、止まっても短時間で復帰できる設計のほうが現実的になります。

試験だけでは閉じない — 運用側の備え

出荷前の試験で全数のSDCを排除することは、現実的には困難です。そのため対策は運用側にも置くのが前提になります。

対策
デバイスECC、RAS機能(エラーの検出・報告・回復)、劣化の監視
システム定期的な健全性チェック、疑わしいノードの隔離
アプリケーションチェックポイント(定期保存して巻き戻せるようにする)、結果の妥当性検証

設計面では、故障を前提に冗長性を持たせる考え方もあります(冗長回路)。試験で選別し、設計で耐え、運用で検知する——この三段構えが、大規模GPU運用の実際です。

まとめ

GPUの信頼性について、要点を整理します。

  • GPU固有の負荷は電力密度・熱サイクル・積層パッケージの3つ
  • AIワークロードは負荷変動が激しく、接合部に繰り返し応力がかかる
  • HBMやCoWoSを含む構造では、TSV・マイクロバンプ・反りが信頼性の焦点
  • 試験項目はJEDEC共通だが、バーンインに必要な電力と冷却が装置側の制約になる
  • 積層構造の内部はX線・超音波探傷で非破壊観察する
  • SDCは試験をすり抜ける。エラー信号を出さずに計算結果だけが誤る
  • Metaは54日間で6件、Googleは1〜2週間に1回のSDCを報告している
  • ECCは記憶データを守るが演算の誤りは守らない。ABFTも低精度演算では機能しにくい
  • 個体の確率が低くても数万個×数か月なら必ず起きる

GPUの信頼性は、出荷前の試験だけで完結しません。「壊れないように作る」と同時に「壊れても気づける仕組みを持つ」ことが、AIインフラを支える条件になっています。

なお、SDCという現象自体はCPUを大量に並べたデータセンターで先に問題化しました。CPU側の経年劣化と信頼性についてはCPUの信頼性試験で、実際に起きたVmin Shift問題とあわせて整理しています。

参考にした主な調査・資料

※本文中のJEDEC規格番号(JESD22-A104/A105/A108/A110)は各規格の公開情報に基づきます。規格本体の閲覧にはJEDECへの登録が必要です。