CPUの信頼性試験とは?Vmin Shift問題に学ぶ「試験の前提」と経年劣化

半導体の信頼性試験は、出荷前に「10年使っても壊れないか」を数週間で見極める作業です。ところがCPUでは、その試験を通過した製品が出荷後に不安定化するという事例が実際に起きています。
2023年から2024年にかけてIntelの第13/14世代Coreで発生した不安定動作問題は、その典型でした。原因は製造不良ではなく、使われ方によって経年劣化が想定より速く進んだことにあります。
信頼性試験が保証するのは、試験時に想定した条件で使った場合の寿命でしかない。
本記事では、CPUの経年劣化メカニズム、実際に起きた事例、サーバーCPUが持つRAS機能、そして試験項目と装置を整理します。
CPUの寿命を削るもの
トランジスタは使うほど特性が変化します。主な劣化メカニズムは次のとおりです。
| 現象 | 内容 | 加速要因 |
|---|---|---|
| NBTI/PBTI | ゲート絶縁膜への電荷トラップで、しきい値電圧が変動する | 電圧・温度 |
| HCI(ホットキャリア注入) | 加速された電子が絶縁膜に入り込み特性を変える | 電圧・スイッチング |
| TDDB | 絶縁膜が時間とともに破壊に至る | 電圧・温度 |
| エレクトロマイグレーション | 電流で金属原子が移動し、配線が細る/断線する | 電流密度・温度 |
いずれも電圧と温度で加速します。信頼性試験がこの2つを軸にストレスをかけるのは、実使用の何年分かを短期間で再現するためです。
劣化は「動かなくなる」形では現れない
重要なのは、CPUの経年劣化がいきなり故障する形を取らない点です。特性がじわじわ変化し、まず安定動作に必要な最低電圧(Vmin)が上がっていきます。
設計時にはこの上昇分を見込んだ電圧マージンが確保されています。しかし劣化が想定を超えて進むと、マージンを食いつぶし、ある日から特定の条件でだけエラーが出るようになります。
この現れ方が、CPUの故障診断を難しくしています。
- 再現性が低い——負荷や温度が揃ったときだけ症状が出る
- 他の部品が疑われやすい——メモリや電源、ソフトウェアのせいに見える
- 徐々に悪化する——使い込むほど頻度が上がる
「買った当初は問題なかったのに、しばらく使ったら不安定になった」という訴えは、経年劣化がマージンを削った結果として説明がつきます。
【実例】第13/14世代CoreのVmin Shift問題
この「Vminが上がる」という現象が、実際の製品で表面化したのがIntelの事例です。
Intelは根本原因を次のように説明しています。
マイクロコードとBIOSコードが過大なコア電圧を要求し、特にアイドル時や軽負荷時にVmin shiftを引き起こす。より具体的には、IAコア内のクロックツリー回路が、高電圧・高温下での信頼性経年劣化に特に脆弱である
国内メディアの解説によれば、劣化したクロックツリー回路でクロックのデューティサイクルシフトが生じ、それがシステムの不安定につながっていました。
原因は1つではなかった
Intelは4つの動作シナリオを特定し、それぞれに対策を打っています。
| # | 要因 | 対策 |
|---|---|---|
| 1 | マザーボードの電力供給設定がIntelのガイダンスを超過 | Intel Default Settings の適用 |
| 2 | eTVBアルゴリズムが高温時でも高性能状態で動作させていた | マイクロコード 0x125(2024年6月) |
| 3 | SVIDアルゴリズムが高電圧を要求する頻度・持続時間 | マイクロコード 0x129(2024年8月) |
| 4 | アイドル・軽負荷時に過大な電圧を要求 | マイクロコード 0x12B |
0x12Bは0x125と0x129を包含する累積的な更新で、Intelは i9-14900K での内部テストにおいて性能への影響は実行ごとのばらつきの範囲内としています。またIntelは、モバイル版および将来の製品はこの問題の影響を受けないと明言しています。
対応としては、該当製品の保証期間が2年延長される措置も取られました。
この事例が示していること
技術的に注目すべきは、回路の設計そのものが誤っていたわけではない点です。問題は、その回路に想定を超える電圧が繰り返し掛かる動作条件が生まれてしまったことにありました。
試験は「こう使われるはず」という前提の上に成り立つ。前提が実使用とずれれば、寿命の見積もりもずれる。
ここから読み取れる論点は3つあります。
- 制御ソフト(マイクロコード)が信頼性を左右する——ハードウェアが同じでも、電圧の掛け方次第で劣化速度が変わる
- アイドル時も安全とは限らない——高負荷時ではなく、軽負荷時の電圧要求が問題だった
- 周辺の設定が寿命に影響する——マザーボード側が推奨値を超える電力設定をしていた
単体デバイスの試験だけでなく、システムとして組み上がったときの動作条件まで含めて評価する必要がある、ということです。
サーバーCPUのRAS機能
一方、止められないサーバー用途では「壊れない」だけでなく「壊れても気づき、続けられる」ことが求められます。これを担うのがRAS(Reliability/Availability/Serviceability)機能です。
| 機能 | 役割 |
|---|---|
| ECC | メモリのビット誤りを検出・訂正する |
| マシンチェック機構 | ハードウェアエラーを検出し、OSに報告する |
| 訂正可能エラーの記録 | 訂正できた誤りも記録し、故障の予兆として扱う |
| ミラーリング・縮退運転 | 故障箇所を切り離して運用を継続する |
特に重要なのが訂正可能エラーの監視です。訂正できている間は動作に支障がありませんが、その発生頻度が上がっていれば劣化が進んでいる証拠になります。壊れる前に交換するための材料です。
ただしRASにも限界があります。エラーとして検出されずに誤った計算結果が出るSDC(サイレントデータ破損)は、この枠組みでは捕捉できません。大規模インフラでのSDCはGPUの信頼性試験でも触れたとおり、演算そのものの誤りであるためECCの対象外です。
SDCはCPUで先に問題化した
SDCが業界の課題として認識された発端は、GPUではなくCPUを大量に並べたデータセンターでした。Metaは自社インフラでの調査結果を論文として公開し、一部のCPUコアが特定の条件でのみ誤った計算結果を返す事例を報告しています。
厄介なのは、その振る舞いです。
- 常に間違うわけではない——特定の演算・温度・電圧のときだけ誤る
- 製造テストは通過している——出荷時点では検出されなかった
- コア単位で発生する——同じCPUでも特定のコアだけが疑わしい
「壊れている」と「正常」の中間に、「たまに間違えるが、動き続ける」という状態が存在するわけです。従来の合否判定型の試験は、基本的にこの中間状態を想定していませんでした。
経年劣化との関係も指摘されています。マージンが削られていけば、以前は正しく動いていた条件で誤り始める可能性があるためです。Vmin Shiftのような劣化とSDCは、地続きの問題として捉えられます。
試験項目と装置
基本となる試験はJEDECのJESD22シリーズで、HTOL(高温動作寿命、JESD22-A108)、温度サイクル(A104)、HAST(A110)などが共通します。詳細は信頼性試験の基本で整理しています。
CPUで特に重視されるのは次の点です。
| 試験 | 目的 |
|---|---|
| HTOL | 高温・高電圧で通電し、経年劣化を加速して寿命を推定する |
| バーンイン | 初期不良を出荷前に顕在化させる |
| 電圧・周波数マージン試験 | Vminを実測し、劣化後も余裕があるか確認する |
| パワーサイクル | ON/OFFの繰り返しによる熱応力を評価する(JESD22-A105) |
使用する装置は、ストレスを与える側と測る側に分かれます。
- バーンイン装置:加熱しながら通電する。多数個を同時投入するため、専用ボードと大容量電源が要る
- 恒温槽・温度サイクル試験装置:温度ストレスを与える
- 冷熱衝撃装置:急激な温度変化で接合部を評価する
- LSIテスター:試験前後の電気的特性を測定する。Vminの変化を追うのもここ
- 電源・負荷装置:電圧を細かく振ってマージンを測る
Vmin Shiftのような劣化を捉えるには、「動くか動かないか」ではなく「どこまで電圧を下げても動くか」を測る必要があります。合否判定ではなく、マージンの変化量を見るのがCPU評価の要点です。
まとめ
- CPUの劣化はNBTI/HCI/TDDB/エレクトロマイグレーションが主因。電圧と温度で加速する
- 劣化は突然の故障ではなく、Vmin(安定動作に必要な最低電圧)の上昇として現れる
- Intelは第13/14世代Coreの問題について、IAコア内のクロックツリー回路が高電圧・高温下の経年劣化に脆弱だったと説明している
- 要因は4つあり、マイクロコード0x125/0x129/0x12Bで段階的に対処された
- 問題は回路設計ではなく電圧の掛け方(制御ソフトと周辺設定)にあった
- つまり試験の前提が実使用とずれれば、寿命の見積もりもずれる
- サーバーではRAS機能が要。訂正可能エラーの頻度は故障の予兆として使える
- ただしSDCはRASでも捕捉できない
- CPU評価では合否ではなくマージンの変化量を測る
- SDCはCPUを並べたデータセンターで先に問題化した。製造テストを通過した個体が特定条件でのみ誤る
CPUの信頼性は、シリコン単体ではなくマイクロコード・電源設計・冷却まで含めたシステム全体で決まります。各社の設計思想の違いが、こうした部分にも表れています。
参考にした主な調査・資料
- 第13/14世代Core不安定動作の根本原因が判明。新たなマイクロコードを公開(PC Watch)— Intelが公表した根本原因、クロックツリー回路の劣化とデューティサイクルシフト、4つの動作シナリオとマイクロコード対応
- Intel、第14/13世代Coreの保証期間を2年延長(PC Watch)— 保証延長措置
- Silent Data Corruptions at Scale(arXiv/Meta)— 大規模インフラにおけるSDCの実態
※本文中のJEDEC規格番号(JESD22-A104/A105/A108/A110)は各規格の公開情報に基づきます。規格本体の閲覧にはJEDECへの登録が必要です。














