堀は崩れていない。堀の外に、城が建っている。
CUDAの堀は4つある。崩れたのは一番浅い層だけで、深い層は手つかずだ。
CUDAの堀は4つある。崩れたのは一番浅い層だけで、深い層は手つかずだ。
第2話で書いた。
CUDAの堀とは、技術の差ではなく、積み上がった時間の差だと。
2026年、その堀が「崩れ始めた」という記事が、急に増えている。
AMDが追いついた。
Googleが自分でチップを作っている。
中国が国産化を進めている。
どれも、事実に基づいてはいる。
でも、こうした記事には、一つ、共通の雑さがある。
「CUDAの堀」を、一つのかたまりとして扱っていることだ。
実は、堀は一つじゃない。
性質のまったく違う4つの堀が、重なっている。
そして、層ごとに、状況がぜんぜん違う。
ある層は、もう崩れている。
ある層は、無傷のままだ。
だから「崩れた」も「無傷だ」も、どちらも部分的に正しい。
どの層を見ているかで、答えが変わる。
この記事では、4つの層を分けて、一つずつ採点する。
結論を先に言うと
崩れたのは一番浅い層だけで、深い層は手つかず。
そして本当に起きているのは、堀が埋まることではなく、
別の場所に、掘り直されることだ。
堀を、4つに分解する
まず、NVIDIAの強さを支えている4層を整理する。
城の堀を、外側から内側へ、順に見ていくイメージ。
- 第1層:言語・API層
CUDAという「書き方」そのもの。プログラムからGPUの機能を呼び出すための、窓口。 - 第2層:ライブラリ層
20年かけて積み上げられた、最適化済みの部品群。第2話で書いたcuDNNや、その仲間たち。 - 第3層:通信層
何百、何千のGPUをつないで、一つの巨大なモデルを動かす仕組み。NCCL(エヌシーシーエル)、NVLink(エヌブイリンク)という技術。 - 第4層:供給網層
HBM(AI用の超高速メモリ)と、CoWoS(チップを立体的に貼り合わせる先端技術)の生産枠。技術ではなく、「作れる量」の話。
「CUDAが強い」と言うとき、多くの人が思い浮かべるのは、第1層だ。
でも
第1層は、この中で一番弱い。
第1層:言語・API もう崩れている
CUDAで書いたプログラムを、他社のGPUで動かす。
これ自体は、もう難しくない。
AMDには「HIP(ヒップ)」という仕組みがあり、
CUDAのコードを、ほぼそのまま変換できる。
中国のMoore Threads(ムーア・スレッズ)の「MUSA(ムーサ)」は、
CUDAの窓口とほぼ1対1で対応するように設計されている。
「Musify」という付属ツールが、自動で変換する。
つまり、「書き方」の壁は、技術的にはとっくに越えられている。
面白いのは、NVIDIA自身が、この層の弱さを分かっていることだ。
NVIDIAは2021年から、利用規約に一つの条項を入れた。
「CUDA向けに作られたソフトを、他社のチップで動かす変換の仕組み(翻訳レイヤー)を使ってはならない」と。
技術で守れないから、契約で守っている。
実際に効いた例もある。
AMDが資金を出していた「ZLUDA」という翻訳プロジェクトは、その後、打ち切られた。
訴訟のリスクが、理由の一つと推測されている。
でも、考えてみてほしい。
米国企業の利用規約を、中国国内の企業に守らせる実効性は
ほぼ、ない。
採点:崩落済み。ただし、ここが崩れても大勢に影響しない。
なぜ影響しないのか。
それは、第2層を見ればわかる。
第2層:ライブラリほぼ無傷
本丸は、ここだ。
第2話で書いた通り、CUDAの本当の価値は「書き方」じゃない。
その上に、20年かけて積み上がった部品群にある。
cuDNN、TensorRT、FlashAttention、量子化の部品
これらは全部「CUDA向けに最初に書かれ、CUDA上で徹底的に磨かれた」ものだ。
言語を真似ることはできる。
でも、20年分の磨き込みは、真似できない。
ここで、一つ公平に言っておきたい。
AMDのROCm(ロックエム)は、確かに進歩した。
ある検証では、AMDのMI300Xで、
中規模モデルの学習がCUDA比94%の速度に達した。
70Bクラス(700億パラメータ)の大型モデルでも、差は8%程度だったという報告がある。
数字だけ見ると、もう並んだように見える。
でも、残った差の「中身」が問題だ。
残った差は、モデルの中核であるAttention(注意機構)まわりに集中している。
その参照実装であるFlash Attention 2は、CUDA専用だ。
AMD側の対応は進んでいるが、条件の組み合わせ(因果マスク、位置エンコーディング、ウィンドウ幅……)で、一歩遅れる。
つまり、こうだ。
「ROCmでFlash Attentionは動く」は、一部の構成については正しく、別の構成については正しくない。
そして、最先端の研究で必要になるのは、たいてい後者のほうだ。
「平均では追いついた。でも、端の条件で崩れる。」
これが、20年の蓄積の差の、正確な現れ方だ。
平均値では見えない。
一番難しい場面で、初めて差が出る。
採点:ほぼ無傷。
第3層:通信いま一番熱い主戦場
ここが、最も見落とされている層だ。
現代のAIは、GPU1枚では動かない。
何百、何千枚をつないで、一つの巨大な計算機として動かす。
そのために、GPU同士が高速で通信する必要がある。
その通信を担うのが、NVIDIAの「NCCL」と「NVLink」だ。
問題は、ここだ。
NVIDIAのNCCLと、AMDの「RCCL」には、互換性がない。
つまり
ソフト側の移行を完全に終えたチームでも、
複数メーカーのGPUが混ざったクラスタで学習を始めた瞬間、
NCCL依存が復活する。
第1層と第2層を越えても、第3層で止まる。
動きは出てきている。
2026年1月に登場した「HetCCL」は、この通信層を共通化する、初めての現実的な候補と見られている。
そして、ハード側では
NVIDIAが遅れている、数少ない場所でもある。
Broadcom(ブロードコム)の「Tomahawk 6」は、業界初の102.4Tbps(テラビット毎秒)のイーサネットスイッチとして、2026年3月に量産に入った。
一方、NVIDIAの対抗製品「Spectrum-X1600」の量産は、2026年後半とされている。
NVIDIAが、他社の後を追う。
1年前なら、考えられなかった構図だ。
採点:勝負がついていない。今後1〜2年で、最も動く層。
第4層:供給網誰も回避できない
最後の堀は、技術ではない。
生産枠だ。
どれだけ優秀な計算チップを設計しても、
それを動かす超高速メモリ(HBM)がなければ、性能は出ない。
そして、チップとメモリを立体的に貼り合わせる先端技術(CoWoS)の生産能力も、限られている。
この二つを、誰が、どれだけ確保できるか。
中国のメモリ大手CXMTは、
AIに使えるHBMの生産能力が月産5,000枚程度にとどまり、
次世代HBMの量産スケジュールは、繰り返し先送りされていると報じられている。
この層は、エンジニアリングで解決できる部分が小さい。
資本と、交渉力と、時間の勝負だ。
挑戦者にとって、最も冷酷な壁である。
採点:無傷。しかも、努力で埋まりにくい。
4層とも、正面からは崩れていない
ここまでの採点を並べる。
- 第1層(言語)崩落済み。だが影響は小さい。
- 第2層(部品)ほぼ無傷。
- 第3層(通信)主戦場。勝負はついていない。
- 第4層(供給網)無傷。
正面から見れば、堀は崩れていない。
にもかかわらず
「NVIDIAの優位が揺らいでいる」という感覚には、根拠がある。
なぜか。
戦っていないところで、削られているからだ。
堀を渡らない者たち
数字を見てほしい。
調査会社TrendForceの予測では、
2026年のカスタムASIC(特定用途向けに専用設計されたチップ)の出荷は、約45%増。
対して、GPUの出荷は約16%増。
専用チップのほうが、3倍近い速さで伸びている。
GoogleのTPU(Googleが自社設計したAI専用チップ)は、
2026年に430万個の出荷見込みで、2028年には3,500万個超へ。
Metaは、2026年に最大1,350億ドルをAIインフラに投じる計画で、
その柱に自社チップ「MTIA」を据えている。
なぜ、これが効くのか。
理由は、単純だ。
専用チップは、CUDAを使わない。
4つの堀のうち、3つを
そもそも渡らずに、済ませている。
堀を越える必要がない。
堀の外に、自分の城を建てている。
「学習はNVIDIA、推論は自社チップ」
ここで、2026年の一番大きな構造変化を、書いておきたい。
AIには、大きく二つの仕事がある。
- 「学習」大量のデータからモデルを作る、重い作業。
- 「推論」できたモデルを使って、実際に答えを出す作業。
これまでは、両方をNVIDIAのGPUでやっていた。
でも今、推論の比重が急激に増えている。
ChatGPTに質問するたび、画像を生成するたび、それは全部「推論」だ。
ある調査では、2026年にはAIデータセンターの計算力の3分の2が推論に使われるという。
そして推論には、専用チップが向いている。
学習は、いろんな試行錯誤が必要で、柔軟なGPUが有利だ。
でも推論は、決まったモデルを繰り返し動かすだけなので、
その処理に特化した専用チップのほうが、電力も、コストも、安く済む。
だから、巨大IT企業は、こう動き始めた。
「学習はNVIDIAで。推論は自社チップで。」
Googleは、その完成形に近い。
TPUの次世代では、学習用と推論用で設計パートナーを分け、
推論用はコストを20〜30%下げる方向に振っている。
買う側が、作る側に回る。
最も静かで、最も効く、切り崩し方だ。
ただし、大きな落とし穴がある
ここで終わると、
「専用チップがNVIDIAを倒す」という、よくある結論になる。
でも実際は、もう少し皮肉だ。
専用チップも、新しい堀を掘っている。
GoogleのTPU向けに、JAXやTensorFlowという道具で最適化したコードは、
他のチップへの移行に、高いコストがかかる。
導入が進むほど、離れにくくなる。
これはCUDAがNVIDIAに対してやったことと、構造的にまったく同じだ。
つまり、今起きているのは「CUDAからの解放」ではない。
「堀の分散」だ。
NVIDIAという一つの城の堀が、
Google、Meta、Amazonそれぞれの城の堀に、分かれていく。
開発者の自由という意味では、正直、ほとんど改善していない。
一つの囲いから、複数の囲いに変わっただけだ。
そして、もう一つの皮肉
さらに面白い分析がある。
専用チップは、NVIDIAを「置き換えている」のではなく、
AI半導体の市場そのものを、広げているだけ
という見方だ。
これまでGPUでは採算が合わなかった処理が、
専用チップなら成立するようになった。
その分、パイそのものが大きくなっている。
だから、こういう奇妙な状態が起きている。
NVIDIAのシェアは、下がっている。
NVIDIAの売上は、上がっている。
「シェア低下」と「売上増加」が、同時に成立している。
2026年7月時点で、NVIDIAの時価総額は約5兆ドル。世界一のままだ。
「NVIDIAは終わった」も、「NVIDIAは無敵だ」も、
どちらも、この現実を説明できない。
結論:堀は崩れていない。掘り直されている
4層で採点した結果を、もう一度。
- 言語・API 崩落済み(ただし影響は小さい)
- ライブラリ ほぼ無傷
- 通信 主戦場。勝負はついていない
- 供給網 無傷
堀は、崩れていない。
でも、堀の外に、新しい城が次々と建っている。
そして、NVIDIAが本当に失う可能性があるのは、
技術的な優位というより
「全部これで済む」という、便利さのほうだ。
かつては、AIをやるならNVIDIA一択だった。
考える必要すらなかった。
今は、買う側が考え始めている。
「学習はNVIDIA、推論は自社ASIC」と、使い分けを。
一択が、選択になった。
その時点で、独占の性質は、変わっている。
ここまでは、西側の話だ
第3話で見てきたのは、
米国を中心とした、西側の競争の話だ。
AMD、Google、Meta、Broadcom
みんな「効率」という同じ土俵の上で、NVIDIAと競っている。
ワットあたりの性能。チップあたりの性能。そのための微細化。
しかし、まったく別の関数で戦っている国がある。
効率を捨てて、物量と電力で殴りにいく国だ。
輸出規制で、最新のチップが買えない。
最先端の製造装置も、手に入らない。
その制約の中で、その国は
堀を越えるのではなく、隣に、まったく別の城を建て始めている。
次回は、そちらを見る。