AI半導体
推論チップの内製化——OpenAIも自前ASICを発表
計算資源を買う側に徹してきた OpenAI が、ついに自前のチップを出した。6月24日に公開された Jalapeño は、Broadcom と組んだ初の独自チップで、LLM の推論(inference)に特化した設計だ1。ただし公式が示す性能は「早期テストで電力あたり性能が現行の最先端より大幅に良い」までだ。よく引かれる約5割のコスト削減は公式発表ではなく、Broadcom の CEO が Bloomberg に語ったとして報じられた数字だ1。Google・Amazon・Microsoft・Meta も自前チップを持つか開発を公表しており、OpenAI はその側に回った2。ただし、これを「推論が NVIDIA の GPU から専用チップへ置き換わる」と読むのは早い——推論が2026年に AI 計算の約3分の2を占めるという当の予測を出した Deloitte 自身が、その読みを名指しで否定している3。
何が発表されたか
Jalapeño は OpenAI にとって初の独自シリコンで、汎用ではなく推論のために設計された点が肝だ——カーネル、メモリの動き、ネットワーク、モデルの配信パターンといった推論で効く部分に最適化したという。初期設計から製造テープアウトまで約9か月と速く、自社の AI モデルの助けを借りたとしている1。
数字は早期段階の主張として読むべきものだ。公式が挙げるのは電力あたり性能の優位だけで、他社チップとの比較値は無い。「主要な AI アクセラレータ並みの電力と処理量に、専用の推論システムに近い遅延を」というくだりも、達成ではなく目標として書かれている。約5割のコスト削減も、比較対象・測定指標・ワークロードの条件は示されていない1。
読み違えやすいのは時期のほうだ。 初期展開が2026年末というのは公式の表現だが、Broadcom の CEO は発表当日、2026年後半にあるのは「小規模な試作開発」で、本格的な立ち上がりは2027年、フル稼働は2028年前半だと語っている4。2026年末に実機が広く回るという話ではない。
顔ぶれはすでに揃っている
Jalapeño は「点」ではない。Google は2026年4月、第8世代の TPU で学習用と推論用をチップごと分離し、推論専用の TPU 8i を出した。Microsoft は2026年1月に第2世代の AI チップを、Meta は Broadcom と複数版の AI プロセッサを開発中だと公表している2。Amazon は2025年末の re:Invent で Trainium3 UltraServers の提供を発表し、Amazon Bedrock の本番ワークロードがすでに Trainium3 上で動いていると書いている5。自前設計のアクセラレータで本番の推論を回すことは、もう構想ではない。
そのうえで、NVIDIA を置き換えた企業はまだ無い。第8世代 TPU を報じた記事は、Google が新チップを NVIDIA 製品と比較すらせず自社の前世代を基準に語っていることを指摘し、巨大テック各社のいずれも NVIDIA を置き換えてはいない、と書いている2。
「推論が2/3」は「GPUの置き換え」を意味しない
この流れの背景としてよく引かれるのが、AI 計算に占める推論の割合が2023年の約3分の1、2025年の約半分から2026年に約3分の2へ達するという Deloitte の予測だ3。だが、この数字を出した記事そのものの主題は「AI の次の局面は、より少ない計算力ではなく、より多くの計算力を要するだろう」である3。
同記事はまず、推論への移行は「推論だけに最適化した(おそらくずっと安い)チップ」で足り、データセンターも小さく少なくて済むのではないか、という読みを紹介する。そのうえでDeloitte はやや違う見方をすると続ける——推論特化チップの市場は2026年に500億ドル超へ伸びるが、計算の大半は依然として、2000億ドル超の高価で電力を食う最先端 AI チップの上で実行される。市場は「どちらか」ではなく「両方」になりそうだ、というのが結論だ。「推論向けに最適化」が低消費電力を意味するとも限らず、GDDR7 を使う推論向け製品がラック1本あたり370 kW(同じ供給元の学習向け版の約3倍の電力密度)を要する例も挙げている3。
つまり、内製 ASIC の顔ぶれが増えることと、最先端 GPU の需要が減ることは、同じ話ではない。本稿が引ける範囲で確かなのは、推論の載る先が単一ベンダーの GPU だけではなくなったということまでだ。
作る側にとって何が変わるか
同じモデルを載せる先が NVIDIA の GPU 以外にも増えるとき、何を基準に選ぶか。
- 推論コストは、モデルの効率だけの話ではなくなる。 同じモデルでも、どのチップで動くかでコストが変わる——AWS は、Trainium で学習と推論のコストを最大5割下げた顧客名を挙げている(AWS 自身の発表)5。推論がどのシリコンに載るかが、価格と可用性を左右し始める。
- 垂直統合が進む。 モデルを作る会社がチップまで設計すると、モデル・ソフト・ハードが一体で最適化される。速さと安さの一方で、そのスタックへの囲い込みも強まりうる——自前チップの割安さは、そのプラットフォーム内での話になりやすい。
- 移行先は増えても、GPU の予算は消えない。 推論特化チップの市場は伸びるが、計算の大半は高価な最先端チップの上に残る3——自前 ASIC の話を、GPU 調達をやめる話として読むと外す。Jalapeño 自身、本格的な立ち上がりは2027年以降である4。
出典5件
-
OpenAI, “OpenAI and Broadcom unveil LLM-optimized inference chip”(公式ブログ, 2026-06-24)。LLM 推論特化・初期設計から製造テープアウトまで9か月(自社モデルの助力)・2026年末に初期展開。公式が述べる性能は「早期テストで電力あたり性能が現行の最先端より大幅に良い」「詳細な技術レポートは今後」までで、同ページに他社チップとの比較値は無く、「主要 AI アクセラレータ並みの電力・処理量に専用推論システムに近い遅延を」は目標として書かれている。約50%のコスト削減は公式発表ではなく、Broadcom CEO(Hock Tan)が Bloomberg に語ったとして報じられた数字で、比較対象・測定指標・ワークロード・コストの比較基準はいずれも非公表(Bloomberg 本体は未取得で、二次報道を経た帰属)。https://openai.com/index/openai-broadcom-jalapeno-inference-chip/ ↩ ↩2 ↩3 ↩4
-
CNBC, “Google unveils chips for AI training and inference in latest shot at Nvidia”(2026-04-22)。Google が第8世代 TPU で学習用と推論用をチップごとに分離し、推論専用の TPU 8i(SRAM 384MB、Ironwood の3倍)を出したことを報じる。Microsoft の第2世代 AI チップ(1月発表)と Meta の Broadcom との開発にも触れる。同記事は「巨大テック各社のいずれも NVIDIA を置き換えてはいない」と明記しており、NVIDIA の推論シェアが下がるという予測は載せていない。 https://www.cnbc.com/2026/04/22/google-launches-training-and-inference-tpus-in-latest-shot-at-nvidia.html ↩ ↩2 ↩3
-
Deloitte, “Why AI’s next phase will likely demand more computational power, not less”(Deloitte Insights, TMT Predictions 2026, 2025-11-18)。AI計算に占める推論の割合が2023年の約3分の1、2025年の約半分から2026年に約3分の2へ達すると予測し、推論特化チップの市場も2026年に500億ドル超へ伸びるとする。ただし同記事の主張は「安い推論特化チップへ移る」ではない——その読みに対し
Deloitte sees things somewhat differentlyとし、計算の大半は依然2000億ドル超の高価な最先端 AI チップ上で実行される、市場は「どちらか」ではなく「両方」になる、と予測する。GDDR7 採用の推論向け製品がラックあたり370 kW を要する例も挙げる。いずれも2025年11月時点の予測であり、割合の分母(FLOPs/稼働時間/支出のいずれか)は明示されていない。 https://www.deloitte.com/us/en/insights/industry/technology/technology-media-and-telecom-predictions/2026/compute-power-ai.html ↩ ↩2 ↩3 ↩4 ↩5 -
CNBC, “OpenAI unveils first chip as part of Broadcom deal in effort to ‘build the full stack’“(2026-06-24)。Hock Tan が発表当日、2026年後半は「小規模な試作開発」でそこから拡大し、2027年に本格的に立ち上がって2028年前半にフル稼働すると語ったことを報じる。公式の「2026年末に初期展開」は、量産・本格稼働の時期とは別物である。https://www.cnbc.com/2026/06/24/openai-and-broadcom-reveal-jalapeno-first-ai-chip-in-partnership.html ↩ ↩2
-
Amazon, “Frontier agents, Trainium chips, and Amazon Nova: key announcements from AWS re:Invent 2025”(公式ブログ, 2025-12-04)。Trainium3 UltraServers の提供に加え、Amazon Bedrock の本番ワークロードがすでに Trainium3 上で稼働していること、学習と推論のコストを最大50%下げた顧客例(Anthropic ほか)を挙げる。いずれも AWS 自身の発表であり、独立評価ではない。 https://www.aboutamazon.com/news/aws/aws-re-invent-2025-ai-news-updates ↩ ↩2
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。