In Silico

Materials Informatics

計算が出す新物質は実験が作ってきた構造からずれる

2026/7/20 (更新: 2026/8/12)

目次
【課題】「計算上の安定」は「実験で作れる」ではないGNoMEは大量提案、だが「安定」は計算(DFT)基準【手段】計算と実験のずれを2つの角度から測る実験が歩んだ構造との差/参照値の系統誤差
※概念図(課題→手段):計算の「安定」は実験の「実在」の一次近似
要点

AIによる材料発見は、まず数で語られる。GNoMEは「既存基準で安定な構造220万個、うち38万1000個が更新後の凸包上に残る」と報告し1、MatterGenは目標物性を条件に新結晶を生成してみせた2。だが、その「安定」は計算(DFT)で安定という意味であって、実験で作れるという意味ではない。2026年6月に相次いで出た独立した2本の研究が、この差を正面から測った。1本目は、計算が出す提案が、実験が実際に新物質を見つけてきた構造の範囲からずれると示した3。2本目は、計算の参照値そのものが実験の代わりにならないと、事前登録した検証で示した4。ただし——このずれは生成AI固有ではなく計算全般の性質で、公開標本で見るかぎり生成系のMatterGenが最も実験に近い。そして1本目は、測った距離をそのまま実験家が候補を選り分けるための事前分布に変えている。

「安定」は、二つの意味を持つ

材料発見のAIは、桁で語られてきた。だがGNoMEの数字は一つではなく、三つの別々の基準の上に並んでいる1

ここで足し算は通らない。論文は先行研究の4万8000件を出発点だと書き、更新後の凸包に載る安定結晶の総数を42万1000としている。素直に足せば42万9000だが、そうはならない。凸包は棚に積み上げる在庫ではなく、新しい点が入るたびに引き直される下側の包絡線だからだ。論文自身、GNoMEが Materials Project と OQMD から少なくとも5000件の「安定」材料を凸包から押し出したと書いている1。8000件の差は、新しい発見が足りなかったのではなく、先行研究の一部が押し下げられた分を含んでいる。

同じ「安定」という語が二つの異なる凸包を指しているので、いちばん大きい220万を「新材料の数」と読むと、二段ぶん取り違えることになる。MatterGenは拡散モデルで、目標の物性・対称性・組成を条件に新しい結晶を生成できると示した2。数は圧倒的だ。

だが、ここでの「安定」は計算上の安定を指す。DFT(密度汎関数理論)で計算したエネルギーが、既知構造の作る凸包より下にある、という意味だ。それは「実験室で合成できる」とも「実在する」とも同じではない。合成には速度論や前駆体の入手性が絡み、DFTの計算値自体にも系統誤差がある。数万・数百万という見出しの数字は、計算という物差しの上で数えられている。問題は、その物差しが実験のどこまで代理になるかだ。

計算提案は、実験が作ってきた構造からずれる

1本目(Nguyenら、2026年6月29日公開のプレプリント)は、変わった角度からこれを測った3。ICSDの実験構造16万7500件を構造の似かたで並べた連続空間に埋め込み、その空間をグラフのコミュニティ(族)に切り分け、報告年の順に再生したのだ。

族とは何か。結晶学の名札で切った分類ではなく、構造どうしの近さでまとまった一群のことだ。最大級の10族では、一つの族が平均44.2種類(16〜86)の空間群にまたがっていた。対称性をわずかに崩したり単位胞を取り直したりしただけの構造は、この物差しでは同じ族の内側に留まる。そして族は化学的に意味を持つ——著者らは教科書に載る9つの分野転換を、族の急成長として言い当てている。銅酸化物超伝導体、巨大磁気抵抗マンガナイト、MAX相、Liイオン電池正極などだ。銅酸化物の族は378件のうち1986年以前の登録がゼロで、最初の一件は1987年——ベドノルツとミュラーの報告の直後にあたる。

この物差しで見ると、実験の発見には強い慣性がある。測ったのは、新しく報告されたICSDの簡約組成式のうち熱力学の安定性ネットワーク(トヨタ研究所)に対応する項目がある1万6582件である(この分母自体、突き合わせ可能だった1万8821件の88.1%にあたる)。そのうち1万3739件(82.9%)が既存の族に入った。まったく新しい族の誕生は、1930年代の40.2%から2010年代の2.6%へ落ちていた。実験の発見は、過去に作れた化学の近傍を探る営みだ、というわけだ。

同じ地図に計算側の5つの標本を投影すると、実験分布への近さは held-out ICSD > MatterGen >{GNoME・Materials Project(理論)}> JARVIS > Alexandria の順だった3。この並び順は、族の切り分けのしかた(近傍グラフの k、Louvain の resolution)や判定のしきい値をいろいろ変えても崩れない。ただし在籍率そのものの絶対値は切り分けの粗さで動く——粗く切るほど全標本の率が上がる。順位は頑健で、水準は約束されていない3。つまり計算が出す提案は、実験が実際に歩んできた構造空間から系統的に外へ出ている。ただし測られたのは公開された標本だ——GNoMEは公開5000件、MatterGenは公開386件のCIFで、著者らも親モデルの全分布を表すとは限らないと断っている。

ここで公平を期すべき点が二つある。第一に、著者ら自身が強調するのは、この構造的なずれは生成AIに固有ではなく、試したすべての計算集合に共通するということだ3。純粋なDFTデータベースであるMaterials Projectの理論構造も、同じように実験が作ってきた構造からずれていた。これは「生成モデルが雑だ」という話ではなく、「計算による材料探索が、実験の発見のしかたとは別の空間を歩く」という、より広い話だ。第二に、著者らはこのずれをどちらかの落ち度とも見ていない。実験が既知の型の内側に留まるのは、近傍に足がかりのない構造を狙うのが合成上きついからだ。計算がそこを出られるのは合成経路の制約を負っていないからで、狙って外へ出ること自体は設計どおりでもある。

そして著者らは、測って終わりにしていない。構造の近さ(族の内側か外側か)と、1980年以降のICSDに同じ簡約組成式があるかどうか——この二軸を掛け合わせた四つのマス目を、合成可能性の事前分布として提示する3。左上(族の内側かつ組成に前例あり)が最も強く、右下(族の外かつ組成も新規)が最も弱い。左上に入るのは、MP理論構造とJARVISが約7%、MatterGen-publicが2.3%、Alexandriaのoff-hullが0.6%、GNoMEの公開集合は0.0%だった。実験家が有限の合成予算に候補を落とし込むための座標であって、優劣の判決ではない、と著者らは断っている。

計算の参照は、実験ではない

別の入口から同じ溝を突いたのが2本目だ(Vepa単著、2026年6月19日公開のプレプリント)4。機械学習によるナトリウム系正極(Naイオン電池の材料)のスクリーニングを題材に、計算で得た電圧を「正解」に使うこと自体の危うさを、事前登録(pre-registration)した検証で測っている。閾値も失敗の定義も主要指標も、解析の前に固定してから臨む、という作法だ。

報告では、モデルの平均絶対誤差は保留テストで0.67V、事前登録した保守的な指標——交差検証でバイアス補正した誤差の95%信頼上界——で1.09Vだった4。だが核心はモデルの精度ではない。予測・データベース参照・実測の三つを突き合わせられた化合物は2件しかないが、その2件ではMaterials ProjectのPBE+U参照値が実測より約0.54V低く、全体のずれを支配していたのはモデルの誤差ではなく参照側の誤差だった。0.54Vはこのn=2の比較から出た数字で、系統誤差の向きと桁を示すものであって、確立した補正量ではない。加えて残差は電圧に強く依存し(相関 r=−0.94)、単純な一律補正では直せなかった。ついでに、狙ったNa置換空間の少なくとも70%はすでに論文化済みで、「新規発見」の余地も見た目より狭かった4。計算値を実験の代わりに信じてスクリーニングを回すと、モデルの良し悪し以前に、土台の参照がずれている——という指摘だ。

同種の批判は以前からある。CheethamとSeshadriは、GNoME Explorer の掲載2047件のうち先頭250件を手で点検した5。網羅的な調査は時間がかかりすぎるとして、著者ら自身が明示的に断念している。その250件について、新規性・信頼性(提案された構造と組成が実験で実現しうること)・実用性の三つを兼ねる化合物の証拠は乏しい、というのが結論だ。これは失敗率の測定ではない。全体の約12%を手で見て良い例が見当たらなかった、という所見である。中身は、既知物質の些細な焼き直しにあたる組成、酸化数が既知物質と整合しない組成、そして本来は無秩序であるはずの配置を人為的に秩序化して対称性を下げた構造、といったものだった。

ただし同じ論文は肯定の側も書いている。「新しい組成の多くは既知物質の些細な焼き直しだが、計算的手法は全体として信頼できる組成を出しており、そのことは基礎となる手法が健全だという確信を与える」5。数の大きさは使える材料の多さを意味しない。だが、出てくる組成そのものが出鱈目だという指摘でもない。

橋は、粗いなりに架かっている

ここで「AIの材料発見は看板倒れだ」と締めるのは、片側だけを見た読み方になる。反対側の証拠も具体的だ。MatterGenは体積弾性率200 GPaを目標に TaCr₂O₆ を生成し、著者らはそれを実際に合成したと報告する2。ただし測ったのはナノインデンテーションによるヤング率で、体積弾性率はそこからDFT由来のポアソン比を使って推定した値だ。4回の測定で158±11 GPa、粉末試料が緻密でない可能性を理由に最大値169 GPaを最良推定に採り、設計目標比で2割以内だとしている。

この代表例には査読済みの反論がある。Materials Horizons に載った再検討は、まず予測したものと合成されたものを分けて置く。MatterGenが予測したのは秩序構造 TaCr₂O₆ で、実際に合成されたと報告されたのは無秩序相 Ta₁/₃Cr₂/₃O₂ のほうだ。組成式は割り算で揃うが構造は揃わない——どちらも同じルチル型(空間群 P4₂/mnm)ながら、TaCr₂O₆ は c軸が3倍の長さを持ち Ta と Cr が別々のサイトに秩序化しているのに対し、Ta₁/₃Cr₂/₃O₂ では両者が同じサイトを分け合う。再検討が「新規化合物ではない」と論じているのは後者、つまり合成されたと報告された無秩序相のほうである。それは1971年に報告済みの Ta₁/₂Cr₁/₂O₂ と同形で、c軸まわりに90°回すと酸素の位置が精密化の誤差より小さい差で重なり、しかもその ICSD 登録はMatterGenが新規性の判定に使った参照データセットに入っていた6。同一サイトを複数元素が占める無秩序相を、秩序化した「新規化合物」として取り違える——この分野に共通の落とし穴だという。

反論は、何が合成されたのかという手前の段にも及ぶ。公開されたPXRDパターンを組み直すと、原論文の精密化は原子変位パラメータを0 Ų——原子がまったく振動しないという物理的にありえない値——に固定しており、これが占有率の見積もりを歪めていた。取り直した組成は Ta₀.₄₃Cr₀.₅₇O₂ で、狙った Ta₁/₃Cr₂/₃O₂ ですらない、というのが再検討の結論だ6。硬さの比較も分が悪い。既知の Ta₁/₂Cr₁/₂O₂ の体積弾性率は181 GPaと報告されており、測られた169 GPaより硬いからだ。係争しているのは「新規化合物を設計した」という一点にとどまらない。

GNoMEの側はどうか。安定と報告した構造のうち736件がICSDの実験構造と一致した1。だが、この736件を「予測が先回りしていた」証拠として読めるのは一部にすぎない。論文自身が、736件の一致のうち184件がプロジェクト開始以降の新規報告にあたる、と書いている。残る552件は、予測とは無関係にすでに知られていた構造との一致である。加えてGNoMEは結晶を生成するモデルではなく、候補を篩にかけるスクリーニング器だ。ここで支えられているのは「生成」ではなく、大規模な計算篩が実験と交差しうる、という一点である。

そして前節の通り、公開標本で見るかぎり、実験が作ってきた構造に最も近い計算集合はMatterGenだった3。粗いなりに、線は現実まで届いている。

この報告を、どう割り引くか

2本の新研究はいずれも査読前のプレプリントで、独立再現は未確認だ。1本目には族の切り分け方に結論が引きずられる懸念があるが、著者らは近傍数・Louvainの解像度・しきい値の百分位を振っても順位が保たれると報告している3。2本目のほうが土台は薄い——Na正極という単一材料系、実験アンカーはn=6、参照値との三点比較に至ってはn=2である4。ここに並べた数字は、著者らが自分の枠組みの内側で出した測定値だ。

向きの違う2本が同じ場所を指している点は、それでも見逃せない。計算の「安定」は、実験の「実在」の一次近似にすぎない。そして両者の間には、測れるずれがある——実験が作ってきた構造からの距離として3、参照値の系統誤差として4

測ったずれをどう使うかで、2本は分かれる。2本目は残差の電圧依存(r=−0.94)から「一律の補正は成り立たない」と結論し、自分のスクリーンを取り下げた4。1本目は逆に、測った距離をそのまま道具にした。構造の近さと組成の前例を掛け合わせた四象限を、実験家が計算提案を選り分けるための事前分布として差し出している3。著者らはこう言い換える——材料AIが向き合うべき問いは「この提案は新しいか」ではなく、「実際に実現された化学に対して、これはどこに立っているか」だ。

あとは使う側の作法になる。参照をDFTでなく実験にアンカーし直すこと、検証を事前登録して都合よく緩めないこと。そして「計算上は安定」と言うたびに「では実験では?」と問い直すこと。計算の「安定」は、実在に照らして初めて意味を持つ。


出典6件
  1. Amil Merchant, Simon Batzner, Samuel S. Schoenholz, Muratahan Aykol, Gowoon Cheon, Ekin Dogus Cubuk, “Scaling deep learning for materials discovery”(GNoME), Nature 624, 80–85 (2023)。論文の表現では「GNoME models found 2.2 million crystal structures stable with respect to the Materials Project. Of these, 381,000 entries live on the updated convex hull as newly discovered materials」——220万=先行研究(Materials Project)を基準にした安定38万1000=発見どうしを競わせた更新後の凸包の上、で数える対象が違う。更新後の凸包に載る安定結晶の総数は「381,000 new entries for a total of 421,000 stable crystals」と書かれ、先行の4万8000との単純な和(42万9000)にはならない。論文自身が「GNoME displaces at least 5,000 ‘stable’ materials from the Materials Project and the OQMD」と述べる通り、凸包を引き直せば先行の一部が押し出されるためである。さらに「Of the stable structures, 736 have already been independently experimentally realized」とし、この736はICSDの実験構造との照合で得た数で、著者らは組成の厳密一致を課しているため下限だろうと注記する。前向きの証拠として読めるのはこのうち184件で、論文は「Overall, we found 736 matches, providing experimental confirmation for the GNoME structures. 184 of these structures correspond to novel discoveries since the start of the project」と書いている。大規模計算スクリーニングが安定候補を桁違いに広げうる側の一次証拠。https://doi.org/10.1038/s41586-023-06735-9 2 3 4

  2. Claudio Zeni, Robert Pinsler, Daniel Zügner ほか (Microsoft Research AI4Science), “A generative model for inorganic materials design”(MatterGen), Nature 639, 624–632 (2025)。目標物性を条件に新規結晶を生成する拡散モデルで、学習データは Materials Project と Alexandria から再計算した Alex-MP-20(60万7683件)。体積弾性率200 GPaを目標に生成した TaCr₂O₆ を合成し、ナノインデンテーションで測ったヤング率とDFT由来のポアソン比0.30から体積弾性率を推定、4回の測定で158±11 GPa、粉末試料が緻密でない可能性から最大値169 GPaを最良推定とした(生成された秩序構造のDFT予測値は222 GPa)。従来モデル比で新規かつ安定な構造を2倍以上出せるとする。生成+安定/新規フィルタが現実に検証された新材料を生みうる側の一次証拠。https://doi.org/10.1038/s41586-025-08628-5 2 3

  3. Dan Nguyen, Karen Cao, Brian Chu, Nick Lemoff, Paul Kienzle, William Ratcliff II, “Computed materials proposals depart from the structural memory of experimental discovery”(arXiv:2606.30967, 2026年6月29日公開・査読前)。ICSDの実験構造16万7500件を構造類似度の連続空間に埋め込み、Louvain法でグラフのコミュニティ(族)へ分割して報告年順に再生。新しく報告された簡約組成式1万6582件のうち1万3739件(82.9%)が既存の族に入り、族の新設は1930年代40.2%から2010年代2.6%へ低下。最大級の10族では1族あたり平均44.2種類の空間群にまたがり、対称性の些細な低下や単位胞の取り直しは同じ族の内側に収まる。族は化学的に有意で、銅酸化物・CMRマンガナイト・MAX相・Liイオン電池正極を含む9つの教科書的な分野転換を言い当てる。投影した外部標本はGNoME公開5000件CIF・MatterGen-public公開386件CIF・MP理論構造/JARVIS-DFT/Alexandria-PBE各5000件で、実験分布への近さは held-out ICSD > MatterGen >{GNoME・MP理論}> JARVIS > Alexandria の順。著者らは「構造的なずれは生成AI固有ではなく、試したすべての計算集合に共通する」と明記したうえで、構造の近さと1980年以降のICSD簡約組成式の前例を組み合わせた四象限を「計算材料を選別するための歴史的な合成可能性の事前分布」として提示する。https://arxiv.org/abs/2606.30967 2 3 4 5 6 7 8 9 10

  4. Krishna Teja Vepa(単著), “Computational references are not experiments: pre-registered validation of machine-learned sodium-cathode voltages”(arXiv:2606.23725, 2026年6月19日公開・査読前)。機械学習によるNaイオン正極電圧の予測を、閾値・失敗基準・主要指標を事前登録したうえで実験アンカー(監査済みの既知Na正極 n=6、1件を文書化して除外。n=7でも判定は変わらないとする)に対して検証。保留テストの平均絶対誤差0.67V、事前登録の保守指標(交差検証でバイアス補正した誤差の95%信頼上界)で1.09V。予測・データベース参照・実測の三つが揃う2件では、Materials ProjectのPBE+U参照値が実測より約0.54V低く、参照側の誤差が全体のずれを支配。残差は電圧依存(r=−0.94)で加法的な較正は成り立たないとし、狙ったNa置換空間の少なくとも70%は既発表と報告して、著者はスクリーンを取り下げている。https://arxiv.org/abs/2606.23725 2 3 4 5 6 7

  5. Anthony K. Cheetham, Ram Seshadri, “Artificial Intelligence Driving Materials Discovery? Perspective on the Article: Scaling Deep Learning for Materials Discovery”(Chemistry of Materials 2024, DOI:10.1021/acs.chemmater.4c00643)。GNoME Explorer の掲載2047件について「網羅的な調査は時間がかかりすぎる」として明示的に断念し、先頭250件のみを手で点検したうえで、新規性・信頼性(credibility=提案された構造と組成が実験で実現しうること)・実用性の三つを兼ねる化合物の証拠は乏しい(scant evidence)と結論した代表的な批判的レビュー。指摘の中身は、既知物質の些細な焼き直しにあたる組成、酸化数が既知物質と整合しない組成、無秩序であるはずの配置を秩序化して対称性を下げた構造など。一方で著者らは「新しい組成の多くは既知物質の些細な焼き直しだが、計算的手法は全体として信頼できる組成を出しており、そのことは基礎となる手法が健全だという確信を与える」とも書き、38万4870組成の中には際立って新規なものもあるはずだと予期している。https://doi.org/10.1021/acs.chemmater.4c00643 2

  6. Mikkel Juelsholt(単著), “Continued challenges in high-throughput materials predictions: MatterGen predicts compounds from the training dataset,” Materials Horizons 13, 5672–5679 (2026年2月12日受付・4月8日受理, DOI:10.1039/D6MH00268D。ChemRxiv 版は doi:10.26434/chemrxiv-2025-mkls8)。新規でないと論じられているのは、MatterGenが予測した秩序構造 TaCr₂O₆ ではなく、合成されたと報告された無秩序相 Ta₁/₃Cr₂/₃O₂ のほうである。 両者は同じルチル型だが「TaCr₂O₆ の結晶学的c軸は Ta₁/₃Cr₂/₃O₂ の3倍」で、TaCr₂O₆ は Ta と Cr が秩序化した構造にあたる。その Ta₁/₃Cr₂/₃O₂ について「実際には Ta₁/₂Cr₁/₂O₂ と同形である」(1971年に Massard らが報告し、1972年に Astrov らが構造を解いた)、「結晶学的c軸まわりに90°回転させると、二つの構造は同一になる」、「ICSD collection code 9516 は、MatterGen が使う参照データセットに entry 956681 として載っている」と指摘する。さらに原論文の公開PXRDを再精密化し、原子変位パラメータが0 Ųに固定されていたために占有率が歪んだとして組成 Ta₀.₄₃₍₂₎Cr₀.₅₇₍₂₎O₂ を得、「TaCr₂O₆ は合成に成功していない」と結論する。既知の Ta₁/₂Cr₁/₂O₂ は体積弾性率181 GPaの超硬材料として報告済みで、測定された169 GPaより硬いとも述べる。主命題は「MatterGen は自分の訓練データと自分が予測した化合物を区別できない。ゆえに新規性を担保するには予測1件ごとに人の点検が必要で、それが MatterGen のうたう高速な材料予測を妨げる」。生成モデルの「新規性」主張を割り引く側の査読済み一次資料。https://pubs.rsc.org/en/content/articlelanding/2026/mh/d6mh00268d 2

この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。