AIエージェント
AIコーディングに効くのは領域理解——40万セッション分析
Anthropic が約40万件の Claude Code セッション(約23.5万人、2025年10月〜2026年4月)を分析したところ、成否を分けていたのはコードが書けるかどうかではなく、解こうとしている問題をどれだけ分かっているかだった1。実務への含意は一つに尽きる——AI コーディングへの投資先は「書き方の練習」だけでなく「対象領域の理解」にもある。ただしこれは1社の大規模な自社利用データであり、独立した追試はまだない(後述)。
同じ一度の指示から、熟練者は倍以上を引き出す
一番はっきり出たのは、同じ「1回の指示」から引き出せる仕事量の差だ1。
- 初心者のセッションでは、1つの指示がおよそ5アクション・約600語の出力を動かす。
- その分野に詳しい人のセッションでは、同じ1指示が約12アクション(2倍超)・約3,200語(5倍)の連鎖を動かす。
つまり「詳しい人ほど、AI に短く指示しても長く正しく走らせられる」。この差を生むのはプログラミングの訓練ではなく、扱っている領域の理解の深さだった、というのがこの分析の主張である1。
役割分担も数字で出ている。人間は計画上の意思決定(何を作るか)の約70%を担い、実行上の意思決定(どう作るか)は約20%——裏を返せば AI が実行判断の約80%を引き受けている1。人が「解くべき問題」を定め、AI が「その解き方」を埋める、という分担だ。
エンジニア以外でも成功率はほぼ変わらない
では「コードを書いた経験がない職種」はどうか。分析は米労働統計局(BLS)の23の職業大分類でセッションを見ている。コードを生むセッションの検証済み成功率は、ソフトウェア系が34%、それ以外の職種が29%——差はわずか5ポイントだった1。
しかも、データ内で最も大きい10の職業群すべて(コンピュータ・数学/経営・財務/アート・デザイン・メディア/マネジメント/生命・自然・社会科学など)が、成功率でソフトウェアエンジニアの7ポイント以内に収まっていた。むしろマネジメント系がエンジニアをわずかに上回って最上位だった1。ただしこの一点については研究チーム自身が、検証済み成功はトランスクリプト上の明示的な確認に一部依存しており、マネージャーは要求どおりの結果が出たときに明言しやすい可能性がある、と注記している。プログラマかどうかより、その分野を分かっているかが効く——順位そのものより、10職業群が7ポイント以内に収まるという幅の狭さがそう読める。
この「プログラマでなくても作れる」という方向は、Anthropic 以外の独立した実験でも部分的に裏づけられている。Web の知識がほとんど無い非プログラマが LLM の助けで動く Web アプリを作れた割合は約73%に達し、つまずきの多くは問題の捉え方ではなく技術的な統合の細部だった2。ただし過信は禁物だ。別の研究では、業務ユーザーが AI 生成コードの——技術力ではなく分野知識や批判的思考で気づけるはずの——意思決定を損ないかねない重大な欠陥を見逃しやすいことが示されている3。「作れる」と「正しいと見抜ける」は別の能力だ。 ただしこの研究を「だから分野理解を積め」の根拠にはできない——参加者は自分の分野の業務専門家であり、それでも見逃した。著者らの結論は「専門家でさえ批判的に評価できない」であって、処方も分野理解の増強ではなく、モデル側の信頼性向上と、批判的な関与を促す説明の設計だった。分野理解は必要条件ではあっても、検証を保証しない。
どう受け取るか——1社のデータであることを含めて
これは思いつきの予想ではなく、公開された分析と実データに基づく。同時に、過大評価しないための線引きも要る。研究チーム自身が二つの限界を明記している1。
- 実世界の成果までは測れていない。 測っているのはセッション内の振る舞い(アクション数・出力量・検証済みか)であって、「そのコードが本番で価値を生んだか」ではない。
- 分類はモデル頼み。 職種や熟練度の推定はトランスクリプトの自動分類に依存し、その精度をスケールで確かめきるのは難しい。
- 伸びの大半は「極める」前に出ている。 報告自身が、上がり幅の多くは初心者→中級の移行で生じ、中級と熟練の差は小さいと書く。原文は
the gains come mostly from competence, not masteryで、deep specialization adds only a bit more beyond thatと続く。熟練が効くという本稿の主題に、当の出典が付けている限定である。
加えて——これは Anthropic が自社ツールの利用ログを分析したもので、この「熟練度で差がつく」という所見そのものの独立追試はまだない。むしろ独立で厳密な検証は、別の角度からより慎重な絵を描く。METR のランダム化比較試験では、熟練したオープンソース開発者が AI ツールを使うとタスク完了がむしろ約19%遅くなった。本人たちは事前に約24%速くなると予想し、事後も速くなったと感じていたにもかかわらず、だ。対象は2025年初頭のモデル(Cursor Pro と Claude 3.5/3.7 Sonnet)である4。自己申告や観察データを額面どおり受け取れない理由が、まさにここにある。だから本稿の数字も「業界全体で確立した法則」ではなく、規模の大きい一つの強いシグナルとして読むのが正確だ。もっとも、「エージェントが”どう作るか”を引き受けるほど、差がつくのは”何を作るべきか=対象理解”に移る」という方向は、非プログラマが AI で実務ツールを組む動き(ドメイン専門家によるビルド)とも符合する。留保を踏まえても、投資の重心の置き所ははっきりしている——書き方の練習だけでなく、対象領域の理解に投じる価値がある。
出典4件
-
Hitzig, Massenkoff, Lyubich, Zhang, Heller, McCrory(Anthropic), “Agentic coding and persistent returns to expertise”(2026-06-16)。約40万件のセッション・約23.5万人・2025年10月〜2026年4月。初心者 約5アクション/約600語 対 熟練 約12アクション/約3,200語、計画の約70%が人・実行の約80%が Claude、BLS 23職業大分類でソフトウェア系34%対それ以外29%・上位10職業群がエンジニアの7ポイント以内でマネジメントが最上位、実世界の成果は未測定・分類はモデル依存、はいずれも本レポートの記述による。https://www.anthropic.com/research/claude-code-expertise ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
Weber(Kempten UAS), “Feasibility of AI-Assisted Programming for End-User Development”(2025)。Web の知識がほぼ無い非プログラマが LLM 補助で動く Web アプリを作れた割合は約73%、主な障壁は問題理解でなく技術的統合の細部(ただし学歴が高いほど成功率も高く、方向性であって絶対ではない)。査読前・単一研究で独立再現は未確認。https://arxiv.org/abs/2512.05666 ↩
-
Virk, Liu(UC Davis), “Non-programmers Assessing AI-Generated Code: A Case Study of Business Users Analyzing Data”(2025)。業務ユーザーは AI 生成コードの意思決定を損ないかねない重大な欠陥——分野知識や批判的思考で気づけるはずのものも含め——を見逃しやすかった=「作れる」と「正しく検証できる」は別能力。VL/HCC 2025 採択(査読済み)。ただし予備調査 n=10 +追試 n=18 の小標本で、独立再現は未確認。なお同論文の結論は「懐疑的な業務専門家でも、技術的でない欠陥すら批判的に評価できない」であり、処方はモデルの信頼性向上と説明UIの設計。https://arxiv.org/abs/2508.06484 ↩
-
Becker, Rush, Barnes, Rein(METR), “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity”(2025-07)。16人の熟練OSS開発者のランダム化比較試験で、AIツール使用時にタスク完了が約19%遅くなった(事前予想は+24%、事後も速くなったと錯覚)=自己申告・観察データを慎重に読む根拠。なおこの結果は2025年初頭のモデルを対象にしたもので、METR 自身が同ページ冒頭で「2026年2月に、2025年後半のAIツールについて新しいデータを公開した」と告知している(同更新では、当時の被験者について推定が加速側に振れたと報告する一方、選択バイアスが大きく信頼できる信号ではないと自認している)。19%という値が撤回されたわけではないが、現行モデルに対する METR の見立てではない。https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/(arXiv:2507.09089、査読前) ↩
この記事はAIが執筆しています。内容には誤りが含まれる可能性があります。ご注意ください。