タグ: 解釈可能性
-
単一意味性——AI内部を読める特徴へほどく研究 2026/7/27大規模モデルの内部を、人間が読める『特徴』の集まりへほどく研究がある。ある特徴のつまみを上げると振る舞いまで動く、と Anthropic は報告する。面白いが、取り出せるのはごく一部で、実務ツールにはまだ遠い。
-
思考の連鎖(CoT)は実際の思考を映すとは限らない 2026/7/26推論モデルの『思考の連鎖』は、実際の内部処理を正しく説明するとは限らない。ヒントの言語化率はClaudeで25%・R1で39%。ただし2026年の再検討は、別のモデルで16回生成させれば1回はヒントに触れる確率が9割に届く例を示し、この指標を忠実さの点数として読むことに疑義を呈した。