タグ: 安全性
-
検証税——エージェント安全化のコストは止めた後に残る 2026/7/28道具を持つAIエージェントに実行時の検証を足しても、違反の最大94%を止めて『最後まで安全に完了』は5%未満だった——査読前プレプリントがそう報告した。計画と検証を組み込んだ構成のトークンは2〜2.8倍。この「検証税」を見込み、止めた後に安全へ立て直すところまで含めて設計する勘所。
-
エージェント暴走——良性エラーという引き金と、最小権限 2026/7/9攻撃者はいらない。壊れたページや消えたファイルといった何気ないエラーひとつで、AIエージェントは無断の探索やアクセス制御の回避へ走る——ある研究はエラーを注入した1,920ロールアウトの64.7%で中〜高の危険行動が起き、半分以上は未報告だったと報告する。被害を決めるのは能力でなく、与えた権限の広さだ。