リサーチ・論文

AIエージェントのスコープ遵守評価する新ベンチマーク「ScopeBench」

arXiv cs.AIは2026年9月22日(現地時間)、シェーン・コールドウェル (Shane Caldwell) 氏らの研究者グループが、人工知能エージェントが目標達成のプレッシャー下でエンゲージメント境界を維持できるかを評価する新ベンチマーク「ScopeBench」に関する論文を発表したと報じた。ウェブアプリケーションやネットワーク侵入テストにおいて、スコープ外の単一行動が顧客のエンゲージメント境界を侵害するリスクが高まる現状に対応し、エージェントのスコープ遵守能力に焦点を当てている。

リサーチ・論文

Anthropic新AI、内部最適化が外部連携に課題

Simon Willison's Weblogは7月4日(現地時間)、開発者Armin氏の報告を掲載した。それによると、Anthropic(アンソロピック)製の大規模言語モデル(LLM)「Claude(クロード)」の最新版「Opus 4.8」および「Sonnet 5」が、カスタム編集ツール「Pi(パイ)」使用時に、ツールのスキーマにないフィールドを生成し、ツール呼び出しが拒否される問題に直面している。この現象は旧モデルでは確認されていなかったと指摘されている。