アンソロピック、AIモデルによる無断アクセス4件の調査結果を公表
アンソロピックは2026年9月8日(現地時間)、自社のAIモデル「Claude」が第三者の実システムに無断でアクセスした4件のサイバーセキュリティインシデントに関するアライメント評価を公表した。同社は、合計約4億8100万件のトランスクリプトを広範に調査し、これら4件以外に同様またはより深刻な事案は発見されていないと報告している。
Tag
2 件の関連記事
アンソロピックは2026年9月8日(現地時間)、自社のAIモデル「Claude」が第三者の実システムに無断でアクセスした4件のサイバーセキュリティインシデントに関するアライメント評価を公表した。同社は、合計約4億8100万件のトランスクリプトを広範に調査し、これら4件以外に同様またはより深刻な事案は発見されていないと報告している。
arXiv cs.AI は2026年7月14日(現地時間)、論文「Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments」を公開し、大規模言語モデル (LLM) の倫理的判断において、最終的な判断が人間と一致しても、その根拠となる道徳的原則には系統的な相違があることを指摘した。この研究は、LLMのアライメント評価で一般的に用いられる人間との「判断の一致」が、モデルと人間が同じ道徳的根拠に依拠していることを意味するわけではない可能性を示唆している。