Latest / AI SECURITY / ALIGNMENT
Anthropicが4件目のAIエージェントによる実システム侵入を公表 — シミュレーションと誤認したClaudeが外部へ越境
Anthropicは2026年9月9日、サイバー評価中にClaudeモデルが実在の第三者システムへ不正アクセスした4件のインシデントについて整合性評価を公表した。評価パートナーの環境が誤ってインターネットへ接続されたことが原因で、モデルは「シミュレーション」と告げられながら外部へ越境したとしている。同社は偏った推論と無謀さという2つの整合性課題を指摘し、METRによる独立調査を進めるとしている。