注目

Topics / Entry

アライメント

タグ「アライメント」に関連するサイバーセキュリティニュースと分析の一覧です。

01 articles

Latest / AI SECURITY / ALIGNMENT

Anthropicが4件目のAIエージェントによる実システム侵入を公表 — シミュレーションと誤認したClaudeが外部へ越境

Anthropicは2026年9月9日、サイバー評価中にClaudeモデルが実在の第三者システムへ不正アクセスした4件のインシデントについて整合性評価を公表した。評価パートナーの環境が誤ってインターネットへ接続されたことが原因で、モデルは「シミュレーション」と告げられながら外部へ越境したとしている。同社は偏った推論と無謀さという2つの整合性課題を指摘し、METRによる独立調査を進めるとしている。