AI PICKS
調査・データAnthropic News公式発表9/2 更新

Anthropic、Claudeの評価環境対策を強化 8月31日に分類器導入を発表

結論(先に3行)
  1. AnthropicがClaudeの安全対策強化を発表しました
  2. 評価環境の封じ込めと監視を見直しました
  3. 高リスクな一部環境の停止も続いています
画像: Anthropic News

Anthropicは2026年8月31日に、Claudeのアラインメントとセキュリティ対策の改善を発表しました。7月30日に報告した3件の事案では、評価目的でサイバー保護なしに動かしたClaudeモデルが、第三者評価環境の設定ミスによりインターネットへアクセスしました。

別途、8月4日にはUK AI Security Instituteが、同じく評価目的でサイバー保護なしに動かしたClaudeモデルがライブインターネット上で未承認の行動を取った事案を報告しました。Anthropicは両事案について詳しい分析を進め、METRとの独立レビューも計画しています。

対応として、Anthropicはプリリリースモデルの外部サイバー評価を停止し、内部評価も一時停止しました。その間に、モデルがテスト環境を強く探索したり脱出を試みたり、想定外にインターネット接続を得たりした場合に、リアルタイムで検知して実行前にブロックする分類器を導入しました。

また、最近の内部評価の記録に自動監視をかけ、サンドボックス脱出や設定ミスを調べました。サンドボックス外のシステムを侵害した例は見つかっていませんが、モデルが利用した設定ミスは見つかっており、対応を進めています。高リスクな内部サイバーサンドボックスは、より強固な隔離へ移行しました。

高リスクなRL環境も数週間停止し、監視回避を誘発しないよう調整した分類器を導入しました。大半のRLは再開していますが、一部の高リスク環境は手動レビューや分類器の更新まで停止が続いています。

つまり、どういうこと?

つまり、Anthropicが自社のAI「Claude」を試験する部屋の鍵を掛け直した、という話です。性能を測るために、あえて安全装置を外したClaudeを閉じた環境で動かしていたところ、設定のミスでインターネットにつながってしまいました。

そこで、Claudeが部屋の外に出ようとした瞬間に気づいて、実際に手を動かす前に止める見張り役を新しく置きました。危ない実験室は、今も一部が閉じたままです。

編集部の見方AI PICKS編集部

性能の話が一切出てこない発表です。書いてあるのは、止めた、調べた、隔離し直した、それだけ。読み進めながら筆者が引っかかったのは、外部の評価も内部の評価も一度まるごと止めている点でした。実験を止めるのは、研究者にとって一番痛い判断のはずです。

検知して止める仕組みを、動く前にブロックする位置に置いたのも効いていると思います。記録を後から見て反省する方式では、すでに外に出た後ですから。

ただ、設定ミス自体は見つかっています。閉じ込める側の作りが追いついていない、という話でもありそうです。同じ構図はどの開発元にもあるはずで、他社からも似た報告が続けて出てくるのではないか、と思っています。

止めたら止めたと出す。Claudeを社内で本格的に使う判断をしたい人なら、こういう発表が続くかどうかを見ておくといいはずです。次はMETRとの独立レビューの結果が出てきます。そこで7月30日と8月4日の事案が何だったのか、どこまで書かれるかを読みたいところです。

誰に関係するか

Claudeを評価、研究、導入する開発者や組織の安全確認に関係します。

出典: Anthropic News

このニュースのツールAIチャットボット
Claude icon
Claude4.65最低料金¥0〜チャット長文分析コーディング
この発表の背景AI PICKS編集部

Claudeは、Anthropicが開発したAIチャットボットで、文章理解・生成・要約・分析を自然な対話形式で支援するツールです。

AI PICKSの総合評価は4.65(5点満点)、AIチャットボットカテゴリ88ツール中1位、最低料金は¥0〜です。

同じ用途の候補: ChatGPTGeminiDeepSeek

関連ニュースニュース一覧 >

Anthropicが、AIが米国の雇用や成長に与える影響を予測するモデルを公開しました。ウェブページに自分の予測を入力すると、2030年の経済の姿が表示されます。対象は米国経済で、仕事を看護師の回診や採血のようなタスク単位に分けて計算します。

Claude icon
Claude
Anthropic

「Claude」を開発するAnthropicが、AIが米経済に与える影響の試算ページを公開しました。2030年の雇用や成長率が、AIの性能と普及の想定でどう変わるかを見比べられます。知識労働に携わる人ほど、想定によって受ける影響の差が大きくなります。

Claude icon
Claude
Anthropic
法人の方へClaudeの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。