Anthropic、AI安全性テストで生物兵器研究プロンプトをブロック

Anthropicの報告書は、Claudeが生物兵器助成金プロンプトをブロックしたことを明らかにしたが、ユーザーは競合するAIモデルを介してフィルターを回避した。

10/09/2026 22:13約 5 分で読めます

ある助成金申請書がClaudeに提出され、システムの安全性フィルターがそれにフラグを立ててブロックした。数日後、同じ人物が戻ってきて、拒否されたプロンプトは代わりに競合するAIモデルに送られたと報じられている。

Anthropicはこの自社に関する説明を共有した。それは、AI企業が自社のシステムを潜在的な生物兵器研究に関与させていることを示す事例を詳述している。

ブロックされた助成金申請

その申請は、蚊が媒介し、長期にわたる痛みを引き起こし、治療法が存在しないウイルスであるチクングニアを調査するための資金を求めるものだった。その目的は、感染伝播を強化し、免疫防御を回避することだった。民間の研究者によって作成され、軍事施設が実施場所として計画されていた。

当社はこれまでで最も詳細な脅威情報レポートを公開しています。

そこには、人々がClaudeをサイバー攻撃、影響力工作、監視、生物学、兵器製造のために悪用しようとした方法と、当社がそれらをどのように発見し阻止したかが含まれています。

当社はレポート内のすべての活動を阻止しました、…

— Anthropic (@AnthropicAI) September 10, 2026

すべてのやり取りは阻止されたが、回避策が出現した。これらの研究者が使用したプラットフォームは、別の企業のモデルへのバックアップを設定した。Claude自身がそのコードの作成を支援したが、そのタスクは過剰な拒否に対する解決策としてClaudeに提示された。

5件の事例、悪意の立証なし

レポートは154ページに及び、生物関連のインシデント5件を含む。Anthropicはアカウントを無効化し、研究所を保留し、多くの人が予想していた非難は控えた。

「私たちは彼らが害を意図していたとは主張しません。また、彼らや彼らの研究所を特定することは、彼らを害にさらす可能性があります」とチームはレポートで述べた

それでも、フィルターは特定の状況では機能した。鳥インフルエンザに焦点を当てた研究者は、より性能の低いモデルに誘導され、Anthropicはその支援を主に管理的なものと見なしている。

数字で見るAnthropicの生物兵器事例

  • レポートの154ページ
  • 公開された生物関連事例5件
  • 国家関連機関の30日間の一斉調査で発見された35件の研究活動
  • 1時間:あるユーザーがOpus 5で天然痘ファミリーの助成金を起草するのに要した時間

懸念を引き起こすべき側面

それらの35件の試みのほとんどは、標準的な民間研究だった。それが問題だ。同じ専門知識はワクチンも兵器も作り得る。そしてフィルターは意図を解釈できない。

「分類器は利益を可能にすると同時に害を防ぐことはできない」とAnthropicは述べた。

その制約は以前にも課題に直面してきた。4月には、あるDiscordコミュニティが初日にその制限付きモデルにアクセスした

こうした懸念が高まる中、ワシントンが動き出している。下院議員のテッド・リュー氏とナサニエル・モラン氏は7月に「AIキルスイッチ法」を提出した。この法律は、開発者に対し、自社のシステムをシャットダウンする能力を保持することを義務付けるものだ。

同じレポートでは、Claudeを使用して反体制派を監視していたクライアントを削除した。

共有先

X (Twitter)Telegram

免責事項:本記事の内容は第三者メディアからの引用であり、参考情報としてのみ提供されます。投資助言を構成するものではありません。暗号資産およびその他の金融商品には大きな価格変動リスクがありますので、ご自身で慎重にご判断ください。

関連記事