Anthropic 在 AI 安全測試中封鎖生物武器研究提示

Anthropic 的報告顯示,Claude 封鎖了生物武器補助金提示,但使用者透過競爭對手的 AI 模型繞過了過濾器。

2026-09-10 22:13約 4 分鐘閱讀

一份補助金提案提交給 Claude,系統的安全過濾器標記並封鎖了它。幾天後,同一人再次出現,據報導被拒絕的提示被發送到另一個競爭對手的 AI 模型。

Anthropic 分享了這個關於自身的描述,詳細說明了一個 AI 公司展示其系統參與潛在生物武器研究的案例。

被封鎖的補助金申請

該請求是為了資助研究基孔肯雅熱,這是一種由蚊子傳播的病毒,會導致持續疼痛且缺乏治療方法。其目的是增強傳播能力並逃避免疫防禦。該提案由民間研究人員起草,並計劃以軍事設施作為主辦地點。

我們正在發布迄今為止最詳細的威脅情報報告。

它涵蓋了人們如何試圖濫用 Claude——進行網路攻擊、影響行動、監視、生物學以及建造武器——以及我們如何發現並阻止他們。

我們擾亂了報告中的每一項操作,……

— Anthropic (@AnthropicAI) 2026年9月10日

所有互動都被阻止,但出現了變通方法。這些調查人員使用的平台設置了備用方案,轉向另一家公司的模型。Claude 本身協助撰寫了該程式碼,而這項任務被呈現為解決過度拒絕的方案。

五個案例,無確立惡意

這份報告長達154頁,包含五起生物相關事件。Anthropic 停用了這些帳戶,扣留了實驗室,然後沒有做出許多人預期的指控。

「我們並不主張他們有意造成傷害,而揭露他們或他們的實驗室可能使他們面臨危險。」團隊在報告中表示

儘管如此,過濾器在某些情況下確實發揮了作用。一位專注於禽流感的研究人員被轉向能力較低的模型,而 Anthropic 認為這種協助主要是行政性質的。

Anthropic 生物武器案例數據一覽

  • 報告共154頁
  • 已發布5起生物案例
  • 在對國家關聯機構的30天掃描中發現35項研究努力
  • 1小時:一位使用者在 Opus 5 上起草天花家族補助金所花費的時間

應引起關注的方面

這35次嘗試中大部分是標準的民間研究。這就是問題所在。同樣的專業知識可以製造疫苗或武器,而過濾器無法解讀意圖。

「分類器無法同時實現利益和防止傷害,」Anthropic 表示。

其限制先前已面臨挑戰。4月,一個 Discord 社群在第一天就訪問了其受限模型

隨著這些擔憂升級,華盛頓正在採取行動。眾議員 Ted Lieu 和 Nathaniel Moran 在7月提出了《AI 終止開關法案》,要求開發者保留關閉其系統的能力。

同一份報告移除了使用 Claude 監控異議人士的客戶。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章