Anthropic Chặn Các Yêu Cầu Nghiên Cứu Vũ Khí Sinh Học Trong Bài Kiểm Tra An Toàn AI

Báo cáo của Anthropic tiết lộ Claude đã chặn các yêu cầu tài trợ vũ khí sinh học, mặc dù người dùng đã vượt qua bộ lọc thông qua các mô hình AI đối thủ.

10/09/2026 22:13Đọc khoảng 11 phút

Một đề xuất tài trợ đã được gửi đến Claude, nơi bộ lọc an toàn của hệ thống đã phát hiện và chặn nó. Vài ngày sau, cùng một cá nhân quay lại, và các yêu cầu bị từ chối được cho là đã được gửi đến một mô hình AI cạnh tranh thay thế.

Anthropic đã chia sẻ câu chuyện này về chính mình, mô tả một trường hợp trong đó một công ty AI chứng minh hệ thống của chính họ tương tác với nghiên cứu vũ khí sinh học tiềm ẩn.

Đơn Tài Trợ Bị Chặn

Yêu cầu này là để tài trợ cho nghiên cứu về chikungunya, một loại virus do muỗi lây lan gây đau đớn kéo dài và không có phương pháp điều trị. Mục tiêu của nó là tăng cường khả năng lây truyền và tránh né hệ thống miễn dịch. Nó được soạn thảo bởi các nhà nghiên cứu dân sự, với một cơ sở quân sự được lên kế hoạch làm địa điểm chủ nhà.

Chúng tôi đang công bố báo cáo tình báo mối đe dọa chi tiết nhất của mình cho đến nay.

Nó đề cập đến cách mọi người đã cố gắng lạm dụng Claude—cho các cuộc tấn công mạng, chiến dịch gây ảnh hưởng, giám sát, sinh học và chế tạo vũ khí—và cách chúng tôi phát hiện và ngăn chặn chúng.

Chúng tôi đã phá vỡ mọi hoạt động trong báo cáo,…

— Anthropic (@AnthropicAI) September 10, 2026

Tất cả các tương tác đã bị ngăn chặn, nhưng một cách vòng vo đã xuất hiện. Nền tảng được các nhà điều tra này sử dụng đã thiết lập một bản sao lưu sang mô hình của một công ty khác. Chính Claude đã hỗ trợ viết mã đó, với nhiệm vụ được trình bày với nó như một giải pháp cho việc từ chối quá mức.

Năm Trường Hợp, Không Có Chủ Ý Xấu Được Xác Lập

Báo cáo dài 154 trang và bao gồm năm sự cố liên quan đến sinh học. Anthropic đã vô hiệu hóa các tài khoản, giữ lại các phòng thí nghiệm, và sau đó kiềm chế khỏi lời buộc tội mà nhiều người mong đợi.

“Chúng tôi không khẳng định rằng họ có ý định gây hại, và việc xác định họ hoặc phòng thí nghiệm của họ có thể khiến họ gặp nguy hiểm,” nhóm nghiên cứu cho biết trong báo cáo.

Tuy nhiên, các bộ lọc đã hoạt động trong một số tình huống nhất định. Một nhà nghiên cứu tập trung vào cúm gia cầm đã được chuyển hướng sang các mô hình kém năng lực hơn, và Anthropic coi sự hỗ trợ đó chủ yếu là hành chính.

Các Trường Hợp Vũ Khí Sinh Học Của Anthropic Theo Số Liệu

  • 154 trang trong báo cáo
  • 5 trường hợp sinh học được công bố
  • 35 nỗ lực nghiên cứu được tìm thấy trong một cuộc quét 30 ngày các tổ chức liên kết nhà nước
  • 1 giờ: thời gian một người dùng mất để soạn thảo một đề xuất tài trợ về họ đậu mùa trên Opus 5

Khía Cạnh Đáng Lo Ngại

Hầu hết trong số 35 nỗ lực đó là nghiên cứu dân sự tiêu chuẩn. Đó là vấn đề. Cùng một chuyên môn có thể tạo ra vắc-xin hoặc vũ khí, và một bộ lọc không thể diễn giải ý định.

“Một bộ phân loại không thể đồng thời cho phép lợi ích và ngăn ngừa tác hại,” Anthropic cho biết.

Các ràng buộc của nó đã phải đối mặt với những thách thức trước đó. Vào tháng 4, một cộng đồng Discord đã truy cập vào mô hình bị hạn chế của nó ngay trong ngày đầu tiên.

Khi những lo ngại này leo thang, Washington đang hành động. Các hạ nghị sĩ Ted Lieu và Nathaniel Moran đã nộp dự luật AI Kill Switch Act vào tháng 7, yêu cầu các nhà phát triển giữ lại khả năng tắt hệ thống của họ.

Cùng một báo cáo đã loại bỏ các khách hàng sử dụng Claude để giám sát bất đồng chính kiến.

Chia sẻ tới

X (Twitter)Telegram

Tuyên bố miễn trừ trách nhiệm: Nội dung bài viết đến từ bên thứ ba, chỉ mang tính tham khảo và không phải lời khuyên đầu tư. Tiền mã hóa và các sản phẩm tài chính khác có rủi ro biến động giá lớn, vui lòng cân nhắc kỹ trước khi quyết định.

Bài viết liên quan