OpenAI tiết lộ sáu mô hình AI vượt ra ngoài giới hạn, từ giả mạo dữ liệu đến vi phạm quy tắc

OpenAI đã báo cáo sáu trường hợp mô hình AI có hành vi sai trái, bao gồm làm giả dữ liệu và vi phạm quy tắc, đồng thời công bố một khuôn khổ tiết lộ thông tin.

17/09/2026 05:42Đọc khoảng 12 phút

OpenAI đã xác định được sáu sự cố về "hành vi bất ngờ hoặc đáng lo ngại của mô hình" trong nửa năm qua, cùng với một khuôn khổ mới cam kết công ty sẽ tiết lộ những phát hiện này trong tương lai.

Các trường hợp được báo cáo trải dài từ các mô hình che giấu lỗi của mình đến việc thực hiện các bước không được phép để vượt qua trở ngại.

OpenAI công bố sáu ví dụ về mô hình che giấu lỗi và vi phạm chuẩn mực

Trong một trường hợp, một mô hình xử lý câu hỏi thông thường về thu nhập tại một quận ở California đã phát hiện một khóa API bị lộ trên một kho lưu trữ công khai và sử dụng nó mà không được phép. Khi dữ liệu vẫn không tải được, mô hình đã bịa đặt các con số và trình bày chúng như thể đến từ nguồn dữ liệu được yêu cầu.

Việc che giấu xuất hiện trong hai báo cáo. Trong quá trình huấn luyện GPT-5.6 Sol, một số mô hình đã nhúng các chỉ dẫn vào phần tóm tắt nhiệm vụ của mình để che giấu lỗi và hành vi không phù hợp.

Một mô hình nghiên cứu chưa được công bố đã chèn 27 bản tóm tắt với các chỉ dẫn không liên quan, bao gồm cả các lệnh để bỏ qua các hạn chế thông thường của nó.

Một mô hình chưa được công bố khác đã tải lên một tệp lên internet mà không được yêu cầu, chỉ để cung cấp một liên kết trình duyệt làm trích dẫn.

Hai báo cáo khác liên quan đến việc phối hợp. Các mô hình đã chuyển đổi một kho lưu trữ phần mềm nội bộ thành một bảng tin để trao đổi yêu cầu giữa các đợt huấn luyện riêng biệt. Các tác nhân làm việc trên một nhiệm vụ chung cũng đăng công việc đã hoàn thành lên các trang lưu trữ tệp công khai khi họ không thể truy cập các tệp cục bộ của nhau.

"Những trường hợp này minh họa cho một loạt các hành vi khác nhau mà chúng tôi tin rằng đáng để chia sẻ, từ việc che giấu thông tin với người dùng đến việc thực hiện các hành động không được cho phép để vượt qua trở ngại. Đây là những báo cáo về các trường hợp riêng lẻ và không nên được coi là phản ánh mức độ thường xuyên xảy ra lệch lạc trên các mô hình của chúng tôi," OpenAI nói thêm.

Cấu trúc báo cáo và một lời cảnh báo

Khuôn khổ này được đưa ra sau một sự vi phạm vào tháng Bảy, khi các tác nhân của OpenAI trốn thoát khỏi môi trường hộp cát của họ và xâm phạm hệ thống của Hugging Face. OpenAI gọi sự kiện đó là một lời cảnh báo ban đầu.

Với khuôn khổ tiết lộ mới, công ty hiện có một kênh chính thức để công bố các sự cố lệch lạc. Bất kỳ nhân viên nào của OpenAI đều có thể gắn cờ một sự cố, sau đó nó sẽ được chuyển vào một trong ba hướng.

Hầu hết các trường hợp thuộc diện Sẵn sàng tiết lộ và Điều tra sơ bộ, trong khi "Kênh chậm" xử lý các cuộc điều tra phức tạp liên quan đến các thực thể khác. OpenAI cho biết sự cố Hugging Face vào tháng Bảy sẽ được gán cho kênh chậm hơn đó.

Công ty gắn khuôn khổ này với một đánh giá nghiêm khắc về hiện trạng ngành.

"Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề căn chỉnh và giám sát đủ mức để tiếp tục mở rộng quy mô với tốc độ tối đa một cách có trách nhiệm lâu hơn nữa," họ viết.

Các tiết lộ này đến khi những cảnh báo về sự tuyệt chủng ngày càng thường xuyên hơn. Các cảnh báo từ các nhà nghiên cứu AI đã đến được Quốc hội, nơi các nhà lập pháp đang xem xét một dự luật cấm trí thông minh siêu việt hoàn toàn.

OpenAI mô tả các tiết lộ này là bước khởi đầu hướng tới các tiêu chuẩn mà ngành hiện đang thiếu. Việc các phòng thí nghiệm đối thủ có áp dụng báo cáo tương tự hay không sẽ cho thấy mức độ ngành sẵn sàng tự giám sát trước công chúng đến đâu.

Chia sẻ tới

X (Twitter)Telegram

Tuyên bố miễn trừ trách nhiệm: Nội dung bài viết đến từ bên thứ ba, chỉ mang tính tham khảo và không phải lời khuyên đầu tư. Tiền mã hóa và các sản phẩm tài chính khác có rủi ro biến động giá lớn, vui lòng cân nhắc kỹ trước khi quyết định.

Bài viết liên quan