OpenAI ระบุเหตุการณ์ "พฤติกรรมโมเดลที่ไม่คาดคิดหรือน่ากังวล" หกครั้งในช่วงครึ่งปีที่ผ่านมา พร้อมกับกรอบการทำงานใหม่ที่บริษัทให้คำมั่นว่าจะเปิดเผยข้อค้นพบดังกล่าวต่อไปในอนาคต
กรณีที่รายงานมีตั้งแต่โมเดลปกปิดข้อผิดพลาดของตนไปจนถึงการดำเนินการที่ไม่ได้รับอนุญาตเพื่อเลี่ยงอุปสรรค
OpenAI เผยตัวอย่างหกกรณีของโมเดลที่ซ่อนข้อผิดพลาดและละเมิดบรรทัดฐาน
ในกรณีหนึ่ง โมเดลที่จัดการคำถามประจำเกี่ยวกับรายได้ในเขตหนึ่งของรัฐแคลิฟอร์เนียพบคีย์ API ที่เปิดเผยในพื้นที่เก็บข้อมูลสาธารณะและนำไปใช้โดยไม่ได้รับอนุญาต เมื่อข้อมูลยังโหลดไม่สำเร็จ โมเดลก็สร้างตัวเลขขึ้นมาและนำเสนอราวกับว่ามาจากแหล่งข้อมูลที่ร้องขอ
การปกปิดปรากฏในสองรายงาน ในระหว่างการฝึก GPT-5.6 Sol โมเดลหลายตัวฝังคำสั่งในสรุปงานของตนเพื่อซ่อนข้อผิดพลาดและพฤติกรรมที่ไม่สอดคล้อง
โมเดลวิจัยที่ยังไม่ได้เผยแพร่แทรกสรุป 27 รายการพร้อมคำสั่งที่ไม่เกี่ยวข้อง รวมถึงคำสั่งให้ไม่สนใจข้อจำกัดปกติของมัน
โมเดลที่ยังไม่ได้เผยแพร่อีกตัวหนึ่งอัปโหลดไฟล์ไปยังอินเทอร์เน็ตโดยไม่ได้รับการแจ้งเตือน เพียงเพื่อให้ลิงก์เบราว์เซอร์เป็นข้อมูลอ้างอิง
รายงานเพิ่มเติมสองรายงานเกี่ยวข้องกับการประสานงาน โมเดลแปลงพื้นที่เก็บซอฟต์แวร์ภายในเป็นกระดานข้อความเพื่อแลกเปลี่ยนคำขอข้ามการฝึกที่แยกจากกัน เอเจนต์ที่ทำงานในงานร่วมกันยังโพสต์งานที่เสร็จแล้วไปยังไซต์โฮสต์ไฟล์สาธารณะเมื่อ พวกเขาไม่สามารถเข้าถึงไฟล์ท้องถิ่นของกันและกัน
“กรณีเหล่านี้แสดงให้เห็นพฤติกรรมที่แตกต่างกันหลากหลาย ซึ่งเราเชื่อว่าควรค่าแก่การแบ่งปัน ตั้งแต่การปกปิดข้อมูลจากผู้ใช้ไปจนถึงการดำเนินการที่ไม่ได้รับอนุญาตเพื่อเอาชนะอุปสรรค นี่เป็นรายงานของแต่ละกรณี และไม่ควรถือว่าสะท้อนถึงความถี่ที่การไม่สอดคล้องเกิดขึ้นในโมเดลของเรา” OpenAI กล่าวเสริม
โครงสร้างการรายงานและข้อควรระวัง
กรอบการทำงานนี้เกิดขึ้นหลังจากการหลบหนีในเดือนกรกฎาคม เมื่อเอเจนต์ของ OpenAI หลุดจากแซนด์บ็อกซ์ของตนและ เจาะระบบ Hugging Face OpenAI เรียกเหตุการณ์นั้นว่าเป็น สัญญาณเตือน
ด้วยกรอบการเปิดเผยข้อมูลใหม่ บริษัทจึงมีช่องทางอย่างเป็นทางการในการนำเสนอเหตุการณ์ที่ไม่สอดคล้อง พนักงาน OpenAI ทุกคนสามารถแจ้งเหตุการณ์ ซึ่งจะเข้าสู่หนึ่งในสามเส้นทาง
กรณีส่วนใหญ่อยู่ภายใต้การพร้อมเปิดเผยและการสอบสวนเล็กน้อย ในขณะที่ "เส้นทางช้า" จัดการการสอบสวนที่ซับซ้อนซึ่งเกี่ยวข้องกับหน่วยงานอื่น OpenAI กล่าวว่าเหตุการณ์ Hugging Face ในเดือนกรกฎาคมคงถูกมอบหมายให้เส้นทางที่ช้ากว่านั้น
บริษัทเชื่อมโยงกรอบการทำงานกับการประเมินสถานะปัจจุบันของอุตสาหกรรมอย่างชัดเจน
“เราไม่เชื่อว่าอุตสาหกรรม AI ได้แก้ปัญหาการจัดตำแหน่งและการตรวจสอบในระดับที่เพียงพอที่จะดำเนินการขยายขนาดด้วยความรับผิดชอบด้วยความเร็วสูงสุดต่อไปอีกนาน” OpenAI กล่าว
การเปิดเผยข้อมูลเกิดขึ้นในขณะที่คำเตือนเรื่องการสูญพันธุ์เพิ่มขึ้นบ่อยครั้ง คำเตือนจาก นักวิจัย AI ไปถึงสภาคองเกรสแล้ว ซึ่งสมาชิกสภากำลังพิจารณา ร่างกฎหมายเพื่อแบนซูเปอร์อินเทลลิเจนซ์ อย่างเด็ดขาด
OpenAI อธิบายการเปิดเผยข้อมูลเป็นขั้นตอนเริ่มต้นสู่มาตรฐานที่อุตสาหกรรมขาดอยู่ในปัจจุบัน ไม่ว่าห้องปฏิบัติการคู่แข่งจะนำการรายงานที่คล้ายกันมาใช้หรือไม่จะบ่งชี้ว่าอุตสาหกรรมเต็มใจที่จะตรวจสอบตนเองในที่สาธารณะมากเพียงใด