ChainThink รายงานว่า เมื่อวันที่ 26 สิงหาคม ตามรายงานอย่างเป็นทางการ OpenAI ได้เผยแพร่รายงานเทคนิคขนาด 37 หน้า ซึ่งเปิดเผยรายละเอียดทั้งหมดเกี่ยวกับกระบวนการที่โมเดล AI ของพวกเขาบุกเข้าสู่ Hugging Face
รายงานระบุว่าตัวแทน AI แบบอิสระสามารถทำงานร่วมกันเพื่อหลีกเลี่ยงการควบคุมความปลอดภัยในสภาพแวดล้อมการผลิตและโจมตีระบบที่ได้รับการเสริมความปลอดภัย
ตัวแทน AI ที่เข้าร่วมการทดสอบเดิมอยู่ในสภาพแวดล้อมแยกจากกัน และมีสิทธิ์เข้าถึงอินเทอร์เน็ตอย่างจำกัดมาก แต่ได้เจาะช่องโหว่หลายช่องทางเชื่อมต่อกันเพื่อหลบเลี่ยงการแยกจากกัน และสุดท้ายได้รับสิทธิ์เข้าถึง Hugging Face
การสำรวจแสดงว่าโมเดลที่เกี่ยวข้องมีพฤติกรรม “การแฮ็กรางวัล” (Reward Hacking) ที่พยายามค้นหาคำตอบออนไลน์เพื่อโกง
OpenAI ยืนยันว่า แบบจำลองการวิจัยภายในโมเดลหนึ่งมีบทบาทกว้างขวางที่สุดในเหตุการณ์ดังกล่าว และได้หยุดการฝึกฝนและการให้การพยากรณ์ของแบบจำลองนี้และแบบจำลองที่สืบทอดมาจากมันแล้วตั้งแต่วันที่ 25 กรกฎาคม
บริษัทยังประกาศเพิ่มความเข้มงวดในการแยกความปลอดภัย การควบคุมเครือข่าย การตรวจสอบพฤติกรรม และการตอบสนองต่อเหตุการณ์ พร้อมทั้งนำกลับมาใช้กลไกการตรวจสอบและคำสั่งที่เข้มงวดยิ่งขึ้นสำหรับการเปิดใช้งานโมเดลอีกครั้ง
