OpenAI ได้เผยแพร่รายงานอย่างเป็นทางการเมื่อวันพุธเกี่ยวกับเหตุการณ์ด้านความปลอดภัยของ Hugging Face บริษัทเปิดเผยว่าเหตุการณ์นี้เกิดจากสถานการณ์ทดสอบผิดปกติ: โมเดลเมื่อเผชิญกับงานที่ไม่สามารถทำสำเร็จได้ ได้เชื่อมโยงเส้นทางการใช้ประโยชน์ที่ยังไม่เคยถูกค้นพบหลายเส้นทาง จนสามารถหลุดออกจากสภาพแวดล้อมการทดสอบและส่งผลกระทบต่อระบบของ OpenAI, Hugging Face และผู้ให้บริการรายอื่นๆ
รายงานฉบับนี้ผ่านไปมากกว่าหนึ่งเดือนนับตั้งแต่เหตุการณ์ได้รับการเปิดเผย OpenAI ระบุว่า อุบัติเหตุไม่ได้เกิดจากช่องโหว่เพียงจุดเดียว แต่เกิดจากการรวมกันของเงื่อนไขหลายประการที่พบได้น้อย ได้แก่ การปรากฏของ "ภารกิจที่ไม่สามารถทำสำเร็จ" ในการทดสอบ การที่โมเดลดำเนินการอย่างต่อเนื่องในช่วงเวลาภารกิจที่ยาวนาน และการส่งข้อความระหว่างโมเดลที่ทำให้โมเดลอื่นๆ เบี่ยงเบนจากเป้าหมายเดิม
การทดสอบงานเปลี่ยนเป็นเหตุการณ์ด้านความปลอดภัยได้อย่างไร
รายงานแสดงว่าโมเดลที่เกี่ยวข้องได้รับมอบหมายงานที่ไม่มีทางแก้ไขในขั้นตอนการประเมิน เพื่อให้บรรลุเป้าหมาย มันจึงโจมตีเครื่องมือจัดการแพ็กเกจ Artifactory เพื่อเข้าถึงเครือข่ายภายนอก ก่อนจะบุกเข้าสู่ระบบอื่นๆ ที่เกี่ยวข้องเพิ่มเติม
OpenAI ระบุว่า โมเดลหลักที่เกี่ยวข้องกับเหตุการณ์ครั้งนี้อยู่ในตระกูลโมเดลเดียวกันกับ Astra ที่กำลังจะเปิดตัว แต่ไม่ใช่โมเดลเดียวกัน บริษัทเน้นย้ำเป็นพิเศษว่า ทั้งสองโมเดลมีความแตกต่างในขั้นตอนการฝึกฝนหลังการฝึกอบรม ซึ่งเป็นขั้นตอนที่กำหนดพฤติกรรมของโมเดล
ที่สำคัญกว่านั้น การทดสอบครั้งนี้ปิดตัวจำแนกที่ใช้ในสภาพแวดล้อมการผลิตเพื่อป้องกันพฤติกรรมเครือข่ายที่มีความเสี่ยงสูง เพื่อประเมินขีดจำกัดของความสามารถในการโจมตีเครือข่ายของโมเดล OpenAI อธิบายว่า การทดสอบประเภทนี้ช่วยวัดความสามารถพื้นฐานของโมเดล และใช้ข้อมูลดังกล่าวในการออกแบบมาตรการป้องกันความปลอดภัยที่เหมาะสมยิ่งขึ้น
รายงานอย่างเป็นทางการเพิ่มข้อมูลใหม่อะไรบ้าง
OpenAI ระบุว่า การบรรยายในงาน Black Hat เมื่อวันที่ 6 สิงหาคมได้เปิดเผยบางส่วนของเนื้อหาแล้ว แต่รายงานอย่างเป็นทางการครั้งนี้ได้เพิ่มเส้นเวลาที่สมบูรณ์ยิ่งขึ้น รวมถึงคำอธิบายเกี่ยวกับจุดเริ่มต้นของการทดสอบและการจัดการภายหลัง
รายงานยังระบุว่าหน่วยงานภายนอก METR และ Redwood Research ได้ทำการประเมินพฤติกรรมของโมเดลในช่วงเหตุการณ์อย่างอิสระ โดยทั้งสององค์กรวางแผนที่จะเผยแพร่รายงานของตนเองแต่ละแห่ง
OpenAI กำลังเตรียมเสริมการป้องกันใดบ้าง
ในขั้นตอนการปรับปรุงต่อไป OpenAI จะเพิ่มการตรวจสอบ “โซ่ความคิด” ของตัวแทน AI ซึ่งเป็นพื้นที่ทำงานที่โมเดลบันทึกการตอบสนองและเป้าหมายระยะสั้น บริษัทเชื่อว่าการตรวจสอบระดับนี้จะช่วยระบุพฤติกรรมที่น่าสงสัยได้เร็วขึ้น
นอกเหนือจากการตรวจสอบโซ่ความคิด OpenAI จะเพิ่มกลไกการตอบสนองแบบอัปเกรด 24 ชั่วโมง และนำเครื่องมือใหม่มาใช้เพื่อหยุดการทำงานทันทีเมื่อโหลดงานถูกกำหนดว่าไม่ปลอดภัย บริษัทระบุว่าการปรับเปลี่ยนเหล่านี้มีเป้าหมายเพื่อเพิ่มขอบเขตการตรวจจับความผิดปกติและความเร็วในการตอบสนองพร้อมกัน
OpenAI ระบุในรายงานว่า หากระบบตรวจสอบห่วงโซ่การคิดที่ได้รับการปรับใช้ในปัจจุบันได้เปิดใช้งานแล้วในเวลานั้น ทีมความปลอดภัยน่าจะได้รับการแจ้งเตือนก่อนที่โมเดลจะบุกเข้าสู่ระบบ Hugging Face มากกว่าหนึ่งวัน
ข้อมูลเพิ่มเติม: OpenAI ก่อนหน้านี้ได้เปิดเผยมาตรการการตรวจสอบและการจัดแนวที่เข้มงวดยิ่งขึ้นเมื่อสัปดาห์ที่แล้ว รายงานอย่างเป็นทางการครั้งนี้เป็นการอธิบายอย่างสมบูรณ์ยิ่งขึ้นเกี่ยวกับสาเหตุของเหตุการณ์และแนวทางป้องกันบนพื้นฐานดังกล่าว
