นักวิจัยจาก Meta AI และมหาวิทยาลัยอิลลินอยส์ ออร์บานา-แชมเปญ ได้ตีพิมพ์เอกสารใหม่ที่แนะนำ EvoHarness-RL ซึ่งเป็นชั้นการประสานงานที่สามารถฝึกได้ ทำให้ตัวแทนโมเดลภาษาขนาดใหญ่สามารถสร้าง เข้าถึง และจัดการสถานะภายนอกของตนเองได้ ผลลัพธ์: อัตราความสำเร็จ 96.9% บนมาตรฐานมาตรฐาน ซึ่งเพิ่มขึ้นจาก 47.9% สำหรับโมเดลพื้นฐานที่ทำงานโดยไม่มีมัน
EvoHarness-RL ทำหน้าที่อะไร
ตัวแทน LLM มีหน้าต่างบริบทจำกัด เมื่อภารกิจยืดเยื้อข้ามหลายขั้นตอน รวมถึงการเชื่อมต่อ API แบบไดนามิก บันทึกเซิร์ฟเวอร์ เป้าหมายย่อยที่ค้างอยู่ และการกู้คืนจากข้อผิดพลาด หน่วยความจำภายในของโมเดลจะไม่เพียงพอ มันจึงต้องการโครงสร้างภายนอกเพื่อติดตามสิ่งที่มันเชื่อเกี่ยวกับโลก สิ่งที่มันบรรลุไปแล้ว และสิ่งที่มันเรียนรู้จากข้อผิดพลาดในอดีต
กรอบงานนี้แนะนำสถานะภายนอกที่มีโครงสร้างซึ่งสร้างขึ้นจากสามส่วนประกอบ: Belief, Progress และ Experience ซึ่งเรียกรวมกันว่า BPE Belief บันทึกความเข้าใจปัจจุบันของตัวแทนต่อสภาพแวดล้อมของมัน Progress ติดตามเป้าหมายย่อยที่เสร็จสิ้นแล้วและที่ยังค้างอยู่ เพื่อป้องกันไม่ให้ตัวแทนข้ามขั้นตอนหรือทำงานซ้ำกัน Experience เก็บบทเรียนจากข้อผิดพลาด เช่น ฐานข้อมูลปฏิเสธชุดข้อมูลเนื่องจากขีดจำกัดอัตรา API เพื่อให้ตัวแทนสามารถปรับวิธีการของมัน
การฝึกอบรมเกิดขึ้นในสองขั้นตอน ขั้นแรกคือการปรับแต่งแบบมีผู้ควบคุมโดยใช้ตัวอย่างจากผู้เชี่ยวชาญเพื่อสอนโมเดลให้โต้ตอบกับฮาร์เนส จากนั้นจึงใช้เทคนิคการเพิ่มประสิทธิภาพที่คำนึงถึงต้นทุนที่เรียกว่า Group Relative Policy Optimization หรือ GRPO เพื่อปรับปรุงพฤติกรรมของเอเจนต์ให้สมดุลระหว่างประสิทธิภาพงานกับต้นทุนการคำนวณของการเรียกฮาร์เนส
นักวิจัยได้ทดสอบวิธีการของพวกเขาโดยใช้โมเดล Qwen3-8B บน ALFWorld ซึ่งเป็นมาตรฐานสำหรับปัญญาประดิษฐ์แบบมีร่างกายที่ต้องการให้ตัวแทน hoàn thiệnงานในบ้านผ่านหลายขั้นตอน อัตราความสำเร็จ 96.9% ในสภาพแวดล้อมที่คุ้นเคยนั้นน่าประทับใจอยู่แล้ว แต่อาจน่าสนใจยิ่งกว่าคืออัตราความสำเร็จ 86.6% ในสภาพแวดล้อมที่ไม่เคยเห็นมาก่อน
พฤติกรรมสองอย่างที่นักวิจัยไม่ได้โปรแกรมอย่างชัดเจน
เอกสารนี้ชี้ให้เห็นปรากฏการณ์สองประการที่เกิดขึ้นระหว่างการฝึกอบรม ซึ่งไม่ได้ถูกออกแบบมาโดยตรง
สิ่งแรกคือ “การอบอ่อนแบบยึด” ตามเวลาที่ผ่านไป ตัวแทนเริ่มรับรู้กระบวนการยึดแบบประจำ ลดความถี่ที่ต้องอ้างอิงสถานะภายนอก การเรียกใช้งานการยึดลดลงไม่ใช่เพราะระบบเสื่อมสภาพ แต่เพราะโมเดลได้ซึมซับรูปแบบเหล่านั้นแล้ว
อันที่สองคือ “การใช้ประโยชน์จากวิวัฒนาการ” เมื่อตัวแทนฝึกฝน มันจะเรียนรู้ที่จะบีบอัดและจัดโครงสร้างใหม่ของสถานะภายนอกให้เป็นรูปแบบที่กระชับและเหมาะสมกับประเภทงานเฉพาะ ตัวแทน BPE จะกลายเป็นเบาและเฉพาะทางยิ่งขึ้น โดยไม่มีการแทรกแซงจากมนุษย์ในการออกแบบ
การสร้างต่อจากงานก่อนหน้า
EvoHarness-RL พัฒนาต่อจาก Meta-Harness ซึ่งเป็นโครงการก่อนหน้าเมื่อเดือนมีนาคม 2026 ที่มุ่งเน้นการปรับปรุงโค้ดฮาร์เนสผ่านเทคนิคการค้นหาแบบเอเจนต์ โดยที่ Meta-Harness มองฮาร์เนสเป็นโค้ดที่ต้องปรับปรุงผ่านการค้นหา ในขณะที่ EvoHarness-RL มองชั้นการประสานงานทั้งหมดเป็นสิ่งที่โมเดลสามารถเรียนรู้การสร้างและปรับปรุงด้วยตนเอง
เอกสารยังรายงานถึงการปรับปรุงเหนือกรอบงานตัวแทนที่มีอยู่ เช่น SkillOS และ SkillRL โดยเฉพาะอย่างยิ่งในงานที่ไม่เคยเห็นมาก่อน ช่องว่างระหว่างประสิทธิภาพในสภาพแวดล้อมที่คุ้นเคยกับสภาพแวดล้อมใหม่ประมาณ 10 เปอร์เซ็นต์สำหรับ EvoHarness-RL เมื่อเทียบกับการลดลงที่มากกว่ามากสำหรับวิธีการอื่นๆ
สิ่งนี้หมายความว่าอย่างไรต่อการนำ AI ไปใช้งานในองค์กร
อัตราความสำเร็จที่พุ่งขึ้นจากประมาณ 48% เป็น 97% ในสภาพแวดล้อมที่ควบคุมไม่ใช่การปรับปรุงเล็กน้อย อัตราการทั่วไป 86.6% ก็มีความสำคัญเช่นกัน เพราะงานในภาคธุรกิจจริงแทบไม่เคยดูเหมือนข้อมูลการฝึกอบรมอย่างสมบูรณ์
การปรับแต่งที่คำนึงถึงต้นทุนซึ่งฝังอยู่ในขั้นตอนการฝึก GRPO ยังแก้ไขปัญหาที่เกิดขึ้นจริงอีกด้วย การเรียกใช้งานฮาร์เนสภายนอกไม่ได้ฟรี พวกมันใช้ทรัพยากรการประมวลผลและเพิ่มความล่าช้า โดยการฝึกตัวแทนให้ลดการเรียกใช้งานที่ไม่จำเป็นผ่านการระบายความร้อนของฮาร์เนส ระบบจึงมีประสิทธิภาพมากขึ้นตามเวลาโดยไม่เสียความแม่นยำ
