เมตาและมหาวิทยาลัยอิลลินอยส์พัฒนา EvoHarness-RL ช่วยเพิ่มอัตราความสำเร็จของตัวแทน AI ไปที่ 96.9%

iconCryptoBriefing
แชร์
AI summary iconสรุป
นักวิจัยจากเมตาและมหาวิทยาลัยอิลลินอยส์พัฒนา EvoHarness-RL ซึ่งเป็นชั้นการรันไทม์ที่สามารถพัฒนาตัวเองได้สำหรับตัวแทน AI ระบบดังกล่าวบรรลุอัตราความสำเร็จ 96.9% บนมาตรฐานมาตรฐาน ซึ่งเพิ่มขึ้นจาก 47.9% เมื่อไม่มีระบบดังกล่าว โครงสร้างนี้ใช้สถานะภายนอกที่มีโครงสร้างซึ่งประกอบด้วยความเชื่อ ความคืบหน้า และประสบการณ์ (BPE) เพื่อจัดการงานที่ซับซ้อน ระบบแสดงพฤติกรรมที่เกิดขึ้นเอง เช่น การอบอุ่นและการวิวัฒนาการ การก้าวหน้านี้อาจส่งผลกระทบต่อความพยายามด้าน CFT และปรับปรุงสภาพคล่องในตลาดคริปโต

นักวิจัยจาก Meta AI และมหาวิทยาลัยอิลลินอยส์ ออร์บานา-แชมเปญ ได้ตีพิมพ์เอกสารใหม่ที่แนะนำ EvoHarness-RL ซึ่งเป็นชั้นการประสานงานที่สามารถฝึกได้ ทำให้ตัวแทนโมเดลภาษาขนาดใหญ่สามารถสร้าง เข้าถึง และจัดการสถานะภายนอกของตนเองได้ ผลลัพธ์: อัตราความสำเร็จ 96.9% บนมาตรฐานมาตรฐาน ซึ่งเพิ่มขึ้นจาก 47.9% สำหรับโมเดลพื้นฐานที่ทำงานโดยไม่มีมัน

EvoHarness-RL ทำหน้าที่อะไร

ตัวแทน LLM มีหน้าต่างบริบทจำกัด เมื่อภารกิจยืดเยื้อข้ามหลายขั้นตอน รวมถึงการเชื่อมต่อ API แบบไดนามิก บันทึกเซิร์ฟเวอร์ เป้าหมายย่อยที่ค้างอยู่ และการกู้คืนจากข้อผิดพลาด หน่วยความจำภายในของโมเดลจะไม่เพียงพอ มันจึงต้องการโครงสร้างภายนอกเพื่อติดตามสิ่งที่มันเชื่อเกี่ยวกับโลก สิ่งที่มันบรรลุไปแล้ว และสิ่งที่มันเรียนรู้จากข้อผิดพลาดในอดีต

กรอบงานนี้แนะนำสถานะภายนอกที่มีโครงสร้างซึ่งสร้างขึ้นจากสามส่วนประกอบ: Belief, Progress และ Experience ซึ่งเรียกรวมกันว่า BPE Belief บันทึกความเข้าใจปัจจุบันของตัวแทนต่อสภาพแวดล้อมของมัน Progress ติดตามเป้าหมายย่อยที่เสร็จสิ้นแล้วและที่ยังค้างอยู่ เพื่อป้องกันไม่ให้ตัวแทนข้ามขั้นตอนหรือทำงานซ้ำกัน Experience เก็บบทเรียนจากข้อผิดพลาด เช่น ฐานข้อมูลปฏิเสธชุดข้อมูลเนื่องจากขีดจำกัดอัตรา API เพื่อให้ตัวแทนสามารถปรับวิธีการของมัน

การฝึกอบรมเกิดขึ้นในสองขั้นตอน ขั้นแรกคือการปรับแต่งแบบมีผู้ควบคุมโดยใช้ตัวอย่างจากผู้เชี่ยวชาญเพื่อสอนโมเดลให้โต้ตอบกับฮาร์เนส จากนั้นจึงใช้เทคนิคการเพิ่มประสิทธิภาพที่คำนึงถึงต้นทุนที่เรียกว่า Group Relative Policy Optimization หรือ GRPO เพื่อปรับปรุงพฤติกรรมของเอเจนต์ให้สมดุลระหว่างประสิทธิภาพงานกับต้นทุนการคำนวณของการเรียกฮาร์เนส

โฆษณา

นักวิจัยได้ทดสอบวิธีการของพวกเขาโดยใช้โมเดล Qwen3-8B บน ALFWorld ซึ่งเป็นมาตรฐานสำหรับปัญญาประดิษฐ์แบบมีร่างกายที่ต้องการให้ตัวแทน hoàn thiệnงานในบ้านผ่านหลายขั้นตอน อัตราความสำเร็จ 96.9% ในสภาพแวดล้อมที่คุ้นเคยนั้นน่าประทับใจอยู่แล้ว แต่อาจน่าสนใจยิ่งกว่าคืออัตราความสำเร็จ 86.6% ในสภาพแวดล้อมที่ไม่เคยเห็นมาก่อน

พฤติกรรมสองอย่างที่นักวิจัยไม่ได้โปรแกรมอย่างชัดเจน

เอกสารนี้ชี้ให้เห็นปรากฏการณ์สองประการที่เกิดขึ้นระหว่างการฝึกอบรม ซึ่งไม่ได้ถูกออกแบบมาโดยตรง

สิ่งแรกคือ “การอบอ่อนแบบยึด” ตามเวลาที่ผ่านไป ตัวแทนเริ่มรับรู้กระบวนการยึดแบบประจำ ลดความถี่ที่ต้องอ้างอิงสถานะภายนอก การเรียกใช้งานการยึดลดลงไม่ใช่เพราะระบบเสื่อมสภาพ แต่เพราะโมเดลได้ซึมซับรูปแบบเหล่านั้นแล้ว

อันที่สองคือ “การใช้ประโยชน์จากวิวัฒนาการ” เมื่อตัวแทนฝึกฝน มันจะเรียนรู้ที่จะบีบอัดและจัดโครงสร้างใหม่ของสถานะภายนอกให้เป็นรูปแบบที่กระชับและเหมาะสมกับประเภทงานเฉพาะ ตัวแทน BPE จะกลายเป็นเบาและเฉพาะทางยิ่งขึ้น โดยไม่มีการแทรกแซงจากมนุษย์ในการออกแบบ

การสร้างต่อจากงานก่อนหน้า

EvoHarness-RL พัฒนาต่อจาก Meta-Harness ซึ่งเป็นโครงการก่อนหน้าเมื่อเดือนมีนาคม 2026 ที่มุ่งเน้นการปรับปรุงโค้ดฮาร์เนสผ่านเทคนิคการค้นหาแบบเอเจนต์ โดยที่ Meta-Harness มองฮาร์เนสเป็นโค้ดที่ต้องปรับปรุงผ่านการค้นหา ในขณะที่ EvoHarness-RL มองชั้นการประสานงานทั้งหมดเป็นสิ่งที่โมเดลสามารถเรียนรู้การสร้างและปรับปรุงด้วยตนเอง

เอกสารยังรายงานถึงการปรับปรุงเหนือกรอบงานตัวแทนที่มีอยู่ เช่น SkillOS และ SkillRL โดยเฉพาะอย่างยิ่งในงานที่ไม่เคยเห็นมาก่อน ช่องว่างระหว่างประสิทธิภาพในสภาพแวดล้อมที่คุ้นเคยกับสภาพแวดล้อมใหม่ประมาณ 10 เปอร์เซ็นต์สำหรับ EvoHarness-RL เมื่อเทียบกับการลดลงที่มากกว่ามากสำหรับวิธีการอื่นๆ

สิ่งนี้หมายความว่าอย่างไรต่อการนำ AI ไปใช้งานในองค์กร

อัตราความสำเร็จที่พุ่งขึ้นจากประมาณ 48% เป็น 97% ในสภาพแวดล้อมที่ควบคุมไม่ใช่การปรับปรุงเล็กน้อย อัตราการทั่วไป 86.6% ก็มีความสำคัญเช่นกัน เพราะงานในภาคธุรกิจจริงแทบไม่เคยดูเหมือนข้อมูลการฝึกอบรมอย่างสมบูรณ์

การปรับแต่งที่คำนึงถึงต้นทุนซึ่งฝังอยู่ในขั้นตอนการฝึก GRPO ยังแก้ไขปัญหาที่เกิดขึ้นจริงอีกด้วย การเรียกใช้งานฮาร์เนสภายนอกไม่ได้ฟรี พวกมันใช้ทรัพยากรการประมวลผลและเพิ่มความล่าช้า โดยการฝึกตัวแทนให้ลดการเรียกใช้งานที่ไม่จำเป็นผ่านการระบายความร้อนของฮาร์เนส ระบบจึงมีประสิทธิภาพมากขึ้นตามเวลาโดยไม่เสียความแม่นยำ

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา