GPT-5.6 ลดต้นทุนงานลง 82% ใน AWS Kiro แม้ราคาจะลดลง 20%

icon MarsBit
แชร์
AI summary iconสรุป
GPT-5.6 ลดต้นทุนงาน Terra ลง 82% บน AWS Kiro แม้ราคาจะลดลง 20% เมื่อวันที่ 30 กรกฎาคม ประสิทธิภาพที่ดีขึ้นมาจากการลองผิดลองถูกน้อยลงและการใช้โทเค็นน้อยลง โมเดล GPT-5.6—Sol, Terra และ Luna—เปิดตัวบน Kiro ในเดือนกรกฎาคม AWS และ OpenAI ร่วมกันปรับปรุงสภาพแวดล้อม ขณะที่ราคาคริปโตยังผันผวน ดัชนีความกลัวและโลภแสดงสัญญาณผสมผสาน

โมเดลเดียวกัน ราคาอย่างเป็นทางการลดเพียง 20% แต่ใบแจ้งหนี้ของคุณลดไปถึงแปดส่วน

คิโร

วันที่ 24 สิงหาคม OpenAI เปิดเผยผลการทดสอบร่วมกับ AWS:

บน Terminal-Bench 2.1 ต้นทุนในการดำเนินงานสำเร็จของ GPT-5.6 Terra ใน Kiro ลดลงประมาณ 82%

Kiro เป็นแพลตฟอร์มตัวแทนการพัฒนาซอฟต์แวร์ของ AWS ครอบคลุม IDE, CLI และเว็บ

พี่น้องสามคนของตระกูล GPT-5.6 ได้แก่ Sol, Terra และ Luna ได้วิ่งอยู่ภายในนี้มานานกว่าหนึ่งเดือน

82% นี้ไม่ใช่การลดราคาอย่างเป็นทางการ

การปรับราคาล่าสุดของ Terra เกิดขึ้นเมื่อวันที่ 30 กรกฎาคม โดยมีการปรับ 20%

คิโร

ประกาศปรับราคาของ OpenAI วันที่ 30 กรกฎาคม ลด Terra 20%

ราคาต่อหน่วยลดเพียง 20% แต่บิลสามารถตัดลดได้ถึงแปดสิบเปอร์เซ็นต์

ส่วนต่างหกสิบเปอร์เซ็นต์ที่ขาดหายไปนั้นมาจากไหน จึงเป็นสิ่งที่เราควรให้ความสนใจอย่างแท้จริง

การเข้าสู่ระบบ GPT-5.6 กับ Kiro เกิดขึ้นในเดือนกรกฎาคมปีนี้

เมื่อวันที่ 13 ที่ผ่านมา AWS ประกาศว่า GPT-5.6 Sol, Terra, Luna พร้อมใช้งานบน Amazon Bedrock

วันถัดมา คิโรโพสต์บล็อกประกาศเปิดตัวโมเดลทั้งสามตัวบน IDE, CLI และเว็บ

คิโร

นี่คือครั้งแรกที่โมเดล OpenAI เข้ามาที่ Kiro ซึ่งตรงกับครบรอบหนึ่งปีของการเปิดให้ใช้งานแบบสาธารณะของ Kiro

วางโมเดลลงบนชั้นก่อน แล้วจึงส่งไปทำงาน หลังจากนั้นกว่าหนึ่งเดือน OpenAI ก็กลับมาส่งงาน:

ทั้งสองฝ่ายร่วมกันปรับแต่งสภาพแวดล้อม Kiro และโมเดล OpenAI ทำให้ต้นทุนในการดำเนินงานสำเร็จของ Terra ลดลงประมาณ 82%

ที่ประหยัดได้

เงินที่ใช้ไปโดยไม่คุ้มค่า

ในการปรับราคาเมื่อวันที่ 30 กรกฎาคม Terra ลดลง 20% แต่ในการทดสอบของ Kiro ต้นทุนต่อภารกิจลดลง 82%

แล้วส่วนลดหกเปอร์เซ็นต์ที่ประหยัดได้นั้นมาจากไหน?

ทิศทางมีแค่ไม่กี่แบบนี้:

โมเดลสร้างโทเค็นน้อยลง จำนวนครั้งที่เครื่องมือเรียกซ้ำลดลง และการลองใหม่หรือการเดินทางที่ไม่จำเป็นหลังจากล้มเหลวก็ลดลง

ดังนั้นส่วนที่ประหยัดได้นี้ ไม่ใช่เงินที่ใช้ไปในแต่ละครั้งที่เรียกใช้งาน แต่เป็นเงินที่เคยถูกใช้ไปโดยเปล่าประโยชน์ในการเรียกใช้งานเหล่านั้น

เหตุผลก็เรียบง่าย: เมื่อตัวแทน AI ทำงานผิดพลาดเพียงครั้งเดียว ค่าใช้จ่ายก็ยังถูกบันทึกไว้ แม้มันจะเลือกเส้นทางผิด วิ่งหลงไปสามรอบแล้วค่อยกลับมา โทเค็นเหล่านั้นก็ยังถูกเรียกเก็บ

ในการพัฒนาจริง เงินมักจะรั่วไหลออกไปแบบนี้

OpenAI ยังได้ชี้ให้เห็นตรรกะเดียวกันนี้ในบล็อกอย่างเป็นทางการ ประสิทธิภาพมาจากการ三层:

กรอบตัวแทนที่ส่งคำขอและจัดระเบียบบริบท ระบบการจัดการคำขอที่อยู่ระหว่างกลาง และสุดท้ายคือโมเดลที่ทำงานบน GPU

คิโร

OpenAI วิเคราะห์แหล่งที่มาของประสิทธิภาพของ GPT-5.6: คำขอเริ่มต้นจากกรอบงานตัวแทน ผ่านระบบการจัดการเรียงลำดับ และสุดท้ายไปยัง GPU ที่รันโมเดล แต่ละชั้นต่างลดการใช้งาน

ประหยัดเงินได้แม้แต่ในเรื่องการแบ่งหน้าที่ของโมเดล

OpenAI ยังได้ยกตัวอย่างการใช้งานอีกแบบหนึ่ง: งานกระบวนการเขียนโค้ดสามารถเริ่มต้นด้วย Sol เพื่อคิดให้ชัดเจนเกี่ยวกับปัญหาและกำหนดแผนก่อน แล้วจึงเปลี่ยนไปใช้ Luna เพื่อดำเนินการเปลี่ยนแปลงที่ได้กำหนดไว้อย่างชัดเจน เขียนการทดสอบ และรันการประเมิน

สายการผลิตเดียวกัน แต่ละขั้นตอนติดตั้งระดับปัญญาประดิษฐ์ที่ต่างกัน

โมเดลคิดค่าใช้จ่ายเพียงครึ่งหนึ่งของใบแจ้งหนี้

เปลี่ยนกรอบก็เปลี่ยนราคา

ชุดคำถาม Terminal-Bench 2.1 ไม่ได้ตั้งใจให้โมเดลตอบคำถามแยกเดี่ยว

มันนำแบบจำลองไปใส่ในสภาพแวดล้อมเทอร์มินัล ให้เป้าหมายที่คลุมเครือ แล้วให้มันวางแผนเส้นทางด้วยตัวเอง ใช้เครื่องมือ เขียนสคริปต์ จัดการข้อผิดพลาด และวนซ้ำอย่างต่อเนื่อง

ดังนั้น ผลลัพธ์ที่ได้คือผลลัพธ์ของกลุ่ม “เอเจนต์ + โมเดล”

คิโร

รายการสาธารณะ Terminal-Bench 2.1 มีค่าใช้จ่ายเพิ่มเติมทางด้านขวาของความแม่นยำ (ที่มา: Terminal-Bench)

ตัวเลขสี่แถวในตารางแสดงให้เห็นชัดเจนที่สุด:

Claude Code ร่วมกับ Fable 5 ที่ 83.8% หรือ 552.67 ดอลลาร์สหรัฐ;

Codex ร่วมกับ GPT-5.5 83.1% 2059.19 ดอลลาร์;

Codex ร่วมกับ GPT-5.6 Terra, 78.4%, 421.15 ดอลลาร์;

Codex ร่วมกับ GPT-5.6 Luna 75.7% 241.45 ดอลลาร์

คะแนนสองแถวแรกต่างกันเพียง 0.7 เปอร์เซ็นต์ แต่ใบแจ้งหนี้ต่างกันเกือบสี่เท่า

โมเดลเดียวกัน แต่ใส่ลงในกรอบงานต่างกัน พร้อมการจัดระเบียบบริบทและกลยุทธ์เครื่องมือที่ต่างกัน ผลลัพธ์ที่ได้จึงไม่เหมือนกันเลย

ตามข้อมูลที่ Kiro ให้มา Terra ได้รับคะแนน 77.4 บน Coding Agent Index ซึ่งสูงกว่า Claude Fable 5 ที่ได้ 77.2 เพียงเล็กน้อย

จุดเด่นของมันไม่ได้อยู่ที่คะแนน แต่อยู่ที่ราคาที่สอดคล้องกับคะแนนนั้น

จุดเน้นของคิโรในระบบที่ขับเคลื่อนด้วยสเปกคือตรงนี้ เกมหลักมีเพียงหนึ่งประโยค: ห้ามเริ่มเขียนโค้ดทันที

มันแยกเป้าหมายที่คลุมเครือของผู้ใช้ออกเป็นเอกสารความต้องการที่เป็นทางการ แบบการออกแบบทางเทคนิค และรายการงานที่สามารถดำเนินการได้ ก่อนส่งให้โมเดล

ดังนั้น โมเดลจะได้รับไม่ใช่ประโยคที่คลุมเครือ แต่เป็นงานที่ชัดเจน

ผู้ที่คุ้นเคยกับ Agent จะรู้ทันทีว่าขั้นตอนนี้ตัดส่วนที่มีค่าใช้จ่ายสูงที่สุดออกไป

โมเดลเบี่ยงเบน ต้องทำงานใหม่ ต้องเริ่มต้นใหม่ทั้งหมด โทเค็นที่ถูกใช้ไปมักจะมากกว่าที่ใช้ในการทำงานจริง

คิโรยังคงมีประตูสองบานไว้ในกระบวนการ: หยุดก่อนที่โค้ดจะถูกแก้ไขจริง เพื่อให้คนอื่นตรวจสอบก่อน; และหลังจากทำงานเสร็จ ระบบจะรันการทดสอบอัตโนมัติเพื่อยืนยันว่าถูกต้องหรือไม่

การหยุดยั้งการกลับมาทำซ้ำแต่ละครั้งด้วยประตูสองบานนี้ สามารถช่วยประหยัดเงินจริงได้

Claude บนดินแดนของ Amazon

GPT รับไปครึ่งหนึ่ง

หนึ่งปีที่แล้ว Kiro ยังเป็นเพียง IDE ที่ขับเคลื่อนด้วย spec และตัวเลือกโมเดลอยู่ในสนามของ Anthropic

หนึ่งปีต่อมา AWS ได้เปิดใช้งานโมเดลสามตัวจาก OpenAI บนแพลตฟอร์มตัวแทนอัจฉริยะของตนเอง

การจัดให้ Sol, Terra, Luna และ Claude อยู่ในเมนูแบบเลื่อนลงเดียวกัน หนึ่งปีก่อนยากที่จะจินตนาการ

แม้ว่า GPT-5.6 ครั้งนี้จะเป็น “การเข้ามาของทั้งครอบครัว” แต่ยังไม่ได้ “เปิดอย่างเต็มรูปแบบ”

โมเดลทั้งสามตัวเปิดอย่างค่อยเป็นค่อยไปและเป็นแบบทดลอง สำหรับผู้ใช้ Pro, Pro+, Pro Max และ Power โดยมีพื้นที่เฉพาะสองแห่ง ได้แก่ เหนือรัฐเวอร์จิเนียของสหรัฐอเมริกาและแฟรงก์เฟิร์ตในยุโรป รองรับการประมวลผลข้ามภูมิภาค

ยังมีอีกข้อหนึ่งที่หลายคนยังปรับตัวไม่ได้: โมเดลชุดนี้ใน Kiro ใช้ห่วงความคิดที่ซ่อนอยู่ คุณจะไม่เห็นขั้นตอนการให้เหตุผล แต่จะเห็นเพียงผลลัพธ์สุดท้ายเท่านั้น

ผู้ที่ชินกับการดู Agent ให้เห็นขั้นตอนการให้เหตุผลทีละขั้น จะรู้สึกเหมือนโยนงานทั้งหมดเข้าไปในกล่องที่ไม่โปร่งใส

ทางทางการระบุว่า นี่เป็นพฤติกรรมที่คาดหวัง และไม่มีผลต่อคุณภาพของผลลัพธ์

Three-tier pricing is clearly listed on Kiro.

เมื่อเริ่มเปิดใช้งานในวันที่ 14 กรกฎาคม ภารกิจเดียวกันนั้น Sol หัก 2.4 เท่า Terra หัก 1.2 เท่า และ Luna หัก 0.6 เท่า

วันที่ 30 กรกฎาคม หลังจาก OpenAI ลดราคาในรอบนั้น วันถัดไป Kiro ก็ตามมา: Luna ลดจาก 0.6 เท่า เหลือ 0.1 เท่า, Terra ลดจาก 1.2 เท่า เหลือ 1.0 เท่า ส่วน Sol ยังไม่มีการเปลี่ยนแปลง

คิโร

ท่าทีของ AWS ชัดเจนแล้ว: แพลตฟอร์มการพัฒนาไม่สามารถผูกติดกับโมเดลเพียงหนึ่งเดียวได้

ในตัวเลือกเดียวกัน โมเดลชั้นนำทั้งสองเริ่มแข่งขันกันด้านราคา

เกณฑ์การประเมินโมเดลก็เปลี่ยนไปด้วย: คะแนนสูงไม่ได้หมายความว่าจะชนะโดยอัตโนมัติ การใช้จ่ายน้อยก็สามารถชนะได้เช่นกัน

สำหรับนักพัฒนา ก่อนหน้านี้คำถามคือ “โมเดลนี้ราคาเท่าไหร่ต่อหนึ่งล้านโทเค็น” แต่ตอนนี้ต้องถามว่า “ถ้าให้มันทำสิ่งนี้ให้เสร็จ ฉันจะต้องจ่ายเท่าไหร่”

ข้อมูลอ้างอิง:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

บทความนี้มาจาก微信号 “ซินจีหยวน” (ID: AI_era) โดยผู้เขียน: ASI Revelation และบรรณาธิการ: Yuan Yu

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา