GPT-5.6 giảm chi phí nhiệm vụ 82% trên AWS Kiro dù giá giảm 20%

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
GPT-5.6 đã giảm chi phí nhiệm vụ Terra tới 82% trên AWS Kiro, bất chấp mức giảm giá 20% vào ngày 30 tháng Bảy. Những cải thiện về hiệu suất đến từ ít nỗ lực thất bại hơn và lượng token sử dụng thấp hơn. Các mô hình GPT-5.6—Sol, Terra và Luna—đã ra mắt trên Kiro vào tháng Bảy. AWS và OpenAI đã cùng tối ưu hóa môi trường. Khi giá tiền điện tử vẫn biến động, chỉ số nỗi sợ và tham lam cho tín hiệu hỗn hợp.

Cùng một mô hình, giá chính thức chỉ giảm 20%, nhưng hóa đơn của bạn lại giảm tới tám phần mười.

Kiro

Ngày 24 tháng 8, OpenAI công bố kết quả một cuộc thử nghiệm cùng với AWS:

On Terminal-Bench 2.1, the cost of completing a successful task with GPT-5.6 Terra in Kiro has decreased by approximately 82%.

Kiro là nền tảng tác nhân phát triển phần mềm của AWS, bao phủ IDE, CLI và Web.

Ba anh em Sol, Terra, Luna trong gia đình GPT-5.6 đã chạy trong hơn một tháng.

82% này không phải là giảm giá chính thức.

Lần điều chỉnh gần nhất của Terra là vào ngày 30 tháng 7 với mức thay đổi 20%.

Kiro

Thông báo điều chỉnh giá của OpenAI vào ngày 30 tháng 7, Terra giảm 20%.

Giá đơn chỉ giảm 20%, nhưng hóa đơn có thể giảm tới tám phần mười.

Sáu mươi phần trăm chênh lệch ở giữa được tiết kiệm từ đâu mới là điều đáng để chúng ta quan tâm.

GPT-5.6 ra mắt trên Kiro là vào tháng 7 năm nay.

Vào ngày 13, AWS thông báo GPT-5.6 Sol, Terra, Luna đã chính thức khả dụng trên Amazon Bedrock.

Ngay ngày hôm sau, Kiro đăng blog thông báo ba mô hình đã được ra mắt trên IDE, CLI và Web.

Kiro

Đây là lần đầu tiên mô hình OpenAI xuất hiện trên Kiro, đúng dịp kỷ niệm một năm công bố bản dùng thử công khai của Kiro.

Đặt mô hình lên kệ trước, sau đó đưa đi làm việc, hơn một tháng sau, OpenAI quay lại nộp bài tập:

Hai bên cùng phối hợp tinh chỉnh môi trường Kiro và mô hình OpenAI, giúp giảm chi phí thực hiện một nhiệm vụ thành công của Terra khoảng 82%.

Tiết kiệm được

Tiền đi đường vòng

Lần điều chỉnh giá vào ngày 30 tháng 7, Terra giảm 20%, nhưng trong thử nghiệm của Kiro, chi phí cho mỗi nhiệm vụ giảm 82%.

Sáu phần trăm tiết kiệm được đó đến từ đâu?

Các hướng chỉ có vài cái này:

Mô hình trả về ít token hơn, số lần gọi lại công cụ ít hơn, và ít lần thử lại hoặc đi đường vòng sau khi thất bại.

Vì vậy, phần tiết kiệm lớn này không phải là tiền cho mỗi lần gọi, mà là tiền của những lần gọi vốn sẽ bị lãng phí.

Lý do rất đơn giản: một tác nhân AI thực hiện sai một nhiệm vụ, hóa đơn vẫn được tính. Nó chọn sai hướng, đi lệch ba vòng rồi mới quay lại, những token đó vẫn bị tính phí.

Trong thực tế phát triển, tiền thường bị mất đi như thế này.

OpenAI cũng đã đề cập đến cùng một logic này trên blog chính thức, hiệu quả đến từ ba cấp độ:

Khung hệ thống agent khởi tạo yêu cầu và tổ chức ngữ cảnh, hệ thống điều phối yêu cầu ở giữa, và cuối cùng là mô hình chạy trên GPU.

Kiro

OpenAI phân tích nguồn gốc hiệu suất của GPT-5.6: Yêu cầu bắt đầu từ khung tác nhân, được điều phối bởi hệ thống sắp xếp, cuối cùng chạy trên GPU, mỗi lớp đều tiết kiệm.

Tiết kiệm chi phí còn có thể tiết kiệm đến việc phân công mô hình.

OpenAI cũng từng đưa ra một ví dụ sử dụng: quy trình mã hóa có thể bắt đầu bằng Sol để làm rõ vấn đề và xác định kế hoạch, sau đó chuyển sang Luna để thực hiện những thay đổi đã được xác định rõ, viết bài kiểm tra và chạy đánh giá.

Cùng một dây chuyền sản xuất, các giai đoạn khác nhau được trang bị trí thông minh ở các cấp độ khác nhau.

Mô hình chỉ chiếm một nửa hóa đơn

Đổi khung thời gian thì giá cũng thay đổi

Bộ đề Terminal-Bench 2.1 không yêu cầu mô hình làm bài riêng lẻ.

Nó đưa mô hình vào một môi trường terminal, đưa ra một mục tiêu mơ hồ, để nó tự lập kế hoạch đường đi, gọi công cụ, viết script, xử lý lỗi và lặp lại nhiều lần.

Vì vậy, kết quả đạt được là của sự kết hợp “đối tượng thông minh + mô hình”.

Kiro

Bảng xếp hạng Terminal-Bench 2.1, bên phải độ chính xác đã thêm một mục chi phí. (Nguồn ảnh: Terminal-Bench)

Bốn dòng số trong bảng xếp hạng nói lên nhiều điều nhất:

Claude Code kết hợp với Fable 5, 83,8%, 552,67 đô la;

Codex kết hợp GPT-5.5, 83,1%, 2059,19 đô la;

Codex kết hợp GPT-5.6 Terra, 78,4%, 421,15 đô la;

Codex kết hợp với GPT-5.6 Luna, 75,7%, 241,45 USD.

Hai dòng đầu chỉ cách nhau 0,7 phần trăm điểm, nhưng hóa đơn lại chênh lệch gần 4 lần.

Cùng một mô hình, nhúng vào các khung khác nhau, kết hợp với các chiến lược tổ chức ngữ cảnh và công cụ khác nhau, kết quả đầu ra hoàn toàn không giống nhau.

Theo dữ liệu do Kiro cung cấp, Terra đạt 77,4 điểm trên Coding Agent Index, chỉ cao hơn một chút so với 77,2 của Claude Fable 5.

Điểm nổi bật của nó không phải là điểm số, mà là mức giá tương ứng với điểm số đó.

Điểm nhấn của Kiro trong bộ spec-driven cũng ở đây, cách chơi cốt lõi chỉ có một câu: Không được ngay lập tức viết mã.

Nó trước tiên tách câu mục tiêu mơ hồ của người dùng thành tài liệu yêu cầu chính thức, thiết kế kỹ thuật và danh sách nhiệm vụ có thể thực hiện, sau đó giao cho mô hình.

Như vậy, mô hình nhận được không còn là một câu mơ hồ, mà là một công việc được làm rõ ràng.

Những người quen thuộc với Agent sẽ ngay lập tức nhận ra rằng bước này đã loại bỏ khoản chi phí đắt đỏ nhất.

Các mô hình bị lệch hướng, làm lại, phá đi làm lại, số token bị tiêu tốn thường nhiều hơn cả công việc chính thức.

Kiro vẫn để lại hai chốt kiểm tra trong quy trình: dừng lại để người khác xem qua trước khi thực sự sửa code; sau khi hoàn thành công việc, tự động chạy một vòng kiểm thử để xác minh xem có đúng không.

Mỗi lần tái xử lý bị chặn lại bởi hai cổng này đều có thể tiết kiệm được tiền thật.

Claude trên sân của Amazon

GPT đã lấy đi một nửa

Một năm trước, Kiro chỉ là một IDE được định hướng bởi spec, nơi mà trình chọn mô hình thuộc về Anthropic.

Một năm sau, AWS đã đưa vào nền tảng tác nhân tự phát triển của mình ba mô hình của OpenAI.

Hình ảnh Sol, Terra, Luna và Claude được xếp cùng nhau trong một menu thả xuống cách đây một năm khó có thể tưởng tượng.

Mặc dù GPT-5.6 lần này là “cả gia đình cùng入驻”, nhưng chưa “mở rộng toàn diện”.

Ba mô hình được mở rộng dần và mang tính thí nghiệm, dành cho người dùng Pro, Pro+, Pro Max và Power, chỉ có hai khu vực: Bắc Virginia, Hoa Kỳ và Frankfurt, Châu Âu, hỗ trợ suy luận xuyên khu vực.

Còn một điểm nữa khiến nhiều người không quen: các mô hình này trong Kiro sử dụng chuỗi suy luận ẩn, bạn không thể thấy các bước suy luận của nó, chỉ thấy được kết quả cuối cùng.

Những người quen theo dõi Agent từng bước suy luận sẽ cảm thấy như ném một việc đang làm vào một chiếc hộp không trong suốt.

The official statement is that this is expected behavior and does not affect output quality.

Ba cấp mô hình được niêm yết rõ ràng trong Kiro.

Vào ngày 14 tháng 7, khi vừa ra mắt, cùng một nhiệm vụ đó, Sol bị trừ 2,4 lần, Terra bị trừ 1,2 lần, Luna bị trừ 0,6 lần.

Vào ngày 30 tháng 7, đợt giảm giá của OpenAI được thực hiện, ngày hôm sau Kiro theo kịp: Luna giảm từ 0,6 lần xuống còn 0,1 lần, Terra giảm từ 1,2 lần xuống còn 1,0 lần, chỉ có Sol không thay đổi.

Kiro

AWS đã bày tỏ rõ ràng quan điểm: một nền tảng phát triển không thể chỉ gắn bó với một mô hình duy nhất.

Trong cùng một bộ chọn, hai mô hình tiên tiến bắt đầu cạnh tranh về giá.

Tiêu chí đánh giá mô hình cũng đã thay đổi: điểm cao không còn tự động đảm bảo chiến thắng, chi ít tiền cũng có thể thắng.

Đối với các nhà phát triển, trước đây khi chọn mô hình, họ hỏi: “Mô hình này giá bao nhiêu cho một triệu token?”, giờ đây họ phải hỏi: “Để khiến nó hoàn thành việc này, tôi sẽ phải chi bao nhiêu?”

Tài liệu tham khảo:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Bài viết này đến từ tài khoản WeChat "Tân Trí Nguyên" (ID: AI_era), tác giả: ASI Khải Lộ, biên tập: Nguyên Vũ

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.