
Phiên bản nhập môn của Luna giảm giá sâu, giá đầu vào mỗi triệu token giảm từ 1 USD xuống 0,2 USD, giá đầu ra giảm từ 6 USD xuống 1,2 USD.
Tính theo nhân dân tệ, giá đầu vào giảm từ khoảng 6,8 nhân dân tệ xuống 1,35 nhân dân tệ, giá đầu ra giảm từ khoảng 40,6 nhân dân tệ xuống 8,1 nhân dân tệ.
Terra, được định vị là "người lao động chính hàng ngày", cũng giảm 20%, giá nhập và xuất lần lượt giảm xuống còn 2 USD và 12 USD.
Converted to CNY, they are approximately RMB 13.5 and RMB 81.2 respectively.
Chỉ có mô hình cao cấp Sol giữ nguyên giá, nhưng đã ra mắt chế độ Fast mode, tốc độ nhanh nhất đạt 2,5 lần chế độ tiêu chuẩn, tăng tốc mà không tăng giá.

Sau khi Codex thực hiện việc đặt lại mức sử dụng mạnh mẽ, giá đã lập tức được giảm, OpenAI, bạn định ép chết ai vậy…
Cuộc chiến giá này đã trở nên nóng bỏng trực tiếp.
OpenAI cho biết việc giảm giá là do GPT-5.6 Sol đã tự giúp mình tiết kiệm chi phí.
GPT-5.6 Sol tham gia vào việc tự cải tiến, hiệu suất đã có bước nhảy vọt, vì vậy đặc biệt tri ân người dùng mới và cũ~
OpenAI, bạn cũng chơi trò đạp chân trái lên chân phải để bay lên rồi nhỉ

.
Hai sản phẩm giảm giá, một sản phẩm tăng tốc
Hiện tại, giá API của ba mô hình GPT-5.6 lần lượt là:
GPT-5.6 Luna: Nhập 0,2 USD mỗi triệu token, xuất 1,2 USD;
GPT-5.6 Terra: 2 USD cho mỗi triệu token đầu vào, 12 USD cho mỗi triệu token đầu ra;
GPT-5.6 Sol: 5 USD cho mỗi triệu token đầu vào, 30 USD cho mỗi triệu token đầu ra.

Sau khi giảm giá, Luna đã trải qua một cú sụp đổ lớn.
Giá đầu vào của nó đã bằng với thế hệ trước GPT-5.4 nano, còn giá đầu ra còn rẻ hơn 0,05 USD.
Tuy nhiên, hai mô hình này không thực hiện hoàn toàn cùng một công việc; GPT-5.4 nano chủ yếu hướng đến các nhiệm vụ đơn giản, tần suất cao như phân loại, trích xuất thông tin và sắp xếp.
GPT-5.6 Luna được OpenAI định vị là một mô hình nhắm đến các tải công việc nhạy cảm về chi phí, có thể gọi công cụ, xử lý ngữ cảnh dài và thực hiện các luồng công việc nhiều bước.
Nói một cách đơn giản, OpenAI đang bán các mô hình hỗ trợ Agent với mức giá tương đương các mô hình nhỏ trước đây.
Terra giữ mức điều chỉnh thận trọng, giảm 20%.
Sol giữ nguyên giá, thêm chế độ Fast mode, tốc độ tối đa đạt 2,5 lần so với chế độ tiêu chuẩn, giá là 2 lần chế độ tiêu chuẩn, mức độ thông minh của mô hình không đổi.
Nó cũng sẽ thay thế Priority Processing trước đây. Các yêu cầu API từng sử dụng nhãn priority sẽ tự động chuyển sang chế độ Fast.
The official stated that this adjustment will also apply to Codex and ChatGPT Work.
Giá đăng ký sẽ không giảm, tổng hạn mức của người dùng cũng không tăng, nhưng khi gọi Terra và Luna, lượng hạn mức tiêu hao sẽ tương ứng giảm.
Cùng một khoản phí đăng ký, có thể để mô hình thực hiện nhiều nhiệm vụ hơn.
OpenAI cũng đã thay thế mô hình tự đánh giá trong ChatGPT và Codex CLI từ GPT-5.4 sang GPT-5.6 Luna.
Auto-review chịu trách nhiệm kiểm tra mã và kết quả chỉnh sửa ở nền tảng, là nhiệm vụ Agent phổ biến cao điển hình.
Kết hợp với việc nâng cấp mô hình và giảm giá Luna, OpenAI dự kiến chi phí của mình sẽ giảm xuống còn khoảng một phần mười so với trước đây.
Các mô hình giá rẻ giờ đây không còn chỉ đảm nhận các nhiệm vụ truyền thống như phân loại, trích xuất, mà còn bắt đầu tham gia vào các khâu yêu cầu phán đoán và gọi công cụ như kiểm tra mã và giám sát nền tảng.
Hiện tại, vị trí của ba mô hình là:
Giao các tác vụ nhạy cảm với ngân sách và có lượng gọi lớn cho Luna;
Giao việc thường ngày cho Terra;
Tiếp tục sử dụng Sol cho nhiệm vụ khó khăn;
Nếu ngay cả việc chờ đợi cũng thấy quá chậm, hãy chi gấp đôi tiền để mua tốc độ.
GPT-5.6 bắt đầu tham gia vào việc giảm chi phí cho chính nó
Tại sao lại giảm giá đột ngột?
OpenAI cho biết nguyên nhân là do GPT-5.6 Sol đã tham gia vào việc tối ưu hóa hệ thống sản xuất của chính họ.
Sự gia tăng hiệu quả mà nó mang lại đã được chuyển hóa thành những con số giảm giá trên bảng giá.
Cụ thể, GPT-5.6 Sol đã viết lại và tối ưu hóa một số GPU Kernel trong môi trường sản xuất, thiết kế và thực hiện hàng trăm thí nghiệm tạo Token, đồng thời tham gia giám sát quá trình huấn luyện và can thiệp khi xảy ra sự cố.
Kết quả cuối cùng cũng rất nổi bật: tối ưu hóa GPU Kernel giúp giảm 20% chi phí dịch vụ端到端 của GPT-5.6; cải tiến giải mã suy đoán giúp tăng hiệu suất tạo Token lên hơn 15%.

GPU Kernel có thể được hiểu là chương trình cấp thấp thực hiện các tác vụ tính toán cụ thể của mô hình trên GPU.
Mô hình không cần thay đổi, chỉ cần viết các chương trình này hiệu quả hơn, cùng một GPU sẽ thực hiện tính toán nhanh hơn, xử lý được nhiều yêu cầu hơn và chi phí mỗi lần gọi sẽ giảm theo.
Đoán mã hóa là quá trình trong lúc tạo câu trả lời, đầu tiên sẽ đoán hàng loạt các Token có thể xuất hiện tiếp theo, sau đó gửi cho mô hình chính để xác minh. Đoán càng chính xác, số bước cần tạo và chờ từng bước sẽ càng ít.
Hai cải tiến này không làm giảm khả năng của mô hình, nhưng giúp cùng một mô hình chạy nhanh hơn và rẻ hơn.
Tuy nhiên, đây vẫn chưa phải là việc GPT-5.6 tự nâng cấp hoàn toàn chính nó.
OpenAI đã nhấn mạnh rằng toàn bộ quá trình vẫn do con người dẫn dắt.
Mô hình có thể viết mã, chạy thí nghiệm và giám sát bất thường, nhưng việc xác định mục tiêu, đánh giá kết quả có thể sử dụng được hay không, và mã có được đưa vào môi trường sản xuất hay không, vẫn cần sự can thiệp của con người.
OMT
Cuối cùng, còn một thay đổi mới.
Lần giảm giá này có một điểm tập trung cụ thể: Workflow của Agent.
Luna được giảm giá mạnh nhất, không chỉ là mô hình nhỏ truyền thống dùng để phân loại và trích xuất.
Theo định vị của OpenAI, nó có thể gọi công cụ và thực hiện các tác vụ nhiều bước, chủ yếu nhắm đến các tải công việc tần suất cao và nhạy cảm với chi phí.
Do đó, việc Luna giảm giá 80% cũng giúp hạ thấp rào cản để Agent hoạt động lâu dài.
Cho phép các nhiệm vụ kiểm tra, xác minh và giám sát, vốn trước đây không thể thực hiện thường xuyên do chi phí quá cao, trở thành các bước thông thường trong quy trình làm việc.
Kết hợp thêm GPT-5.6 để tối ưu hệ thống sản xuất của chính nó, một chu trình mới đã xuất hiện:
Việc tham gia của mô hình giúp nâng cao hiệu suất vận hành và giảm chi phí; sau khi giá giảm, mô hình được áp dụng vào nhiều quy trình làm việc tần suất cao hơn; quy mô gọi sử dụng mở rộng, từ đó thúc đẩy chu kỳ tối ưu hóa hiệu suất tiếp theo.
Vòng lặp giảm giá của OpenAI đã bắt đầu hình thành.
Sau những thao tác này, áp lực hiện đang trực tiếp đổ lên A社:
Đến lượt bạn rồi.

Liên kết tham khảo: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Bài viết này đến từ tài khoản công chúng WeChat "Quantum Bit", tác giả: Quan tâm đến công nghệ tiên tiến
