Trong tuần qua, Qwen3.8-Max-Preview và Kimi K3 lần lượt ra mắt, đẩy quy mô tham số của các mô hình lớn trong nước lên mức hơn 2 nghìn tỷ.
Tuy nhiên, cuộc cạnh tranh giữa các mô hình lớn đã vượt qua giai đoạn chỉ xem xét các bảng xếp hạng và số lượng tham số. Khả năng thực sự tích hợp vào quy trình làm việc hàng ngày mới là tiêu chuẩn tốt nhất để đánh giá năng lực của mô hình cơ sở.
Đối với điều này, Biteye hôm nay quyết định thử xem là lừa hay ngựa, kéo ra chạy một vòng.
Cùng là lời nhắc “một câu để tạo một trò chơi web kiểu Biteye với tên Thunder Fighter”, ba mô hình Qwen3.8, Kimi K3 và gpt5.6 sol đã đưa ra những câu trả lời hoàn toàn khác nhau:
- Qwen3.8: Có thể hành động, và chỉ giới hạn ở việc có thể hành động
- GPT-5.6 Sol: Hiệu ứng trực quan đẹp, giống trang web chính thức của thương hiệu
- Kimi K3: Nhiều tính năng thú vị nhất, cảm giác trò chơi mạnh nhất
⚠️ Lời nhắc nhở: Do Kimi K3 bị giới hạn về sức tính toán nên không còn mở đăng ký, đợt thử nghiệm này sẽ được WorkBuddy gọi.
Qwen3.8: Máy bay chiến đấu đã cất cánh, nhưng rồi không có gì thêm | Đánh giá: 1 sao
https://x.com/i/status/2079865420576927996
🔗:Thử nghiệm phiên bản Qwen3.8
Mở phiên bản Qwen3.8, cảm giác đầu tiên là: Đùa tôi à?
Nền màu xanh đậm, ở giữa là một logo không phải bản gốc của Biteye, cùng một nút “Bắt đầu chơi”. Văn bản màu đen trong tiêu đề hòa lẫn vào nền tối, như đã kích hoạt chế độ ẩn danh từ trước.
Sau khi vào trò chơi, các chức năng cơ bản thì cũng tạm được:
- Kéo thả máy bay chiến đấu bằng chuột
- Tự động bắn đạn
- Máy bay địch hình tam giác đỏ
- Score counting
- Collision and termination mechanism
Trong thử nghiệm thực tế, máy bay chiến đấu có thể bắn liên tục, điểm số cũng tăng lên tới 858, Qwen3.8 ít nhất đã chạy thành công.
Vấn đề là cả trò chơi giống như một bản demo Canvas vừa được dựng lên: máy bay đối phương là hình tam giác, đạn là những chấm sáng, cách chơi gần như không có thay đổi. Không có hệ thống nâng cấp vũ khí, không có hệ thống vật phẩm, cũng không có nhịp độ cấp rõ ràng.
Như chính đội ngũ Qwen đã công bố, quá trình hậu huấn luyện của Qwen3.8 vẫn chưa hoàn tất và đang được “lặp lại hàng ngày”.
Rõ ràng, nghệ thuật và lập kế hoạch chưa vào nhóm.
GPT-5.6 Sol: Thiết kế đẹp, cách chơi cần cải thiện | Đánh giá: 3.5 sao⭐
https://x.com/i/status/2079865420576927996
🔗:Chơi thử GPT-5.6 Sol phiên bản
Mở phiên bản GPT-5.6 Sol, khí thế lập tức tăng lên.
Bên trái là nhiệm vụ nổi bật, ở giữa là khu vực chiến đấu, bên phải là radar trực quan và mô-đun telemetri. Nền tối kết hợp với màu xanh huỳnh quang, cùng với sự pha trộn tiếng Trung và tiếng Anh cùng các yếu tố thương hiệu Biteye, tạo nên cảm giác thị giác giống bảng điều khiển điệp viên 007.
Hệ thống của nó cũng phong phú hơn nhiều so với Qwen, ví dụ:
- Wave波次
- Armor装甲
- Trạng thái Overdrive
- Combo liên tiếp
- Kỷ lục cao nhất
- Tạm dừng chức năng
- Sử dụng chuột và bàn phím cùng lúc
Trong quá trình thử nghiệm, trò chơi chạy thành công và đạt được 922 điểm. Sau khi thua, thay vì hiển thị đơn giản “Game Over”, nó sẽ hiển thị “Máy bay chiến đấu ngoại tuyến”, và để bắt đầu lại thì gọi là “Kết nối lại”. Từ lúc bắt đầu đến khi kết thúc, văn bản và hình ảnh đều duy trì một thế giới quan thống nhất, điều này khá ấn tượng.
Tuy nhiên, vấn đề với GPT-5.6 Sol là nó quá giỏi trong việc đóng gói. Các bảng thông tin ở hai bên chiếm rất nhiều không gian, trong khi khu vực trò chơi thực sự lại bị ép ở giữa. Nó giống như một trang sự kiện thương hiệu hoàn thiện cao, trong đó tình cờ nhúng vào một trò chơi nhỏ.
So sánh với Qwen3.8, gpt-5.6 sol đã có đầy đủ đội ngũ nghệ thuật, thương hiệu và vận hành, nhưng rõ ràng đội ngũ thiết kế trò chơi đã lười biếng một chút.
Kimi K3: Khi người khác đang làm demo, nó đã bắt đầu thêm các điểm nạp tiền | Đánh giá: 4 sao ⭐
https://x.com/i/status/2079865420576927996
🔗:Thử nghiệm phiên bản Kimi K3
Màn hình đầu tiên của Kimi K3 tuy không ấn tượng bằng GPT-5.6 Sol, nhưng khi phần hướng dẫn trò chơi xuất hiện, hương vị đã khác biệt:
- W: Nâng cấp sức mạnh
- S: StarShield
- B: Bom
- H: Sửa chữa
- Space: Deploy the bomb
- P: Tạm dừng
- M: Tắt tiếng
Sau khi vào trò chơi, bạn sẽ có ba sinh mạng, cấp độ hỏa lực, số lượng bom, nút tạm dừng và công tắc âm thanh.
Hai phiên bản còn lại vẫn đang chậm chạp giải quyết vấn đề “máy bay di chuyển thế nào”, trong khi Kimi K3 đã bắt đầu cân nhắc cách người chơi tương tác sau khi nhặt được vật phẩm.
Đây cũng là sự khác biệt rõ ràng nhất giữa ba phiên bản: Qwen đã thực hiện chức năng bắn súng, Sol đã tạo ra bao bì trực quan, còn Kimi chủ động bổ sung vật phẩm, tài nguyên, sự phát triển và kỹ năng chủ động.
Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players new things.
Ba mô hình này nên được tuyển vào bộ phận nào?
Nếu coi ba mô hình là nhân viên mới, cuộc kiểm tra này sẽ tương tự như:
Trò chơi được tạo bằng một câu lệnh, giờ đây không còn chỉ cạnh tranh về mã nữa
Lấy ví dụ về thử nghiệm máy bay chiến đấu của Biteye, hiện nay việc yêu cầu mô hình lớn viết mã để tạo một trang web với “máy bay di chuyển và đạn được bắn ra” không hề khó.
Nhưng điều thực sự tạo nên sự khác biệt là sau khi được huấn luyện về logic tiền xử lý, mô hình có chủ động thiết kế phản hồi, cấp độ, vật phẩm, sự phát triển và chủ đề trực quan hay không. Mô hình lớn không chỉ cần hiểu mã nguồn, mà còn phải thực sự hiểu tại sao người chơi lại sẵn sàng chơi thêm một ván nữa.
