Trong một khoảnh khắc ngắn ngủi nhưng tuyệt đẹp vào tháng 1 năm 2025, các mô hình AI mở trọng số đã bắt kịp các đối thủ nguồn đóng. Khoảng cách xếp hạng Elo trên bảng xếp hạng do cộng đồng đóng góp của Arena đã giảm về mức zero. Sự ngang bằng.
Khoảng thời gian đó đã qua. Tính đến tháng 9 năm 2026, khoảng cách giữa các mô hình biên giới đóng tốt nhất và các đối thủ mở trọng số hàng đầu đã giãn rộng lên 29 điểm Elo, theo dữ liệu đánh giá của Arena AI. Claude Opus 5 Max có điểm số 1505, trong khi Kimi K3 Max của Moonshot AI, đối thủ mở trọng số mạnh nhất, kém gần 30 điểm. Peter Gostev, Trưởng nhóm Năng lực AI của Arena, đã ở trung tâm của việc theo dõi và trực quan hóa sự phân hóa này.
Số liệu thực sự có nghĩa gì
Hành trình này kể một câu chuyện thú vị hơn bất kỳ hình ảnh tĩnh nào. Từ mức 0 vào tháng 1 năm 2025 lên 29 điểm vào tháng 9 năm 2026, đường xu hướng đang di chuyển theo hướng ngược lại với những người ủng hộ mô hình mở. Phân tích của Epoch AI củng cố hình ảnh này từ một góc độ khác: các mô hình mở hiện đang tụt hậu khoảng bốn tháng so với các mô hình đóng trong hiệu suất trên những nhiệm vụ khó nhất. Con số này tăng từ mức tụt hậu ba tháng được ghi nhận vào cuối năm 2025.
Arena xử lý hơn 10 triệu đánh giá mỗi tháng, dựa trên một kho dữ liệu khổng lồ từ các tương tác thực tế của người dùng thay vì các tiêu chuẩn giả lập. Khi hàng triệu người dùng ẩn danh liên tục ưa thích đầu ra của một mô hình hơn mô hình khác, tín hiệu này khó có thể bị bỏ qua.
Kinh doanh đo lường AI
Arena bản thân đã trở thành một câu chuyện kinh doanh hấp dẫn. Những gì bắt đầu như một dự án nghiên cứu tại Đại học California, Berkeley vào năm 2023 đã chuyển mình thành một doanh nghiệp mang về doanh thu hàng năm 100 triệu USD. Nó đạt được mức doanh thu này chỉ trong tám tháng sau khi triển khai dịch vụ đánh giá trả phí.
Đóng góp cụ thể của Gostev tập trung vào việc làm rõ các điểm yếu của mô hình. Công việc của ông nhấn mạnh sự căng thẳng giữa hiệu suất của mô hình khi được đánh giá bởi các chuyên gia lĩnh vực so với người dùng phổ thông, một sự phân biệt cực kỳ quan trọng đối với các triển khai doanh nghiệp.
Địa chính trị của các mô hình mở
Phát triển mô hình mở trọng lượng hoạt động nhất đã chuyển mạnh sang các phòng thí nghiệm Trung Quốc. Chuỗi Kimi của Moonshot AI, GLM của Zhipu, DeepSeek và Qwen của Alibaba đại diện cho ranh giới của những gì có sẵn công khai. Tuy nhiên, khoảng cách vẫn còn tồn tại. Anthropic, OpenAI và Google DeepMind tiếp tục đẩy các mô hình đóng của họ tiến xa hơn, nhanh hơn.
