Nhà nghiên cứu OpenAI tuyên bố các phòng thí nghiệm AI hàng đầu hiện không còn đọc các bài báo

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Một nhà nghiên cứu của OpenAI tuyên bố các phòng thí nghiệm AI hàng đầu hiện nay không còn đọc các bài báo do các tuyên bố thổi phồng và tính tái tạo kém. Một cuộc kiểm toán do Đại học Chicago dẫn đầu cho thấy chỉ có 8 trong số 105 bài báo hàng đầu tại ICML 2026 có thể được xác minh đầy đủ. Mã nguồn thiếu, tài liệu không đầy đủ và kết quả không thể tái tạo là những vấn đề phổ biến. Chi phí để tái tạo một bài báo lên tới 2,2 triệu USD. Các nhà giao dịch đánh giá các tài sản liên quan đến AI nên cân nhắc kỹ tỷ lệ rủi ro - lợi nhuận. Các mức hỗ trợ và kháng cự trên thị trường có thể thay đổi khi niềm tin vào nghiên cứu AI suy giảm.

Người trong phòng thí nghiệm前沿几乎不读论文了?

Một nhà nghiên cứu của OpenAI chỉ trích ba hội nghị hàng đầu: Quá nhiều lời quảng cáo thổi phồng và gian lận!

SAI

Nguyên nhân bắt nguồn từ một bài báo ICLR có hiệu quả tốt đến mức khó hiểu, sau khi cộng đồng mạng nghiên cứu kỹ thì mới phát hiện ra “bí quyết” của nó.

SAI

Bài báo tại hội nghị hàng đầu đã “tiến hóa” thành thế này sao?

SAI

Trước hết xem mã có mở nguồn không, sau đó kiểm tra trong phương pháp thực nghiệm có ẩn giấu gì “mẹo vặt” không, cuối cùng mới là kết quả thu được có thể hỗ trợ cho kết luận cốt lõi hay không — qua từng cấp độ chất vấn như vậy, có bao nhiêu bài báo hội nghị hàng đầu có thể chịu được sự kiểm nghiệm?

Thật sự có người làm như vậy.

Trong 105 bài, chỉ có 8 bài đạt yêu cầu

Tháng 7 năm nay, SAI, được đồng sáng lập bởi Phó Giáo sư Khoa học Máy tính và Khoa học Dữ liệu tại Đại học Chicago, Trần Thần Hạo, đã công bố một cuộc “đánh giá thí điểm” quy mô lớn.

Họ đã chọn toàn bộ 168 bài báo Oral của ICML 2026.

Năm nay, ICML đã nhận được 23.918 bài nộp, chỉ có 168 bài được chọn để trình bày miệng, chiếm khoảng 0,7%.

Nói cách khác, SAI đã sàng lọc từ hơn 20.000 bài nộp để chọn ra những bài xuất sắc nhất.

Ngoài việc đọc bài báo, thiết kế thí nghiệm và kết quả giống như các nhà đánh giá truyền thống, SAI Review còn tải về mã nguồn, mô hình và dữ liệu, cấu hình môi trường và chạy thí nghiệm, sau đó so sánh từng mục kết quả chạy với nội dung bài báo gốc.

SAI đã xem xét toàn bộ 168 bài Oral, trong đó chỉ có 104 bài có mã nguồn mở, và cuối cùng đã tái hiện đầy đủ 105 bài.

Trong đó, chỉ có 34 bài tái hiện được hơn 40% các tuyên bố; số bài có tỷ lệ tái hiện vượt quá 80% chỉ còn lại 8 bài.

SAI

Dù mỗi bài báo chứa ít nhất 1, 3 hay 5 tuyên bố có thể xác minh, điểm tái hiện trung vị luôn ở mức 28%–30%, và phân phối tổng thể không thay đổi đáng kể.

SAI

Sau khi loại bỏ các thí nghiệm không chạy, bị hủy sớm hoặc vượt quá khả năng phần cứng, trung vị điểm tái hiện vẫn chỉ ở mức 42%–50%; khi mỗi bài báo ít nhất chứa 3 tuyên bố có thể xác minh, trung vị ổn định ở mức 42%.

Đã gặp phải tất cả các vấn đề phổ biến nhất trong quá trình tái hiện: mã không chạy được, tệp bị thiếu, hướng dẫn không đầy đủ, phụ thuộc bị hỏng, hoặc kết quả chạy mã không khớp với bài báo.

Còn 4 bài báo nghiên cứu dựa trên các mô hình đã bị ngừng hoạt động. Các nhà nghiên cứu sau này, dù sẵn sàng chi tiền và bỏ thời gian, cũng không thể tái tạo được kết quả tương tự.

SAI cũng đưa ra hai ví dụ cụ thể hơn.

Một bài báo nghiên cứu coi việc “chỉ huấn luyện 0,77% tham số của mô hình cơ sở” là điểm nổi bật, nhưng điểm kiểm tra được phát hành thực tế lại được huấn luyện với 6,31% tham số, khoảng 8 lần con số tuyên bố.

Một bài báo khác trình bày bảng độ tin cậy được đánh giá bởi mô hình trọng tài, nhưng trong mã nguồn mở không tìm thấy mô hình trọng tài này, cũng không có kịch bản nào có thể tính ra các con số trong bảng.

Bài báo chất lượng kém, lợi nhuận cao, rủi ro thấp

Kết quả tái tạo của SAI có thể nói là rất tệ.

Tệ hơn nữa, những vấn đề được phát hiện ở đây chỉ là những vấn đề "có điều kiện mới có thể được phát hiện".

Những bài báo không có mã nguồn thì trực tiếp trở nên “không thể chê vào đâu được”.

SAI

Ngay cả khi mã nguồn được công khai hoàn toàn, việc xác minh một bài báo khoa học cũng đòi hỏi thời gian, công sức và chi phí khổng lồ, và kết quả cuối cùng lại không như mong đợi, không biết sẽ thất vọng đến mức nào.

Theo ước tính dựa trên giá theo nhu cầu công khai của Google Cloud do SAI cung cấp, chi phí trung vị để chạy lại toàn bộ một bài báo Oral tại ICML là khoảng 8.900 USD. Trong số 105 bài báo, 17 bài vượt quá 100.000 USD, và bài đắt nhất gần 2,2 triệu USD.

Bài luận càng phụ thuộc vào sức mạnh tính toán quy mô lớn, thì khả năng tái tạo độc lập càng khó khăn.

Không có mã nguồn, người khác không thể kiểm tra; có mã nguồn, cũng chưa chắc ai đủ khả năng chi trả chi phí này.

Do đó, một bài báo nghiên cứu có vấn đề hoàn toàn có thể vượt qua quá trình bình duyệt, được trích dẫn, sau đó được đưa vào sơ yếu lý lịch để đổi lấy cơ hội trúng tuyển, vị trí giảng dạy hoặc công việc tại các phòng thí nghiệm lớn.

Đôi khi có người phát hiện ra kết quả không khớp, các cuộc họp cũng hiếm khi xem xét lại, và bài báo không nhất thiết bị thu hồi.

Đây chính là điều mà phần bình luận nói đến: “Thực hiện nghiên cứu kém vẫn có lợi nhuận, nhưng gần như không có chi phí nào.”

SAI

Không đọc bài báo, nhưng khi tuyển dụng thì phải xem bài báo

Trong lĩnh vực mô hình lớn, thực sự có nhiều tiến bộ quan trọng không còn xuất hiện dưới dạng bài báo khoa học.

Là một kỹ sư của OpenAI, đứng ở tiền tuyến của ngành, việc có cảm nhận này không khó hiểu. Bởi vì có nguồn lực tính toán dồi dào hơn, phản hồi thí nghiệm nhanh hơn và rất nhiều kết quả nội bộ không công khai, nên có thể tự tin "không cần đọc các bài báo nghiên cứu".

Nhưng nói ra như vậy thì cũng hơi kỳ kỳ.

Một bình luận chế giễu những người trong các công ty công nghệ hành động như vậy là “lên bờ rồi rút thang”: tuyển dụng các nhà nghiên cứu từ các trường đại học, xây dựng trên những thành tựu đã được tích lũy công khai trong giới học thuật, cạnh tranh nhân tài và GPU với giá cao hơn, ngày càng ít chấp nhận đánh giá đồng nghiệp, cuối cùng lại quay sang tuyên bố rằng nghiên cứu học thuật “chủ yếu là lừa đảo”.

SAI

Hơi sắc nét một chút, nhưng thật sự có lý.

Những người trong các phòng thí nghiệm tiên tiến này có thể "không đọc bài báo", nhưng những người muốn gia nhập vẫn cần phải xuất bản bài báo trước.

Đối với sinh viên và các nhà nghiên cứu trẻ thiếu kinh nghiệm ngành, các bài báo hội nghị hàng đầu vẫn là bằng chứng trực tiếp nhất để chứng minh năng lực nghiên cứu.

Việc nộp đơn xin tiến sĩ, tìm kiếm vị trí giảng dạy, hay gia nhập các phòng thí nghiệm tiên tiến như OpenAI đều dựa vào các bài báo để thu hút sự chú ý.

Những người trong ngành công nghiệp sau khi bước vào các phòng thí nghiệm lớn coi thường các bài báo, nhưng vẫn sử dụng số lượng bài báo, cấp độ hội nghị và thành tích trích dẫn để lọc những người đứng ngoài cửa.

Bài luận vì vậy rơi vào một vị trí khó xử: độ tin cậy của nó trong việc truyền bá kiến thức bị đặt câu hỏi, nhưng giá trị của nó trong cạnh tranh nhân tài thì hoàn toàn không hề suy giảm.

Vì vậy, câu nói “Phòng thí nghiệm lớn đã không còn đọc bài báo nữa” nghe có vẻ hơi cao ngạo và kiêu căng. Bởi vì những người thực sự có đủ tư cách để không đọc bài báo, thường đã vượt qua ngưỡng cửa đó nhờ vào chính các bài báo đó.

Of course, not all students are meticulously crafted academic villains.

Một nhà nghiên cứu đại học đùa rằng anh ấy thậm chí còn mong các sinh viên của mình đã có khả năng viết một bài luận thổi phồng hoặc thậm chí là làm giả.

SAI

Một số người đang cố gắng trở thành kẻ lừa đảo học thuật, trong khi những người khác vẫn đang vật lộn với LaTeX.

Liên kết tham khảo:

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074

https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886

Bài viết này đến từ tài khoản WeChat “Machine Heart” (ID: almosthuman2014), tác giả: Machine Heart

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.