Các nhà nghiên cứu tại Edinburgh nén các mô hình AI lên đến 8 lần trong khi tăng điểm kiểm tra hiệu suất

iconCryptoBriefing
Chia sẻ
AI summary iconTóm tắt
Tin tức AI và tiền mã hóa từ Edinburgh: Các nhà nghiên cứu từ Đại học Edinburgh và NVIDIA đã phát triển Phương pháp Giảm thưa bộ nhớ động (DMS), một phương pháp nén các mô hình AI lên tới 8 lần đồng thời cải thiện điểm số trên các bộ kiểm tra. Kỹ thuật này thu nhỏ bộ nhớ cache khóa-giá trị (KV) bằng cách giữ lại chỉ các token quan trọng nhất, giúp các mô hình suy luận nhanh hơn. Trên AIME 24, GPQA Diamond và LiveCode Bench, các mô hình DMS vượt trội hơn các phiên bản đầy đủ lần lượt 12, 8 và 10 điểm. Tin tức trên chuỗi tiếp tục nhấn mạnh những tiến bộ trong AI với những lợi ích hiệu suất thực tế.

Việc làm cho thứ gì đó nhỏ hơn đồng thời tốt hơn nghe như một sự vi phạm các định luật vật lý cơ bản. Nhưng các nhà nghiên cứu tại Đại học Edinburgh, hợp tác cùng NVIDIA, đã thực hiện được điều này với các mô hình ngôn ngữ lớn. Kỹ thuật của họ, được gọi là Dynamic Memory Sparsification (DMS), nén một thành phần thiết yếu của hạ tầng AI đi 8 lần, đồng thời giúp các mô hình đạt điểm cao hơn trên các bài kiểm tra khó.

Nếu các mô hình AI có thể chạy tốt hoặc tốt hơn với một phần nhỏ bộ nhớ, cánh cửa sẽ mở ra để triển khai các khả năng suy luận nghiêm túc trên các thiết bị hiện tại không thể xử lý chúng, bao gồm thiết bị đeo, thiết bị nhà thông minh và các thiết bị biên.

DMS hoạt động thực tế như thế nào

Để hiểu được bước đột phá này, bạn cần biết về bộ nhớ đệm khóa-giá trị (KV). Khi một mô hình AI suy luận qua một vấn đề, nó lưu các kết quả trung gian vào bộ nhớ đệm này, về cơ bản là bộ nhớ làm việc giúp mô hình theo dõi quá trình suy nghĩ của chính nó. Càng dài và phức tạp hơn chuỗi suy luận, bộ nhớ đệm càng lớn và đòi hỏi nhiều tài nguyên tính toán hơn.

DMS sử dụng một con dao mổ để xử lý quy trình này. Thay vì giữ lại mọi token trong bộ nhớ đệm, nó chọn lọc chỉ giữ lại những token quan trọng nhất và loại bỏ những phần còn lại. Kết quả là bộ nhớ đệm KV được nén xuống còn một phần tám kích thước ban đầu. Bằng cách xóa bỏ những dữ liệu không cần thiết, các mô hình có thể khám phá những con đường suy luận sâu sắc và phức tạp hơn trong cùng một ngân sách tính toán.

Quảng cáo

Kết quả chuẩn

Trong kỳ thi tuyển chọn AIME 24, các mô hình nén sử dụng DMS đạt điểm trung bình cao hơn 12 điểm so với các mô hình không nén.

Trên GPQA Diamond, một bộ tiêu chuẩn được xây dựng từ các bài toán khoa học cấp độ sau đại học trong vật lý, hóa học và sinh học, các mô hình nén DMS đạt điểm trung bình cao hơn hơn 8 điểm.

Trên LiveCode Bench, nơi kiểm tra khả năng lập trình thực tế, các mô hình được nén đã đạt được 10 điểm cao hơn so với các phiên bản đầy bộ nhớ đệm khi đọc cùng một lượng dữ liệu bộ nhớ đệm KV.

Nghiên cứu viên trưởng Tiến sĩ Edoardo Ponti đã tóm tắt lợi ích kép một cách đơn giản.

Các mô hình có thể suy luận nhanh hơn nhưng với chất lượng tương đương.

Trong một khung thời gian cố định, một LLM sử dụng DMS có thể khám phá nhiều chuỗi lập luận hơn và đưa ra những kết luận mạnh mẽ hơn.

Một xu hướng dài hơn, đang tăng tốc

Lĩnh vực AI đã theo đuổi hiệu quả mô hình kể từ giữa những năm 2010, khi các kỹ thuật như tri thức phân tán, cắt tỉa và lượng tử hóa bắt đầu chứng minh rằng các mô hình nhỏ hơn có thể cạnh tranh với các mô hình lớn hơn trên các nhiệm vụ cụ thể. Điều DMS bổ sung vào dòng chảy này là sự tập trung vào bộ nhớ trong quá trình suy luận—các tài nguyên tiêu thụ không khi mô hình đang được huấn luyện, mà khi nó đang thực sự được sử dụng. Nén bộ nhớ suy luận xuống 8 lần có nghĩa là mỗi lần triển khai trở nên rẻ hơn đáng kể để vận hành.

Nghiên cứu đã được trình bày tại hội nghị NeurIPS và được mô tả chi tiết trong một bài báo có tựa đề “Inference-Time Hyper-Scaling with KV Cache Compression.” Các đánh giá được thực hiện bằng các mô hình Llama và Qwen.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.