NVIDIA công bố hướng dẫn suy luận AI, tốc độ tăng 6 lần không mất dữ liệu do các đội Trung Quốc dẫn đầu

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
NVIDIA đã công bố hướng dẫn suy luận AI vào ngày 2 tháng 9, giới thiệu sáu phương pháp tăng tốc. Các đội Trung Quốc dẫn đầu các đổi mới quan trọng như speculative decoding và DFlash, mang lại tốc độ tăng lên 6 lần mà không mất dữ liệu. Chỉ số nỗi sợ và tham lam vẫn ở mức cao khi các altcoin cần theo dõi đang thu hút sự chú ý. Các giới hạn phần cứng như kích thước tile GPU ảnh hưởng đến thiết kế mô hình. Phương pháp MTP của DeepSeek-V3 và các kỹ thuật khác được nhấn mạnh vì hiệu quả. Hướng dẫn chi tiết chi phí và các trường hợp sử dụng cho từng phương pháp.

Gần đây, NVIDIA đã công bố một hướng dẫn chính thức về suy luận mô hình lớn, nhưng khi lật qua lật lại, người ta lại thấy như một tập hợp các bài báo của các nhóm người Hoa.

Sự việc là như thế này.

Ngày 2 tháng 9, blog công nghệ NVIDIA đã đăng một bài viết dài có tựa đề “Giải mã thiết kế phối hợp mô hình AI bằng đầu cơ”.

Cốt lõi của bài viết là một bảng lựa chọn, liệt kê sáu phương án tăng tốc suy luận phổ biến nhất hiện nay, phơi bày rõ ràng cả chi phí huấn luyện và bối cảnh áp dụng.

DeepSeek

Giá trị của nó nằm ở chỗ, đây là lần hiếm hoi mà ông vua chip đưa ra một cách chính thức quy chuẩn về cách thiết kế mô hình sao cho bám sát giới hạn vật lý của phần cứng.

Khi họ quay nhìn xung quanh để tìm giải pháp tối ưu có thể nhảy múa trên giới hạn của chip silicon, các phương án cốt lõi trong hướng dẫn gần như đều do các đội ngũ người Hoa dẫn dắt.

Điều này đã vượt xa phạm vi của một bài tổng quan thuật toán thông thường. Bảng này rốt cuộc đã tiết lộ điều gì? Chúng ta hãy phân tích từng dòng một.

Giao dịch hầu như lãi thuần: Speculation Decode đang làm gì

Để hiểu được bảng này, bạn cần làm rõ “giải mã đầu cơ” là gì.

Mô hình lớn phát ra từ ngữ từng từ một. Mỗi khi phát ra một từ, hàng trăm GB tham số phải chạy toàn bộ một vòng trong bộ nhớ GPU. Thực ra, phần lớn thời gian, sức mạnh tính toán đều đang chờ đợi bộ nhớ truyền dữ liệu.

Cách giải của “Giải mã đầu cơ” rất đơn giản và thô bạo—

Trước tiên dùng một mô hình nhỏ nhẹ để thực hiện dự đoán sơ bộ, đoán luôn 7 ký tự; sau đó mô hình lớn xác minh đồng thời 7 ký tự đó.

Xác minh 7 chữ và tự viết 1 chữ mất thời gian tương đương, vì cuối cùng cũng phải di chuyển hết trọng số.

Đoán đúng thì nhận luôn, đoán sai thì bắt đầu lại từ điểm ngắt. Vì mô hình lớn chỉ chấp nhận những chữ mà chính nó vốn đã biết viết, nên đầu ra cuối cùng không cần thay đổi bất kỳ dấu câu nào. Đó chính là cái được gọi là “tăng tốc không tổn thất”.

DeepSeek

Trong trò chơi này, mọi sự khai thác công suất tính toán đều xoay quanh một công thức kỳ vọng toán học cốt lõi:

Speedup = 𝔼[L] × TtargetTdraft + Tverify

Tử số là lợi ích 𝔼[L], đại diện cho độ dài kỳ vọng được chấp nhận (trung bình mỗi vòng, mô hình lớn có thể chọn được bao nhiêu ký tự).

Mẫu số là chi phí bổ sung bạn phải trả, bao gồm thời gian mô hình nhỏ thực hiện dự đoán (Tdraft) cộng với thời gian mô hình lớn xác minh cuối cùng (Tverify).

Muốn tăng tốc độ (Speedup) bùng nổ, về cơ bản chỉ có hai con đường: hoặc là tăng tử số (đoán chính xác hơn), hoặc là nén tối đa mẫu số (đoán nhanh hơn).

Đứng trên vai những đối thủ, tiến hóa lên thế hệ thứ tư

Khi bạn xem bảng của NVIDIA từ trên xuống dưới, bạn sẽ thấy một tuyến chiến đấu rõ ràng.

Dòng đầu tiên là mô hình nháp ngoại vi lâu đời nhất, cần huấn luyện một mô hình nhỏ riêng để làm trợ lý.

NVIDIA đã trực tiếp đưa ra hóa đơn giá cao ngất: việc huấn luyện từ đầu sẽ tiêu tốn từ 1T đến 10T token, chi phí rất cao.

Tuy nhiên, lý do nó vẫn còn trên bảng là vì NVIDIA đã sắp xếp cho nó một số phận cụ thể—họ đã chi 20 tỷ USD để mua lại chip Groq (LPU).

Dòng cuối cùng là phương pháp tra bảng n-gram không cần huấn luyện, dựa vào việc tìm kiếm trực tiếp các đoạn lặp lại từ văn bản trước đó để sao chép, chỉ phù hợp với các tình huống cứng nhắc yêu cầu sao chép dán đoạn văn bản lớn.

Bốn dòng ở giữa mới thực sự đại diện cho sự tiến hóa của công nghệ.

DeepSeek

Hàng thứ hai: EAGLE-3.

Đến từ nhóm của Yuhui Li thuộc Đại học Bắc Kinh và Hongyang Zhang thuộc Đại học Waterloo.

Từ ICML, EMNLP tiến thẳng đến NeurIPS, ba năm liên tiếp ra mắt ba thế hệ, đẩy con đường cũ kỹ “đoán từng chữ một” đến giới hạn vật lý.

Nó từng là ông vua tuyệt đối trong lĩnh vực này, nhưng trong bảng xếp hạng mới của NVIDIA, nó đã bị đẩy xuống vị trí “tham khảo”, với lý do cực kỳ ngắn gọn: độ dài chấp nhận đã bị làn sóng sau vượt qua.

Hàng thứ ba: MTP (Đa Token Dự Đoán).

Ý tưởng dù do Meta khởi xướng vào năm 2024, nhưng chính là DeepSeek -V3.

NVIDIA đánh giá rất cao nó—lựa chọn tốt nhất cho mô hình lớn trên GPU. Trọng tâm là giải pháp này phải được huấn luyện cùng với mô hình chính ngay từ giai đoạn tiền huấn luyện.

Hàng thứ tư: DFlash. Nhân vật mạnh mẽ với tốc độ tăng 6 lần không tổn thất.

Ba tác giả Jian Chen, Yesheng Liang, Zhijian Liu. Nó hoàn toàn từ bỏ cách tiếp cận tuần tự kiểu “đoán từng chữ một” của EAGLE và MTP, thay vào đó học hỏi từ các mô hình khuếch tán, thực hiện một lần tính toán thuận để trực tiếp tạo ra chuỗi dự đoán gồm 7 Token, nén tối đa mẫu số (thời gian).

Nhân tiện nói thêm, giáo viên hướng dẫn Zhijian Liu là trợ lý giáo sư tại UCSD, nhưng đồng thời cũng là nhà khoa học nghiên cứu tại Viện Nghiên cứu NVIDIA.

Hàng thứ năm: DSpark. Được đội ngũ 24 người kết hợp giữa DeepSeek và Đại học Bắc Kinh thực hiện.

Kiến trúc song song của DFlash tuy nhanh, nhưng có một nhược điểm nghiêm trọng: càng về sau, độ chính xác càng giảm. Để ép tăng tử số (độ dài chấp nhận), DSpark đã gắn thêm một mô-đun tuần tự cực nhẹ lên nền tảng song song.

Dữ liệu thực tế rất trực quan: độ dài chấp nhận tăng gần 30% so với EAGLE-3 và tăng 18% so với DFlash. Trong DeepSeek Trong môi trường sản xuất trực tuyến V4, tốc độ nhanh hơn 60% đến 85% so với MTP.

Hardware constants, reverse lock model architecture

Bốn thế hệ công nghệ này có thể khai thác hiệu suất tính toán đến mức độ này không chỉ nhờ vào sự tinh tế trong thuật toán.

Nhiều người nghĩ rằng càng đoán nhiều bản nháp trong một lần thì càng kiếm được nhiều tiền, nhưng điều này hoàn toàn bỏ qua các quy luật vật lý của chip.

Khi cơ chế chú ý chiếm phần lớn thời gian giải mã, tổng số token cần xử lý trong giai đoạn xác thực của mô hình lớn là 1+D (1 đầu vào thực tế + D dự đoán nháp).

Để cung cấp dữ liệu này cho GPU, phần cứng sẽ nhóm các đầu Query và KV ở cấp độ hạ tầng, kích thước khối nhân chú ý cho mỗi nhóm phải bị giới hạn nghiêm ngặt bởi ranh giới ma trận vật lý của GPU (Tile Size, thường là 128 trong kiến trúc hiện tại).

Đây là công thức căn chỉnh cấp cơ sở: G × (1 + D) ≤ 128

Chỉ cần suy luận một chút, bạn sẽ rút ra được nguyên tắc hằng số tối thượng trong hướng dẫn của NVIDIA:

D = 128G − 1

Trong đó, G là số nhóm chú ý (tỷ lệ giữa các đầu Query và KV).

Điều này có nghĩa là cách bạn phân nhóm sự chú ý khi thiết kế mô hình sẽ trực tiếp quyết định bản nháp cần dự đoán bao nhiêu ký tự để vừa khít hoàn toàn các khối của GPU.

Nếu G=8, bạn có thể phỏng đoán chính xác 15 bản nháp; nếu G=32, bạn chỉ có thể phỏng đoán 3 bản. Phần cứng không thể vượt qua ranh giới, ngay cả khi bạn chỉ sử dụng một nửa tile cuối cùng, sức mạnh tính toán vẫn sẽ bị tính phí theo toàn bộ tile.

Trước đây, việc giải mã đầu cơ là gói tăng tốc được đội ngũ kỹ thuật thêm vào sau khi mô hình được huấn luyện xong. Nhưng hiện nay, các định luật vật lý cơ bản cho bạn biết: một hằng số của ma trận phần cứng đã trực tiếp được suy ngược lại thành các tham số thiết kế kiến trúc mô hình.

Chúng ta hiếm khi thấy các nhà sản xuất chip đưa phương trình ràng buộc của phần cứng cơ bản vào bản thiết kế của mô hình lớn như vậy.

Kết thúc

Trọng tâm của cuộc đua về hiệu suất chạy mô hình đã hoàn toàn thay đổi.

Thời đại chỉ đơn thuần tích lũy các tham số khổng lồ đang dần kết thúc; hiện tại, yếu tố quyết định thắng bại nằm ở ai hiểu rõ hơn về giới hạn vật lý của mảnh silicon dưới chân mình.

Trên sân chơi mới nơi các gã khổng lồ bán dẫn đảo ngược quy tắc, các đội ngũ người Hoa đã âm thầm trở thành câu trả lời mặc định để phá vỡ thế bế tắc.

Những ông lớn về sức mạnh tính toán như NVIDIA tất nhiên sẽ không quan tâm đến thuật toán nào được đặt trên kệ.

Nhưng giải pháp tối ưu nhằm khai thác tối đa giới hạn của wafer này rốt cuộc do ai tạo ra, rõ ràng được ghi chép đầy đủ trên giấy trắng mực đen.

Bài viết này đến từ tài khoản WeChat “Xin Trí Nguyên”, tác giả: ASI Khải Huyền

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.