ZhipuAI đã triển khai xong 100.000 bộ tăng tốc AI trong nước trong hai tuần

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
ZhipuAI đã triển khai hệ thống suy luận GLM-5.3-Flash trên một cụm hơn 100.000 bộ tăng tốc AI trong nước chỉ trong hai tuần, theo tin tức AI + crypto. Thông lượng đầu đến cuối của hệ thống tăng 3,2 lần, với AI-driven Infra Agent xử lý các nhiệm vụ tối ưu hóa thường do các kỹ sư cấp cao thực hiện. Tin tức trên chuỗi nhấn mạnh sự tích hợp nhanh chóng của AI vào hạ tầng, cho thấy cách tự động hóa đang thay đổi các quy trình kỹ thuật. Việc triển khai này phản ánh đà tăng trưởng ngày càng mạnh mẽ trong lĩnh vực AI + crypto tại Trung Quốc.
Trong hai tuần, 100.000 bộ xử lý AI trong nước, một khởi đầu để tối ưu hóa mô hình của riêng bạn.

Tác giả bài viết: APPSO

Nguồn bài viết: Wall Street Journal

Vừa mới đây, Tiến sĩ Tang Jie, Khoa học gia trưởng của Zhipu GLM, đã chia sẻ một nghiên cứu về tối ưu hóa hệ thống suy luận GLM-5.3-Flash trên nền tảng X.

Anh ấy tiết lộ, từ khi GLM-5.3-Flash chạy lần đầu tiên trên bộ tăng tốc AI trong nước đến khi hoàn thành việc xử lý toàn bộ lưu lượng sản xuất, chỉ mất hai tuần. Trong quá trình này, khả năng thông lượng đầu đến cuối của hệ thống đã tăng 3,2 lần.

Điều khiến Đường Kiệt ấn tượng nhất là những công việc tối ưu hóa lớn lao không chỉ được thực hiện bởi các kỹ sư hạ tầng, mà còn bởi một Infra Agent được điều khiển bởi GLM-5.3.

“Một mô hình giúp tối ưu hóa chính dịch vụ của nó.” Đường Kiệt mô tả sự thay đổi này.

Theo anh ta, điều này có nghĩa là AI bắt đầu tham gia vào việc tối ưu hóa hệ thống chịu trách nhiệm vận hành chính nó. Mặc dù vẫn còn rất xa mới đến được hình thức tự cải tiến đệ quy (Recursive Self-Improvement, RSI) thực sự, nhưng một dạng sơ khai đã xuất hiện.

Đội ngũ ZhiPu cũng cho biết, trong năm qua, họ nhận thấy vai trò của GLM đang thay đổi.

Ban đầu, nhóm đã khám phá khả năng của GLM trong việc hiểu mã và lĩnh vực an ninh mạng, với mong muốn sử dụng mô hình để hỗ trợ phân tích lỗ hổng trong mã phức tạp. Tuy nhiên, khi khả năng của mô hình được nâng cao, GLM bắt đầu tham gia vào việc xây dựng chính các hệ thống AI.

Đội ngũ cho biết họ đã quan sát thấy mô hình hoàn thành những nhiệm vụ trước đây cần đội ngũ kỹ sư hạ tầng giàu kinh nghiệm mất vài tuần mới hoàn thành, và những công việc này sẽ直接影响 cách huấn luyện và triển khai các mô hình thế hệ tiếp theo.

Hoàn thành triển khai cụm tính toán trong nước trong hai tuần

Để đưa một mô hình lớn từ lần chạy đầu tiên trên phần cứng mới đến một dịch vụ suy luận có thể ổn định xử lý các yêu cầu sản xuất, cần rất nhiều công việc kỹ thuật hệ thống.

GLM-5.3-Flash lần này được triển khai trên cụm hơn 100.000 bộ xử lý AI trong nước. Nhóm ZhiPu cho biết đây là một lần triển khai quy mô lớn mà trước đây thiếu kinh nghiệm chín chắn để tham khảo.

Đội ngũ cần giải quyết nhiều vấn đề, bao gồm hạn chế về dung lượng bộ nhớ显存 và băng thông liên kết của chip trong nước, thích ứng với kiến trúc mô hình mới, hỗ trợ ngữ cảnh dài 1 triệu token, cũng như xử lý yêu cầu đa phương tiện. Đồng thời, hệ sinh thái phần mềm của các bộ tăng tốc AI trong nước vẫn đang trong giai đoạn phát triển, một số Kernel chưa được hỗ trợ đầy đủ, và nhiều tài liệu cần đội ngũ kỹ thuật tự khám phá.

Tang Jie cho biết, trong các điều kiện hạn chế này, Infra Agent được điều khiển bởi GLM-5.3 đã tham gia vào quá trình tối ưu hóa hệ thống suy luận, giúp phân tích các điểm nghẽn hiệu năng, đề xuất các giải pháp tối ưu và thực hiện một số thay đổi mã nguồn.

Toàn bộ quá trình tối ưu không đơn giản là tăng tài nguyên tính toán, mà là tìm kiếm sự cân bằng mới giữa sức mạnh tính toán, bộ nhớ, truyền thông và lập lịch.

Đội ngũ ZhiPu đã áp dụng một loạt các giải pháp tối ưu. Ví dụ: sử dụng ReplaySSM để đổi tính toán lấy không gian bộ nhớ, giảm áp lực bộ nhớ GPU thông qua song song tensor trong nút, nâng cao hiệu quả sử dụng dung lượng thông qua bộ nhớ đệm độ chính xác hỗn hợp INT8, FP8, BF16, đồng thời giới thiệu kiến trúc tách biệt Encode-Prefill-Decode (EPD) để các giai đoạn suy luận khác nhau có thể được lập lịch linh hoạt hơn.

Cuối cùng, hiệu suất dịch vụ end-to-end của GLM-5.3-Flash đã cải thiện khoảng 3 lần so với phiên bản ban đầu, đạt mức sử dụng phần cứng và chi phí trên mỗi token gần ngang bằng với các nền tảng GPU NVIDIA phổ biến.

Sau khi triển khai, GLM-5.3-Flash đã được đưa vào thử nghiệm trong môi trường sử dụng thực tế. Đội ngũ Zhipu cho biết, mô hình này từng chạy dưới tên ẩn Ox-Alpha trên các nền tảng OpenCode và OpenRouter, trở thành một trong những mô hình được sử dụng nhiều nhất trên cả hai nền tảng trong vòng một tuần, xử lý hơn 62 nghìn tỷ token trong sáu ngày.

Tuy nhiên, sự thay đổi thực sự trong thí nghiệm này không chỉ là để AI viết mã, mà còn để AI có thể hiểu tại sao các hệ thống phức tạp lại thay đổi hiệu suất.

Ví dụ, khi hệ thống phản hồi “độ thông qua giảm 20%”, nó chỉ có thể cho thấy có sự bất thường ở một nơi nào đó, nhưng không thể trực tiếp thông báo cho Agent rằng tầng nào gặp vấn đề, giả định hiện tại có sai sót hay không, và cần xác minh điều gì tiếp theo.

Đối với các kỹ sư giàu kinh nghiệm, việc phán đoán này dựa vào kinh nghiệm lâu năm. Kỹ sư biết khi nào nên xem đường thời gian thực thi, khi nào chạy bài kiểm tra vi hiệu năng, và nên so sánh đầu ra của mô-đun nào.

Đội ngũ ZhiPu mong muốn chuyển đổi kinh nghiệm kỹ thuật này thành cơ chế phản hồi mà AI có thể gọi, và gọi nó là “dense feedback”.

Trung tâm của cơ chế này là giúp Agent nhận được thông tin gần với quá trình phán đoán kỹ thuật hơn.

Khi mô hình cần xác minh tính chính xác của phép tính, nó có thể nhận phản hồi về tính chính xác tương ứng; khi mô hình cần phân tích nguyên nhân suy giảm hiệu suất, nó có thể xem xét thời gian tiêu tốn trong quá trình vận hành hệ thống; khi mô hình thử nghiệm các giải pháp tối ưu hóa mới, nó có thể đánh giá thông qua thực nghiệm xem giải pháp đó có phù hợp với bối cảnh hiện tại hay không.

Đội ngũ ZhiPu cho rằng phản hồi thực sự hiệu quả cần đáp ứng một số điều kiện: nó phải đủ gần với vấn đề cụ thể, có thể thu được nhanh chóng và có thể được xác minh thông qua các thí nghiệm khách quan. Nếu không, lượng lớn nhật ký và chỉ số có thể khiến Agent khó xác định hướng hành động tiếp theo.

Hệ thống tối ưu hóa mô hình, dịch vụ hệ thống mô hình

Với sự hỗ trợ của dense feedback, Infra Agent bắt đầu tham gia vào việc xác định các vấn đề ẩn trong hệ thống suy luận.

Trong bối cảnh đường dẫn song song của KDA, Agent đã phát hiện một vấn đề ảnh hưởng đến độ chính xác của tính toán ngữ cảnh dài.

Do cần liên tục hợp nhất ma trận trạng thái giữa các shard ngữ cảnh khác nhau, lỗi làm tròn do tính toán TF32 sẽ tích lũy dần theo độ dài chuỗi, cuối cùng dẫn đến sai lệch kết quả tính toán.

Agent đã xác định vấn đề trong quá trình xử lý độ chính xác của việc truyền và hợp nhất trạng thái bằng cách so sánh kết quả của các đường dẫn thực thi khác nhau. Các bản sửa lỗi liên quan đã được hợp nhất vào PR #1180 của dự án Flash Linear Attention.

Một vấn đề khác xuất hiện giữa KV Transfer và lịch trình DeepEP.

Trong quá trình kiểm tra, Agent phát hiện KV Transfer không tạo ra sự chồng lấp hiệu quả với DeepEP Dispatch, dẫn đến chi phí truyền tải vượt quá 30% trong một số tình huống.

Sau đó, Agent tiếp tục phân tích chuỗi gọi Python và C++, phát hiện rằng đường dẫn trong nút không giải phóng GIL của Python kịp thời, khiến nhiệm vụ truyền không thể được thúc đẩy kịp thời.

Sau khi hoàn thành chỉnh sửa, chi phí bổ sung do KV Transfer mang lại đã giảm từ hơn 30% xuống dưới 1%.

Ngoài ra, Agent còn tối ưu hóa một Decode Kernel.

Nó phát hiện rằng do vấn đề về cách chia Kernel, cùng một nhóm phép tính chuẩn hóa đã được thực hiện lặp lại bốn lần. Bằng cách tái tổ chức cấu trúc tính toán để giảm thiểu các phép tính lặp lại, Kernel cuối cùng đạt được mức tăng hiệu năng 1,71 lần.

Ý tưởng tối ưu này được rút ra từ việc Agent học hỏi từ các Kernel hiện có của các dự án như SGLang, Flash Linear Attention và DeepGEMM. Nó khái quát hóa kinh nghiệm tối ưu từ những mã nguồn này thành một “xương sống tối ưu”, sau đó kết hợp với phản hồi từ hệ thống hiện tại để đánh giá tính phù hợp.

Trước đây, các kinh nghiệm tối ưu hóa tương tự chủ yếu dựa vào tích lũy cá nhân của các kỹ sư.

Trong quá trình này, Agent bắt đầu học các phương pháp tối ưu từ mã nguồn hiện có, sau đó kiểm chứng thông qua thực nghiệm xem các phương pháp này có phù hợp với môi trường phần cứng và mô hình mới hay không.

Tang Jie cho biết, các kỹ sư con người vẫn chịu trách nhiệm đặt mục tiêu, xây dựng môi trường phản hồi và xem xét các thay đổi có rủi ro cao.

Nhưng vai trò của các kỹ sư đang thay đổi, từ người trực tiếp giải quyết từng vấn đề, dần chuyển sang thiết kế các hệ thống phản hồi.

Đội ngũ ZhiPu cho rằng môi trường phản hồi có thể xác minh, được xây dựng trên các nhiệm vụ cơ sở hạ tầng thực tế, có thể cũng là nền tảng quan trọng để huấn luyện các mô hình thế hệ tiếp theo. Mỗi lần Agent hoàn thành nhiệm vụ kỹ thuật, đều có thể trở thành dữ liệu để mô hình thế hệ tiếp theo học hỏi.

Hiện tại, các trường hợp của GLM-5.3-Flash vẫn còn khoảng cách so với việc tự cải tiến đệ quy thực sự. Tuy nhiên, Đường Kiệt cho rằng một vòng lặp quy mô nhỏ nhất đã xuất hiện.

Mô hình tối ưu hóa hệ thống, trong khi hệ thống phục vụ mô hình.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.