Vals AI huy động 40 triệu USD vòng Series A do a16z dẫn đầu để xây dựng các bộ tiêu chuẩn mô hình AI độc lập
2026/08/22 12:06:00

Đợt huy động vốn cho thấy nhu cầu ngày càng tăng đối với các tiêu chuẩn đánh giá hiệu suất AI trong thế giới thực
Vào giữa tháng 8 năm 2026, Vals AI công bố vòng gọi vốn Series A trị giá 40 triệu đô la Mỹ với định giá 400 triệu đô la Mỹ, do Andreessen Horowitz dẫn dắt và có sự tham gia của các nhà đầu tư hiện hữu là 8VC, Pear VC và Bloomberg Beta, cùng với các nhà đầu tư mới là HRT Ventures và Next Ladder Ventures. Công ty có trụ sở tại San Francisco tự định vị mình là một nhà đánh giá độc lập các mô hình AI tiên tiến, xây dựng các tiêu chuẩn đánh giá hiệu suất trên các công việc chuyên nghiệp mang ý nghĩa kinh tế thay vì các bài kiểm tra mang phong cách học thuật đã gần như bão hòa. Kết quả của họ đã xuất hiện trong các thẻ mô hình của OpenAI, Anthropic, Google, Meta và xAI. Doanh thu đã tăng gấp tám lần so với toàn bộ năm 2025, cơ sở khách hàng đã tăng gấp đôi và đội ngũ đã tăng gấp ba trong vòng sáu tháng.
Bên cạnh khoản đầu tư, Vals đã ra mắt Vals Smith để thực hiện các bài kiểm tra mã hóa tùy chỉnh được trích xuất từ bất kỳ kho lưu trữ GitHub nào, chỉ số RSI được phát triển cùng CoreWeave để đo lường khả năng tự cải tiến lặp lại, ReverseEngBench được tạo ra cùng các nhà nghiên cứu từ Columbia, Tufts, UC Berkeley và UCLA, cùng với chỉ số Vals 2.0 được mở rộng, trong đó đánh giá hiệu suất dựa trên đóng góp của từng ngành đối với GDP của Hoa Kỳ. Những động thái này xuất hiện khi các doanh nghiệp đang đối mặt với áp lực ngày càng tăng để áp dụng AI trong khi thiếu các phương pháp đáng tin cậy để đo lường lợi tức đầu tư, đồng thời các chính phủ đang tìm kiếm các thước đo độc lập về năng lực tiên tiến và rủi ro mạng. Luận điểm cốt lõi là các bài kiểm tra chuyên môn độc lập, được cập nhật liên tục đã trở thành hạ tầng thiết yếu cho nền kinh tế AI, thu hẹp khoảng cách ngày càng lớn giữa điểm số trên bảng xếp hạng do nhà cung cấp báo cáo và khả năng thực tế trong việc hoàn thành các công việc đa bước trong lĩnh vực tài chính, luật, kỹ sư phần mềm và các lĩnh vực rủi ro cao.
Tại sao các bảng xếp hạng AI truyền thống đã mất đi sức mạnh dự đoán cho các quyết định doanh nghiệp
Các tiêu chuẩn học thuật công khai từng cung cấp một ngôn ngữ chung để theo dõi tiến bộ của mô hình, nhưng một phân tích vào tháng 2 năm 2026 của các nhà nghiên cứu tại ETH Zurich và Stanford đã xem xét 60 bài đánh giá mô hình ngôn ngữ lớn được sử dụng rộng rãi và phát hiện rằng 29 trong số đó đã bão hòa, với khoảng cách hiệu suất giữa mô hình hàng đầu và thứ hai rơi vào phạm vi nhiễu đo lường. Ô nhiễm xảy ra khi dữ liệu kiểm tra xâm nhập vào các bộ dữ liệu huấn luyện, đôi khi thông qua Common Crawl, trong khi các phòng thí nghiệm cũng tối ưu hóa trực tiếp chống lại các mục tiêu đã biết. Kết quả là, điểm số cao trên MMLU, HumanEval hoặc các bộ tương tự không còn dự đoán đáng tin cậy thành công trên các quy trình chuyên nghiệp phức tạp, nhiều bước. Vals giải quyết vấn đề này bằng cách giữ các bộ kiểm tra chính ở chế độ riêng, hợp tác với các chuyên gia lĩnh vực để xác định các nhiệm vụ đại diện, và loại bỏ các tiêu chuẩn đánh giá khi chúng ngừng phân biệt được các mô hình.
Vào tháng 5 năm 2026, công ty đã thay thế đánh giá CorpFin trước đó bằng Bài kiểm tra Mô hình hóa Excel khó hơn, chính xác vì sự phân biệt đã sụp đổ. Tiếp cận thích ứng này coi việc đánh giá là cơ sở hạ tầng liên tục thay vì một kỳ thi tĩnh, mang lại tín hiệu rõ ràng hơn cho các doanh nghiệp khi lựa chọn mô hình để triển khai sản xuất. Tài liệu chính thức về phương pháp của công ty và thông báo đầu tư của a16z đều nhấn mạnh rằng các bộ dữ liệu riêng, do chuyên gia tuyển chọn và được thay thế liên tục, có khả năng chống lại con đường bão hòa hiệu quả hơn so với các bài kiểm tra tĩnh hoàn toàn công khai hoặc hoàn toàn riêng tư.
Cách Vals xây dựng các tiêu chuẩn dựa trên các quy trình làm việc thực tế của chuyên gia
Vals hợp tác với các luật sư thực hành, chuyên gia phân tích tài chính, kỹ sư phần mềm và bác sĩ lâm sàng để xác định hệ thống phân loại các nhiệm vụ định nghĩa công việc năng lực trong mỗi lĩnh vực, sau đó phát triển các hệ thống chấm điểm tự động đánh giá sản phẩm công việc được tạo ra dựa trên tiêu chuẩn chuyên gia thay vì độ chính xác của câu trắc nghiệm hoặc sự trùng khớp chính xác về chuỗi ký tự. Một nhiệm vụ điển hình của Finance Agent v2 yêu cầu tác nhân truy xuất dữ liệu hỗ trợ từ các tài liệu, tổng hợp các mô hình giá trị tương đối giữa các công ty cùng ngành, xác định các yếu tố thúc đẩy ngành và đưa ra các khuyến nghị đầu tư có cơ sở mà không bịa đặt con số hay mất bối cảnh qua các bước. Vào tháng 5 năm 2026, mô hình có điểm cao nhất chỉ đạt 52% độ chính xác trên bộ nhiệm vụ này, cho thấy ngay cả các hệ thống tiên tiến nhất vẫn chưa hoàn thành khoảng một nửa số nhiệm vụ mà một chuyên gia phân tích được kỳ vọng xử lý.
Cùng một triết lý này áp dụng cho nghiên cứu pháp lý, di chuyển mã, kỹ thuật dựa trên terminal và mã hóa y tế. Vì việc chấm điểm được tự động hóa nhưng được hiệu chỉnh theo phán quyết của chuyên gia, các đánh giá có thể được tạo ra trong vòng vài giờ sau khi nhận quyền truy cập mô hình, phù hợp với chu kỳ hàng tuần hiện tại của các bản phát hành tiên tiến. Công ty đã mở nguồn một phần cơ sở hạ tầng đánh giá để hỗ trợ tính tái tạo, đồng thời bảo vệ tính toàn vẹn của các bộ kiểm tra riêng tư tạo ra các điểm số chính. Sự kết hợp giữa đối tác lĩnh vực, chấm điểm tự động cấp chuyên gia và thời gian phản hồi nhanh đã phân biệt nền tảng này với cả bảng xếp hạng học thuật và các sân chơi thuần túy dựa trên sở thích.
Lý do của a16z khi dẫn đầu vòng gọi vốn với định giá 400 triệu đô la
Andreessen Horowitz đã định vị khoản đầu tư xung quanh vấn đề bất cân xứng thông tin kinh điển được nhà kinh tế học George Akerlof mô tả: khi người bán hiểu rõ hơn về chất lượng sản phẩm so với người mua và có động lực trình bày dữ liệu tích cực, thị trường sẽ suy thoái về hướng các kết quả chất lượng thấp hơn. Jennifer Li và các đồng nghiệp tại a16z đã so sánh nhu cầu về một người đánh giá AI độc lập với sự xuất hiện lịch sử của Moody’s trên thị trường tín dụng và các kiểm toán viên độc lập trong báo cáo của các công ty đại chúng. Mô hình doanh thu của Vals, thu phí cho các dịch vụ đánh giá thay vì xác nhận bất kỳ tuyên bố nào của phòng thí nghiệm cụ thể, nhằm duy trì tính độc lập về mặt cấu trúc.
Công ty nhấn mạnh độ sâu kỹ thuật của các nhà sáng lập và sự hoài nghi lâu dài về tính hợp lệ của các tiêu chuẩn, lưu ý rằng Rayan Krishnan và Langston Nashold đã từng hợp tác giải quyết các vấn đề đo lường thực tế trong khi học khoa học máy tính tại Stanford. Định giá của vòng gọi vốn và sự tham gia của HRT Ventures – quỹ gắn liền với giao dịch định lượng – càng cho thấy vốn chuyên sâu coi việc đo lường đáng tin cậy là cơ sở hạ tầng then chốt, chứ không phải công cụ nghiên cứu phụ trợ. Bình luận chính thức từ a16z nhấn mạnh rằng các mô hình đang chuyển từ việc trả lời câu hỏi sang thực hiện các quy trình tác nhân kéo dài nhiều giờ, làm tăng chi phí của việc lựa chọn mô hình kém từ việc tiêu tốn token sang mất thời gian và ảnh hưởng đến kết quả của khách hàng.
Bối cảnh của những người sáng lập và nguồn gốc của luận thuyết đánh giá độc lập
Rayan Krishnan, người đảm nhiệm vị trí CEO của công ty, có nền tảng nổi bật với kinh nghiệm làm việc trước đó tại Palantir, một công ty phân tích dữ liệu nổi tiếng. Đồng sáng lập của anh, Langston Nashold, giữ vị trí CTO và mang theo khối lượng kinh nghiệm phong phú từ thời gian làm việc tại các công ty công nghệ lớn như Meta, NVIDIA và Hudson River Trading. Hai nhà sáng lập lần đầu tiên gặp nhau trong một chuyến đi bộ đường dài trước khi nhập học tại Đại học Stanford, nơi họ nhanh chóng kết nối với nhau. Sau đó, họ hợp tác trên nhiều khóa học khoa học máy tính, dẫn đến một nhận thức quan trọng: các mô hình ngôn ngữ lớn có tiềm năng cách mạng hóa cách thức thực hiện công việc. Tuy nhiên, họ cũng nhận ra rằng ngành công nghiệp vẫn chưa có các phương pháp đáng tin cậy và hiệu quả để kiểm thử những mô hình này. Được thúc đẩy bởi những hiểu biết của mình, họ đưa ra quyết định táo bạo rời bỏ các chương trình sau đại học của mình để thành lập Vals. Trọng tâm ban đầu của dự án mới là các nhiệm vụ tài chính và lập trình, mà họ xác định là đại diện cho những phần lớn đáng kể trong hoạt động kinh tế tại Hoa Kỳ.
Khi bắt đầu thu hút sự chú ý trên thị trường, họ đã nhận được nhiều sự trích dẫn nổi bật trong các thẻ mô hình lớn và nhận được sự hỗ trợ từ Bộ Thương mại đối với các sáng kiến của mình, cùng với sự tham gia vào các nỗ lực của Quốc hội liên quan đến chính sách AI. Các nhà sáng lập đặt trọng tâm mạnh mẽ vào việc liên tục loại bỏ các tiêu chuẩn đánh giá lỗi thời và sử dụng các bộ kiểm tra riêng. Tiếp cận này là kết quả trực tiếp từ những quan sát của họ về tốc độ mà các mô hình có thể đạt đến đỉnh điểm của các tiêu chuẩn tĩnh và cách dữ liệu huấn luyện có thể ảnh hưởng đến các đánh giá công khai. Kinh nghiệm kết hợp của họ trong cả hệ thống sản xuất và môi trường định lượng đã đóng vai trò quan trọng trong việc thiết kế hệ thống đánh giá, cũng như sản phẩm thương mại mà các doanh nghiệp hiện đang sử dụng để lựa chọn và theo dõi các mô hình phù hợp với trình độ công nghệ tiên tiến nhất.
Các tiêu chuẩn của đại lý tài chính tiết lộ những khoảng cách kéo dài giữa điểm số trên bảng xếp hạng và công việc cấp phân tích
Mặc dù các mô hình đạt kết quả gần như hoàn hảo trên các bộ thử nghiệm học thuật cũ, bộ Finance Agent v2 vẫn tiếp tục phơi bày những thiếu sót nghiêm trọng về nội dung không thể bỏ qua. Các nhiệm vụ trong bộ này bao gồm tổng hợp đa tài liệu, mô hình hóa giá trị tương đối và tạo khuyến nghị, tất cả đều phản ánh sát sao đầu ra hàng ngày của các chuyên gia phân tích tài chính trong ngành. Mức trần 52 phần trăm ghi nhận vào tháng 5 năm 2026 đối với hệ thống hàng đầu là lời nhắc nhở rõ ràng rằng điểm số cao về kiến thức tổng quát không tự động đồng nghĩa với khả năng phân tích tài chính đáng tin cậy và tự chủ.
Vals định trọng số một cách chiến lược chỉ số tổng hợp Vals bằng cách xem xét đóng góp ước tính của các ngành đối với GDP của Hoa Kỳ, điều này mang lại hiệu ứng nhân lớn cho lĩnh vực tài chính, đảm bảo rằng tác động kinh tế được phản ánh chính xác trong xếp hạng tổng thể của các mô hình khác nhau. Các doanh nghiệp đã triển khai thành công các mô hình được lựa chọn một phần thông qua đánh giá của Vals báo cáo sử dụng nền tảng này không chỉ cho quá trình lựa chọn ban đầu mà còn để đo lường liên tục hiệu suất sản phẩm so với các mức cơ sở tiên tiến đã thiết lập. Hơn nữa, khoảng cách hiệu suất hiện tại cũng đóng vai trò quan trọng trong việc định hướng các quyết định phân bổ vốn trong các tổ chức tài chính. Các tổ chức này phải chứng minh chi tiêu AI của mình bằng những lợi ích năng suất có thể định lượng, thay vì chỉ dựa vào các minh chứng định tính, vốn thường mang tính chủ quan và ít đáng tin cậy hơn. Quá trình đánh giá liên tục này là thiết yếu để đảm bảo rằng các khoản đầu tư vào công nghệ AI mang lại lợi ích và cải tiến rõ rệt về hiệu quả hoạt động.
Vals Smith Mở Các Tiêu Chuẩn Lập Trình Tùy Chỉnh Được Trích Xuất Trực Tiếp Từ Các Kho Doanh Nghiệp
Với thông báo về vòng gọi vốn Series A, Vals đã chính thức triển khai Smith cho tất cả mọi người, cho phép bất kỳ tổ chức nào tạo ra một bộ tiêu chuẩn mã hóa tùy chỉnh từ các kho lưu trữ GitHub của chính họ. Hệ thống trích xuất các nhiệm vụ phát triển thực tế từ các pull request lịch sử và áp dụng các bài kiểm tra ẩn để xác định xem mô hình có thể hoàn thành công việc hay không. Người dùng nhận 120 tín dụng miễn phí để bắt đầu. Đối với các công ty có cơ sở mã chứa các mẫu, thư viện và quy ước kiến trúc độc quyền, sự khác biệt giữa trình độ Python hoặc Java chung và khả năng hoạt động trong môi trường cụ thể đó là quyết định.
Smith do đó chuyển đổi câu hỏi trừu tượng về khả năng lập trình thành một thước đo cụ thể, phù hợp với từng tổ chức. Các doanh nghiệp sớm áp dụng giờ đây có thể xếp hạng các mô hình dựa trên hiệu suất trong khối lượng công việc kỹ thuật thực tế của họ, thay vì dựa trên các bộ bài kiểm tra công khai có thể đã bị ghi nhớ một phần hoặc tối ưu hóa quá mức. Phiên bản này mở rộng phạm vi của Vals ra ngoài các bộ kiểm tra chuyên ngành sẵn có sang cơ sở hạ tầng đánh giá được tùy chỉnh, có khả năng mở rộng theo nhu cầu của khách hàng.
Chỉ số RSI và ReverseEngBench mở rộng phạm vi bao phủ vào các lĩnh vực rủi ro biên giới
Đi kèm với đợt huy động vốn gần đây, Vals đã tự hào ra mắt Chỉ số RSI, được phát triển cùng với CoreWeave. Chỉ số sáng tạo này nhằm đánh giá xem các mô hình khác nhau có khả năng thực hiện các nhiệm vụ nghiên cứu thiết yếu để thúc đẩy sự phát triển mô hình, các kỹ thuật nén, phương pháp huấn luyện, chiến lược tối ưu hóa tham số, thực hành kỹ thuật harness và đánh giá sau huấn luyện hay không. Ngoài ra, công ty đã giới thiệu ReverseEngBench, một dự án được phát triển cẩn trọng cùng với các tổ chức học thuật danh tiếng, bao gồm Đại học Columbia, Đại học Tufts, Đại học California tại Berkeley và Đại học California tại Los Angeles. Bộ tiêu chuẩn toàn diện này bao gồm 19 chương trình độc quyền, tổng cộng trung bình hơn 16.000 dòng mã.
Các chương trình này bao gồm nhiều lĩnh vực đa dạng, bao gồm giao thức mạng, firmware, ứng dụng trò chơi, quy trình khôi phục định dạng tệp và phân tích phần mềm độc hại, tất cả đều được bảo vệ bởi một bộ công cụ chống phân tích toàn diện nhằm tăng cường bảo mật. Kết quả sơ bộ cho thấy sự khác biệt đáng kể giữa các mô hình hàng đầu, cho thấy còn nhiều tiềm năng chưa được khai thác trước khi các tác nhân có thể reverse-engineer các tệp nhị phân thực tế một cách nhất quán. Ngoài những nỗ lực này, các công việc giai đoạn đầu cũng đã được khởi động trong lĩnh vực ứng dụng sức khỏe tâm thần, với kế hoạch mở rộng thêm vào các lĩnh vực then chốt như đánh giá tác động môi trường, ứng dụng quân sự và các lĩnh vực an toàn sinh học. Các đánh giá này, có hướng tiếp cận dựa trên rủi ro, nhằm vào những năng lực thiết yếu để nâng cao tư thế bảo mật doanh nghiệp và các đánh giá của chính phủ đối với các hệ thống tiên tiến nhất.
Vals Index 2.0 Tổng hợp hiệu suất được trọng số theo đóng góp kinh tế
Trang web được thiết kế lại và Vals Index 2.0 hiện cung cấp phạm vi bao phủ rộng lớn hơn đáng kể trên nhiều lĩnh vực khác nhau, bao gồm tài chính, lập trình và các nhiệm vụ pháp lý. Các trọng số ngành được sử dụng trong Chỉ số được suy ra từ dữ liệu gia tăng giá trị do Cục Phân tích Kinh tế cung cấp. Công thức tổng hợp được sử dụng tính trung bình các chỉ số hiệu suất trong mỗi ngành và sau đó kết hợp các điểm số ngành này dựa trên tỷ trọng xấp xỉ của chúng trong GDP. Tính đến giữa tháng 8 năm 2026, Claude Opus 5 đang dẫn đầu Chỉ số, theo sau gần sát bởi Claude Fable 5 và GPT-5.6 Sol.
Chỉ số được cập nhật thường xuyên để phản ánh các bản phát hành mô hình mới nhất và đóng vai trò là chỉ số chính duy nhất cho thấy tác động kinh tế tiềm năng, đồng thời vẫn cho phép người dùng phân tích sâu vào các bảng xếp hạng lĩnh vực riêng lẻ để có cái nhìn chi tiết hơn. Do các tiêu chuẩn cơ sở vẫn chủ yếu là riêng tư và được làm mới định kỳ, Chỉ số có thể duy trì sự khác biệt trong thời gian dài hơn so với các tổ hợp hoàn toàn công khai. Các doanh nghiệp và nhà nghiên cứu đều tham khảo Chỉ số này không chỉ để so sánh thứ hạng tương đối mà còn để thực hiện phân tích đánh đổi giữa chi phí, độ trễ và khả năng trong toàn bộ hệ sinh thái mô hình hiện tại, đảm bảo họ đưa ra quyết định thông thái dựa trên dữ liệu liên quan nhất hiện có.
Mô hình áp dụng doanh nghiệp và nhu cầu về ROI có thể định lượng
Các triển khai AI quy mô lớn ngày càng tích hợp đánh giá Vals khi lựa chọn các mô hình cơ sở và khi đánh giá các sản phẩm nội bộ so với các chỉ số hiệu suất tiên tiến. Sự kết hợp giữa thời gian phản hồi nhanh, tính chuyên biệt lĩnh vực và tính độc lập này hiệu quả giải quyết các thách thức thực tiễn mà các đội ngũ mua sắm và lãnh đạo kỹ thuật gặp phải: các bảng điểm nhà cung cấp đơn lẻ không còn đủ để đưa ra các quyết định mang tính then chốt.
Sự tăng trưởng doanh thu đáng kinh ngạc gấp tám lần so với toàn bộ năm 2025, cùng với việc cơ sở khách hàng tăng gấp đôi và số lượng nhân sự tăng gấp ba chỉ trong sáu tháng, rõ ràng cho thấy nhu cầu đã vượt qua giai đoạn thử nghiệm ban đầu và bước vào giai đoạn phụ thuộc vào hoạt động. Các chính phủ cũng đã hợp tác với nền tảng để có được những hiểu biết quý giá về đo lường năng lực và rủi ro mạng, từ đó củng cố vai trò quan trọng của nó trong cả bối cảnh thương mại và chính sách. Khả năng của nền tảng trong việc theo kịp các bản cập nhật mô hình hàng tuần đảm bảo rằng tín hiệu luôn được cập nhật và liên quan, thay vì tụt hậu so với ranh giới前沿 vài tháng.
Hệ sinh thái và sự phân biệt cấu trúc so với các nền tảng dựa trên sở thích
Các nỗ lực đánh giá khác thực sự tồn tại trong lĩnh vực này, bao gồm các sân chơi bỏ phiếu ưu tiên tổng hợp phán xét của con người đối với các đầu ra mở, cũng như các phương pháp tâm lý học nhằm rút ngắn đáng kể thời gian đánh giá. Vals nổi bật nhờ thiết kế nhiệm vụ chuyên môn được chuyên gia tuyển chọn, đảm bảo tính liên quan và ứng dụng cao, cùng với việc chấm điểm tự động được hiệu chỉnh kỹ lưỡng để đáp ứng các tiêu chuẩn ngành đã được thiết lập. Công ty sử dụng các bộ dữ liệu kiểm tra riêng tư được liên tục cập nhật để duy trì tính toàn vẹn của các đánh giá, đồng thời có hồ sơ trích dẫn được chứng minh bởi mọi phòng thí nghiệm hàng đầu trong lĩnh vực này.
Bản ghi trích dẫn này đóng vai trò là một hình thức hợp lệ quan trọng mà những người mới gia nhập phải nỗ lực đạt được để xây dựng độ tin cậy. Hơn nữa, sự nhấn mạnh của công ty vào các quy trình làm việc đa bước được cân nặng theo yếu tố kinh tế, thay vì chỉ tập trung vào sở thích hội thoại hoặc tốc độ thuần túy, đã định vị nó như một hạ tầng thiết yếu để đưa ra các quyết định sản xuất có căn cứ, chứ không chỉ đơn thuần là một người chơi trong các bảng xếp hạng nghiên cứu. Các nhà đầu tư rõ ràng đã nhận ra và định giá sự khác biệt độc đáo này vào mức định giá ấn tượng 400 triệu đô la.
Suy luận dành cho các nhà phát triển mô hình và tốc độ đo lường khả năng
Các phòng thí nghiệm hàng đầu hiện nay hoạt động trong một môi trường nơi các điểm số độc lập mang lại độ tin cậy bên ngoài, trong khi các con số tự báo cáo ngày càng mất đi sự tin cậy. Việc trích dẫn trong các thẻ mô hình cho thấy với các nhà mua doanh nghiệp rằng kết quả đã trải qua sự xem xét của bên thứ ba. Đồng thời, việc liên tục tạo ra các tiêu chuẩn khó hơn đã nâng cao ngưỡng mà các mô hình tiếp theo phải vượt qua. Quá trình “leo dốc” đã thúc đẩy tiến bộ AI do đó đang đối mặt với một tập hợp các ngọn đồi dốc hơn và được cập nhật thường xuyên hơn.
Các nhà phát triển coi đánh giá là việc thứ yếu có nguy cơ phát hiện ra các khoảng trống năng lực chỉ sau khi triển khai; những người tích hợp đo lường độc lập từ sớm có thể ưu tiên các cải tiến mang tính thực tế. Việc mở nguồn các thành phần hạ tầng được chọn cũng khuyến khích tính tái tạo, đồng thời bảo vệ các đánh giá riêng tư cốt lõi tạo ra các điểm số có tín hiệu cao nhất.
Nhu cầu rộng lớn hơn đối với các tổ chức đo lường đáng tin cậy
Khi các hệ thống AI ngày càng thâm nhập sâu hơn vào các quy trình có hậu quả pháp lý và tài chính, sự vắng mặt của các phép đo độc lập tạo ra những rủi ro bất cân xứng thông tin tương tự như những gì từng dẫn đến sự ra đời của các cơ quan xếp hạng và kiểm toán viên trong các ngành công nghiệp khác. Các chỉ số tăng trưởng của Vals và danh tiếng của các nhà đầu tư hỗ trợ cho thấy vốn nhận ra khoảng trống thể chế này. Sứ mệnh được công bố của công ty, nhằm trở thành người đánh giá độc lập đối với trí tuệ nhân tạo, phù hợp với các yêu cầu thực tiễn của doanh nghiệp tìm kiếm sự rõ ràng về ROI và của các nhà hoạch định chính sách tìm kiếm hiểu biết về năng lực và rủi ro.
Việc mở rộng liên tục sang các lĩnh vực chuyên nghiệp và rủi ro bổ sung sẽ thử thách xem phương pháp này có thể mở rộng quy mô đồng thời duy trì tính độc lập và chất lượng tín hiệu hay không. Hiện tại, sự kết hợp giữa các sản phẩm mới ra mắt gần đây, sự tăng trưởng thương mại nhanh chóng và cam kết vốn từ các nhà đầu tư nổi bật đã giúp Vals trở thành điểm tham chiếu trung tâm cho bất kỳ ai phải quyết định mô hình nào thực sự có thể thực hiện công việc quan trọng.
Câu hỏi thường gặp
Vals AI đã công bố điều gì cụ thể trong vòng gọi vốn Series A?
Vals AI đã gọi thành công vòng Series A 40 triệu USD với định giá 400 triệu USD vào ngày 13 tháng 8 năm 2026. Andreessen Horowitz dẫn đầu vòng gọi vốn, với các nhà đầu tư hiện hữu là 8VC, Pear VC và Bloomberg Beta tiếp tục tham gia, cùng với các nhà đầu tư mới là HRT Ventures và Next Ladder Ventures. Công ty đồng thời ra mắt Vals Smith cho các bài kiểm tra mã tùy chỉnh, RSI Index, ReverseEngBench, Vals Index 2.0 được mở rộng và trang web được xây dựng lại. Các tuyên bố chính thức từ cả Vals và a16z xác nhận các con số cũng như các sản phẩm ra mắt đi kèm.
Các tiêu chuẩn Vals khác với các bảng xếp hạng công khai như MMLU hoặc SWE-bench như thế nào?
Vals tập trung vào các quy trình chuyên nghiệp nhiều bước được xác định cùng các chuyên gia lĩnh vực và được đánh giá bởi các hệ thống tự động được hiệu chuẩn theo tiêu chuẩn chuyên gia. Các bộ dữ liệu kiểm tra chính vẫn được giữ bí mật và được loại bỏ khi chúng ngừng phân biệt được các mô hình, giảm thiểu ô nhiễm và gian lận tối ưu hóa. Các bộ công cụ học thuật công khai thường bị bão hòa hoặc rò rỉ vào dữ liệu huấn luyện, làm giảm giá trị dự đoán của chúng đối với các nhiệm vụ doanh nghiệp thực tế. Tiếp cận của Vals tạo ra kết quả trong vòng vài giờ sau khi truy cập mô hình và đã xuất hiện trong các thẻ mô hình của các phòng thí nghiệm lớn.
Ý nghĩa của điểm số 52 phần trăm trong các nhiệm vụ của Finance Agent là gì?
Vào tháng 5 năm 2026, mô hình hàng đầu đạt độ chính xác khoảng 52 phần trăm trên bộ Finance Agent v2, yêu cầu mô hình hóa giá trị tương đối, tổng hợp tài liệu và các khuyến nghị có cơ sở. Con số này cho thấy ngay cả các hệ thống mạnh nhất hiện có vẫn chưa hoàn thành khoảng một nửa các nhiệm vụ mà một chuyên gia phân tích tài chính chuyên nghiệp được kỳ vọng thực hiện. Khoảng cách giữa điểm số học thuật và hiệu suất thực hiện nhiệm vụ chuyên nghiệp chính là vấn đề Vals nhằm đo lường và từ đó giúp thu hẹp.
Ai là những người sáng lập và họ mang đến những kinh nghiệm gì?
CEO Rayan Krishnan trước đây từng làm việc tại Palantir. CTO Langston Nashold có kinh nghiệm tại Meta, NVIDIA và Hudson River Trading. Cả hai đều học khoa học máy tính tại Stanford và bắt đầu hợp tác giải quyết các vấn đề đo lường trước khi thành lập công ty. Nền tảng của họ kết hợp kinh nghiệm về hệ thống sản xuất với góc nhìn định lượng và nghiên cứu, định hình sự nhấn mạnh của Vals vào việc đánh giá chặt chẽ và linh hoạt.
Vals Smith mang lại điều gì cho doanh nghiệp?
Vals Smith cho phép bất kỳ tổ chức nào tạo ra một tiêu chuẩn mã hóa tùy chỉnh trực tiếp từ các kho lưu trữ GitHub của nó. Hệ thống trích xuất các nhiệm vụ phát triển thực tế từ các pull request lịch sử và áp dụng các bài kiểm tra ẩn. Người dùng bắt đầu với 120 tín dụng miễn phí. Công cụ chuyển đổi các tiêu chuẩn mã hóa chung thành các phép đo cụ thể của tổ chức, phản ánh các mẫu mã và thực hành kỹ thuật độc quyền.
Chỉ số Vals tích hợp trọng số kinh tế như thế nào?
Chỉ số tổng hợp hiệu suất trên các nhiệm vụ tài chính, lập trình và pháp lý, sau đó trọng số các mức trung bình theo ngành dựa trên đóng góp ước tính của chúng vào GDP của Hoa Kỳ bằng dữ liệu từ Cục Phân tích Kinh tế. Chỉ số tổng hợp kết quả cung cấp một thước đo tổng thể duy nhất về tác động kinh tế tiềm năng, đồng thời vẫn cho phép kiểm tra chi tiết các kết quả từng lĩnh vực. Phiên bản 2.0 đã mở rộng phạm vi bao phủ và được cập nhật thường xuyên để phản ánh các bản phát hành mô hình mới.
🔥 KuCoin Mang Đến Một Tùy Chọn Ổn Định Hơn Trong Thị Trường Biến Động
Nếu bạn lo lắng về những biến động thường xuyên trên thị trường và tìm kiếm một lựa chọn ổn định hơn để kiếm tiền thụ động, KuCoin là nơi phù hợp để bạn đến:

Simple Earn: Nạp và rút token mọi lúc, nhận lợi nhuận ổn định.
KuCoin Earn: Kiếm lợi nhuận ổn định với quản lý tài sản chuyên nghiệp.
Nắm giữ để kiếm tiền: Nhận phần thưởng bằng cách nắm giữ tài sản trong các tài khoản Tài trợ, Giao dịch, Ký quỹ, Giao sau, Khai thác và Tài khoản hợp nhất.
Staking: Khai thác tiềm năng sinh lời từ các tài sản trên chuỗi.
Đầu tư Nâng cao: Đầu tư Nâng cao cung cấp nhiều sản phẩm có cấu trúc giúp tiền của bạn tăng trưởng trong mọi thị trường.
Shark Fin: Bảo vệ tiền vốn và lợi nhuận đảm bảo
Đầu tư kép: Mua thấp và bán cao với các tính toán lợi nhuận minh bạch.
Snowball: Lợi suất cao, có bảo vệ giá.
Mua với chiết khấu: Mua tiền điện tử với giá chiết khấu.
KCS Loyalty: Nâng cấp cấp độ để tận hưởng các quyền lợi độc quyền bằng cách stakes ≥ 1 KCS.
KuCoin Wealth: Khám phá giá trị tương lai và bắt đầu hành trình đầu tư thông minh của bạn.
Lợi ích của KCS: Giữ và stake KCS để truy cập các lợi ích trên toàn nền tảng.
KCS Staking 2.0: Tham gia quản trị trên chuỗi của KCS để kiếm lợi nhuận.
Thông báo miễn trừ trách nhiệm: Nội dung này chỉ mang tính chất thông tin và không cấu thành lời khuyên đầu tư. Đầu tư vào tiền điện tử tiềm ẩn rủi ro. Vui lòng tự nghiên cứu (DYOR).
Tuyên bố từ chối trách nhiệm: Trang này được dịch bằng công nghệ AI để thuận tiện cho bạn. Để biết thông tin chính xác nhất, hãy tham khảo bản gốc tiếng Anh.
