Vals AI 完成由 a16z 領投的 4000 萬美元 A 輪融資,致力於建立獨立的 AI 模型基準
2026/08/22 12:06:00

融資輪次顯示對真實世界 AI 性能基準的需求不斷上升
2026 年 8 月中旬,Vals AI 宣布完成由 Andreessen Horowitz 領投、現有投資者 8VC、Pear VC 和 Bloomberg Beta,以及新投資者 HRT Ventures 和 Next Ladder Ventures 參與的 4000 萬美元 A 輪融資,公司估值為 4 億美元。這家總部位於舊金山的公司將自身定位為前沿 AI 模型的獨立評估機構,構建用於評估經濟意義上專業工作表現的基準,而非已趨飽和的學術式測試。其結果已出現在 OpenAI、Anthropic、Google、Meta 和 xAI 的模型卡片中。與 2025 年全年相比,收入增長了八倍,客戶基礎翻了一倍,團隊規模在六個月內增加了三倍。
與此同時,Vals 推出了 Vals Smith,用於從任何 GitHub 倉庫提取的自定義編碼基準測試;與 CoreWeave 合作開發的 RSI 指數,用於衡量遞歸自我改進能力;與哥倫比亞大學、塔夫茨大學、加州大學伯克利分校和加州大學洛杉磯分校的研究人員共同創建的 ReverseEngBench;以及擴展的 Vals 指數 2.0,根據各行業對美國 GDP 的貢獻來加權性能。這些舉措出現在企業面臨越來越大的壓力,需要採用 AI,卻缺乏可靠的方法來量化投資回報,同時政府也尋求獨立的前沿能力與網絡風險評估指標之際。其核心觀點是,獨立且持續更新的專業任務基準測試已成為 AI 經濟的必要基礎設施,縮小了供應商報告的排行榜分數與實際在金融、法律、軟件工程和高風險領域完成多步驟工作的能力之間日益擴大的差距。
為何傳統 AI 排行榜已失去對企業決策的預測力
過去,公共學術基準曾為追蹤模型進展提供共同語言,但蘇黎世聯邦理工學院與史丹佛大學的研究人員於2026年2月對60個廣泛使用的大型語言模型評估進行分析,發現其中29個已達到飽和,頂尖模型與第二名之間的性能差距已落入測量噪音範圍內。污染發生在測試數據進入訓練語料庫時,有時透過 Common Crawl 導入,同時實驗室也會直接針對已知目標進行優化。結果是,MMLU、HumanEval 或類似套件上的高分已無法可靠預測在雜亂、多步驟的專業工作流程中的表現。Vals 透過保持主要測試集私密、與領域專家合作定義具代表性的任務,並在基準不再能區分模型時予以退役,來解決這一問題。
在 2026 年 5 月,該公司以更嚴格的 Excel 建模基準取代了先前的 CorpFin 評估,正是因為差異化已崩潰。這種適應性方法將評估本身視為持續的基礎設施,而非靜態考試,使企業在選擇用於生產部署的模型時能獲得更明確的訊號。該公司方法論的官方文件以及 a16z 的投資公告均強調,由專家精心策劃並持續更新的私有數據集,比完全公開或純私有靜態測試更能有效抵抗飽和路徑。
Vals 如何根據實際專業工作流程建立基準
Vals 與執業律師、金融分析師、軟體工程師和臨床醫生合作,繪製定義各領域專業工作任務的分類法,並開發自動評分系統,根據專家標準評估生成的工作成果,而非僅依賴多項選擇的正確性或字串完全匹配。一個典型的 Finance Agent v2 任務要求代理從文件中檢索支援資料、綜合同業公司的相對價值模型、識別產業催化因素,並在不虛構數據或遺失步驟上下文的情況下,提出基於事實的投資建議。在 2026 年 5 月,得分最高的模型在該任務套件上的準確率僅達 52%,顯示即使是最先進的系統,仍無法完成專業分析師應處理的約一半任務。
相同的哲學也適用於法律研究、代碼遷移、終端式工程和醫療編碼。由於評分是自動化且根據專家判斷進行校準的,因此在獲得模型存取權後數小時內即可產生評估結果,與前沿模型每週發布的節奏相符。該公司已將其評估基礎設施的部分內容開源,以支持可重複性,同時保護用於生成主要分數的私有測試集的完整性。這種領域合作、自動化專家級評分與快速回應的結合,使該平台有別於學術排行榜和純粹基於偏好的競賽場地。
a16z 對以 4 億美元估值領投本輪的理據
安德森·霍洛維茨將這項投資置於經濟學家喬治·阿克洛夫所描述的經典資訊不對稱問題框架中:當賣方比買方更了解產品品質,且有動機呈現有利資料時,市場將趨向低品質的結果。a16z 的李珍妮佛與同事們將獨立 AI 評分者的必要性,與信用市場中穆迪的歷史出現以及上市公司報告中獨立審計師的出現相提並論。Vals 的營收模式透過收取評估服務費用,而非認證任何特定實驗室的聲稱,旨在維持結構上的獨立性。
該公司強調創始人具有深厚的技术背景,並長期對基準的有效性持懷疑態度,指出 Rayan Krishnan 和 Langston Nashold 在斯坦福大學攻讀計算機科學期間,已就實際測量問題展開合作。本輪融資的估值,以及與量化交易相關的 HRT Ventures 的參與,進一步表明,精明資本將可靠的測量視為關鍵基礎設施,而非邊緣研究工具。a16z 的官方評論強調,模型正從回答問題轉向執行數小時的代理工作流程,錯誤的模型選擇所帶來的代價已從代幣支出轉變為時間損失和客戶結果受損。
創始人的背景與獨立評估理論的起源
擔任公司首席執行官的雷揚·克里希南,擁有豐富的背景,曾於知名數據分析公司 Palantir 工作。他的共同創始人蘭斯頓·納索爾擔任首席技術官,並從 Meta、NVIDIA 和 Hudson River Trading 等大型科技公司積累了豐富的經驗。這兩位創始人最初在史丹福大學的迎新前背包旅行中相遇,並迅速建立了友誼。他們後來在多門電腦科學課程中合作,並達成了一項重要認知:大型語言模型有潛力徹底改變工作方式。然而,他們也意識到,業界仍缺乏可信且有效的測試這些模型的方法。受此洞察激勵,他們毅然決定離開各自的研究生課程,創立 Vals。他們新事業的初期重點放在金融和編程任務上,這些任務被他們視為美國經濟活動中佔比巨大的部分。
隨著他們在市場上逐漸獲得關注,他們的成果被主要模型卡片廣泛引用,並獲得商務部對其倡議的支持,以及參與與人工智慧政策相關的國會努力。創始人強調持續淘汰過時基準並使用私有測試集的重要性。這種方法直接源於他們觀察到模型如何迅速達到靜態基準的頂峰,以及訓練數據如何影響公開評估。他們在生產系統和量化環境中的綜合經驗,顯著影響了評估堆疊的設計,以及企業目前用於選擇和監控模型、以與技術前沿保持一致的商業產品。
財務代理基準顯示排行榜分數與分析師級工作之間存在持續差距
儘管模型在舊有的學術測試套件上已達到近乎完美的表現,但 Finance Agent v2 套件仍持續揭示出無法忽視的重大不足。此套件所包含的任務涵蓋多文件綜合、相對價值建模與建議生成,這些均與業界專業金融分析師的日常產出高度相似。2026 年 5 月領先系統所錄得的 52 百分比上限,清楚提醒我們:高通用知識分數並不能自動等同於可靠且自主的財務分析能力。
Vals 透過考慮各行業對美國 GDP 的近似貢獻,來策略性地加權其綜合 Vals 指數,這使金融業產生顯著的乘數效應,確保經濟影響在各模型的綜合排名中得到準確反映。成功部署部分透過 Vals 評估選出的模型的企業報告稱,不僅在初始選擇過程中使用該平台,還用於持續衡量產品表現與既定前沿基準的對比。此外,現有的性能差距在金融機構的資本配置決策中也發揮關鍵作用。這些機構必須以可量化的生產力提升來證明其 AI 支出的合理性,而非僅依賴主觀且較不可靠的定性展示。這一持續評估過程對於確保 AI 技術投資產生實際效益並提升運營效率至關重要。
Vals Smith 開啟了直接從企業儲存庫提取的自訂編碼基準測試
隨著 A 輪融資的公告,Vals 已使 Smith 普遍可用,允許任何組織從其自身的 GitHub 倉庫生成自定義編程基準。該系統從歷史性拉取請求中提取真實的開發任務,並應用隱藏測試來判斷模型是否能完成工作。用戶可獲得 120 個免費積分開始使用。對於代碼庫中包含專有模式、函式庫和架構慣例的公司而言,通用 Python 或 Java 熟練度與在該特定環境中運作的能力之間的區別至關重要。
因此,Smith 將編碼能力的抽象問題轉化為具體的、特定於組織的衡量標準。早期的企業採用者現在可以根據其實際工程工作負載的表現來對模型進行排名,而非依賴可能已被部分記憶或優化的公共測試套件。此版本將 Vals 的應用範圍從預建領域基準擴展至可隨客戶需求擴展的定制評估基礎設施。
RSI 指數與 ReverseEngBench 擴大覆蓋至前沿風險領域
配合近期的融資,Vals 與 CoreWeave 合作隆重推出 RSI 指數。此創新指數旨在評估各類模型是否具備執行對推進模型開發、壓縮技術、訓練方法、參數優化策略、硬體工程實踐及訓練後評估至關重要的研究任務的能力。此外,公司還推出了 ReverseEngBench 項目,該項目與哥倫比亞大學、塔夫茨大學、加州大學柏克萊分校和加州大學洛杉磯分校等知名學術機構精心合作開發。此綜合基準包含 19 個專有程式,合計平均超過 16,000 行代碼。
這些計劃涵蓋多個不同領域,包括網路協議、固件、遊戲應用、檔案格式恢復流程和惡意軟體分析,所有這些均受到一套廣泛的反分析套件保護,以提升安全性。初步結果顯示,領先的前沿模型之間存在顯著差異,表明在代理能夠一致地逆向工程真實二進位檔之前,仍有巨大的潛力可挖掘。除了這些努力之外,已在心理健康應用領域啟動了早期工作,並計劃進一步擴展至環境影響評估、軍事應用和生物安全等關鍵領域。這些以風險為導向的評估,針對的是對提升企業安全態勢和政府對尖端系統評估至關重要的能力。
Vals 指數 2.0 按經濟貢獻加權聚合表現
重新設計的網站和 Vals 指數 2.0 現在在金融、編碼和法律任務等多個領域提供了更廣泛的覆蓋。指數中使用的部門權重源自經濟分析局提供的附加價值數據。綜合公式通過對每個部門的表現指標取平均值,然後根據其佔 GDP 的近似份額將這些部門得分進行組合。截至 2026 年 8 月中旬,Claude Opus 5 在指數中位居首位,緊隨其後的是 Claude Fable 5 和 GPT-5.6 Sol。
該指數會頻繁更新,以反映最新的模型發布情況,並作為一個關鍵指標,用以顯示潛在的經濟影響,同時仍允許用戶深入查看各個領域的排行榜,以獲得更詳細的洞察。由於底層基準測試大多為私有且定期更新,該指數能比純公有綜合指數維持更長時間的差異化。企業和研究人員不僅參考此指數進行相對排名,還用於對當前模型生態系統中的成本、延遲與能力之間的權衡進行分析,以確保根據最相關的數據做出明智決策。
企業採用模式與可量化的投資回報需求
大規模的 AI 部署在選擇基礎模型以及將內部產品與前沿性能指標進行評估時,正日益整合 Vals 評估。這種快速回應、領域專屬性和獨立性的結合,有效解決了採購團隊和技術主管所面臨的實際挑戰:僅靠供應商評分卡已不足以做出高風險決策。
相較於整個 2025 年的收入增長了八倍,加上在短短六個月內客戶數量翻倍、員工人數增加三倍,清楚表明需求已從初期的試驗階段轉入運營依賴階段。政府也已與該平台接觸,以獲取能力衡量和網路風險方面的寶貴洞察,從而強化了其在商業和政策層面的重要性。該平台能夠跟上每週的模型發布步伐,確保訊號保持最新且相關,而非落後於前沿數個月。
生態系統與基於偏好平台的結構差異
其他評估方法在該領域中確實存在,包括聚合人類對開放式輸出偏好投票的平台,以及旨在顯著縮短評估時間的心理測量方法。Vals 透過專家策劃的專業任務設計,確保高度相關性與實用性,並搭配經過精密校準以符合既定領域標準的自動化評分,從而脫穎而出。該公司使用持續更新的私有測試集,以維護評估的完整性,並擁有該領域所有主要前沿實驗室的明確引用記錄。
此引用記錄是一種至關重要的合法性形式,新進入者必須努力獲取以建立可信度。此外,該公司強調經濟加權的多步驟工作流程,而非僅專注於對話偏好或純粹速度,使其成為做出明智生產決策的關鍵基礎設施,而不僅僅是研究排行榜中的一名參與者。投資者顯然已認可並將這種獨特差異化因素計入其令人印象深刻的 4 億美元估值中。
模型開發者與能力測量的進展
前沿實驗室現在運作的環境中,獨立評分具有外部可信度,而自報數字則日益失去可信度。在模型卡片中被引用,向企業買家表明結果已接受第三方審查。同時,不斷創建更難的基準,提高了後續模型必須達成的標準。因此,推動人工智慧進步的「爬山」過程,面臨著更陡峭且更頻繁更新的山丘。
將評估視為次要考慮的開發者,可能只在部署後才發現能力缺口;而那些更早整合獨立測量的開發者,則能優先改善對實際工作至關重要的方面。選擇性開源基礎設施組件,進一步促進了可重現性,同時保護了能產生最高信號分數的核心私有評估。
對可信測量機構的更廣泛市場需求
隨著人工智慧系統日益深入具有法律和財務後果的工作流程,缺乏獨立的衡量標準,會產生與歷史上其他行業催生評級機構和審計師相同的資訊不對稱風險。Vals 的成長指標及其投資者的水準表明,資本已認知到這一制度性缺口。該公司明確的使命是擔任人工智慧的獨立評估者,這與企業追求投資回報清晰度以及政策制定者尋求能力與風險洞察的實際需求相符。
持續擴展至更多專業與風險領域,將測試該方法論在保持獨立性與信號品質的同時能否擴展。目前,近期產品發布、快速商業推廣與高調資本投入的結合,使 Vals 成為任何必須決定哪些模型真正能執行重要工作的人士的核心參考點。
常見問題
Vals AI 在其 A 輪融資中具體宣佈了什麼?
Vals AI 於 2026 年 8 月 13 日完成 4000 萬美元的 A 輪融資,估值為 4 億美元。Andreessen Horowitz 領投本輪,原有投資者 8VC、Pear VC 和 Bloomberg Beta 跟投,新投資者 HRT Ventures 和 Next Ladder Ventures 加入。公司同時發布了 Vals Smith 用於自訂編碼基準、RSI 指數、ReverseEngBench、擴展的 Vals 指數 2.0 以及重建的網站。Vals 和 a16z 的官方聲明均確認了上述數字及配套產品的發佈。
Vals 基準與 MMLU 或 SWE-bench 等公開排行榜有何不同?
Vals 專注於與領域專家共同定義的多步驟專業工作流程,並由根據專家標準校準的自動化系統進行評分。主要測試集保持私密,當它們不再能區分模型時即被退役,以減少污染和優化操縱。公共學術套件經常達到飽和或洩漏至訓練數據中,限制了其在真實企業任務中的預測價值。Vals 的方法在模型存取後數小時內即可產生結果,且已出現在各大實驗室的模型卡片中。
金融代理任務中 52 分的分數有何意義?
在 2026 年 5 月,領先模型在 Finance Agent v2 套件上達到了約 52% 的準確率,該套件要求進行相對價值建模、文件綜合和基於事實的建議。這一數字表明,即使是最強大的現有系統,仍會失敗約一半被專業金融分析師預期完成的任務。學術成績與專業任務表現之間的差距,正是 Vals 旨在衡量並協助縮小的問題。
創始人是誰?他們帶來了哪些經驗?
首席執行官雷安·克里希南曾於 Palantir 工作。首席技術官蘭斯頓·納肖爾德擁有 Meta、NVIDIA 和 Hudson River Trading 的工作經驗。兩人皆於史丹佛大學修讀電腦科學,並在創立公司前開始合作解決測量問題。他們的背景結合了生產系統經驗與量化及研究視角,塑造了 Vals 對嚴謹且適應性評估的重視。
Vals Smith 為企業提供哪些功能?
Vals Smith 讓任何組織都能直接從其 GitHub 倉儲生成自訂編碼基準。該系統從歷史性的拉取請求中提取真實的開發任務,並套用隱藏測試。用戶初始享有 120 個免費積分。此工具將通用編碼基準轉換為反映專有代碼模式和工程實踐的組織特定指標。
Vals 指數如何融入經濟權重?
該指數彙總金融、編程和法律任務的表現,並根據美國經濟分析局的數據,按照各行業對美國GDP的近似貢獻度進行加權。所得的綜合指數提供了一個衡量潛在經濟影響的單一主指標,同時仍允許詳細檢視各領域的具體結果。2.0 版擴大了覆蓋範圍,並經常更新以反映新模型的發布。
🔥 KuCoin 在波動市場中提供更穩定的選擇
如果您擔心市場頻繁的上下波動,並希望尋求更穩定的被動收益方式,KuCoin 是您的理想選擇:

Simple Earn:隨時充幣和提幣,獲得穩定回報。
KuCoin 賺幣:透過專業資產管理賺取穩定收益。
持幣生息:透過在資金帳戶、交易帳戶、保證金帳戶、合約帳戶、挖礦帳戶及統一帳戶中持有資產來賺取獎勵。
質押:釋放鏈上資產的收益潛力。
進階投資:進階投資提供多種結構性產品,協助您的資金在任何市場中增長。
鲨鱼鳍:本金保障與保證收益
雙幣盈:低買高賣,回報計算透明。
雪球:高收益,附價格保護。
折扣購買:以折扣價購買加密貨幣。
KCS 忠誠計劃:質押 ≥ 1 KCS 以升級,享受專屬好處。
KuCoin 財富管理:發掘未來價值,開啟您的智慧投資之旅。
KCS 優惠:持有並質押 KCS,以享有平台各項優惠。
KCS 質押 2.0:參與 KCS 鏈上治理以賺取收益。
免責聲明:此內容僅供資訊參考,不構成投資建議。加密貨幣投資存在風險,請自行研究(DYOR)。
免責聲明: 本頁面經由 AI 技術翻譯,旨在方便您的閱讀。欲獲取最準確資訊,請以原始英文版本為準。
