Vals AI ระดมทุนซีรีส์ A มูลค่า 40 ล้านดอลลาร์สหรัฐ โดยนำโดย a16z เพื่อสร้างมาตรฐานโมเดล AI แบบอิสระ

การระดมทุนสื่อถึงความต้องการที่เพิ่มขึ้นสำหรับมาตรฐานการวัดประสิทธิภาพของ AI ในโลกจริง
ในช่วงกลางเดือนสิงหาคม 2026 Vals AI ประกาศการระดมทุนรอบ Series A มูลค่า 40 ล้านดอลลาร์สหรัฐ โดยมีมูลค่าบริษัทอยู่ที่ 400 ล้านดอลลาร์สหรัฐ นำโดย Andreessen Horowitz พร้อมการมีส่วนร่วมจากนักลงทุนเดิมได้แก่ 8VC, Pear VC และ Bloomberg Beta รวมถึงผู้สนับสนุนรายใหม่คือ HRT Ventures และ Next Ladder Ventures บริษัทที่มีสำนักงานใหญ่อยู่ที่ซานฟรานซิสโกระบุว่าตนเองเป็นผู้ประเมินอิสระสำหรับโมเดล AI ขั้นสูง โดยสร้างมาตรฐานการประเมินที่วัดประสิทธิภาพบนงานมืออาชีพที่มีความหมายทางเศรษฐกิจ แทนการทดสอบแบบวิชาการที่มีการอิ่มตัวไปแล้ว ส่งผลให้ผลลัพธ์ของพวกเขากลายเป็นส่วนหนึ่งของโมเดลการ์ดจาก OpenAI, Anthropic, Google, Meta และ xAI รายได้เติบโตขึ้นแปดเท่าเมื่อเทียบกับทั้งปี 2025 ฐานลูกค้าเพิ่มขึ้นเป็นสองเท่า และทีมงานขยายตัวเป็นสามเท่าภายในหกเดือน
พร้อมกับการระดมทุน Vals เปิดตัว Vals Smith สำหรับการทดสอบการเขียนโค้ดแบบกำหนดเองที่ดึงมาจาก repository ใดๆ บน GitHub, ดัชนี RSI ที่พัฒนาขึ้นร่วมกับ CoreWeave เพื่อวัดความสามารถในการปรับปรุงตนเองแบบวนซ้ำ, ReverseEngBench ที่สร้างร่วมกับนักวิจัยจากมหาวิทยาลัยโคลัมเบีย, มหาวิทยาลัยทัฟส์, มหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์ และมหาวิทยาลัยแคลิฟอร์เนีย ลอสแอนเจลิส และดัชนี Vals 2.0 ที่ขยายขอบเขตโดยให้น้ำหนักตามส่วนแบ่งของแต่ละภาคส่วนต่อ GDP ของสหรัฐอเมริกา การเคลื่อนไหวเหล่านี้เกิดขึ้นในช่วงที่องค์กรต่างๆ กำลังเผชิญกับแรงกดดันที่เพิ่มขึ้นในการนำ AI มาใช้ แต่ขาดวิธีการที่เชื่อถือได้ในการวัดผลตอบแทนจากการลงทุน และในขณะเดียวกันรัฐบาลก็กำลังมองหาตัวชี้วัดอิสระสำหรับความสามารถขั้นสูงสุดและความเสี่ยงทางไซเบอร์ หลักการพื้นฐานคือ การทดสอบแบบอิสระที่อัปเดตอย่างต่อเนื่องสำหรับงานเฉพาะทางได้กลายเป็นโครงสร้างพื้นฐานที่จำเป็นสำหรับเศรษฐกิจ AI ซึ่งช่วยปิดช่องว่างที่เพิ่มขึ้นระหว่างคะแนนในตารางอันดับที่ผู้ให้บริการรายงานกับความสามารถจริงในการดำเนินงานหลายขั้นตอนในด้านการเงิน กฎหมาย การพัฒนาซอฟต์แวร์ และโดเมนความเสี่ยงระดับสูง
เหตุผลที่ตารางอันดับ AI แบบดั้งเดิมสูญเสียพลังการทำนายสำหรับการตัดสินใจขององค์กร
การวัดผลทางวิชาการสาธารณะเคยให้ภาษาที่ใช้ร่วมกันในการติดตามความก้าวหน้าของโมเดล แต่การวิเคราะห์ในเดือนกุมภาพันธ์ 2026 โดยนักวิจัยจาก ETH Zurich และสแตนฟอร์ดได้ตรวจสอบการประเมินโมเดลภาษาขนาดใหญ่ที่ใช้กันอย่างแพร่หลาย 60 รายการ และพบว่า 29 รายการมีการอิ่มตัวแล้ว โดยช่องว่างระหว่างประสิทธิภาพของโมเดลอันดับหนึ่งและอันดับสองลดลงจนอยู่ภายในขอบเขตของเสียงรบกวนในการวัดผล การปนเปื้อนเกิดขึ้นเมื่อข้อมูลการทดสอบเข้าสู่ชุดข้อมูลการฝึกอบรม บางครั้งผ่าน Common Crawl ในขณะที่ห้องปฏิบัติการบางแห่งก็ปรับแต่งโดยตรงตามเป้าหมายที่รู้จักกันอยู่แล้ว ผลลัพธ์คือคะแนนสูงบน MMLU, HumanEval หรือชุดการประเมินที่คล้ายกันไม่สามารถคาดการณ์ความสำเร็จในกระบวนการทางอาชีพที่ซับซ้อนและมีหลายขั้นตอนได้อีกต่อไป Vals จัดการปัญหานี้โดยรักษาชุดการทดสอบหลักให้เป็นความลับ ร่วมมือกับผู้เชี่ยวชาญด้านสาขาเพื่อกำหนดงานตัวแทน และเลิกใช้การประเมินผลเมื่อไม่สามารถแยกแยะความแตกต่างระหว่างโมเดลได้อีกต่อไป
ในเดือนพฤษภาคม 2026 บริษัทได้แทนที่การประเมิน CorpFin รุ่นก่อนหน้าด้วยเกณฑ์การสร้างแบบจำลอง Excel ที่ยากขึ้น โดยเฉพาะเพราะความแตกต่างได้หายไป การใช้แนวทางที่ปรับตัวนี้ถือว่าการประเมินเป็นโครงสร้างพื้นฐานที่ต่อเนื่องมากกว่าการสอบแบบคงที่ ทำให้องค์กรได้สัญญาณที่ชัดเจนยิ่งขึ้นเมื่อเลือกรุ่นสำหรับการใช้งานจริง เอกสารอย่างเป็นทางการเกี่ยวกับวิธีการของบริษัทและการประกาศการลงทุนจาก a16z ต่างเน้นย้ำว่าชุดข้อมูลส่วนตัวที่ผู้เชี่ยวชาญคัดสรรและมีการแทนที่อย่างต่อเนื่องสามารถต้านทานเส้นทางการอิ่มตัวได้ดีกว่าการทดสอบแบบคงที่ทั้งแบบเปิดเผยอย่างสมบูรณ์หรือแบบส่วนตัวอย่างสมบูรณ์
วิธีที่ Vals สร้างมาตรฐานการวัดผลจากกระบวนการทำงานจริงของมืออาชีพ
Vals ร่วมมือกับทนายความที่ปฏิบัติงาน นักวิเคราะห์การเงิน วิศวกรซอฟต์แวร์ และผู้เชี่ยวชาญด้านคลินิก เพื่อจัดทำโครงสร้างของงานที่กำหนดความเชี่ยวชาญในแต่ละสาขา จากนั้นพัฒนาระบบการให้คะแนนอัตโนมัติที่ประเมินผลงานที่สร้างขึ้นเทียบกับมาตรฐานของผู้เชี่ยวชาญ แทนการใช้ความถูกต้องแบบตัวเลือกหลายข้อหรือการจับคู่สตริงอย่างแม่นยำ งานแบบ Finance Agent v2 ทั่วไปต้องการให้ตัวแทนดึงข้อมูลสนับสนุนจากเอกสาร สร้างแบบจำลองค่าสัมพัทธ์ข้ามบริษัทคู่แข่ง ระบุปัจจัยกระตุ้นภาคอุตสาหกรรม และสรุปคำแนะนำการลงทุนที่มีพื้นฐานอย่างมีเหตุผล โดยไม่สร้างตัวเลขเท็จหรือสูญเสียบริบทระหว่างขั้นตอน ในเดือนพฤษภาคม 2026 โมเดลที่ได้คะแนนสูงสุดมีความแม่นยำเพียง 52 เปอร์เซ็นต์บนชุดงานนี้ ซึ่งบ่งชี้ว่าแม้แต่ระบบชั้นนำก็ยังล้มเหลวในการจัดการงานประมาณครึ่งหนึ่งที่นักวิเคราะห์มืออาชีพควรทำ
หลักการเดียวกันนี้ใช้ได้กับการวิจัยด้านกฎหมาย การย้ายโค้ด การวิศวกรรมแบบใช้เทอร์มินัล และการจัดรหัสทางการแพทย์ เนื่องจากการให้คะแนนเป็นไปโดยอัตโนมัติแต่ได้รับการปรับเทียบตามดุลยพินิจของผู้เชี่ยวชาญ การประเมินผลสามารถผลิตขึ้นภายในไม่กี่ชั่วโมงหลังจากได้รับการเข้าถึงโมเดล ซึ่งสอดคล้องกับความถี่รายสัปดาห์ของการเปิดตัวรุ่นล่าสุด บริษัทได้เปิดแหล่งที่มาของส่วนหนึ่งของโครงสร้างพื้นฐานการประเมินเพื่อสนับสนุนความสามารถในการทำซ้ำ ในขณะที่ยังคงรักษาความสมบูรณ์ของชุดการทดสอบแบบส่วนตัวที่ใช้สร้างคะแนนหลัก ความผสมผสานระหว่างความร่วมมือด้านสาขา การให้คะแนนระดับผู้เชี่ยวชาญแบบอัตโนมัติ และการตอบสนองอย่างรวดเร็ว ทำให้แพลตฟอร์มนี้โดดเด่นจากทั้งตารางผู้นำทางวิชาการและเวทีที่อิงเพียงความชอบเท่านั้น
เหตุผลของ a16z ในการนำการระดมทุนในมูลค่า 400 ล้านดอลลาร์
Andreessen Horowitz ได้กรอบการลงทุนรอบปัญหาความไม่สมดุลของข้อมูลแบบคลาสสิกที่นักเศรษฐศาสตร์ George Akerlof อธิบายไว้: เมื่อผู้ขายรู้ข้อมูลเกี่ยวกับคุณภาพของผลิตภัณฑ์มากกว่าผู้ซื้อและมีแรงจูงใจในการนำเสนอข้อมูลที่เป็นบวก ตลาดจะเสื่อมคุณภาพลงสู่ผลลัพธ์ที่มีคุณภาพต่ำกว่า Jennifer Li และทีมงานที่ a16z เปรียบเทียบความจำเป็นในการมีผู้ประเมิน AI ที่เป็นอิสระกับการเกิดขึ้นของ Moody’s ในตลาดสินเชื่อและผู้สอบบัญชีอิสระในการรายงานของบริษัทจดทะเบียน โมเดลรายได้ของ Vals ซึ่งเรียกเก็บค่าบริการประเมินแทนการรับรองข้ออ้างของห้องปฏิบัติการใดๆ โดยเฉพาะ มีเป้าหมายเพื่อรักษาความเป็นอิสระเชิงโครงสร้าง
บริษัทได้เน้นย้ำถึงความเชี่ยวชาญด้านเทคนิคของผู้ก่อตั้งและข้อสงสัยระยะยาวเกี่ยวกับความถูกต้องของมาตรฐานการวัด พร้อมระบุว่า Rayan Krishnan และ Langston Nashold ได้ร่วมมือกันแก้ไขปัญหาการวัดในโลกจริงขณะศึกษาวิทยาการคอมพิวเตอร์ที่สแตนฟอร์ด การประเมินมูลค่าในการระดมทุนครั้งนี้และการมีส่วนร่วมของ HRT Ventures ซึ่งเชื่อมโยงกับการซื้อขายเชิงปริมาณ ยิ่งบ่งชี้ว่าทุนระดับสูงมองว่าการวัดที่เชื่อถือได้เป็นโครงสร้างพื้นฐานสำคัญ ไม่ใช่เพียงเครื่องมือวิจัยรอง คำแถลงอย่างเป็นทางการของ a16z ย้ำว่าโมเดลกำลังเปลี่ยนจากตอบคำถามไปสู่การดำเนินงานแบบ agentic ที่ใช้เวลาหลายชั่วโมง ทำให้ต้นทุนของการเลือกโมเดลที่ไม่ดีเพิ่มขึ้นจากค่าใช้จ่ายของโทเค็นไปเป็นเวลาและผลลัพธ์ของลูกค้าที่สูญเสียไป
พื้นหลังของผู้ก่อตั้งและที่มาของทฤษฎีการประเมินอย่างอิสระ
เรยัน คริชนาն ซึ่งดำรงตำแหน่งซีอีโอของบริษัท มีพื้นหลังที่โดดเด่นรวมถึงประสบการณ์ก่อนหน้าที่ Palantir บริษัทวิเคราะห์ข้อมูลที่มีชื่อเสียง เพื่อนร่วมก่อตั้งของเขา แลงสตัน นาชอลด์ ดำรงตำแหน่งซีทีโอ และนำประสบการณ์อันกว้างขวางจากช่วงเวลาที่他曾ทำงานที่บริษัทเทคโนโลยีชั้นนำ เช่น Meta, NVIDIA และ Hudson River Trading ผู้ก่อตั้งทั้งสองคนพบกันครั้งแรกระหว่างทริปเดินป่าก่อนOrientation ที่มหาวิทยาลัยสแตนฟอร์ด ซึ่งพวกเขาสร้างความสัมพันธ์อันแน่นแฟ้นอย่างรวดเร็ว ต่อมาพวกเขาได้ร่วมมือกันในหลักสูตรวิทยาการคอมพิวเตอร์ต่างๆ ซึ่งนำไปสู่การตระหนักครั้งสำคัญ: โมเดลภาษาขนาดใหญ่มีศักยภาพในการปฏิวัติวิธีการทำงาน อย่างไรก็ตาม พวกเขาได้ตระหนักว่าอุตสาหกรรมยังขาดวิธีการที่น่าเชื่อถือและมีประสิทธิภาพในการทดสอบโมเดลเหล่านี้ ด้วยแรงบันดาลใจจากความเข้าใจของพวกเขา พวกเขาจึงตัดสินใจอย่างกล้าหาญที่จะละทิ้งหลักสูตรปริญญาโทของตนเองเพื่อก่อตั้ง Vals เป้าหมายเริ่มต้นของธุรกิจใหม่นี้คืองานด้านการเงินและการเขียนโปรแกรม ซึ่งพวกเขาได้ระบุว่าเป็นส่วนสำคัญของกิจกรรมทางเศรษฐกิจในสหรัฐอเมริกา
เมื่อพวกเขาเริ่มได้รับความนิยมในตลาด พวกเขาได้รับการอ้างอิงอย่างเด่นชัดในใบสมัครโมเดลหลักๆ และได้รับการสนับสนุนจากกระทรวงพาณิชย์สำหรับโครงการของพวกเขา รวมถึงการมีส่วนร่วมในความพยายามของสภาคองเกรสที่เกี่ยวข้องกับนโยบายปัญญาประดิษฐ์ ผู้ก่อตั้งให้ความสำคัญอย่างยิ่งต่อความจำเป็นในการเลิกใช้เกณฑ์วัดที่ล้าสมัยและใช้ชุดทดสอบส่วนตัว แนวทางนี้เป็นผลโดยตรงจากการสังเกตของพวกเขาเกี่ยวกับความเร็วที่โมเดลสามารถบรรลุจุดสูงสุดของเกณฑ์วัดแบบคงที่ และวิธีที่ข้อมูลการฝึกอบรมสามารถส่งผลต่อการประเมินของสาธารณะ ประสบการณ์ร่วมกันของพวกเขาในระบบการผลิตและสภาพแวดล้อมเชิงปริมาณได้ช่วยกำหนดการออกแบบชุดการประเมิน รวมถึงผลิตภัณฑ์เชิงพาณิชย์ที่องค์กรต่างๆ ตอนนี้ใช้เพื่อเลือกและติดตามโมเดลให้สอดคล้องกับเทคโนโลยีล่าสุด
การเปรียบเทียบประสิทธิภาพของตัวแทนการเงินเปิดเผยช่องว่างที่ยังคงมีอยู่ระหว่างคะแนนในตารางอันดับกับงานระดับนักวิเคราะห์
แม้ว่าโมเดลจะบรรลุผลลัพธ์ใกล้เคียงสมบูรณ์แบบบนชุดการทดสอบทางวิชาการรุ่นเก่า ชุดการทดสอบ Finance Agent v2 ยังคงเปิดเผยช่องว่างที่สำคัญซึ่งไม่สามารถมองข้ามได้ งานที่เกี่ยวข้องในชุดนี้ครอบคลุมการสังเคราะห์เอกสารหลายฉบับ การสร้างแบบจำลองค่าสัมพัทธ์ และการสร้างคำแนะนำ ซึ่งทั้งหมดนี้สะท้อนอย่างใกล้เคียงกับผลลัพธ์รายวันที่นักวิเคราะห์การเงินมืออาชีพในอุตสาหกรรมผลิตขึ้น ขีดจำกัดที่ 52 เปอร์เซ็นต์ที่บันทึกได้ในเดือนพฤษภาคม 2026 สำหรับระบบชั้นนำ เป็นการเตือนให้ระลึกอย่างชัดเจนว่าคะแนนความรู้ทั่วไปที่สูงไม่ได้หมายความว่าจะมีความสามารถในการวิเคราะห์การเงินที่เชื่อถือได้และเป็นอิสระ
Vals กำหนดน้ำหนักของดัชนีรวม Vals Index โดยพิจารณาสัดส่วนประมาณการของแต่ละภาคส่วนต่อ GDP ของสหรัฐอเมริกา ซึ่งทำให้ภาคการเงินมีผลคูณที่สำคัญ รับประกันว่าผลกระทบทางเศรษฐกิจจะสะท้อนอย่างแม่นยำในการจัดอันดับรวมของแบบจำลองต่างๆ องค์กรที่ประสบความสำเร็จในการนำแบบจำลองที่เลือกบางส่วนผ่านการประเมินของ Vals ไปใช้งานรายงานว่าใช้แพลตฟอร์มนี้ไม่เพียงแต่สำหรับกระบวนการเลือกเริ่มต้น แต่ยังใช้สำหรับการวัดผลประสิทธิภาพของผลิตภัณฑ์อย่างต่อเนื่องเทียบกับเกณฑ์พื้นฐานขั้นสูงที่กำหนดไว้ นอกจากนี้ ช่องว่างด้านประสิทธิภาพที่มีอยู่ยังมีบทบาทสำคัญในการให้ข้อมูลแก่การตัดสินใจจัดสรรทุนภายในสถาบันการเงิน สถาบันเหล่านี้ต้องพิสูจน์ค่าใช้จ่ายด้าน AI ด้วยผลกำไรด้านผลิตภาพที่วัดได้ แทนที่จะพึ่งพาการนำเสนอเชิงคุณภาพเพียงอย่างเดียว ซึ่งมักมีลักษณะเชิงอัตวิสัยและน่าเชื่อถือน้อยกว่า กระบวนการประเมินอย่างต่อเนื่องนี้มีความสำคัญอย่างยิ่งในการรับรองว่าการลงทุนในเทคโนโลยี AI จะให้ผลประโยชน์และปรับปรุงประสิทธิภาพการดำเนินงานอย่างเป็นรูปธรรม
Vals Smith เปิดตัวการทดสอบประสิทธิภาพการเขียนโค้ดแบบกำหนดเองที่ดึงมาจากคลังข้อมูลขององค์กรโดยตรง
ด้วยการประกาศซีรีส์ A Vals ได้เปิดให้ Smith ใช้งานทั่วไป ทำให้องค์กรใดๆ ก็สามารถสร้างมาตรฐานการเขียนโค้ดแบบกำหนดเองจาก repository GitHub ของตนเองได้ ระบบจะดึงงานพัฒนาที่แท้จริงจาก pull requests ในอดีต และใช้การทดสอบแบบซ่อนไว้เพื่อประเมินว่าโมเดลสามารถ hoàn thiệnงานนั้นได้หรือไม่ ผู้ใช้จะได้รับเครดิตฟรี 120 หน่วยเพื่อเริ่มต้น สำหรับบริษัทที่มีรหัสแหล่งที่มาซึ่งมีรูปแบบ ไลบรารี และข้อตกลงด้านสถาปัตยกรรมเฉพาะตัว ความแตกต่างระหว่างทักษะทั่วไปใน Python หรือ Java กับความสามารถในการทำงานภายในสภาพแวดล้อมเฉพาะนั้นถือเป็นปัจจัยสำคัญ
สมิธจึงแปลงคำถามเชิงนามธรรมเกี่ยวกับความสามารถในการเขียนโค้ดให้เป็นการวัดผลที่เฉพาะเจาะจงตามองค์กร ผู้ใช้งานรายแรกในองค์กรสามารถจัดอันดับโมเดลตามประสิทธิภาพบนภาระงานวิศวกรรมจริงของพวกเขา แทนที่จะใช้ชุดการทดสอบสาธารณะที่อาจถูกจดจำหรือปรับแต่งบางส่วนแล้ว การเปิดตัวครั้งนี้ขยายขอบเขตของ Vals ออกไปจากเกณฑ์มาตรฐานที่มีอยู่แล้วไปสู่โครงสร้างพื้นฐานการประเมินที่ปรับแต่งได้ ซึ่งสามารถขยายขนาดตามความต้องการของลูกค้า
ดัชนี RSI และ ReverseEngBench ขยายขอบเขตการครอบคลุมไปยังโดเมนความเสี่ยงระดับหน้า前沿
ร่วมกับการระดมทุนเมื่อเร็วๆ นี้ Vals ได้เปิดตัวดัชนี RSI อย่างเป็นทางการ ซึ่งพัฒนาขึ้นร่วมกับ CoreWeave ดัชนีนี้มีเป้าหมายเพื่อประเมินว่าโมเดลต่างๆ มีความสามารถในการดำเนินงานวิจัยที่จำเป็นสำหรับการพัฒนาโมเดล เทคนิคการบีบอัด วิธีการฝึกอบรม กลยุทธ์การปรับค่าพารามิเตอร์ แนวทางการสร้างฮาร์ดแวร์ และการประเมินหลังการฝึกอบรมหรือไม่ นอกจากนี้ บริษัทยังได้เปิดตัว ReverseEngBench ซึ่งเป็นโครงการที่พัฒนาอย่างรอบคอบร่วมกับสถาบันการศึกษาชั้นนำ ได้แก่ มหาวิทยาลัยโคลัมเบีย มหาวิทยาลัยทูฟส์ มหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์ และมหาวิทยาลัยแคลิฟอร์เนีย ลอสแอนเจลิส แบบทดสอบที่ครอบคลุมนี้ประกอบด้วยโปรแกรมเฉพาะตัว 19 โปรแกรม ซึ่งโดยรวมมีโค้ดเฉลี่ยมากกว่า 16,000 บรรทัด
โปรแกรมเหล่านี้ครอบคลุมหลากหลายด้าน รวมถึงโปรโตคอลเครือข่าย ฟีร์มแวร์ แอปพลิเคชันเกม กระบวนการกู้คืนรูปแบบไฟล์ และการวิเคราะห์มัลแวร์ ซึ่งทั้งหมดได้รับการป้องกันโดยชุดป้องกันการวิเคราะห์ที่ครอบคลุมซึ่งออกแบบมาเพื่อเพิ่มความปลอดภัย ผลลัพธ์เบื้องต้นแสดงให้เห็นถึงความแตกต่างอย่างมีนัยสำคัญระหว่างโมเดลชั้นนำ ซึ่งเปิดเผยศักยภาพที่ยังคงเหลืออยู่มากก่อนที่ตัวแทนจะสามารถถอดรหัสไบนารีที่สมจริงได้อย่างสม่ำเสมอ นอกจากนี้ยังมีงานในระยะเริ่มต้นที่เริ่มขึ้นในด้านแอปพลิเคชันสุขภาพจิต โดยมีแผนขยายไปยังด้านสำคัญอื่นๆ เช่น การประเมินผลกระทบต่อสิ่งแวดล้อม การใช้งานทางทหาร และโดเมนด้านความปลอดภัยทางชีวภาพ การประเมินเหล่านี้ซึ่งมุ่งเน้นไปที่ความเสี่ยง ได้จัดการกับความสามารถที่สำคัญสำหรับการเสริมสร้างท่าทางด้านความปลอดภัยขององค์กรและการประเมินระบบขั้นสูงของรัฐบาล
Vals Index 2.0 รวมผลการดำเนินงานตามน้ำหนักของการมีส่วนร่วมทางเศรษฐกิจ
เว็บไซต์ที่ออกแบบใหม่และ Vals Index 2.0 ตอนนี้มีขอบเขตการครอบคลุมที่กว้างขวางยิ่งขึ้นในหลากหลายด้าน รวมถึงการเงิน การเขียนโค้ด และงานด้านกฎหมาย น้ำหนักของแต่ละภาคส่วนที่ใช้ในดัชนีนี้ได้รับการคำนวณจากข้อมูลมูลค่าเพิ่มที่ให้โดยสำนักงานวิเคราะห์เศรษฐกิจ ฟอร์มูล่าแบบรวมที่ใช้จะเฉลี่ยตัวชี้วัดประสิทธิภาพภายในแต่ละภาคส่วน แล้วรวมคะแนนแต่ละภาคส่วนตามสัดส่วนประมาณของ GDP ณ กลางเดือนสิงหาคม 2026 Claude Opus 5 อยู่ในอันดับแรกของดัชนี ตามด้วย Claude Fable 5 และ GPT-5.6 Sol
ดัชนีได้รับการอัปเดตอย่างสม่ำเสมอเพื่อสะท้อนการเปิดตัวรุ่นล่าสุด และทำหน้าที่เป็นตัวชี้วัดหลักเดียวที่บ่งชี้ศักยภาพทางผลกระทบทางเศรษฐกิจ ขณะเดียวกันก็ยังอนุญาตให้ผู้ใช้สามารถเจาะลึกไปยังตารางอันดับรายโดเมนเพื่อรับข้อมูลเชิงลึกที่ละเอียดยิ่งขึ้น เนื่องจากเกณฑ์อ้างอิงพื้นฐานยังคงเป็นความลับส่วนใหญ่และได้รับการปรับปรุงเป็นระยะ ดัชนีจึงสามารถรักษาความแตกต่างได้นานกว่าดัชนีที่สร้างจากข้อมูลสาธารณะเพียงอย่างเดียว องค์กรและนักวิจัยต่างอ้างอิงดัชนีนี้ไม่เพียงเพื่อจุดประสงค์ในการจัดอันดับเปรียบเทียบ แต่ยังใช้ในการวิเคราะห์การแลกเปลี่ยนระหว่างต้นทุน ความล่าช้า และความสามารถทั่วทั้งระบบนิเวศของโมเดลปัจจุบัน เพื่อให้มั่นใจว่าพวกเขาตัดสินใจอย่างมีข้อมูลโดยอิงจากข้อมูลที่เกี่ยวข้องที่สุดที่มีอยู่
รูปแบบการรับรองจากองค์กรและความต้องการด้าน ROI ที่วัดได้
การใช้งาน AI ในระดับใหญ่กำลังรวมการประเมิน Vals เข้ากับกระบวนการเลือกโมเดลพื้นฐานและการประเมินผลิตภัณฑ์ภายในเทียบกับตัวชี้วัดประสิทธิภาพขั้นสูงสุด การรวมกันของความเร็วในการตอบสนอง ความเฉพาะทางด้านโดเมน และความเป็นอิสระนี้ช่วยแก้ไขความท้าทายเชิงปฏิบัติที่ทีมจัดซื้อและผู้นำทางเทคนิคเผชิญ: ตารางคะแนนผู้จัดจำหน่ายเพียงอย่างเดียวไม่เพียงพออีกต่อไปสำหรับการตัดสินใจที่มีความเสี่ยงสูง
การเติบโตของรายได้แปดเท่าเมื่อเทียบกับทั้งปี 2025 พร้อมกับจำนวนลูกค้าที่เพิ่มเป็นสองเท่าและจำนวนพนักงานที่เพิ่มเป็นสามเท่าภายในเพียงหกเดือน ชี้ให้เห็นอย่างชัดเจนว่าความต้องการได้ก้าวพ้นระยะการทดลองเริ่มต้นไปสู่ระยะที่พึ่งพาในการดำเนินงานแล้ว รัฐบาลยังได้เข้าร่วมกับแพลตฟอร์มนี้เพื่อรับข้อมูลเชิงลึกที่มีคุณค่าเกี่ยวกับการวัดความสามารถและความเสี่ยงทางไซเบอร์ ซึ่งยิ่งเสริมความสำคัญของแพลตฟอร์มนี้ในบริบททั้งเชิงพาณิชย์และเชิงนโยบาย ความสามารถของแพลตฟอร์มในการรักษาความทันสมัยกับการเปิดตัวโมเดลรายสัปดาห์ทำให้สัญญาณยังคงทันสมัยและเกี่ยวข้อง แทนที่จะล้าหลังหน้าความก้าวหน้าอยู่หลายเดือน
ระบบนิเวศและการแยกความแตกต่างเชิงโครงสร้างจากแพลตฟอร์มที่อิงความชอบ
มีความพยายามในการประเมินอื่นๆ ที่มีอยู่ในแวดวงนี้เช่นกัน รวมถึงพื้นที่การลงคะแนนความชอบที่รวบรวมความเห็นของมนุษย์เกี่ยวกับผลลัพธ์แบบเปิดกว้าง รวมถึงวิธีการทางจิตวิทยาที่มุ่งลดเวลาการประเมินอย่างมาก Vals โดดเด่นด้วยการออกแบบงานมืออาชีพที่ได้รับการคัดสรรโดยผู้เชี่ยวชาญ ซึ่งรับประกันความเกี่ยวข้องและความสามารถในการนำไปใช้งานสูง พร้อมกับการให้คะแนนอัตโนมัติที่ถูกปรับเทียบอย่างละเอียดเพื่อให้สอดคล้องกับมาตรฐานของโดเมนที่ยอมรับกันทั่วไป บริษัทใช้ชุดการทดสอบแบบส่วนตัวที่ถูกปลดออกอย่างต่อเนื่องเพื่อรักษาความสมบูรณ์ของการประเมิน และมีประวัติการอ้างอิงที่พิสูจน์ได้จากห้องปฏิบัติการชั้นนำทุกแห่งในวงการ
บันทึกการอ้างอิงนี้ทำหน้าที่เป็นรูปแบบที่สำคัญของการรับรองความน่าเชื่อถือ ซึ่งผู้เข้าร่วมใหม่ต้องพยายามให้ได้รับเพื่อสร้างความน่าเชื่อถือ ยิ่งไปกว่านั้น ความเน้นของบริษัทที่มีต่อกระบวนการทำงานแบบหลายขั้นตอนที่คำนวณตามน้ำหนักทางเศรษฐกิจ แทนที่จะมุ่งเน้นเพียงแค่ความชอบในการสนทนาหรือความเร็วอย่างเดียว ทำให้บริษัทนี้มีตำแหน่งเป็นโครงสร้างพื้นฐานที่สำคัญสำหรับการตัดสินใจด้านการผลิตอย่างมีข้อมูล มากกว่าแค่เป็นผู้เล่นในตารางอันดับการวิจัย นักลงทุนเห็นชัดเจนและได้กำหนดมูลค่าที่น่าประทับใจ 400 ล้านดอลลาร์สหรัฐฯ ตามความแตกต่างเฉพาะตัวนี้
การอนุมานสำหรับนักพัฒนาโมเดลและจังหวะของการวัดความสามารถ
ห้องปฏิบัติการ Frontier ตอนนี้ทำงานในสภาพแวดล้อมที่คะแนนจากภายนอกมีความน่าเชื่อถือ ในขณะที่ตัวเลขที่รายงานด้วยตนเองกลับสูญเสียความน่าเชื่อถืออย่างต่อเนื่อง การอ้างอิงในแบบจำลองการ์ดสื่อถึงผู้ซื้อจากองค์กรว่าผลลัพธ์ได้รับการตรวจสอบโดยบุคคลที่สามแล้ว ในขณะเดียวกัน การสร้างมาตรฐานใหม่ที่ยากขึ้นอย่างต่อเนื่องได้ยกมาตรฐานที่แบบจำลองรุ่นถัดไปต้องก้าวข้าม กระบวนการ “ปีนเขา” ที่ขับเคลื่อนความก้าวหน้าของ AI จึงเผชิญกับภูเขาที่สูงขึ้นและได้รับการปรับปรุงบ่อยครั้งยิ่งขึ้น
นักพัฒนาที่ถือว่าการประเมินเป็นเรื่องรองอาจพบช่องว่างด้านความสามารถเพียงหลังจากการนำไปใช้งานแล้ว; ในขณะที่ผู้ที่รวมการวัดผลอย่างอิสระตั้งแต่เนิ่นๆ สามารถจัดลำดับความสำคัญของการปรับปรุงที่มีความหมายต่อการทำงานจริง การเปิดแหล่งที่มาของส่วนประกอบโครงสร้างพื้นฐานที่เลือกไว้ยังส่งเสริมความสามารถในการทำซ้ำ ขณะเดียวกันก็ปกป้องการประเมินแบบเอกชนหลักที่สร้างคะแนนที่มีสัญญาณสูงสุด
ความต้องการทั่วไปของตลาดต่อสถาบันวัดผลที่เชื่อถือได้
เมื่อระบบปัญญาประดิษฐ์เข้ามามีบทบาทลึกซึ้งยิ่งขึ้นในกระบวนการที่มีผลทางกฎหมายและการเงิน การขาดการวัดผลอย่างเป็นอิสระจึงสร้างความเสี่ยงด้านความไม่สมดุลของข้อมูลที่เคยนำไปสู่การเกิดขึ้นของหน่วยงานจัดอันดับและผู้ตรวจสอบบัญชีในอุตสาหกรรมอื่นๆ มาแล้วในอดีต ตัวชี้วัดการเติบโตของ Vals และคุณภาพของผู้สนับสนุนบ่งชี้ว่าทุนทรัพย์รับรู้ช่องว่างทางสถาบันนี้แล้ว ภารกิจที่บริษัทประกาศไว้ คือการทำหน้าที่เป็นผู้ประเมินอย่างเป็นอิสระสำหรับปัญญาประดิษฐ์ ซึ่งสอดคล้องกับความต้องการเชิงปฏิบัติขององค์กรที่ต้องการความชัดเจนด้านผลตอบแทนการลงทุน และของผู้กำหนดนโยบายที่ต้องการข้อมูลเชิงลึกเกี่ยวกับศักยภาพและความเสี่ยง
การขยายตัวต่อไปสู่โดเมนมืออาชีพและความเสี่ยงเพิ่มเติมจะทดสอบว่าแนวทางนี้สามารถขยายขนาดได้โดยยังคงรักษาความเป็นอิสระและคุณภาพของสัญญาณไว้ ณ ขณะนี้ ความร่วมกันของผลิตภัณฑ์ใหม่ล่าสุด ความสำเร็จทางการค้าอย่างรวดเร็ว และการลงทุนทุนจากผู้มีชื่อเสียง ได้กำหนดให้ Vals เป็นจุดอ้างอิงหลักสำหรับผู้ที่ต้องตัดสินใจว่าโมเดลใดสามารถทำงานที่สำคัญได้จริง
คำถามที่พบบ่อย
Vals AI ประกาศอะไรบ้างในการระดมทุนรอบ Series A?
Vals AI ปิดการระดมทุน Series A มูลค่า 40 ล้านดอลลาร์สหรัฐ โดยมีมูลค่าบริษัทอยู่ที่ 400 ล้านดอลลาร์สหรัฐ เมื่อวันที่ 13 สิงหาคม 2026 Andreessen Horowitz เป็นผู้นำการระดมทุน พร้อมกับนักลงทุนเดิมได้แก่ 8VC, Pear VC และ Bloomberg Beta ที่กลับมาลงทุนอีกครั้ง และนักลงทุนใหม่ได้แก่ HRT Ventures และ Next Ladder Ventures เข้าร่วม บริษัทได้เปิดตัวผลิตภัณฑ์ใหม่พร้อมกัน ได้แก่ Vals Smith สำหรับการทดสอบการเขียนโค้ดแบบกำหนดเอง, RSI Index, ReverseEngBench, Vals Index 2.0 ที่ขยายขอบเขต และเว็บไซต์ที่สร้างใหม่ คำแถลงอย่างเป็นทางการจากทั้ง Vals และ a16z ยืนยันตัวเลขดังกล่าวและการเปิดตัวผลิตภัณฑ์ที่เกี่ยวข้อง
Vals benchmarks แตกต่างจาก leaderboard สาธารณะเช่น MMLU หรือ SWE-bench อย่างไร
Vals มุ่งเน้นที่กระบวนการทางวิชาชีพหลายขั้นตอนที่กำหนดร่วมกับผู้เชี่ยวชาญด้านสาขาและให้คะแนนโดยระบบอัตโนมัติที่ปรับเทียบตามมาตรฐานของผู้เชี่ยวชาญ ชุดการทดสอบหลักยังคงเป็นความลับและจะเลิกใช้เมื่อไม่สามารถแยกแยะโมเดลได้อีกต่อไป ซึ่งช่วยลดการปนเปื้อนและการเล่นระบบเพื่อเพิ่มประสิทธิภาพ ชุดการทดสอบทางวิชาการที่เปิดเผยต่อสาธารณะมักจะอิ่มตัวหรือรั่วไหลเข้าสู่ข้อมูลการฝึกอบรม ทำให้ค่าการทำนายของมันลดลงเมื่อใช้งานในงานจริงขององค์กร แนวทางของ Vals ให้ผลลัพธ์ภายในไม่กี่ชั่วโมงหลังจากเข้าถึงโมเดล และผลลัพธ์ดังกล่าวได้ปรากฏอยู่ในบัตรโมเดลของห้องปฏิบัติการชั้นนำแล้ว
ความสำคัญของคะแนน 52 เปอร์เซ็นต์ในงานของ Finance Agent คืออะไร
ในเดือนพฤษภาคม 2026 โมเดลชั้นนำบรรลุความแม่นยำประมาณ 52 เปอร์เซ็นต์บนชุด Finance Agent v2 ซึ่งต้องการการสร้างแบบจำลองค่าสัมพัทธ์ การสรุปเอกสาร และคำแนะนำที่อิงข้อมูลจริง ตัวเลขนี้แสดงให้เห็นว่าแม้แต่ระบบที่แข็งแกร่งที่สุดที่มีอยู่ก็ยังล้มเหลวประมาณครึ่งหนึ่งของงานที่คาดหวังจากนักวิเคราะห์การเงินมืออาชีพ ช่องว่างระหว่างคะแนนทางวิชาการกับประสิทธิภาพในการทำงานมืออาชีพนี้คือปัญหาที่ Vals มุ่งวัดและช่วยปิดช่องว่างนี้
ผู้ก่อตั้งคือใครและพวกเขานำประสบการณ์อะไรมาบ้าง?
ซีอีโอ เรยัน คริชนาณ เคยทำงานที่ Palantir ซีทีโอ แลงสตัน นาชอลด์ มีประสบการณ์ที่ Meta, NVIDIA และ Hudson River Trading ทั้งคู่เรียนวิทยาการคอมพิวเตอร์ที่สแตนฟอร์ดและเริ่มร่วมมือกันแก้ปัญหาการวัดก่อนก่อตั้งบริษัท พื้นฐานของพวกเขาผสมผสานประสบการณ์ระบบการผลิตเข้ากับมุมมองเชิงปริมาณและการวิจัย ซึ่งกำหนดแนวทางของ Vals ที่เน้นการประเมินอย่างเข้มงวดและปรับตัวได้
Vals Smith ช่วยให้องค์กรสามารถทำอะไรได้บ้าง?
Vals Smith อนุญาตให้องค์กรใดก็ตามสร้างมาตรฐานการเขียนโค้ดแบบกำหนดเองโดยตรงจากที่เก็บ GitHub ของตน ระบบจะดึงงานพัฒนาที่สมจริงจาก pull requests ในอดีตและใช้การทดสอบที่ซ่อนอยู่ ผู้ใช้เริ่มต้นด้วยเครดิตฟรี 120 หน่วย เครื่องมือนี้แปลงมาตรฐานการเขียนโค้ดทั่วไปให้เป็นการวัดผลเฉพาะองค์กรที่สะท้อนรูปแบบโค้ดและแนวทางการวิศวกรรมของตนเอง
Vals Index รวมน้ำหนักทางเศรษฐกิจอย่างไร
ดัชนีรวบรวมประสิทธิภาพของงานด้านการเงิน การเขียนโปรแกรม และงานด้านกฎหมาย จากนั้นคำนวณค่าเฉลี่ยของแต่ละภาคตามสัดส่วนที่ประมาณการไว้ของการมีส่วนร่วมต่อ GDP ของสหรัฐอเมริกาโดยใช้ข้อมูลจากสำนักงานวิเคราะห์เศรษฐกิจ ผลลัพธ์ที่ได้คือตัวชี้วัดรวมที่แสดงถึงผลกระทบทางเศรษฐกิจที่อาจเกิดขึ้นในรูปแบบเดียว พร้อมทั้งยังสามารถตรวจสอบผลลัพธ์รายสาขาได้อย่างละเอียด เวอร์ชัน 2.0 ได้ขยายขอบเขตการครอบคลุมและอัปเดตบ่อยครั้งเพื่อสะท้อนการเปิดตัวโมเดลใหม่ๆ
🔥 KuCoin นำเสนอทางเลือกที่มีความเสถียรมากกว่าในตลาดที่ผันผวน
หากคุณกังวลเกี่ยวกับการขึ้นลงบ่อยครั้งของตลาด และมองหาทางเลือกที่มั่นคงกว่าในการหารายได้แบบพาสซีฟ KuCoin คือสถานที่ที่เหมาะสำหรับคุณ:

Simple Earn: ฝากและถอนโทเค็นได้ทุกเมื่อ รับผลตอบแทนคงที่
KuCoin Earn: รับผลตอบแทนคงที่ด้วยการจัดการสินทรัพย์จากผู้เชี่ยวชาญ
ถือเพื่อรับรางวัล: รับรางวัลโดยการถือสินทรัพย์ในบัญชีการเงิน การเทรด หลักประกัน ฟิวเจอร์ส การเหมือง และบัญชีแบบครบวงจร
การstaking: เปิดศักยภาพในการสร้างรายได้จากสินทรัพย์บนโซ่
การลงทุนขั้นสูง: การลงทุนขั้นสูงเสนอผลิตภัณฑ์เชิงโครงสร้างหลากหลายเพื่อช่วยให้เงินของคุณเติบโตในทุกตลาด
Shark Fin: การคุ้มครองเงินต้นและผลตอบแทนที่รับประกัน
Dual Investment: ซื้อต่ำและขายสูงด้วยการคำนวณผลตอบแทนที่โปร่งใส
Snowball:ผลตอบแทนสูง พร้อมการป้องกันราคา
ซื้อในราคาส่วนลด: ซื้อคริปโตในราคาส่วนลด
KCS Loyalty: ขึ้นระดับเพื่อรับสิทธิพิเศษเฉพาะตัวโดยการสแต็ก KCS ตั้งแต่ 1 KCS ขึ้นไป
KuCoin Wealth: ค้นพบมูลค่าในอนาคตและเริ่มเดินทางการลงทุนอัจฉริยะของคุณ
ประโยชน์ของ KCS: ถือและ Stake KCS เพื่อเข้าถึงประโยชน์ต่างๆ บนแพลตฟอร์ม
KCS Staking 2.0: เข้าร่วมการบริหารจัดการบนโซ่ของ KCS เพื่อรับผลตอบแทน
ข้อจำกัดความรับผิด: เนื้อหานี้มีจุดประสงค์เพื่อข้อมูลเท่านั้น และไม่ถือเป็นคำแนะนำในการลงทุน การลงทุนในคริปโตเคอเรนซีมีความเสี่ยง โปรดทำการวิจัยด้วยตัวเอง (DYOR)
คำปฏิเสธความรับผิดชอบ: หน้านี้แปลโดยใช้เทคโนโลยี AI เพื่อความสะดวกของคุณ สำหรับข้อมูลที่ถูกต้องที่สุด โปรดดูต้นฉบับภาษาอังกฤษ
