OpenAI, NVIDIA และ Google แตกต่างกันในการออกแบบชิป AI สำหรับการอนุมาน LLM

iconMetaEra
แชร์
AI summary iconสรุป
ข่าว AI และคริปโตแสดงให้เห็นว่าผู้เล่นรายใหญ่ต่างมีแนวทางที่แตกต่างกันในการออกแบบชิปสำหรับการประมวลผล LLM: OpenAI’s Jalapeño มุ่งเน้นที่การประมวลผลแบบอินเฟอเรนซ์ NVIDIA ผสาน GPU เข้ากับ LPU ของ Groq และ Google แยก TPU 8t และ 8i สำหรับการฝึกอบรมและการประมวลผลแบบอินเฟอเรนซ์ การประมวลผลแบบอินเฟอเรนซ์ตอนนี้ต้องการแบนด์วิดธ์ HBM ที่สูงขึ้น SRAM ขนาดใหญ่ขึ้น และเส้นทางเครือข่ายที่เชื่อมต่อใกล้ชิดยิ่งขึ้น เมื่อชิปมีความเฉพาะเจาะจงต่อภาระงานมากขึ้น ต้นทุนต่อโทเค็นจึงมีความสำคัญเพิ่มขึ้นควบคู่ไปกับ FLOPS การปรับปรุงกลยุทธ์การออกแบบเครือข่ายกำลังเปลี่ยนรูปแบบการแข่งขันในฮาร์ดแวร์ AI
โครงสร้างการแข่งขันของชิป AI กำลังเปลี่ยนแปลงอย่างลึกซึ้ง OpenAI เปิดตัวชิป Jalapeño ที่เน้นการให้บริการ LLM NVIDIA ผสาน GPU กับ Groq LPU เพื่อสร้างการคำนวณแบบไฮบริด ส่วน Google แยกการฝึกอบรมและการให้บริการออกเป็นชิปสองรุ่นคือ TPU 8t และ TPU 8i แนวทางทั้งสามนี้สะท้อนความต้องการทรัพยากรฮาร์ดแวร์ที่แตกต่างกันระหว่างการฝึกอบรมและการให้บริการ: การฝึกอบรมเน้นการคำนวณเมทริกซ์และการเชื่อมต่อขนาดใหญ่ ในขณะที่การให้บริการต้องการแบนด์วิดธ์ HBM ที่สูงขึ้น SRAM ขนาดใหญ่ขึ้น และเส้นทางเครือข่ายที่สั้นลง เมื่อช่องว่างของสูตรชิปสำหรับงานสองประเภทนี้กว้างขึ้น FLOPS จึงไม่ใช่มาตรฐานเดียวอีกต่อไป ต้นทุนต่อโทเค็นกำลังกลายเป็นจุดวัดใหม่ในการแข่งขันฮาร์ดแวร์ AI

ผู้เขียนบทความ ที่มา: LeFeng.com

ต้นทุนโทเค็นกลายเป็นจุดวัดใหม่ในการแข่งขันฮาร์ดแวร์ของโมเดลขนาดใหญ่

Embodied Intelligence Invades the Greasy Kitchen

เรื่องราวของหุ่นยนต์ที่ทำงานภายใต้การจราจรกว่าล้านครั้ง

อดีตรองประธานฝ่าย Covariant AI และ Zhoupu Shuzhong ได้สรุปบทบาทของ LPU ว่าเป็นการเติมเต็มช่องว่างของ Vera Rubin ในพื้นที่ Decode ความล่าช้าต่ำ

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

การออกแบบชิปของ Groq ก็เกี่ยวข้องกับสิ่งนี้เกือบทั้งหมด ชุดเครื่อง LPX มี 256 ตัว LPU รวมกันมี 128 GB SRAM เท่านั้น ความจุนี้ไม่สามารถเปรียบเทียบกับ HBM ในเครื่อง GPU ได้ แต่แบนด์วิดธ์ของ SRAM ที่รวมกันสามารถถึง 40 PB/s

การออกแบบนี้ให้ความสำคัญกับ “ความใกล้” HBM สามารถเก็บสถานะโมเดลจำนวนมากได้ แต่อยู่ห่างจากหน่วยคำนวณ; SRAM มีราคาแพงและยากต่อการขยายความจุ แต่ข้อมูลอยู่ภายในชิป จึงสามารถให้แบนด์วิดธ์สูงมากและหน่วงเวลาการเข้าถึงต่ำ

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

การคำนวณแต่ละขั้นตอนมีจำกัด และดึงข้อมูลบ่อยครั้ง การวางข้อมูลให้อยู่ใกล้ ALU มากขึ้นจะส่งผลโดยตรงต่อเวลาที่ต้องรอสำหรับโทเค็นถัดไป

Groq ยังลดการควบคุมฮาร์ดแวร์แบบไดนามิกเพิ่มเติม LPU เป็นสถาปัตยกรรมการประมวลผลแบบแน่นอน การจัดตารางคำสั่งส่วนใหญ่จะดำเนินการล่วงหน้าโดยซอฟต์แวร์ ชิปแต่ละตัวทำหน้าที่เป็นทั้งโปรเซสเซอร์และรูตเตอร์พร้อมกัน คอมไพเลอร์จะจัดสรรทรัพยากรการคำนวณและทรัพยากรเครือข่ายร่วมกัน แม้แต่กลไกการควบคุมการไหลของฮาร์ดแวร์แบบดั้งเดิมและช่องเสมือนก็ถูกตัดทิ้งไป

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

ต้นทุนก็ชัดเจนเช่นกัน: สถาปัตยกรรมนี้ไม่ยืดหยุ่นเท่า GPU และ SRAM บนชิปไม่สามารถจุสถานะของโมเดลขนาดใหญ่ทั้งหมดได้ ดังนั้น NVIDIA จึงไม่ได้ให้ Groq 3 รันโมเดลทั้งหมดแบบอิสระ แต่ได้พัฒนาระบบแบบไฮบริดที่ซับซ้อนยิ่งขึ้น

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

การเติมข้อมูลล่วงหน้าทำบน GPU ส่วน Decode ส่วนใหญ่จะย้ายไปที่ LPU; Attention ใน Decode สามารถกลับไปที่ GPU ได้อีกครั้ง GPU และ LPU ต่างก็จัดเก็บ KV Cache ของตนเอง ทั้งสองฝ่ายแลกเปลี่ยน draft Tokens เป็นหลัก พร้อมทั้งใช้ micro-batch เพื่อทับซ้อนการคำนวณและการสื่อสาร เนื่องจาก LPU เป็นระบบซิงโครนัส ในขณะที่ GPU และ KV Cache ภายนอกเป็นระบบอะซิงโครนัส NVIDIA จึงได้เพิ่ม FPGA เข้ามาเป็นสะพานเชื่อมอะซิงโครนัสระหว่างสองระบบ

โครงสร้างนี้แสดงให้เห็นอย่างชัดเจนว่าการแบ่งหน้าที่ของชิป AI ได้ไปถึงระดับใดแล้ว มันไม่ได้แค่แยกออกเป็น “ชิปฝึกอบรม” และ “ชิปการอนุมาน” เท่านั้น แต่ยังสามารถแบ่งส่วนต่างๆ ภายในการ Decode หนึ่งครั้งไปทำงานบนสถาปัตยกรรมที่ต่างกันได้

อย่างไรก็ตาม ข้อมูลที่ NVIDIA นำเสนอได้ระบุขอบเขตของเส้นทางนี้: เมื่อธุรกิจมุ่งเน้นที่ความเร็วในการประมวลผลโดยรวมและสามารถยอมรับความล่าช้าที่สูงขึ้น Rubin GPU ยังคงมีประสิทธิภาพสูง; เมื่อความต้องการความเร็วต่อโทเค็นต่อผู้ใช้หนึ่งรายเพิ่มขึ้น LPX จึงค่อยๆ แสดงข้อได้เปรียบ และเมื่อใช้ LPU เพิ่มขึ้น ประสิทธิภาพโดยรวมของความเร็วในการประมวลผลก็จะลดลง

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

ดังนั้น การปรากฏตัวของ Groq 3 จึงไม่ได้หมายความว่า GPU จะถูกแทนที่ในการให้บริการแบบอ้างอิง มันชี้ให้เห็นอีกเรื่องหนึ่ง: การใช้ GPU ตัวเดียวกันเพื่อครอบคลุมทั้งการรับส่งข้อมูลสูงและหน่วงเวลาต่ำสุดเป็นเรื่องยาก ทำให้ระบบสามารถแยกประสิทธิภาพได้ชัดเจนยิ่งขึ้น โดยให้ฮาร์ดแวร์แต่ละประเภททำงานในช่วงที่มันเชี่ยวชาญ

Google ได้วางรอยตัดนี้ไว้ในระดับที่สูงกว่า

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

การฝึกอบรมและการให้เหตุผล ใช้สูตรชิปสองชุด

Google ได้พัฒนา TPU 8t และ TPU 8i พร้อมกันในรุ่น TPU 8,t มุ่งเน้นการฝึกอบรม,i มุ่งเน้นการอนุมาน การแบ่งประเภทนี้มีตรรกะที่ถูกเขียนไว้โดยตรงบนการตั้งค่าหน่วยความจำของชิป

กำลังแสดงสินค้าจริง Hot Chips โดย TPU 8t ใช้ 6 ชุด HBM ในขณะที่ TPU 8i กลับใช้ 8 ชุด Google อธิบายว่าการประมวลผลแบบอินเฟอร์เรนซ์ต้องการ HBM มากขึ้นต่อหน่วยการคำนวณ พร้อมทั้งต้องการ SRAM ในสัดส่วนที่สูงกว่า ดังนั้น 8i จึงจัดสรรทรัพยากรเพิ่มเติมให้กับ SRAM ความจุหน่วยความจำ และแบนด์วิดธ์

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

ความแตกต่างนี้น่าพิจารณาอย่างยิ่ง หากชิป AI แค่แข่งขันกันที่พลังการคำนวณเมทริกซ์ รุ่นการอนุมานก็ไม่มีเหตุผลใดที่จะใช้พื้นที่ชิปและทรัพยากรการห่อหุ้มจำนวนมากไปกับหน่วยความจำ การออกแบบ TPU 8i แบบนี้บ่งชี้ว่า Google เห็นข้อจำกัดได้ย้ายไปที่การจัดหาข้อมูล

ในระหว่างการฝึก ขนาด Batch ขนาดใหญ่สามารถกระจายต้นทุนการอ่านน้ำหนักไปยังโทเค็นจำนวนมากได้ ในขณะที่ในการถอดรหัส โทเค็นที่สร้างขึ้นแต่ละครั้งมีจำนวนน้อย แต่น้ำหนักและ KV Cache ยังคงถูกเข้าถึงบ่อยครั้ง ดังนั้น ปริมาณแบนด์วิดธ์ HBM ที่ต้องจับคู่กับ FLOPS ต่อหน่วยจึงแตกต่างกันระหว่างงานสองประเภทนี้

Google 甚至还把这种差异应用到了网络拓扑中。过去 TPU 常用的 3D Torus 更适合训练,强调的是大规模集群中的整体吞吐量。TPU 8i 支持 BoardFly,网络路径更短:BoardFly 的路径上限为 7 hops,而 3D Torus 则可达 16 hops

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

สำหรับการฝึกอบรม มักจะมีการคำนวณเมทริกซ์ขนาดใหญ่หลังจากการกระโดดเครือข่ายเพิ่มเติมไม่กี่ครั้ง ทำให้เวลาการสื่อสารสามารถกระจายได้ ขณะที่ช่วงเวลาการคำนวณของแต่ละขั้นตอน Decode สั้น ความล่าช้าของเครือข่ายไม่กี่ครั้งจึงมีแนวโน้มที่จะเข้าไปอยู่ในช่วงเวลาระหว่างโทเค็นโดยตรง

MoE ทำให้ปัญหานี้ชัดเจนยิ่งขึ้น MoE สามารถทำให้ Token หนึ่งๆ กระตุ้นเฉพาะ Expert บางส่วน ซึ่งดูเหมือนคุ้มค่าด้านการคำนวณ แต่ Router จะส่ง Token ไปยัง Expert ที่ต่างกัน เมื่อ Expert เหล่านี้กระจายอยู่บนชิปที่ต่างกัน การคำนวณจะลดลง แต่การสื่อสารแบบ All-to-All จะเพิ่มขึ้น

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

ดังนั้น TPU 8i ยังได้เพิ่ม Collective Acceleration Engine ซึ่งดำเนินการ collective บางส่วนบน I/O Die ที่อยู่ใกล้กับอินเทอร์เฟซเครือข่าย ข้อมูลจึงไม่จำเป็นต้องย้ายไปยัง Compute Die ก่อนแล้วจึงดำเนินการผ่าน HBM แต่สามารถลดการเคลื่อนย้ายข้อมูลภายในชิปได้บางส่วน

การจัดสรรทรัพยากรสำหรับ TPU 8t รุ่นฝึกอบรมนั้นเอียงไปทางอีกด้านอย่างชัดเจน การฝึกอบรมต้องการ FLOPS จำนวนมาก และต้องการขอบเขต Scale-Up ที่ใหญ่เพื่อซิงโครไนซ์พารามิเตอร์และเกรเดียนต์ Superpod ของ TPU 8t สามารถขยายไปถึง 9600 ชิป มีหน่วยความจำ HBM ร่วมกันประมาณ 2 PB และความสามารถในการคำนวณแบบรวมกัน 121 EFLOPS FP4 Google ยังได้แนะนำเครือข่าย Virgo เพื่อสร้างระบบเฉพาะสำหรับการเชื่อมต่อการฝึกอบรมในขอบเขตที่กว้างขึ้น

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

Google ยังได้กล่าวถึงปัญหาการออกแบบชิปที่เป็นรูปธรรมหนึ่งประการ: dark silicon

พื้นที่ชิปและงบประมาณการใช้พลังงานมีจำกัด หากบรรจุทรัพยากรการคำนวณเมทริกซ์จำนวนมากที่จำเป็นสำหรับการฝึกอบรม และเพิ่ม SRAM, HBM และเครือข่ายความล่าช้าต่ำที่จำเป็นสำหรับการอนุมานลงบนชิปเดียวกัน ขณะที่งานโหลดประเภทใดประเภทหนึ่งกำลังทำงาน วงจรบางส่วนจะถูกใช้งานอย่างต่อเนื่อง

Jalapeño แบ่งงานระเบิด แนวโน้มการประมวลผลด้วย GPU เริ่มแยกออก?

เนื่องจากงานทั้งสองประเภทต้องการสัดส่วนทรัพยากรที่ต่างกัน การทำชิปสองตัวจึงสะอาดกว่า

จาก FLOPS ถึงเศรษฐศาสตร์ของโทเค็น

การวางเส้นทางทั้งสามเส้นไว้ด้วยกัน ความแตกต่างจะชัดเจนมาก

OpenAI ทำ Jalapeño โดยเฉพาะฮาร์ดแวร์สำหรับการให้บริการ LLM แต่ยังคงการจัดตารางแบบยืดหยุ่นสำหรับ Prefill และ Decode บนฮาร์ดแวร์ที่เหมือนกัน; NVIDIA แยกย่อยลงไปอีก โดยให้ GPU และ Groq LPU แบ่งหน้าที่แต่ละขั้นตอนในการให้บริการหนึ่งครั้ง; Google ตัดขึ้นไปข้างบน โดยทำให้การฝึกอบรมและการให้บริการเป็น TPU สองตัวแยกกัน

เส้นทางเหล่านี้ไม่มีหลักการคำนวณใหม่ที่ลี้ลับ的背后 แต่เปลี่ยนสัดส่วนของทรัพยากร การฝึกอบรมต้องการลงทุนทรานซิสเตอร์เพิ่มเติมในการคำนวณเมทริกซ์และการเชื่อมต่อขนาดใหญ่ เพราะ Batch ขนาดใหญ่สามารถกระจายต้นทุนการย้ายข้อมูลได้ การให้บริการแบบหน่วงเวลาต่ำต้องการแบนด์วิดธ์ HBM ที่สูงขึ้น SRAM ขนาดใหญ่ขึ้น ความเป็นท้องถิ่นของ KV Cache ที่ดีขึ้น และเส้นทางเครือข่ายที่สั้นลง เพราะใช้เวลามากมายไปกับการรอข้อมูล

เมื่อความต้องการ “สูตรชิป” ของโหลดสองประเภทเริ่มห่างกันมากขึ้น การใช้ชิปทั่วไปหนึ่งตัวเพื่อดูแลทั้งสองอย่างพร้อมกัน จะทำให้การสูญเสียประสิทธิภาพชัดเจนขึ้นเรื่อยๆ

นี่คือเหตุผลที่ตัวเลขหลักในการแข่งขันด้านฮาร์ดแวร์ครั้งนี้กำลังเปลี่ยนไป FLOPS ยังคงสำคัญ แต่ตอนนี้เริ่มมี Tokens/s/user TBT TTFT Tokens/kW HBM bandwidth และความล่าช้าของเครือข่ายปรากฏขึ้นด้วย

มันอธิบายสิ่งเดียวกัน: กำลังการประมวลผลได้ถูกวางไว้แล้ว ระบบสามารถส่งข้อมูลเข้าไปอย่างต่อเนื่องและส่ง Token ที่สร้างขึ้นออกมาให้เร็วที่สุดได้หรือไม่

OpenAI, NVIDIA และ Google ตอนนี้ยังไม่ได้ตั้งเส้นแบ่งเดียวกัน ซึ่งในอนาคตที่จริงๆ แล้วจะยังคงเปลี่ยนไป ก็คือเส้นนี้ควรวาดไว้ที่ไหน

การฝึกอบรมและการอนุมานสามารถแยกออกได้ การ Prefill และ Decode สามารถแยกออกได้ และภายใน Decode ยังสามารถแยก Attention ออกจากคำนวณอื่นๆ ต่อไปได้อีก การแยกย่อยยิ่งละเอียดเท่าใด ประสิทธิภาพของแต่ละงานก็ยิ่งเพิ่มขึ้นได้ง่ายขึ้น แต่การจัดสรรทรัพยากร การย้าย KV Cache และการสื่อสารข้ามฮาร์ดแวร์ก็จะซับซ้อนขึ้นเช่นกัน

ดังนั้นความท้าทายในขั้นตอนถัดไปของการแข่งขันชิป AI อาจไม่ได้จำกัดอยู่แค่การผลิตชิปที่แรงกว่า

ที่ยากกว่านั้นคือการตัดสินใจว่า งานใดควรสร้างชิปเฉพาะสำหรับมัน และงานใดควรคงไว้ในฮาร์ดแวร์ชุดเดิม เพื่อให้ต้นทุนโทเค็นของระบบโดยรวมต่ำที่สุด

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา