AMD ประกาศความร่วมมือกับ Cerebras สร้างโซลูชันรัน LLM แบบ disaggregated inference เพื่อให้สามารถให้บริการโทเค็นด้วยอัตราสูง
การรัน LLM มักแบ่งเป็นสองช่วงคือ prompt processing และ decoding โดยช่วงแรกจะต้องการพลังประมวลผลสูงสุด ทำให้ชิปกราฟิกมีความได้เปรียบสูงขณะที่ช่วงหลังจะต้องการแบนด์วิดท์หน่วยความจำมากกว่า Cerebras มีชิป Wafer Scale Engine ที่ใส่หน่วยความจำความเร็วสูงแบบ SRAM เข้าไปในเวเฟอร์ชิปประมวลผลโดยตรง แม้จะมีต้นทุนสูงแต่ก็ทำให้แบนด์วิดท์หน่วยความจำพุ่งสูงถึง 21PB/s เหมาะกับการรันส่วน decode อย่างยิ่ง
ทาง Cerebras ให้บริการคลาวด์ของตัวเองอยู่ด้วย และความร่วมมือนี้ก็จะเริ่มใช้งานในคลาวด์ของบริษัทเองก่อน โดยจะเริ่มให้บริการ AMD Helios คู่กับเซิร์ฟเวอร์ของ Cerebras ภายในครึ่งหลังของปี 2026 นี้
สำหรับทาง NVIDIA ได้ซื้อ Groq 3 เข้ามาตั้งแต่ปลายปี 2025 และตอนนี้แพลตฟอร์ม Vera Rubin ก็มีชุดขายคู่ Groq 3 อยู่และเตรียมจะผูกกันแนบแน่นยิ่งขึ้นในปีหน้า
ที่มา - AMD
on