AMD ประกาศความร่วมมือกับ Cerebras สร้างโซลูชันรัน LLM แบบ disaggregated inference เพื่อให้สามารถให้บริการโทเค็นด้วยอัตราสูง
การรัน LLM มักแบ่งเป็นสองช่วงคือ prompt processing และ decoding โดยช่วงแรกจะต้องการพลังประมวลผลสูงสุด ทำให้ชิปกราฟิกมีความได้เปรียบสูงขณะที่ช่วงหลังจะต้องการแบนด์วิดท์หน่วยความจำมากกว่า Cerebras มีชิป Wafer Scale Engine ที่ใส่หน่วยความจำความเร็วสูงแบบ SRAM เข้าไปในเวเฟอร์ชิปประมวลผลโดยตรง แม้จะมีต้นทุนสูงแต่ก็ทำให้แบนด์วิดท์หน่วยความจำพุ่งสูงถึง 21PB/s เหมาะกับการรันส่วน decode อย่างยิ่ง
ทาง Cerebras ให้บริการคลาวด์ของตัวเองอยู่ด้วย และความร่วมมือนี้ก็จะเริ่มใช้งานในคลาวด์ของบริษัทเองก่อน โดยจะเริ่มให้บริการ AMD Helios คู่กับเซิร์ฟเวอร์ของ Cerebras ภายในครึ่งหลังของปี 2026 นี้
สำหรับทาง NVIDIA ได้ซื้อ Groq 3 เข้ามาตั้งแต่ปลายปี 2025 และตอนนี้แพลตฟอร์ม Vera Rubin ก็มีชุดขายคู่ Groq 3 อยู่และเตรียมจะผูกกันแนบแน่นยิ่งขึ้นในปีหน้า
ที่มา - AMD
on
เอา AMD Instinct วางคู่…
mr_tawan Wed, 29/07/2026 - 03:29
เอา AMD Instinct วางคู่ Cerebras แบบนี้ดูหลอกตานิด ๆ
Cerebras เป็นชิพ wafer scale อย่างต่ำๆ ก็น่าจะมี20 cm อ่ะ
จริงๆ มันเป็น Helios วางคู่…
lew Thu, 30/07/2026 - 18:33
In reply to เอา AMD Instinct วางคู่… by mr_tawan
จริงๆ มันเป็น Helios วางคู่ Cerebras ตัว Helios มี 72 ชิปก็พอได้อยู่ครับ :P