- เข้าร่วม
- 1 มิถุนายน 2011
- ข้อความ
- 17,094
- คะแนนปฏิกิริยา
- 0
- คะแนน
- 36
Moonshot AI พัฒนาระบบแคชภายในให้ออปติไมซ์กับชิป AMD Instinct MI355X
Body
Moonshot AI ผู้สร้างโมเดลปัญญาประดิษฐ์ Kimi K3 ที่ได้รับความสนใจอย่างสูงในตอนนี้เพราะทำงานได้เหนือกว่า Claude Opus ในการทดสอบจำนวนมาก รายงานถึงการออปติไมซ์ Kimi K2.6 บนชิป AMD MI355X ที่สามารถใช้ฟีเจอร์ต่างๆ ของ AMD ได้อย่างเต็มที่ และเร่งความเร็ว API เพิ่มขึ้นมาก
เทคโนโลยีหลักที่ Moonshot พัฒนาคือ Unified Memory & Bandwidth Pool (UMBP) ระบบสตอเรจสำหรับการเก็บ KV cache ที่ใช้งานระหว่างการประมวลพรอมพ์ ที่ปกติแล้วเซิร์ฟเวอร์รัน LLM จะมีฟีเจอร์นี้เช่นกัน แต่มักทำงานโดยไม่ได้ออปติไมซ์กับงานแบบ agentic โดยเฉพาะ UMBP คำนึงถึงแบนด์วิทธิ์ที่มี, กำหนดนโยบายการดึงแคชออกจากระบบโดยคำนึงถึงการใช้งานแบบ agentic, และใช้ฟีเจอร์ของชิป AMD เช่น GPU-Direct Storage, GPU-initiated NVMe เพื่อให้การดึงข้อมูลเต็มประสิทธิภาพฮาร์ดแวร์ที่สุดเท่าที่เป็นไปได้
UMBP ถูกผูกเข้าไปกับ SGLang เพื่อให้บริการ ผลที่ได้ คือ ระยะเวลารอโทเค็นแรก (time to first token - TTFT) ลดลง 3.2 เท่าตัว ขณะที่อัตราการสร้างโทเค็น เพิ่มขึ้น 7.7% อัตรา cache hit แบบ first call (ไม่ได้แชตต่อเนื่อง แต่หยุดใช้งานไปนานแล้วมาแชตต่อภายหลัง) เพิ่มขึ้น 9.5%
ทาง Moonshot ระบุว่าหลังจากนี้จะหันไปออปติไมซ์ Kimi K3 และรองรับเอนจินอื่นๆ ได้แก่ vLLM และ ATOM ของ AMD เพิ่มเติม
ที่มา - AMD
lew Thu, 23/07/2026 - 02:23
Continue reading...
Body
Moonshot AI ผู้สร้างโมเดลปัญญาประดิษฐ์ Kimi K3 ที่ได้รับความสนใจอย่างสูงในตอนนี้เพราะทำงานได้เหนือกว่า Claude Opus ในการทดสอบจำนวนมาก รายงานถึงการออปติไมซ์ Kimi K2.6 บนชิป AMD MI355X ที่สามารถใช้ฟีเจอร์ต่างๆ ของ AMD ได้อย่างเต็มที่ และเร่งความเร็ว API เพิ่มขึ้นมาก
เทคโนโลยีหลักที่ Moonshot พัฒนาคือ Unified Memory & Bandwidth Pool (UMBP) ระบบสตอเรจสำหรับการเก็บ KV cache ที่ใช้งานระหว่างการประมวลพรอมพ์ ที่ปกติแล้วเซิร์ฟเวอร์รัน LLM จะมีฟีเจอร์นี้เช่นกัน แต่มักทำงานโดยไม่ได้ออปติไมซ์กับงานแบบ agentic โดยเฉพาะ UMBP คำนึงถึงแบนด์วิทธิ์ที่มี, กำหนดนโยบายการดึงแคชออกจากระบบโดยคำนึงถึงการใช้งานแบบ agentic, และใช้ฟีเจอร์ของชิป AMD เช่น GPU-Direct Storage, GPU-initiated NVMe เพื่อให้การดึงข้อมูลเต็มประสิทธิภาพฮาร์ดแวร์ที่สุดเท่าที่เป็นไปได้
UMBP ถูกผูกเข้าไปกับ SGLang เพื่อให้บริการ ผลที่ได้ คือ ระยะเวลารอโทเค็นแรก (time to first token - TTFT) ลดลง 3.2 เท่าตัว ขณะที่อัตราการสร้างโทเค็น เพิ่มขึ้น 7.7% อัตรา cache hit แบบ first call (ไม่ได้แชตต่อเนื่อง แต่หยุดใช้งานไปนานแล้วมาแชตต่อภายหลัง) เพิ่มขึ้น 9.5%
ทาง Moonshot ระบุว่าหลังจากนี้จะหันไปออปติไมซ์ Kimi K3 และรองรับเอนจินอื่นๆ ได้แก่ vLLM และ ATOM ของ AMD เพิ่มเติม
ที่มา - AMD
lew Thu, 23/07/2026 - 02:23
Continue reading...