19 August 2026
AI inference speed claims jump sharply across multiple vendors
- Alibaba's Qwen model reportedly generated 70 tokens per second on Apple's M5 Max chip, showing faster processing on consumer devices.
- Cerebras announced a CS-4 system claiming 1000 tokens per second for large models, a significant jump in datacenter performance.
- Faster inference, meaning quicker AI response times, now affects user experience, operating costs, and how governments view AI competitiveness.
How it was covered
Latent Spaceswyx & Alessio
DFlash 2 claims Qwen3.8-27B at 70 tokens per second on M5 Max while Cerebras announced CS-4 with claims of 1000 tokens per second for 10T models. Inference speed is becoming product UX, economics, and national competitiveness policy.