19 August 2026

AI inference speed claims jump sharply across multiple vendors

  • Alibaba's Qwen model reportedly generated 70 tokens per second on Apple's M5 Max chip, showing faster processing on consumer devices.
  • Cerebras announced a CS-4 system claiming 1000 tokens per second for large models, a significant jump in datacenter performance.
  • Faster inference, meaning quicker AI response times, now affects user experience, operating costs, and how governments view AI competitiveness.

How it was covered

Latent Spaceswyx & Alessio

DFlash 2 claims Qwen3.8-27B at 70 tokens per second on M5 Max while Cerebras announced CS-4 with claims of 1000 tokens per second for 10T models. Inference speed is becoming product UX, economics, and national competitiveness policy.