StoryPartnership

Meta's Llama API launches with Cerebras among the providers serving fast inference

CerebrasWSE-3 / CS-3

Meta launched its Llama API with Cerebras as an inference provider, letting developers select Cerebras hardware to run Llama 4 models. Cerebras reported over 2,600 tokens per second on Llama 4 Scout, up to 18 times faster than GPU-based services.

  • Meta Llama API: developers can select Cerebras as inference backend for Llama 4 models.
  • Cerebras speed: 2,600+ tokens/sec on Llama 4 Scout vs. ~130 tokens/sec on ChatGPT and ~25 on DeepSeek; claims 18x speedup vs. GPU services.
  • Use cases: conversational voice, interactive code generation, multi-step reasoning and real-time agents.
Read the original · Press

More on WSE-3 / CS-3

Primer