StoryPartnership
Meta's Llama API launches with Cerebras among the providers serving fast inference
Meta launched its Llama API with Cerebras as an inference provider, letting developers select Cerebras hardware to run Llama 4 models. Cerebras reported over 2,600 tokens per second on Llama 4 Scout, up to 18 times faster than GPU-based services.
- Meta Llama API: developers can select Cerebras as inference backend for Llama 4 models.
- Cerebras speed: 2,600+ tokens/sec on Llama 4 Scout vs. ~130 tokens/sec on ChatGPT and ~25 on DeepSeek; claims 18x speedup vs. GPU services.
- Use cases: conversational voice, interactive code generation, multi-step reasoning and real-time agents.