
Cerebras Inference es una API de LLM en la nube impulsada por el chip a escala de oblea WSE-3, el procesador de IA más grande jamás construido. Ofrece entre 2,000 y 3,000 tokens por segundo en modelos abiertos, de 10 a 20 veces más rápido que las alternativas basadas en GPU, a partir de $0.10 por millón de tokens.
Cerebras Systems es una empresa de hardware de IA de Santa Clara que construyó el WSE-3, el chip más grande jamás fabricado: una sola oblea de silicio que mide 46,225 milímetros cuadrados, contiene 4 billones de transistores y 900,000 núcleos de cómputo optimizados para IA. En lugar de cortar una oblea de silicio en docenas de chips pequeños, Cerebras trata toda la oblea como un procesador unificado, almacenando matrices completas de pesos de LLM en 44 GB de SRAM en el chip con un ancho de banda de memoria de 21 petabytes por segundo. El sistema comercial CS-3 comercializa este chip como un dispositivo refrigerado por agua. Cerebras Inference, lanzado el 27 de agosto de 2024, es la API de nube pública que brinda a los desarrolladores acceso a este hardware para la inferencia de LLM a velocidades que ningún clúster de GPU puede igualar.
La API de inferencia ofrece un catálogo rotativo de modelos abiertos de vanguardia que incluyen GPT-OSS-120B (alcanzando aproximadamente 3,000 tokens por segundo), Qwen3-235B (hasta 2,500 tokens por segundo con 262K de contexto), Llama 4 Maverick (~2,522 tokens por segundo) y Llama 3.1 8B (2,337 tokens por segundo a $0.10 por millón de tokens). La API es compatible con OpenAI, por lo que la integración requiere cambiar una URL base y una clave de API. Un nivel gratuito proporciona 1 millón de tokens por día sin lista de espera. Los niveles para empresas y desarrolladores desbloquean límites de tasa más altos y programación prioritaria. En enero de 2026, OpenAI firmó un acuerdo de $10 mil millones por 750 megavatios de cómputo de Cerebras hasta 2028, y AWS implementó dispositivos CS-3 en sus centros de datos, haciendo que Cerebras esté disponible a través de AWS Bedrock.
Lo que realmente hace Cerebras Inference en abril de 2026
Cerebras Inference es una API de inferencia pura, no una plataforma de entrenamiento ni un servicio de ajuste fino. Ejecuta modelos de lenguaje de pesos abiertos a velocidades que cambian la economía de las aplicaciones de IA en tiempo real. Cuando un clúster de GPU devuelve una respuesta de Llama 70B en 12-15 segundos, Cerebras devuelve la misma respuesta en menos de 2 segundos. Cuando un clúster de GPU completa un rastro de razonamiento de 405B en 45 segundos, Cerebras lo completa en 3-4 segundos. Las cifras de rendimiento de los puntos de referencia de Artificial Analysis (2025) no son teóricas: GPT-OSS-120B a ~3,000 tokens por segundo, Llama 3.1 8B a ~2,337 tokens por segundo.
El catálogo de modelos actual (abril de 2026) incluye GPT-OSS-120B en variantes altas y bajas, GLM-4.7 (131K de contexto), Qwen3-235B y Qwen3-32B, y Llama 4 Scout. Las ventanas de contexto varían de 33K a 262K tokens según el modelo. Todos los modelos se ejecutan con precisión de 16 bits de forma nativa, lo que significa que no hay concesiones de cuantización en la calidad de salida. La API sigue el formato de OpenAI Chat Completions, admite llamadas a funciones y transmisión (streaming), y es accesible a través de OpenRouter y HuggingFace, así como directamente. Meta se asoció con Cerebras para impulsar la API de Llama, brindando a los desarrolladores velocidades de inferencia hasta 18 veces más rápidas que las soluciones de GPU tradicionales para el acceso a los modelos Llama.
"Cerebras ha sido una verdadera revelación en lo que respecta a la inferencia. Tengo mucho respeto por su fundador, equipo, innovación y tecnología.", maz1b, Hacker News, octubre de 2025
Dónde se sitúa Cerebras frente a Groq y SambaNova
Tres empresas construyeron silicio personalizado específicamente para superar a NVIDIA en inferencia: Cerebras, Groq y SambaNova. Las arquitecturas de sus chips son fundamentalmente diferentes, y las diferencias son importantes para la forma en que se usaría cada uno.
Cerebras vs. Groq: La Unidad de Procesamiento de Lenguaje (LPU) de Groq es un diseño de canalización lineal donde los datos fluyen a través de unidades funcionales en sincronía. Cada chip Groq tiene solo 230 MB de SRAM, por lo que ejecutar un modelo de 70B requiere cientos de chips Groq conectados en red a través de una estructura patentada, y un modelo de 400B requiere miles de chips, lo que eleva el consumo de energía a nivel de rack a cientos de kilovatios. Groq se optimiza para el determinismo y la inferencia de 8 bits; los 16 bits se ejecutan significativamente más lento en el hardware de Groq. El WSE-3 de Cerebras elimina por completo la conexión en red entre chips: 44 GB de SRAM en el chip contienen el modelo en una sola oblea, y la precisión de 16 bits se ejecuta de forma nativa. Los puntos de referencia independientes de Artificial Analysis (2025) muestran que Cerebras es 6 veces más rápido que Groq en modelos idénticos: GPT-OSS-120B a ~3,000 frente a ~493 tokens por segundo, Llama 3.3 70B a más de 2,500 frente a ~403 tokens por segundo. NVIDIA adquirió Groq a finales de 2025 por $20 mil millones; la independencia de Groq como competidor ha terminado, aunque el producto sigue operando.
Cerebras vs. SambaNova: El chip SN40L de SambaNova utiliza una Unidad de Flujo de Datos Reconfigurable (RDU) con una jerarquía de memoria de tres niveles: SRAM, HBM y DRAM. La RDU mapea el gráfico computacional completo de un modelo de IA directamente en el chip como una canalización de flujo de datos personalizada. Esta memoria en niveles significa que SambaNova puede contener múltiples modelos grandes simultáneamente y servirlos sin recargar los pesos. Un sistema SambaNova completo cabe en 16 chips que consumen alrededor de 10 kW en promedio, en comparación con Cerebras, que necesita dispositivos CS-3 completos refrigerados por agua que consumen entre 20 y 27 kW cada uno. SambaNova afirma tener un rendimiento por área 40 veces mejor que Groq y 10 veces mejor que Cerebras en Llama 3.1 70B. La diferencia crítica para los compradores: SambaNova admite la implementación local (on-premises) para empresas; Cerebras es solo en la nube. El rendimiento por usuario de SambaNova para solicitudes individuales es menor que el de Cerebras en tokens brutos por segundo, pero SambaNova puede atender a más usuarios simultáneos sin la sobrecarga de recargar modelos.
Cómo es la realidad de la API de inferencia en el día a día
La ventaja de velocidad es real y se observa de inmediato. Los desarrolladores que crean asistentes de codificación (Cline agregó soporte para Cerebras en la v3.20.4, Roo Code en la v3.25.5) informan respuestas de modelos casi instantáneas en comparación con los proveedores basados en GPU. Para las aplicaciones interactivas, la diferencia entre una respuesta de 2 segundos y una de 0.15 segundos no es una estadística de referencia. Cambia las interacciones de producto que son posibles. A 2,337 tokens por segundo para Llama 3.1 8B, una respuesta de 500 tokens llega en aproximadamente 0.2 segundos.
Sin embargo, la realidad diaria incluye fricciones que los puntos de referencia no capturan. El límite de 30 solicitudes por minuto del nivel gratuito significa que cualquier aplicación con más de un usuario simultáneo alcanzará los límites de inmediato. Debido a que la inferencia es tan rápida, los clientes pueden enviar inadvertidamente ráfagas de tráfico que superan los límites de tasa antes de que un humano haya leído la respuesta anterior. Los desarrolladores deben crear una lógica de reintento explícita con retrasos. El almacenamiento en caché de prompts, que tanto Anthropic como OpenAI ofrecen para reducir costos en contextos repetidos, no existe en Cerebras. Para los bucles de agentes que reconstruyen el historial completo de mensajes en cada llamada a la herramienta, los costos de los tokens se acumulan a precio completo en cada viaje de ida y vuelta. Un desarrollador informó: sin almacenamiento en caché, estás enviando todo el historial de mensajes anterior como tokens de entrada en cada llamada. Esta no es una preocupación teórica, es el principal factor de costo para implementaciones de agentes complejos en la plataforma.
"Los límites de tasa parecen activarse extremadamente rápido y los resultados son menos buenos que los de Claude Code y termina siendo más caro.". Comentarista de Hacker News, hilo de Cerebras Code, 2025
La disponibilidad de los modelos también es menos estable que la de los proveedores de nube de GPU. Cerebras rota activamente el soporte de modelos a medida que su equipo de ingeniería optimiza nuevos puntos de control. Tanto Llama 3.1 8B como Qwen3-235B tienen un aviso de obsolescencia para el 27 de mayo de 2026. Los desarrolladores que crean aplicaciones de producción deben monitorear la disponibilidad de los modelos y manejar las obsolescencias. El catálogo de modelos también es más reducido que las alternativas de nube de GPU: cinco modelos activos frente a docenas disponibles en Together AI o Replicate.
Para quién está diseñado Cerebras
Cerebras Inference está diseñado específicamente para casos de uso donde la latencia es el cuello de botella, no el costo o la diversidad de modelos. Agentes de voz en tiempo real que necesitan turnos de modelo de menos de 200 ms, asistentes de codificación en vivo donde los usuarios perciben la diferencia entre finalizaciones de 2 segundos y 0.1 segundos, y sistemas de agentes que encadenan docenas de llamadas de modelos en secuencia. Estas son las cargas de trabajo donde la velocidad de Cerebras cambia lo que es posible, no solo lo que es conveniente. La lista inicial de clientes lo confirma: GlaxoSmithKline para el descubrimiento de fármacos (inferencia compleja de dominios de proteínas), Cognition para agentes de código y ahora OpenAI para el servicio de ChatGPT en producción a escala masiva.
Los investigadores y científicos de datos que ejecutan experimentos de inferencia a gran escala se benefician del nivel gratuito de 1 millón de tokens por día, que permite la creación de prototipos genuinos de aplicaciones sensibles a la velocidad sin costo alguno. El precio de $0.10/M tokens para Llama 3.1 8B se encuentra entre los más bajos de la industria para cualquier modelo alojado, lo que hace que los experimentos de alto rendimiento sean manejables.
Evítalo cuando: necesites entradas multimodales (imágenes, audio, video): Cerebras es solo texto. Evítalo para implementaciones locales (on-premises), lo cual es físicamente poco práctico dados el factor de forma y los requisitos de energía del sistema CS-3. Evítalo para aplicaciones de agentes que dependen del almacenamiento en caché de prompts para controlar los costos. Evítalo si la disponibilidad constante de modelos es crítica para tu pila de producción: el programa de rotación de modelos es lo suficientemente agresivo como para requerir gastos generales de mantenimiento. Los equipos que necesiten un ajuste fino extenso, personalización de modelos especializados o un amplio catálogo de modelos deberían buscar en su lugar nubes de GPU o la plataforma empresarial de SambaNova.
Lo que Cerebras no es
Cerebras no es una empresa de modelos de IA. No entrena modelos fundacionales ni posee pesos de modelos. Sirve modelos abiertos construidos por Meta, Alibaba y otros, ejecutándolos más rápido de lo que cualquier otra plataforma puede hacerlo. Si el ecosistema de modelos abiertos dejara de producir pesos competitivos, Cerebras no tendría modelos que servir. La empresa depende por completo del lanzamiento continuo de modelos de pesos abiertos que pueda optimizar para su hardware.
Cerebras no es un ecosistema compatible con GPU. Su pila de software es patentada y no está basada en CUDA. Si bien los desarrolladores acceden a la API a través de la interfaz estándar compatible con OpenAI, los kernels personalizados, los esquemas de cuantización o las modificaciones de modelos optimizados para CUDA no se transferirán. Esto es importante para los equipos con canalizaciones de inferencia optimizadas para GPU existentes que desean migrar.
Cerebras no es un proveedor de hardware local para la mayoría de los compradores. El CS-3 es un dispositivo refrigerado por agua que consume entre 20 y 27 kW, lo que requiere una infraestructura de centro de datos diseñada específicamente. A menos que tengas la escala de AWS, estás utilizando Cerebras como una API en la nube, no implementando su hardware. Esto significa que tu latencia de inferencia y rendimiento dependen de las condiciones de la red hacia los centros de datos de Cerebras (seis en América del Norte y Europa a principios de 2026).
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Artículos relacionados
Guías y artículos relacionados con Cerebras.

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Claude Code New Limits (May 2026): Per-Plan Changes & SpaceX Deal
