Saltar al contenido principal
Vantaige
SambaNova screenshot
SambaNova logo

SambaNova

Freemium

SambaNova Cloud es una API de inferencia de IA que ejecuta grandes modelos de código abierto a velocidades que los proveedores basados en GPU no pueden igualar, utilizando la arquitectura de chips RDU propia de SambaNova. Diseñada para cargas de trabajo de empresas y desarrolladores que requieren una inferencia rápida y rentable en modelos de hasta 671B de parámetros.

Casos de uso:Negocios
Funciones:API

SambaNova Systems es una empresa de hardware y nube de IA de Silicon Valley que fabrica sus propios chips específicamente para la inferencia de IA. Fundada en 2017 por los exprofesores de Stanford Kunle Olukotun y Chris Re junto al CEO Rodrigo Liang, la empresa ha desarrollado la Reconfigurable Dataflow Unit (RDU), ahora en su cuarta generación (SN40L) con la quinta generación SN50 anunciada en febrero de 2026. A diferencia de los proveedores de inferencia basados en GPU, la RDU de SambaNova utiliza una arquitectura de memoria de tres niveles que combina HBM3, DDR DRAM y SRAM en el chip, lo que permite que un solo rack de 16 chips ejecute modelos como DeepSeek-R1 671B o GPT-OSS 120B de forma continua, sin el muro de memoria que limita el rendimiento de las GPU.

SambaNova Cloud es la superficie de la API pública: un servicio de pago por token que ofrece acceso a DeepSeek V3, Llama 4 Maverick, GPT-OSS 120B, Gemma 3, MiniMax M2.5 y otros modelos de código abierto. Los precios de entrada comienzan en $0.15 por millón de tokens en DeepSeek-V3.1-cb, con un nivel gratuito (200K tokens/día, sin necesidad de tarjeta de crédito) para evaluación. El Developer Tier, lanzado el 8 de febrero de 2025, añade límites de tasa más altos y facturación por consumo. Para las empresas que necesitan una implementación local (on-premises), SambaManaged envía racks físicos SN40L sin que los datos salgan del entorno del cliente. El producto Samba-1 de la empresa, anunciado el 28 de febrero de 2024, es un modelo de Composition of Experts de 1 billón de parámetros creado para implementaciones empresariales reguladas a nivel local.

Lo que realmente hace SambaNova en abril de 2026

SambaNova opera tanto como una empresa de chips como una nube de inferencia, lo que la distingue de los proveedores puramente de API. El diseño de memoria de la RDU SN40L coloca 64GB de HBM3, 1.5TB de DDR DRAM y 520MB de SRAM en el chip en cada procesador, con 16 chips en un rack estándar de 19 pulgadas refrigerado por aire. Esta arquitectura significa que la plataforma no necesita particionar modelos grandes en docenas de aceleradores como lo hacen los clústeres de GPU.

Los puntos de referencia de Artificial Analysis (marzo de 2026) muestran que SambaNova ofrece una salida de 711 tokens/segundo en gpt-oss-120B y 250 tokens/segundo en DeepSeek R1 671B, en comparación con un promedio de aproximadamente 19 tokens/segundo en los proveedores basados en GPU para el mismo modelo de 671B. La latencia hasta el primer token en gpt-oss-120B ronda los 1.25 segundos.

En la API en la nube, el catálogo de modelos cubre aproximadamente de 8 a 10 modelos rastreados activamente a partir de abril de 2026: múltiples variantes de DeepSeek, Llama 3.3 70B, Llama 4 Maverick, GPT-OSS 120B, Gemma 3 12B y MiniMax M2.5. La API es compatible con OpenAI, lo que significa que la mayor parte del código existente que utiliza el SDK de OpenAI puede apuntar al endpoint de SambaNova con un simple cambio de URL base.

El 26 de febrero de 2026, SambaNova anunció la SN50, su RDU de quinta generación. La empresa afirma que la SN50 ofrece 5 veces la velocidad máxima y más de 3 veces el rendimiento de las GPU Nvidia Blackwell B200 para la inferencia de agentes, con una potencia media de rack de 20kW (lo que permite la implementación en centros de datos refrigerados por aire sin actualizaciones de refrigeración líquida). SoftBank Corp. es el primer cliente anunciado de la SN50, implementándola para servicios de IA soberana en toda la región de Asia-Pacífico. La SN50 se enviará en el segundo semestre de 2026.

"Toda la industria de la IA habla de construir el teléfono inteligente de la IA, un sistema integrado de hardware y software, y hoy, SambaNova es el primero en ofrecer una versión de eso a las empresas". Rodrigo Liang, CEO de SambaNova Systems, comunicado de prensa de BusinessWire, 28 de febrero de 2024

Dónde se sitúa SambaNova frente a Cerebras y Groq

Las tres empresas están construyendo chips específicamente para la inferencia de IA en lugar de adaptar arquitecturas de GPU de propósito general. Las diferencias son arquitectónicas, no cosméticas.

Cerebras (WSE-3) utiliza un motor a escala de oblea: un solo chip que abarca toda una oblea de semiconductores, con 4 billones de transistores, 900,000 núcleos de cómputo y 44GB de SRAM en el chip a un ancho de banda de memoria de 21 PB/s. Este diseño logra la mayor velocidad de tokens por segundo para un solo usuario de cualquier plataforma. La contrapartida: 44GB de SRAM en el chip limitan el tamaño nativo del modelo. Ejecutar modelos más grandes que esa capacidad requiere particionarlos en múltiples sistemas de obleas. WSE-3 también requiere refrigeración líquida especializada a 23kW por sistema, en comparación con la refrigeración por aire estándar de SambaNova a aproximadamente 10kW. Cerebras se ofrece principalmente en la nube; las opciones locales están disponibles pero son poco comunes.

Groq (LPU) utiliza una Language Processing Unit construida como un procesador de transmisión de tensores con una arquitectura de memoria exclusiva de SRAM. Cada chip LPU contiene solo 230 MiB de memoria. Este diseño ofrece una inferencia muy rápida en modelos pequeños a medianos (Llama 3.3 70B a aproximadamente 350 tokens/segundo), pero el uso exclusivo de SRAM significa que ejecutar un modelo de 70B requiere distribuir la carga de trabajo en cientos de chips: aproximadamente 576 chips LPU en 9 racks para la misma carga de trabajo de 70B que SambaNova ejecuta en 16 chips SN40L en un solo rack. A una escala de 671B de parámetros, Groq no puede competir de manera eficiente. No cuenta con implementación local.

El diseño de memoria de tres niveles de SambaNova maneja los modelos más grandes con un hardware mínimo y soporta tráfico empresarial multiusuario simultáneamente en muchos modelos. La contrapartida frente a Cerebras es la velocidad máxima para un solo usuario; la contrapartida frente a Groq es la madurez del ecosistema de desarrolladores y la transparencia de precios.

"Si las GPU pudieran utilizar realmente su ancho de banda de memoria, serían mucho más rápidas, pero no pueden". Anton McGonnell, Jefe de Productos de Software, SambaNova Systems, The Register, septiembre de 2024

Cómo es la realidad de la API para desarrolladores

El nivel gratuito de SambaNova Cloud proporciona 200,000 tokens por día, lo cual es suficiente para evaluar modelos pero no para ejecutar una aplicación en producción. El Developer Tier lanzado el 8 de febrero de 2025 desbloquea la facturación por consumo de pago por token y límites de tasa más altos, con un crédito gratuito de $5 al registrarse. La API es compatible con OpenAI, por lo que la integración es sencilla para los desarrolladores que ya trabajan con API de LLM.

Los límites de tasa son donde se acumula la fricción. Incluso en el Developer Tier, algunos modelos tienen un límite de 20 solicitudes por minuto a pesar de que la documentación afirma límites más altos. Una migración del sistema de facturación de varias semanas a principios de 2026 provocó que muchos desarrolladores se quedaran atascados en los límites de tasa del nivel gratuito incluso después de añadir métodos de pago. Los usuarios en el foro de la comunidad informaron de errores 429 que interrumpían las aplicaciones en producción, y el registro de un desarrollador mostraba 3.3 millones de tokens utilizados frente a un límite diario de 200K que no se actualizó a pesar de tener una tarjeta de crédito vinculada. SambaNova reconoció que el problema era un error de migración de facturación y resolvió la mayoría de los casos mediante ajustes manuales de nivel, pero no ofreció un plazo de finalización firme.

El catálogo de modelos es más reducido que el de OpenAI o Anthropic. No hay modelos fundacionales propietarios de SambaNova disponibles a través de la API en la nube; Samba-1 es exclusivo para empresas a nivel local. No hay GPT-4, ni Claude, ni Gemini. Si su caso de uso requiere algo fuera del conjunto de modelos de código abierto que aloja SambaNova, no podrá cubrirlo dentro de la plataforma.

Para los equipos empresariales que avanzan con la implementación local de SambaManaged, el alcance de la integración se extiende mucho más allá del acceso a la API: la lógica de negocio, la automatización del flujo de trabajo, la monitorización y la recuperación de contexto son todos ingeniería a medida. Un análisis externo describió la experiencia como "comprar un motor de Fórmula 1 cuando lo que realmente necesitas es un coche", señalando la brecha entre la capacidad bruta del hardware y un sistema de producción desplegable.

Para quién está diseñado SambaNova

SambaNova Cloud se adapta a un perfil de desarrollador específico: equipos que ejecutan inferencia de alto rendimiento en grandes modelos de código abierto donde los tokens por segundo se traducen en ahorros de costes reales o diferencias en la experiencia del usuario. Los equipos de servicios financieros que construyen análisis de operaciones en tiempo real, los ingenieros de ML en laboratorios nacionales o industrias reguladas que necesitan privacidad local, y los desarrolladores que construyen agentes de investigación profunda que procesan millones de tokens por sesión representan casos de uso realistas. El precio por token es significativamente inferior al de los proveedores basados en GPU a gran escala: $0.22 de entrada / $0.59 de salida por millón de tokens para gpt-oss-120B frente a tarifas sustancialmente más altas en endpoints de GPU comparables.

El Laboratorio Nacional Argonne del Departamento de Energía de EE. UU. implementó un clúster de inferencia SN40L completo en noviembre de 2024, utilizándolo para impulsar AuroraGPT y la investigación científica impulsada por IA en biología, química y ciencia de materiales. Accenture nombró a Samba-1 como adecuado para clientes empresariales que requieren IA local de pila completa (full-stack). Estos son los arquetipos de clientes a los que SambaNova realmente sirve bien.

Lo que no es SambaNova

Omita SambaNova Cloud si necesita modelos frontera propietarios. No hay GPT-4, ni Claude, ni Gemini, ni acceso a la API del propio Samba-1 de SambaNova. Si su caso de uso requiere acceso a un amplio catálogo de modelos que incluya modelos cerrados, necesita un proveedor diferente.

Omítalo si está creando prototipos en solitario o en un equipo pequeño sin recursos de ingeniería. Los límites de tasa del nivel gratuito se alcanzan rápidamente. El sistema de facturación ha tenido fallos de actualización documentados. La documentación, aunque está mejorando, es más escasa que la de OpenAI. El producto empresarial local requiere meses de trabajo de implementación y un compromiso de ventas completo.

Omítalo si necesita un contexto completo de 128K en modelos grandes. En su lanzamiento en septiembre de 2024, el modelo de 405B se limitó a un contexto de 8K por razones de gestión de tráfico. Los límites de la ventana de contexto en los modelos más grandes siguen siendo una restricción conocida.

El mayor valor de SambaNova se presenta cuando se ejecutan grandes modelos de código abierto a gran escala, la latencia es importante y se está dispuesto a realizar un trabajo de ingeniería real para construir sobre la capacidad de inferencia bruta que ofrece.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con SambaNova.