
Baseten es una plataforma de inferencia gestionada para implementar modelos de IA personalizados y ajustados (fine-tuned) en producción como API con escalado automático. Con el empaquetado de Truss, los pipelines de Chains y el cumplimiento de HIPAA, está dirigida a equipos de ML que lanzan sus propios modelos, y cuenta con el respaldo de una ronda de financiación de 2026 liderada por NVIDIA.
Baseten es una plataforma de inferencia gestionada para llevar modelos de IA personalizados y de código abierto a producción como API rápidas y con escalado automático. Fue fundada en 2019 en San Francisco por cuatro ingenieros que se conocieron creando sistemas de fraude basados en machine learning en Gumroad, con Tuhin Srivastava como CEO, y toda su propuesta de valor se resume en su lema: "la inferencia lo es todo". Empaquetas un modelo y Baseten lo ejecuta en GPU reservadas, encargándose del escalado automático, la monitorización, el registro y el cumplimiento normativo, reduciendo los meses de trabajo de infraestructura que normalmente separan a un modelo entrenado de un endpoint en producción. A diferencia de un simple revendedor de API de modelos, Baseten está diseñado en torno a tus modelos, incluidos los ajustados (fine-tuned) y los totalmente propietarios, con opciones de alojamiento propio y en VPC para equipos que no pueden enviar datos a una nube compartida.
El producto tiene cuatro componentes principales: Dedicated Deployments, que son GPU reservadas con escalado automático facturadas por minuto; Model APIs, que ofrecen acceso por token a modelos abiertos populares como DeepSeek y Llama; Baseten Chains, que ejecutan pipelines multimodelo donde cada paso utiliza el hardware más adecuado; y Baseten Loops, un SDK de 2026 para aprendizaje por refuerzo y ajuste fino (fine-tuning). La puerta de entrada es Truss, el framework de código abierto de Baseten para empaquetar modelos. Entre sus clientes en producción se encuentran Cursor, Notion, la empresa de IA médica Abridge y la empresa de IA legal Harvey, y la plataforma cuenta con las certificaciones SOC 2 Type II y HIPAA. NVIDIA invirtió directamente en la ronda de financiación de Baseten de enero de 2026, una señal de hacia dónde ve el fabricante de GPU que se dirige la demanda de inferencia.
Qué es lo que realmente implementas en Baseten en junio de 2026
La unidad central es la implementación de un modelo. Envuelves un modelo con Truss, lo subes, y Baseten lo sirve en GPU que van desde una modesta T4 hasta una B200, escalando las réplicas según el tráfico e incluso reduciéndolas a cero cuando están inactivas. Para los equipos que no quieren empaquetar nada, las Model APIs ofrecen acceso instantáneo por token a modelos abiertos comunes, mientras que Chains permite conectar varios modelos entre sí (por ejemplo, conversión de voz a texto que alimenta a un LLM que, a su vez, alimenta a un resumidor), ejecutando cada etapa en el hardware adecuado. Loops, añadido en 2026, cierra la brecha entre el entrenamiento y el servicio, permitiendo que un checkpoint ajustado pase a ser un endpoint en vivo con un solo comando.
El impulso detrás de la plataforma es difícil de exagerar. El 23 de enero de 2026, Baseten recaudó $300 millones con una valoración de $5 mil millones, con NVIDIA entre los inversores, y estimaciones independientes muestran que los ingresos se triplicaron de aproximadamente $200 millones a $600 millones anualizados entre diciembre de 2025 y marzo de 2026, impulsados por un volumen de inferencia que creció unas 100 veces año tras año. Esta es una empresa que avanza impulsada por la demanda en lugar de tener que salir a buscarla.
Baseten frente a Modal y Replicate, a nivel mecánico
Modal y Baseten resuelven problemas superpuestos desde extremos opuestos. Modal te ofrece funciones de Python sin servidor (serverless) definidas con decoradores y factura por segundo de ejecución, lo cual es ideal para trabajos por lotes con picos de demanda y computación general que tú mismo construyes. Baseten es un modelo como servicio (model-as-a-service): la unidad es la implementación, no la función, y las optimizaciones de inferencia, como el ajuste del kernel y el almacenamiento en caché de pesos, vienen integradas. La red de entrega de Baseten puede poner en línea un modelo de menos de 20 GB en menos de diez segundos, pero una réplica activa (warm replica) se factura de forma continua, mientras que el modelo por segundo de Modal recompensa el tráfico con picos. En hardware puro, la H100 de Modal cuesta alrededor de $3.95 por hora frente a los $6.50 de Baseten, por lo que pagas a Baseten por la capa de servicio gestionado. Replicate es el otro punto de referencia, aunque fue adquirida por Cloudflare a principios de 2026 e integrada en Workers AI. Siempre se dirigió a desarrolladores individuales que creaban prototipos utilizando un enorme catálogo de modelos de la comunidad, en lugar de a empresas que implementan modelos propietarios bajo normativas de cumplimiento, que es exactamente el territorio de Baseten.
Lo que realmente cuesta la facturación basada en réplicas
Los Dedicated Deployments se facturan por minuto de tiempo de réplica activa, lo que equivale a aproximadamente $0.63 por hora para una T4, $4.00 para una A100, $6.50 para una H100 y $9.98 para una B200. No hay cargos por tiempo de inactividad, pero la palabra clave es réplica, porque cada réplica en ejecución cuesta dinero continuamente, por lo que una configuración de dos réplicas para redundancia duplica la factura de inmediato. Las Model APIs se facturan por token, con DeepSeek V4 a $1.74 de entrada y $3.48 de salida por millón, lo cual es más sencillo para modelos estándar. Las cuentas nuevas obtienen créditos gratuitos, y las startups desde fase semilla hasta Series-A que cumplan los requisitos pueden reclamar hasta $25,000 a través del programa para startups.
"Baseten juega un papel central en nuestra infraestructura de IA para alojar y servir nuestro motor de recomendación de modelos." Tomas Hernando Kofman, Not Diamond, Product Hunt, 2024.
La tensión estructural es el arranque en frío (cold start) frente al coste. Si escalas a cero, ahorras dinero, pero pagas un arranque en frío de 30 a 90 segundos en la siguiente solicitud para un modelo grande. Si mantienes una réplica activa, la latencia desaparece, pero también lo hacen los ahorros del modelo serverless. Para obtener tiempo de GPU puro y económico sin la capa gestionada, RunPod cuesta una fracción del precio, pero renuncias al escalado automático, la optimización y el cumplimiento normativo que justifican el uso de Baseten en primer lugar.
La fricción con la que los equipos de Baseten siguen tropezando
El modelo de facturación es la fuente más común de sorpresas. Los costes por minuto de réplica son difíciles de prever, la redundancia los multiplica y no hay un límite de presupuesto destacado, por lo que los equipos con picos de tráfico informan de facturas que se disparan sin previo aviso. Truss, el mismo framework que facilita la incorporación, también crea costes de cambio, porque abandonar Baseten significa reescribir los wrappers de los modelos para vLLM o SGLang. La calidad del soporte parece inconsistente en las reseñas públicas; un usuario describió una odisea de diez días por un cambio rutinario.
"Todo lo que necesitaba era una simple actualización de la dirección de facturación, algo que cualquier plataforma normal te permite cambiar directamente en la interfaz de usuario." Valerio, Product Hunt, 2025.
Por último, Baseten está diseñado exclusivamente para ingenieros. No hay un panel de autoservicio para usuarios no técnicos, y su monitorización muestra la utilización de la GPU y los tiempos de respuesta en lugar de métricas de negocio. Esto es correcto para su público objetivo, pero supone un muro para cualquiera que espere una experiencia sin código (no-code).
Quién debería construir en Baseten y quién no
Baseten es una excelente opción para los equipos de ingeniería de ML que implementan modelos personalizados o ajustados, para las empresas cuyos requisitos de cumplimiento (como HIPAA, SOC 2 o alojamiento en VPC) descartan las nubes de inferencia compartidas, para los equipos que construyen pipelines multimodelo con Chains, y para los laboratorios que ejecutan post-entrenamiento por refuerzo y desean continuidad desde el entrenamiento hasta la inferencia a través de Loops. Las startups desde fase semilla hasta Series-A que cumplen los requisitos del programa de créditos obtienen una generosa rampa de acceso.
Aporta poco a los equipos que solo llaman a API de modelos listos para usar, donde el proveedor nativo es más sencillo. Los equipos sensibles al precio que ejecutan modelos abiertos estándar a un volumen moderado generalmente encontrarán que Together AI o un host por token es más barato y requiere menos implicación operativa. Los desarrolladores independientes y los aficionados encontrarán excesivos los costes por réplica y la carga de ingeniería, y cualquiera que desee crear prototipos rápidos con poco código avanzará más rápido en Modal. Baseten solo justifica su precio premium cuando realmente necesitas un servicio gestionado, optimizado y que cumpla con las normativas para tus propios modelos.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Artículos relacionados
Guías y artículos relacionados con Baseten.

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?
