Saltar al contenido principal
Vantaige
Kimi screenshot

Kimi K2.6 de Moonshot AI es el modelo de pesos abiertos que impulsó discretamente a Composer 2 de Cursor, lidera SWE-Bench Pro con un 58.6 % y admite enjambres autónomos de 300 agentes, a una fracción del costo por token de Claude Sonnet. La verbosidad, la tasa de alucinaciones y la censura dependiente del idioma son sus verdaderos límites.

Funciones:Long context (256K tokens)Agentic tool-callingAgent Swarm (up to 300 sub-agents)Open weights (Modified MIT)Multimodal input (K2.5+)API accessMulti-document synthesisCode generation

Cuando Cursor lanzó Composer 2 en marzo de 2026, el marketing lo describió como una "inteligencia de programación de nivel frontera" construida a través de un "preentrenamiento continuo combinado con aprendizaje por refuerzo". No se mencionó ningún modelo de terceros. En menos de 24 horas, el desarrollador Mark Kretschmann interceptó el tráfico de la API de Cursor y encontró el identificador del modelo: kimi-k2p5-rl-0317-s515-fast. Composer 2 era Kimi K2.5, un modelo de Moonshot AI, con sede en Pekín, ajustado con RL para tareas de programación. El cofundador de Cursor, Aman Sanger, reconoció públicamente: "Fue un error no mencionar la base de Kimi en nuestro blog desde el principio". No hubo acciones legales; Moonshot felicitó al equipo de Cursor y confirmó una asociación comercial autorizada a través de Fireworks AI.

El incidente se convirtió en noticia por lo que implicaba: una empresa estadounidense bien financiada, valorada en más de $2 mil millones y que generaba unos ingresos estimados de $160M/mes, había elegido un modelo chino de pesos abiertos como base para su producto estrella. Esa es una señal más significativa que cualquier prueba de rendimiento. Esto es lo que nos dice sobre la posición real de Kimi K2.5 y K2.6 en abril de 2026, y dónde se encuentran las verdaderas trampas.

Kimi de un vistazo. Abril de 2026

Moonshot AI lanzó cinco versiones significativas del modelo en menos de un año. Kimi K2 se lanzó en julio de 2025 como un modelo Mixture-of-Experts de 1 billón de parámetros con 32B de parámetros activos por token, pesos abiertos en HuggingFace y un enfoque explícito en casos de uso de agentes. K2 Thinking le siguió en noviembre de 2025, añadiendo razonamiento de cadena de pensamiento y una ventana de contexto de 256K. K2.5 en enero de 2026 añadió entrada multimodal nativa (texto más visión) y amplió el Agent Swarm a 100 subagentes. K2.6, lanzado el 20 de abril de 2026, es la versión de producción actual: 300 subagentes, 4,000 pasos coordinados, SWE-Bench Pro con un 58.6 % (por encima de GPT-5.4 con un 57.7 % y Claude Opus 4.6 con un 53.4 %), y el modelo de pesos abiertos número uno en la clasificación del LM Council con una puntuación de 54.

Todos los pesos de la serie K2 se publican bajo una Modified MIT License, que permite el uso comercial y el ajuste fino. Hay una excepción importante para los equipos más grandes: cualquier producto comercial que supere los $20M/mes en ingresos o los 100M de usuarios activos mensuales debe "mostrar de forma destacada Kimi K2.x" en su interfaz de usuario. Esa es la cláusula que Cursor infringió.

El producto para consumidores en kimi.com ofrece un nivel gratuito y tres niveles de pago (Moderato, Allegretto, Vivace). La API está disponible directamente a través de Moonshot y mediante agregadores que incluyen OpenRouter, Groq, Cloudflare Workers AI y NVIDIA NIM.

En qué es realmente bueno Kimi

Sus fortalezas más claras se dividen en tres áreas: trabajo de código de gran contexto, orquestación de agentes y eficiencia de costos a escala.

Análisis de código de gran contexto. La ventana de contexto de 128K–256K de Kimi K2 permite ingerir una base de código completa de tamaño mediano en una sola solicitud sin necesidad de fragmentarla. La adopción temprana en r/LocalLLaMA fue impulsada por desarrolladores que cargaban árboles de repositorios completos para revisiones de refactorización. Un desarrollador en Hacker News comparó a Kimi directamente con Claude en un flujo de trabajo de agentes en producción y concluyó que estaba "por debajo de Sonnet y Opus 4.0 en capacidad, pero era mejor que Gemini 2.5 Pro en el uso de herramientas" y que "realmente vale la pena probarlo si no quieres gastar los $100 o $200 al mes en Claude Max". Una nota de comparación adicional: Kimi "escribió un código mucho más simple y legible que las soluciones sobrecomplicadas de Claude", a costa de pasar por alto algunos casos extremos sutiles.

Orquestación de agentes. K2 fue diseñado arquitectónicamente para el uso de herramientas y bucles autónomos de múltiples pasos, no fue adaptado a posteriori. La puntuación de 60.2 % en BrowseComp refleja un entrenamiento que trata las tareas de agentes como objetivos de primera clase. La revisión de dos semanas de Kilo Code descubrió que K2.5 "ascendió rápidamente al estatus de mejor rendimiento para la planificación arquitectónica", antes de que el problema de verbosidad apareciera en los estados de facturación. El enjambre de 300 agentes de K2.6 que maneja 4,000 pasos coordinados es el sistema de agentes de pesos abiertos más capaz disponible en abril de 2026.

Relación precio-capacidad. A $0.74 de entrada / $4.66 de salida por millón de tokens para K2.6 a través de OpenRouter (nota: precios de un agregador externo, verifique con la propia API de Moonshot), Kimi es aproximadamente 4–5 veces más barato que Claude Sonnet en tokens de entrada. Para los equipos que ejecutan inferencias de alto volumen o construyen productos sensibles a los costos, esta diferencia es importante, siempre que se gestione el problema de la verbosidad (ver más abajo).

"por debajo de Sonnet y Opus 4.0 en capacidad, pero mejor que Gemini 2.5 Pro en el uso de herramientas" y "realmente vale la pena probarlo si no quieres gastar los $100 o $200 al mes en Claude Max". Comentarista de Hacker News, hilo adyacente a r/LocalLLaMA, julio de 2025

Dónde falla Kimi, los modos de error que los usuarios siguen encontrando

La trampa del costo por verbosidad. Este es el matiz más importante en la práctica del perfil de Kimi K2.5. La revisión de producción de dos semanas de Kilo Code descubrió que K2.5 generó 89M de tokens de salida en un conjunto de tareas donde modelos comparables produjeron una mediana de 14M de tokens, un multiplicador de verbosidad de 6x. El modelo genera en exceso: explicaciones prolijas añadidas a respuestas directas, comentarios no solicitados sobre casos extremos, contexto repetido. El resultado práctico es que el precio por token más barato de Kimi puede producir la factura más cara cuando el modelo emite seis veces más resultados de los que requiere la tarea. Un modelo con un precio de $2/M de salida pero que genera 14M de tokens cuesta menos que un modelo a $0.74/M que genera 89M. Los usuarios de los foros lo resumieron sin rodeos: "Hazle una pregunta de sí o no y te escribirá tres párrafos".

El enfoque de Kilo Code en su revisión: K2.5 "ascendió rápidamente al estatus de mejor rendimiento para la planificación arquitectónica", pero "el uso superó los 50B de tokens/día" debido a la verbosidad, anulando los ahorros de precio.

Tasa de alucinaciones. El índice de conocimiento de Artificial Analysis califica a Kimi K2.5 con -11 frente al +10 de Claude. Esta es una medida de terceros, no marketing de Moonshot. Significa que el modelo es materialmente peor en la recuperación de datos y la precisión de las citas que los modelos de frontera cerrados con los que compite en las pruebas de rendimiento de código. Kimi es adecuado para el trabajo de "encontrar y resumir" en documentos ingeridos; es menos confiable para tareas de "verificar y citar de memoria" sin un paso de fundamentación.

Límites de uso del nivel gratuito. El nivel gratuito de kimi.com es lo suficientemente restrictivo como para que varios usuarios alcancen los límites antes de completar conversaciones básicas. Un usuario de Hacker News informó: "El chat web tiene límites extremadamente bajos, para su información. Me topé con el límite dos veces antes de obtener una respuesta coherente y me rendí". La API tiene una estructura de límite de uso separada vinculada a la cantidad de recarga acumulada, lo que confundió a los desarrolladores que esperaban niveles de RPM fijos.

"El chat web tiene límites extremadamente bajos, para su información. Me topé con el límite dos veces antes de obtener una respuesta coherente y me rendí". Comentarista de Hacker News, julio de 2025

Fallos de coordinación del Agent Swarm. La arquitectura multiagente es el diferenciador principal, pero la coordinación de tareas secuenciales "a veces falla cuando la coordinación se rompe", según múltiples informes de desarrolladores. Los subagentes que trabajan en el mismo conjunto de datos producen "definiciones de columnas ligeramente diferentes" que requieren limpieza posterior. El enjambre es más confiable cuando los resultados de los subagentes son paralelos e independientes; muestra fallos en las canalizaciones secuenciales con dependencias de estado.

Inestabilidad de la API en hosts de terceros. Los usuarios de NVIDIA NIM informaron que Kimi K2.5 generaba errores 400 (Bad Request) y 429 (Too Many Requests) como problemas persistentes, no como picos aislados. La propia API de Moonshot es más estable, pero sigue sujeta a límites de uso basados en niveles que difieren de las convenciones de las API occidentales.

Kimi vs. DeepSeek-V3/R1 vs. GPT-4o

Kimi K2 vs. DeepSeek-V3/R1. Ambos utilizan Mixture-of-Experts con Multi-head Latent Attention. Kimi K2 tiene 1 billón de parámetros en total con 32B activos por token; DeepSeek-V3 ejecuta 671B en total con 37B activos. Kimi se distribuye más ampliamente, 384 expertos, 8 seleccionados por token, vocabulario de 160K, optimizador MuonClip, frente a los 256 expertos de DeepSeek, 2 seleccionados, AdamW. Más sobrecarga de enrutamiento por pasada hacia adelante, pero menor memoria de caché KV por inferencia. La ejecución de entrenamiento de R1 de DeepSeek costó aproximadamente $294K; la de Kimi K2 costó aproximadamente $4.6M, una diferencia de 15x que refleja una estrategia de entrenamiento deliberada. La divergencia central: DeepSeek R1 fue entrenado para matemáticas y razonamiento lógico; Kimi K2 trató el uso de herramientas y los bucles de agentes autónomos como objetivos de entrenamiento de primera clase. La licencia MIT de DeepSeek no tiene umbrales de ingresos ni de MAU; la Modified MIT de Kimi sí los tiene.

Kimi K2 vs. GPT-4o. Nathan Lambert (Interconnects.ai), al revisar K2 Thinking, señaló que los laboratorios chinos "carecen de ciclos de retroalimentación sobre los comportamientos comunes de los usuarios", una ventaja de datos RLHF que OpenAI y Anthropic han construido durante años. GPT-4o, a aproximadamente $2.50/$10 por millón de tokens, es 3–4 veces más caro que Kimi K2.6, con un perfil de alucinaciones sustancialmente mejor y un seguimiento de instrucciones fuera de distribución más consistente. En la programación de agentes específicamente, Kimi K2.6 ahora supera ligeramente a GPT-5.4 en SWE-Bench Pro, pero esa prueba de rendimiento no representa todos los tipos de tareas.

Para la programación de agentes de alto volumen donde el costo importa y se puede gestionar la verbosidad, Kimi K2 es la opción de pesos abiertos. Para el trabajo conversacional y de investigación amplio donde la confiabilidad de los datos es la prioridad, GPT-4o o Claude siguen siendo mejores opciones predeterminadas.

¿Vale la pena el nivel de pago?

El nivel gratuito de kimi.com es genuinamente limitado. Las cuotas para los planes Moderato, Allegretto y Vivace no están verificadas de forma independiente. Moonshot no ha publicado recuentos de tokens específicos por nivel. La ventana de contexto completa de más de 2M de tokens está restringida a los niveles de pago. Para uso en producción, la ruta de la API (directamente desde Moonshot o a través de OpenRouter) es más transparente: el precio es por token, los límites de uso están documentados y el acceso al modelo es idéntico.

Kimi K2.6 a $0.74/$4.66 por millón de tokens de entrada/salida (a través de OpenRouter, agregador de terceros; verifique con la propia API de Moonshot para compromisos de producción) se sitúa por debajo de GPT-4o, Claude Sonnet y la mayoría de los modelos de clase frontera. Se aplica la advertencia de verbosidad: si el volumen de salida de K2 en sus tareas es 3–6 veces mayor que el de un modelo con un precio 3 veces superior, la economía se invierte. Los aciertos de caché de contexto cuestan aproximadamente $0.15 por millón de tokens para entradas repetidas.

Mejores casos de uso (y cuándo evitarlo)

Usa Kimi cuando: Necesites una implementación de pesos abiertos en tu propia infraestructura, los pesos están en HuggingFace y la Modified MIT permite el ajuste fino comercial a escala (como demostró Cursor). Estés ejecutando flujos de trabajo de programación de agentes donde el rendimiento en SWE-Bench importa más que la tasa de alucinaciones. Necesites la ingestión de documentos de gran contexto a escala de producción sin los precios de Claude Sonnet. Quieras ajustar un modelo base capaz para una tarea específica (sujeto al umbral de ingresos de $20M/mes).

Evita Kimi cuando: La precisión de los datos no sea negociable, el índice de conocimiento de -11 de Artificial Analysis es una brecha real frente a los modelos cerrados. Necesites resultados concisos y predecibles, el problema de la verbosidad requiere ingeniería de prompts explícita para controlarlo. Atiendas a usuarios de habla china en temas políticamente adyacentes: NIST CAISI (diciembre de 2025) encontró aproximadamente un 26 % de alineación con los puntos de discusión del PCCh en chino, un 7 % en inglés, "altamente censurado en chino" en temas políticos sensibles. Necesites SLA empresariales de un proveedor occidental, generación de audio o síntesis de imágenes nativa. Kimi no ofrece nada de esto.

La cláusula comercial de la Modified MIT: los productos que se acercan a los $20M/mes de ingresos deben mostrar el nombre del modelo Kimi, el incidente de Cursor confirmó que esto se hace cumplir.

Primeros pasos con Kimi

El camino más rápido es kimi.com, se requiere verificación telefónica. Para el acceso a la API, regístrate en platform.kimi.ai, añade créditos y realiza consultas a través de endpoints compatibles con OpenAI (https://api.moonshot.cn/v1, autenticación con token Bearer). K2.6 también está disponible a través de OpenRouter en moonshotai/kimi-k2.6.

Para el autoalojamiento, los pesos de K2.6 están en HuggingFace bajo la Modified MIT. El modelo de parámetros 1T requiere una infraestructura significativa; el entrenamiento consciente de la cuantización INT4 está integrado en los pesos publicados, lo que reduce los requisitos de memoria. Las configuraciones de servicio se encuentran en el GitHub de Moonshot en github.com/MoonshotAI/Kimi-K2. Hay aplicaciones disponibles para iOS y Android. No existe ninguna extensión de navegador a partir de abril de 2026.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con Kimi.