Saltar al contenido principal
Vantaige
Qwen screenshot

Qwen3.6-27B ofrece un rendimiento de programación cercano a la frontera en 16.8 GB, cabe en una RTX 4090 y supera a su predecesor de 397B. La licencia Apache 2.0 en toda la familia de pesos abiertos lo convierte en el LLM chino con la licencia más limpia para uso comercial en 2026.

Funciones:Apache 2.0 LicenseOpen WeightsMultilingual (119+ languages)MoE ArchitectureCode Generation (Qwen-Coder)Multimodal Vision-Language (Qwen3-VL)Agent Tool CallingHybrid Thinking Mode

El 22 de abril de 2026, el equipo Qwen de Alibaba lanzó Qwen3.6-27B, un modelo denso de 27 mil millones de parámetros que obtiene un 77.2% en SWE-bench Verified, superando al modelo MoE de 397 mil millones de parámetros que lo precedió en las pruebas de rendimiento de programación, y todo ello ocupando solo 16.8 GB de VRAM. Esto significa que se ejecuta cómodamente en una sola RTX 4090 de consumo. Simon Willison, quien ha realizado un seguimiento sistemático del rendimiento de los LLM locales durante años, lo probó el mismo día y lo calificó como "un resultado sobresaliente para un modelo local de 16.8 GB". Ese único dato, un modelo de 27B superando a uno de 397B en la prueba de rendimiento más importante para los agentes de programación, es lo que convierte a Qwen en la historia de pesos abiertos más interesante de abril de 2026.

La familia Qwen en su conjunto no es un proyecto de nicho. A principios de 2026, Alibaba informó de 700 millones de descargas acumuladas en Hugging Face, y Qwen superó a Llama de Meta en descargas mensuales en octubre de 2025. Solo en febrero de 2026, Qwen generó 153.6 millones de descargas, más del doble del total combinado de Meta, DeepSeek, OpenAI, Mistral y Nvidia. Lo que tiene ante sí es, simultáneamente, la familia de modelos de IA de código abierto más descargada del mundo y un producto de API alojada de nivel de producción.

Qwen de un vistazo. Abril de 2026

La familia Qwen abarca varios niveles de productos distintos. En el extremo del consumidor, qwen.ai (anteriormente chat.qwen.ai) ofrece una interfaz web gratuita con acceso a los modelos de la familia Qwen3, que incluyen comprensión de imágenes y videos, procesamiento de documentos, búsqueda web, uso de herramientas y artefactos de código. En el extremo del desarrollador, la API DashScope / Alibaba Cloud Model Studio proporciona acceso programático a partir de $0.05 por millón de tokens de entrada para Qwen-Turbo. Y debajo de ambos se encuentra la capa de pesos abiertos: modelos Apache 2.0 descargables desde Hugging Face que puede ejecutar completamente en su propio hardware, sin pagar a nadie y modificar sin restricciones.

El actual buque insignia de pesos abiertos para la mayoría de los casos de uso es Qwen3.6-27B (lanzado el 22 de abril de 2026, Apache 2.0). Para los equipos que necesitan mayor escala, Qwen3.5-397B-A17B (MoE, Apache 2.0) es el buque insignia de la generación anterior, con 397 mil millones de parámetros en total y 17 mil millones activos por token. Para la implementación en el borde o en dispositivos móviles, la serie pequeña Qwen3.5 se reduce a 0.8B parámetros con un tamaño de 3 GB dirigido al hardware del iPhone 15 Pro. Para el acceso exclusivo a la API propietaria con la máxima capacidad, Qwen3.6-Max-Preview (lanzado el 20 de abril de 2026) reclama la primera posición en seis pruebas de rendimiento de programación con una ventana de contexto de 1M de tokens, aunque los precios de la API no se habían finalizado públicamente hasta el 23 de abril de 2026.

Todos los modelos Qwen3+ de pesos abiertos admiten un interruptor híbrido de pensamiento/no pensamiento: un único peso de modelo alterna entre el modo de instrucción rápida y el razonamiento extendido de cadena de pensamiento por solicitud. No se necesitan implementaciones separadas, se introdujo con QwQ-32B (marzo de 2025) y ahora es estándar en toda la familia.

En qué es realmente bueno Qwen

La programación es su punto fuerte más claro. La puntuación del 77.2% de Qwen3.6-27B en SWE-bench Verified no es una victoria aislada en las pruebas de rendimiento; el anterior Qwen3.6-35B-A3B MoE (lanzado el 16 de abril de 2026) obtuvo un 73.4% en la misma prueba. Las variantes dedicadas Qwen-Coder van más allá: Qwen3-Coder-30B-A3B está disponible para los equipos que desean un punto de control especializado en programación en lugar del modelo de instrucción de propósito general. Las pruebas de Simon Willison del 22 de abril midieron aproximadamente 54 tokens/segundo de velocidad de lectura y 25 tokens/segundo de generación en hardware local, velocidades prácticas para uso interactivo.

La capacidad multilingüe es la segunda ventaja estructural, y está integrada a nivel de arquitectura en lugar de añadida a posteriori. Todos los modelos Qwen3 se entrenaron con 36 billones de tokens en 119 idiomas y dialectos. Qwen3.5 amplía esto a 201 idiomas. El tokenizador BBPE utiliza un vocabulario de 151,669 tokens, aproximadamente cuatro veces mayor que los vocabularios BPE heredados, lo que significa que la escritura CJK se codifica a aproximadamente 1.5–1.8 caracteres por token en lugar de 1 carácter por token. Para los equipos que pagan costos de API por token en japonés, coreano o chino, esta diferencia es medible en las facturas.

El modelo Qwen-MT (Qwen3-MT) es un especialista en traducción dedicado que cubre 92 idiomas utilizando una arquitectura MoE, con un precio de aproximadamente $0.50 por millón de tokens. En la prueba de rendimiento de Alibaba, los evaluadores humanos prefirieron Qwen3-MT sobre GPT-4.1-mini y Gemini-2.5-Flash en 10 idiomas principales. Para las organizaciones que realizan ajustes finos con datos propietarios, la licencia Apache 2.0 y el soporte de QLoRA a través de Unsloth (entrenamiento 2 veces más rápido, 70% menos de VRAM) hacen de Qwen3-8B y Qwen3-14B puntos de partida prácticos.

Dónde falla Qwen, los modos de error con los que los usuarios siguen topándose

El problema más importante en producción es la fiabilidad de las llamadas a herramientas en las pilas de inferencia locales. La familia Qwen3 utiliza un formato de llamada a herramientas basado en XML. La mayoría de los servidores de inferencia esperan JSON. Esta discrepancia requiere una configuración manual de la plantilla de chat que no se produce automáticamente. Además de esto, Ollama descarta silenciosamente los parámetros presence_penalty y repetition_penalty a pesar de que las propias tarjetas de modelo de Qwen recomiendan explícitamente presence_penalty=1.5 para evitar bucles de repetición en el modo de pensamiento. Esto se rastreó en el problema #14493 de GitHub de Ollama, que acumuló importantes votos positivos de la comunidad y no se había resuelto a finales de abril de 2026.

"Tres errores en Ollama hacen que sus capacidades de agente sean completamente disfuncionales. Los parámetros de penalización son aceptados por la API sin error y descartados silenciosamente, aunque la tarjeta del modelo recomienda explícitamente presence_penalty=1.5 para evitar bucles de repetición durante el pensamiento". Problema #14493 de GitHub de Ollama, 2026

La calidad de la cuantización es el segundo modo de fallo práctico. El consenso de la comunidad: Q4_K_M es el nivel mínimo viable; Q8 para cualquier cosa crítica para la fiabilidad. Un error de CUDA 13.2 en abril de 2026 provocó que las cuantizaciones GGUF de 4 bits y menores en los modelos Qwen3.x generaran texto sin sentido. La cuantización de la caché KV en e5m2 causa bucles de repetición. Estos son problemas activos en la ventana de abril de 2026, siga r/LocalLLaMA en lugar de confiar en los valores predeterminados.

La fragmentación de las regiones de la API crea fricción para los usuarios no chinos. El nivel gratuito es solo para Singapur. Las claves de API para Singapur, Virginia (EE. UU.) y Pekín no son intercambiables. El diferencial de precios entre China continental ($0.345/M para la entrada de Qwen-Max) y Singapur ($1.60/M) es una brecha de 4.6 veces, legítima comercialmente, pero una fuente persistente de confusión en la comunidad.

Qwen vs. DeepSeek-V3/R1 vs. Llama 4

La licencia es el diferenciador mecánico en el que la mayoría de los equipos deberían pensar primero. Los pesos abiertos de Qwen3+ son Apache 2.0, uso comercial totalmente permisivo, sin restricciones basadas en el tamaño, sin límites de uso, sin atribución requerida. La licencia de Llama de Meta contiene restricciones que se activan por encima de ciertos umbrales comerciales y han generado una incertidumbre legal recurrente. DeepSeek utiliza una licencia personalizada que requiere una lectura más cuidadosa. Para implementaciones a hiperescala o de marca blanca, la licencia Apache 2.0 de Qwen es la más limpia del grupo.

DeepSeek-V3.2 ejecuta 685B de parámetros totales con 37B activados por token y utiliza Multi-Head Latent Attention (MLA) para una compresión de caché KV más agresiva que la Grouped Query Attention de Qwen, una auténtica ventaja de eficiencia en contextos muy largos. La mayor diferencia arquitectónica es el razonamiento: DeepSeek mantiene ramas separadas para R1 (razonamiento) y V3 (instrucción). El interruptor híbrido de Qwen3 permite que un solo archivo de pesos maneje ambos modos, una implementación, sin ramificaciones.

Llama 4 (Scout: 109B en total, 17B activos) activa 2 expertos más grandes por token frente a los 8 expertos más pequeños de Qwen, un diseño más convencional. El tokenizador de Llama es competitivo en inglés pero menos eficiente en la escritura CJK que el BBPE de vocabulario de 151K de Qwen. Para los mercados de idiomas asiáticos, la diferencia del tokenizador se refleja directamente en los costos de la API por token. Qwen3.5 cubre 201 idiomas en su entrenamiento; Llama 4 está optimizado principalmente para el inglés.

Censura: lo que hacen los pesos frente a lo que hace la API

En enero de 2025, el investigador @xlr8harder ejecutó varios cientos de preguntas políticamente sensibles en modelos de IA chinos de código abierto que se ejecutaban localmente, sin la capa de API de Alibaba. El hallazgo en Qwen2.5-72B fue inequívoco:

"Revisé el sesgo y la censura en dos modelos de IA chinos de código abierto, utilizando varios cientos de preguntas sobre una variedad de temas, y tengo algunas observaciones iniciales para compartir: Lo más interesante para mí: qwen 2.5 72b básicamente no tiene censura, aunque deepseek-v3 ciertamente sí". , @xlr8harder, X/Twitter, 27 de enero de 2025

El contraste con el comportamiento de la API alojada es marcado. El investigador leonardlin, escribiendo en el blog de Hugging Face en junio de 2024, analizó Qwen2-7B-Instruct después de la ablación (una técnica que elimina los vectores de rechazo de los pesos del modelo). Los hallazgos documentan una asimetría dependiente del idioma: el modelo que se ejecuta en chino responde a preguntas sobre los campos de internamiento de Xinjiang con una narrativa explícita alineada con el PCCh, los supuestos campos se describen como invenciones de fuerzas hostiles. El mismo modelo que se ejecuta en inglés simplemente se niega a responder. Esto no es una censura simétrica aplicada a ambos idiomas. Es propaganda en chino y silencio en inglés, dos tipos diferentes de supresión de contenido que operan simultáneamente, en direcciones opuestas.

La conclusión práctica: los pesos son sustancialmente más limpios que la API alojada. La capa de API de Alibaba aplica controles de alineación posteriores al entrenamiento que no están presentes en los pesos del modelo descargado. Si está creando productos que necesitan discutir la historia política china, Taiwán, Xinjiang o la Plaza de Tiananmen con alguna precisión fáctica, la respuesta es probar localmente con la generación de modelo específica que pretende utilizar, y comprender que la API y el modelo local no son el mismo producto desde la perspectiva de la política de contenido. La serie Dolphin Qwen2 mantenida por la comunidad elimina la capa de alineación por completo para las aplicaciones que lo requieren. Tenga en cuenta que las pruebas de @xlr8harder se realizaron en Qwen2.5, no en Qwen3; la nueva generación no se ha vuelto a probar sistemáticamente con una metodología equivalente hasta abril de 2026.

Para quién es Qwen

El perfil más claro es un desarrollador con una RTX 4090 o A100 que desea un rendimiento de programación cercano a la frontera ejecutándose completamente en hardware local, sin pagar costos de API, bajo una licencia que permite el uso comercial sin ataduras. El lanzamiento de Qwen3.6-27B hace que esta sea una conversación diferente a la de hace seis meses. Antes de abril de 2026, ejecutar un modelo que compitiera con las principales API alojadas requería una configuración de múltiples GPU o aceptar compromisos significativos en cuanto a capacidad. La historia de 27B en una 4090 cierra esa brecha sustancialmente.

El segundo perfil claro son los equipos que se expanden a los mercados de idiomas asiáticos. El corpus de entrenamiento de Qwen (36T de tokens, 119 idiomas), el diseño del tokenizador y el modelo de traducción dedicado Qwen-MT están creados para este caso de uso de formas que los modelos centrados en el inglés no lo están. La ventaja de costo por token derivada de la eficiencia del tokenizador es real y se multiplica a escala.

El tercer perfil son las organizaciones que necesitan Apache 2.0 para mayor claridad legal, productos de marca blanca, adquisiciones empresariales que no pueden aceptar restricciones de uso, o proyectos donde los términos de licencia de Llama de Meta o la licencia personalizada de DeepSeek crean fricción. Qwen3+ es la familia abierta cercana a la frontera con la licencia más limpia disponible actualmente.

Qwen no es una buena opción si su producto requiere un comportamiento fiable y probado en temas políticos chinos a través de la API alojada. El matiz de censura descrito anteriormente significa que necesita saber en qué modo de implementación se encuentra y haberlo probado. Tampoco es una buena opción si necesita una compatibilidad perfecta con la API de OpenAI desde el primer momento; las diferencias en el formato de llamada a herramientas, los parámetros del modo de pensamiento y los errores de integración de Ollama significan que existe una fricción de configuración real. Los equipos con presupuestos de infraestructura ajustados que necesitan un modelo que "simplemente funcione" en una pila local pueden descubrir que el trabajo de integración supera las ganancias de capacidad en comparación con modelos que tienen herramientas de inferencia local más maduras.

El lanzamiento de QwQ-32B en marzo de 2025, que igualó a DeepSeek-R1 (671B de parámetros) con 32B de parámetros e impulsó un salto del 8% en un solo día en el precio de las acciones de Alibaba, estableció la plantilla para lo que siguió: lanzamientos repetidos que comprimen lo que requiere el rendimiento de frontera en computación y costo. Qwen3.6-27B es el último ejemplo. Un modelo de 27B, en su GPU, por $0, bajo Apache 2.0.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con Qwen.