Saltar al contenido principal
Vantaige
Falcon screenshot

Falcon es la familia de LLM de pesos abiertos respaldada por el gobierno de los EAU y desarrollada por el Technology Innovation Institute, que abarca transformadores densos, modelos de espacio de estados Mamba y arquitecturas híbridas. Es la principal opción de código abierto para el PNL en árabe, de descarga gratuita y con posibilidad de autoalojamiento.

Funciones:APIOpen Source

Falcon es una familia de grandes modelos de lenguaje de pesos abiertos creada por el Technology Innovation Institute (TII), un centro de investigación respaldado por el gobierno de los EAU que opera bajo el Advanced Technology Research Council de Abu Dabi. El AI and Digital Science Research Center del TII lidera el desarrollo con un equipo de 64 investigadores cuyo objetivo declarado es hacer que la IA de vanguardia sea accesible a nivel mundial, independientemente del dominio de los laboratorios occidentales o chinos. La familia Falcon abarca desde modelos edge de menos de 1B hasta un modelo insignia híbrido de 34B, todos ellos de descarga gratuita desde la organización tiiuae en Hugging Face, sin necesidad de suscripción a ningún proveedor.

La familia abarca varias arquitecturas distintas: la línea original de transformadores densos (de Falcon 1 a Falcon 3), el modelo de espacio de estados Falcon Mamba 7B lanzado en agosto de 2024, el Falcon 2 11B VLM para tareas de visión-lenguaje, Falcon Arabic orientado al PNL en árabe, y la serie híbrida Falcon H1 lanzada en mayo de 2025, que combina la atención de transformadores con capas SSM que se ejecutan en paralelo para ventanas de contexto de hasta 262K tokens. Todos los pesos se publican bajo la Falcon License del TII (basada en Apache 2.0) con una política de uso aceptable, lo que los hace utilizables comercialmente con las advertencias que se analizan a continuación.

Falcon de un vistazo, abril de 2026

Las líneas de modelos Falcon activas a partir de abril de 2026, con sus especificaciones clave:

  • Falcon 3 (dic. 2024): Transformadores densos de 1B, 3B, 7B y 10B. Entrenados con 14 billones de tokens. Ventana de contexto de 32K. Falcon3-10B ocupó la primera posición en la tabla de clasificación de LLM abiertos de Hugging Face para modelos de menos de 13B de parámetros en su lanzamiento. Variantes Base e Instruct, además de versiones cuantizadas GPTQ-Int4/Int8 y AWQ para hardware con memoria limitada.

  • Falcon Mamba 7B (ago. 2024): Un modelo de espacio de estados puro que utiliza la arquitectura Mamba, apartándose por completo de la atención de transformadores. Siete mil millones de parámetros, sobrecarga de memoria constante independientemente de la longitud del contexto, verificado por Hugging Face como el principal SSLM de código abierto en su lanzamiento.

  • Falcon 2 11B VLM (may. 2024): Once mil millones de parámetros, contexto de 8K, codificador de visión CLIP ViT-L/14 integrado con el modelo base. Procesa entradas de imagen y texto de forma conjunta para tareas de comprensión de documentos, subtitulado de imágenes y preguntas y respuestas visuales.

  • Falcon Arabic (may. 2025): Siete mil millones de parámetros, construido sobre la base de Falcon 3-7B con 32,000 tokens específicos para árabe añadidos al vocabulario y una novedosa inicialización de embeddings a partir del mapeo de similitud textual. Alcanza un contexto de 32K y supera a los modelos dedicados al árabe de hasta 4 veces su tamaño en los bancos de pruebas Arabic MMLU, MadinahQA y Aratrust.

  • Falcon H1 (may. 2025): Arquitectura híbrida: la atención de transformadores y SSM se ejecutan simultáneamente por capa, y las salidas se concatenan antes de la proyección. Tamaños desde 0.5B hasta 34B. Contexto de hasta 262K tokens. Disponible en AWS Bedrock Marketplace y NVIDIA NIM. La variante de razonamiento H1R 7B obtuvo una puntuación del 88.1% en los bancos de pruebas de matemáticas AIME-24.

En qué destaca realmente Falcon

La ventaja competitiva más clara de Falcon en abril de 2026 es el PNL en árabe. Falcon Arabic 7B es el único modelo en árabe de pesos abiertos creado específicamente para este fin que lidera de forma constante las clasificaciones OALL (banco de pruebas Open Arabic LLM) entre los modelos de menos de 30B de parámetros. Maneja el árabe estándar moderno junto con dialectos regionales, admite la generación aumentada por recuperación a través de su ventana de contexto de 32K y es genuinamente gratuito para ejecutarse localmente, lo cual es fundamental para las implementaciones en la región MENA con requisitos de residencia de datos.

Las líneas híbridas Mamba y H1 llenan un verdadero vacío de investigación. La inferencia de Mamba es O(1) en memoria independientemente de la longitud de la secuencia, lo que hace que Falcon Mamba 7B sea práctico para tareas de contexto largo que hacen que el crecimiento de la caché KV de los transformadores sea prohibitivo en GPU más pequeñas. Falcon H1 amplía esto con un diseño híbrido que preserva la atención para el contexto local mientras Mamba maneja la memoria de secuencia global, produciendo ventanas de contexto de hasta 262K tokens en un modelo de clase 7B.

"Falcon 3 amplía aún más los límites de los LLM pequeños, contribuyendo a la comunidad de código abierto al proporcionar acceso a una IA de mayor rendimiento. Estamos seguros de que este último lanzamiento abrirá una gama ilimitada de oportunidades." -- Dr. Hakim Hacid, Investigador Jefe, AIDRC/TII, diciembre de 2024

El rendimiento de Falcon 3-10B en razonamiento matemático (83.0 GSM8K) y programación (73.8 MBPP) es competitivo dentro de su clase de parámetros. La familia de modelos también admite la implementación cuantizada (1.58-bit, GPTQ, AWQ) de manera más exhaustiva que muchos de sus pares, apuntando a los casos de uso de inferencia en portátiles y edge para los que el TII diseñó explícitamente.

Dónde falla Falcon: los problemas recurrentes de los usuarios

La queja más constante de los desarrolladores en producción es la licencia. La Falcon License del TII está basada en Apache 2.0, pero incluye una Política de Uso Aceptable que el TII puede actualizar unilateralmente y que los usuarios deben supervisar de forma independiente. Esto es lo opuesto a lo que normalmente implica el lenguaje de una licencia "perpetua e irrevocable".

"Pueden denegar tu caso de uso en cualquier momento sin siquiera notificártelo." -- JimDabell, Hacker News, mayo de 2024

El hilo de Hacker News sobre el lanzamiento de Falcon 2 generó un debate sustancial sobre si los términos son siquiera aplicables dada la contradicción interna entre la concesión irrevocable y una AUP modificable. En la práctica, la mayoría de los equipos legales de las empresas lo consideran un obstáculo y optan por Llama o Qwen en su lugar.

Una segunda frustración persistente es la escasez del ecosistema. La organización tiiuae en Hugging Face tiene 136 modelos publicados, pero la comunidad de ajustes finos, adaptadores LoRA, cuantizaciones e integraciones de aplicaciones es una fracción de lo que existe para Llama o Qwen. Los desarrolladores que construyen sobre Falcon a menudo descubren que necesitan hacer un trabajo que la comunidad ya habría completado para un modelo base más popular.

La brecha entre los bancos de pruebas y la calidad del chat es el tercer tema recurrente. Los miembros de la comunidad que prueban Falcon 2 y los primeros modelos de Falcon 3 señalan que los números en las tablas de clasificación parecen más sólidos que la calidad subjetiva del chat, particularmente para la escritura creativa y el razonamiento de múltiples turnos. Un comentarista de Hacker News observó en el lanzamiento de Falcon 2 que el resultado del 11B estaba "aproximadamente a la par con Mistral 7B y Llama 3 8B" a pesar del mayor recuento de parámetros, lo que socava las afirmaciones de posicionamiento del TII.

Por último, la rápida rotación de modelos crea un riesgo sobre qué base construir. El TII ha lanzado seis familias de arquitecturas distintas desde 2023: Falcon 1, Falcon 2 (con VLM), Falcon Mamba, Falcon 3, Falcon Arabic y Falcon H1 (con la variante de razonamiento H1R). Cada lanzamiento desplaza la recomendación anterior. Los equipos que construyeron pipelines sobre Falcon 40B en 2023 se encontraron con un modelo heredado en menos de un año.

Falcon vs. Llama 4 vs. Qwen 3

Llama 4 (Meta): La diferencia mecánica más crítica es la arquitectura. Llama 4 Scout utiliza una mezcla de expertos con 109 mil millones de parámetros totales, pero solo 17 mil millones activos por token, lo que reduce drásticamente el costo de inferencia a escala. Llama 3-8B utiliza un transformador denso con 8 mil millones de parámetros, más fácil de ajustar pero computacionalmente proporcional. Llama 4 se entrena con más de 40 billones de tokens en más de 200 idiomas, frente a los 14 billones de tokens de Falcon 3 con cuatro idiomas principales. El ecosistema derivado de Llama es el factor dominante en la práctica: existen cientos de miles de ajustes finos de la comunidad, LoRA e integraciones de aplicaciones para los modelos Llama que simplemente no existen para Falcon. Las licencias de Llama (Llama 4 Community License) tienen sus propias restricciones por encima de los 700 millones de usuarios activos mensuales, pero los términos son estables y predecibles de una manera que la AUP modificable de Falcon no lo es. Dónde gana Falcon: especialización en árabe, arquitecturas Mamba/híbridas para la eficiencia en contextos largos y niveles de modelos más pequeños (1B) que Llama 4 no ofrece actualmente.

Qwen 3 (Alibaba): Qwen 3 es el competidor más directo de Falcon en el eje multilingüe, de pesos abiertos y Apache 2.0. Los lanzamientos de Qwen 3 cuentan con una licencia Apache 2.0 genuina (sin AUP modificable), una gama de modelos de 0.6B a 235B (incluidas las variantes MoE) y más de 300 millones de descargas a mediados de 2025. Qwen 3.5-9B obtuvo una puntuación de 81.7 en GPQA Diamond, superando a modelos con 13 veces más parámetros. La profundidad multilingüe de Qwen cubre más de 29 idiomas con un sólido soporte para chino; Falcon Arabic está más especializado para implementaciones centradas en el árabe, pero Qwen carece de un modelo dedicado equivalente para el árabe. En los bancos de pruebas de código (HumanEval, MBPP), Qwen supera sistemáticamente a Falcon en recuentos de parámetros comparables. La elección principal: Qwen para licencias limpias, una selección de modelos más amplia y un soporte más sólido para código/chino; Falcon para aplicaciones centradas en el árabe y la investigación de arquitecturas Mamba/híbridas.

¿Vale la pena el plan de pago?

No hay un plan de pago por parte del TII. Los modelos Falcon se pueden descargar y autoalojar de forma gratuita, sin necesidad de una API de proveedor. El alojamiento de terceros está disponible a través de AWS Bedrock Marketplace (Falcon H1), NVIDIA NIM y AI71 (una empresa de IA independiente de Abu Dabi), cada uno con sus propios precios basados en la computación.

Para la mayoría de los usuarios, el costo de Falcon es la computación para ejecutarlo. Falcon 3-1B y Falcon H1-0.5B se ejecutan en GPU de consumo e incluso en CPU de portátiles en forma cuantizada. Falcon 3-10B requiere una GPU de gama media (RTX 3090 o equivalente) para la inferencia fp16, o puede ejecutarse cuantizado en 8 GB de VRAM. Falcon H1-34B necesita una configuración de múltiples GPU o una instancia en la nube.

La compensación de costos prácticos frente a los servicios de API alojados (OpenAI, Anthropic) favorece a Falcon para aplicaciones de PNL en árabe de alto volumen y sensibles a los costos, donde un equivalente alojado sería costoso y podría no igualar los bancos de pruebas de Falcon Arabic en ese dominio lingüístico.

Mejores casos de uso (y cuándo evitarlo)

Elige Falcon cuando: estés creando aplicaciones en árabe (Falcon Arabic 7B es la opción de pesos abiertos más sólida de su clase), estés investigando o implementando arquitecturas que no sean de transformadores (Mamba, híbrido H1), necesites un modelo soberano o gobernado por los EAU por razones de cumplimiento regional, o estés apuntando a la inferencia edge/fuera de línea con modelos pequeños cuantizados (Falcon 3-1B, H1-0.5B).

Evita Falcon cuando: tu equipo legal necesite términos de código abierto estables y predecibles (la AUP modificable bloquea la adopción empresarial), necesites un gran ecosistema comunitario de adaptadores y ajustes finos (Llama o Qwen tienen muchos más), estés desarrollando principalmente en chino o en tareas con mucho código (Qwen supera a Falcon en ambos), o necesites un solo modelo que sirva a más de 200 idiomas de forma nativa (Llama 4 se entrenó en más idiomas que cualquier modelo de Falcon 3).

Primeros pasos con Falcon

Todos los modelos Falcon están disponibles en huggingface.co/tiiuae. El modelo Falcon 3-7B-Instruct es el punto de partida recomendado para el uso general de chat: entrenamiento con 14T de tokens, contexto de 32K, compatible con la arquitectura Llama para una fácil integración de frameworks (Hugging Face Transformers, Ollama, llama.cpp). Para aplicaciones en árabe, Falcon-Arabic-7B-Instruct es la opción dedicada. Para implementaciones de contexto largo o con memoria limitada, Falcon H1-7B es la opción recomendada actualmente.

El TII mantiene un entorno de pruebas alojado en falconllm.tii.ae para pruebas interactivas sin configuración local. Para el autoalojamiento en producción, los modelos Falcon 3 son compatibles con las herramientas de cuantización estándar (GPTQ, AWQ, llama.cpp GGUF), y el TII publica checkpoints precuantizados que incluyen una variante de 1.58-bit para restricciones de memoria extremas.

Revisa la Falcon License y la Política de Uso Aceptable en falconllm.tii.ae/terms-and-conditions.html antes de crear aplicaciones comerciales. Dada la AUP modificable, se recomienda una revisión legal para cualquier uso de productos integrados o alojados.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Falcon.

Artículos relacionados

Guías y artículos relacionados con Falcon.