跳到主要内容
Vantaige
Falcon screenshot
Falcon logo

Falcon

免费

Falcon 是由阿联酋政府支持、Technology Innovation Institute 开发的开放权重 LLM 系列,涵盖密集型 Transformer、Mamba 状态空间模型和混合架构。它是阿拉伯语 NLP 领域的领先开源选择,可免费下载并自行托管。

使用场景:AI 聊天与助手
功能:APIOpen Source

Falcon 是由阿联酋政府支持的研究中心 Technology Innovation Institute (TII) 开发的开放权重的大型语言模型系列,该中心隶属于阿布扎比的 Advanced Technology Research Council。TII 的 AI and Digital Science Research Center 带领着一支由 64 名研究人员组成的团队进行开发,其既定目标是让前沿 AI 在全球范围内普及,而不受西方或中国实验室的主导。Falcon 系列涵盖了从 1B 以下的边缘模型到 34B 的混合旗舰模型,所有模型均可从 Hugging Face 上的 tiiuae 组织免费下载,无需订阅任何供应商服务。

该系列跨越了几种截然不同的架构:最初的密集型 Transformer 产品线(Falcon 1 到 Falcon 3)、2024 年 8 月发布的 Falcon Mamba 7B 状态空间模型、用于视觉-语言任务的 Falcon 2 11B VLM、针对阿拉伯语 NLP 的 Falcon Arabic,以及 2025 年 5 月推出的 Falcon H1 混合系列(该系列将 Transformer 注意力机制与并行运行的 SSM 层相结合,可实现高达 262K Token 的上下文窗口)。所有权重均在 TII 的 Falcon License(基于 Apache 2.0)和可接受使用政策下发布,使其可用于商业用途,但需注意下文讨论的限制条件。

Falcon 概览(2026 年 4 月)

截至 2026 年 4 月,活跃的 Falcon 模型产品线及其关键规格如下:

  • Falcon 3(2024 年 12 月):1B、3B、7B 和 10B 密集型 Transformer。在 14 万亿个 Token 上进行训练。32K 上下文窗口。Falcon3-10B 在发布时占据了 Hugging Face 开放 LLM 排行榜上 13B 参数以下模型的榜首。提供 Base 和 Instruct 变体,以及针对内存受限硬件的量化 GPTQ-Int4/Int8 和 AWQ 版本。

  • Falcon Mamba 7B(2024 年 8 月):使用 Mamba 架构的纯状态空间模型,完全脱离了 Transformer 注意力机制。70 亿参数,无论上下文长度如何,内存开销均保持恒定,发布时被 Hugging Face 验证为顶级的开源 SSLM。

  • Falcon 2 11B VLM(2024 年 5 月):110 亿参数,8K 上下文,基础模型集成了 CLIP ViT-L/14 视觉编码器。可同时处理图像和文本输入,用于文档理解、图像描述和视觉问答任务。

  • Falcon Arabic(2025 年 5 月):70 亿参数,基于 Falcon 3-7B 主干构建,词汇表中添加了 32,000 个阿拉伯语专用 Token,并采用了基于文本相似性映射的新型嵌入初始化。实现了 32K 上下文,在 Arabic MMLU、MadinahQA 和 Aratrust 基准测试中,其表现优于体积高达其 4 倍的专用阿拉伯语模型。

  • Falcon H1(2025 年 5 月):混合架构:每层并发运行 Transformer 注意力机制和 SSM,输出在投影前进行拼接。规模从 0.5B 到 34B 不等。上下文高达 262K Token。可在 AWS Bedrock Marketplace 和 NVIDIA NIM 上使用。H1R 7B 推理变体在 AIME-24 数学基准测试中得分为 88.1%。

Falcon 的真正优势所在

截至 2026 年 4 月,Falcon 最明显的竞争优势在于阿拉伯语 NLP。Falcon Arabic 7B 是唯一一款专为阿拉伯语构建的开放权重模型,在 30B 参数以下的模型中,它始终在 OALL(开放阿拉伯语 LLM 基准测试)排名中保持领先。它能够处理现代标准阿拉伯语以及地方方言,通过其 32K 上下文窗口支持检索增强生成 (RAG),并且真正可以免费在本地运行,这对于有数据驻留要求的 MENA(中东和北非)地区部署至关重要。

Mamba 和 H1 混合产品线填补了真正的研究空白。无论序列长度如何,Mamba 推理的内存复杂度均为 O(1),这使得 Falcon Mamba 7B 在长上下文任务中非常实用,而此类任务通常会导致 Transformer 的 KV 缓存增长,从而在较小的 GPU 上令人望而却步。Falcon H1 通过混合设计扩展了这一点,保留了对局部上下文的注意力机制,同时由 Mamba 处理全局序列记忆,从而在 7B 级别的模型中实现了高达 262K Token 的上下文窗口。

“Falcon 3 进一步突破了小型 LLM 的边界,通过提供性能更好的 AI 访问权限,为开源社区做出了贡献。我们相信,这一最新版本将开启无限的机遇。”——Dr. Hakim Hacid,AIDRC/TII 首席研究员,2024 年 12 月

Falcon 3-10B 在数学推理 (83.0 GSM8K) 和编码 (73.8 MBPP) 方面的表现,在其同等参数级别中极具竞争力。该模型系列还比许多同类产品更全面地支持量化部署(1.58-bit、GPTQ、AWQ),这正是 TII 明确设计的针对笔记本电脑和边缘推理的用例。

Falcon 的局限性及用户经常遇到的问题

生产环境开发者最一致的抱怨在于许可证。TII 的 Falcon License 基于 Apache 2.0,但它包含一项可接受使用政策 (AUP),TII 可以单方面更新该政策,并要求用户自行监控。这与“永久、不可撤销”的许可证语言通常所暗示的含义恰恰相反。

“他们可以随时拒绝你的用例,甚至无需通知你。”——JimDabell,Hacker News,2024 年 5 月

在 Hacker News 关于 Falcon 2 发布的讨论帖中,人们对这些条款是否具有可执行性进行了激烈的辩论,因为不可撤销的授权与可修改的 AUP 之间存在内部矛盾。在实践中,大多数企业法务团队将其视为障碍,并默认转向使用 Llama 或 Qwen。

第二个持续存在的挫折是生态系统薄弱。tiiuae 在 Hugging Face 组织上发布了 136 个模型,但其微调、LoRA 适配器、量化和应用程序集成的下游社区规模,仅为 Llama 或 Qwen 的一小部分。基于 Falcon 进行开发的开发者经常发现,他们需要自己完成那些在更受欢迎的基础模型上社区早已完成的工作。

基准测试与聊天质量之间的差距是第三个反复出现的主题。测试 Falcon 2 和早期 Falcon 3 模型的社区成员指出,排行榜上的数据看起来比主观的聊天质量更强,特别是在创意写作和多轮推理方面。一位 Hacker News 评论员在 Falcon 2 发布时观察到,尽管参数量更大,但 11B 的结果“大致与 Mistral 7B 和 Llama 3 8B 相当”,这削弱了 TII 的定位主张。

最后,模型的快速迭代带来了“该基于什么构建”的风险。自 2023 年以来,TII 已经发布了六个截然不同的架构系列:Falcon 1、Falcon 2(含 VLM)、Falcon Mamba、Falcon 3、Falcon Arabic 和 Falcon H1(含 H1R 推理变体)。每次发布都会取代之前的推荐。在 2023 年基于 Falcon 40B 构建管道的团队发现,不到一年时间,他们使用的就成了过时模型。

Falcon vs. Llama 4 vs. Qwen 3

Llama 4 (Meta):最关键的机制差异在于架构。Llama 4 Scout 使用混合专家 (MoE) 架构,总参数量为 1090 亿,但每个 Token 仅激活 170 亿参数,从而在大规模应用时显著降低了推理成本。Llama 3-8B 使用具有 80 亿参数的密集型 Transformer,微调更简单,但计算量成正比。Llama 4 在涵盖 200 多种语言的 40 万亿以上 Token 上进行训练,而 Falcon 3 则在 14 万亿个 Token 上进行训练,主要涵盖四种语言。在实践中,Llama 的下游生态系统是主导因素:Llama 模型拥有数十万个社区微调、LoRA 和应用程序集成,而这些在 Falcon 中根本不存在。Llama 许可证(Llama 4 Community License)在月活跃用户超过 7 亿时有其自身的限制,但其条款是稳定且可预测的,而 Falcon 可修改的 AUP 则不然。Falcon 的胜出之处在于:阿拉伯语专业化、用于长上下文效率的 Mamba/混合架构,以及 Llama 4 目前不提供的更小模型层级 (1B)。

Qwen 3 (Alibaba):在开放权重、Apache 2.0 和多语言领域,Qwen 3 是 Falcon 最直接的竞争对手。Qwen 3 版本采用真正的 Apache 2.0 许可证(没有可修改的 AUP),模型范围从 0.6B 到 235B(包括 MoE 变体),截至 2025 年中,下载量已超过 3 亿次。Qwen 3.5-9B 在 GPQA Diamond 上得分为 81.7,优于参数量为其 13 倍的模型。Qwen 的多语言深度涵盖 29 种以上的语言,并具有强大的中文支持;Falcon Arabic 更专注于阿拉伯语优先的部署,而 Qwen 缺乏同等的专用阿拉伯语模型。在代码基准测试(HumanEval、MBPP)中,在同等参数量下,Qwen 始终优于 Falcon。核心选择:如果需要干净的许可证、更广泛的模型选择以及更强的代码/中文支持,请选择 Qwen;如果需要阿拉伯语优先的应用程序以及 Mamba/混合架构研究,请选择 Falcon。

付费层值得吗?

TII 没有提供付费层。Falcon 模型可免费下载并自行托管,无需供应商 API。可通过 AWS Bedrock Marketplace (Falcon H1)、NVIDIA NIM 和 AI71(一家独立的阿布扎比 AI 公司)获得第三方托管服务,每家都有自己基于计算的定价。

对于大多数用户来说,Falcon 的成本在于运行它的计算资源。Falcon 3-1B 和 Falcon H1-0.5B 能够以量化形式在消费级 GPU 甚至笔记本电脑 CPU 上运行。Falcon 3-10B 需要中端 GPU(RTX 3090 或同等产品)进行 fp16 推理,或者可以在 8GB VRAM 上进行量化运行。Falcon H1-34B 则需要多 GPU 设置或云实例。

与托管 API 服务(OpenAI、Anthropic)相比,实际的成本权衡更倾向于将 Falcon 用于高容量、对成本敏感的阿拉伯语 NLP 应用程序,因为在这些应用中,同等的托管服务会很昂贵,并且在该语言领域可能无法达到 Falcon Arabic 的基准测试水平。

最佳用例(以及何时应避免使用)

在以下情况下选择 Falcon:您正在构建阿拉伯语应用程序(Falcon Arabic 7B 是同类产品中最强的开放权重选项),您正在研究或部署非 Transformer 架构(Mamba、H1 混合),出于区域合规性原因您需要一个主权或受阿联酋管辖的模型,或者您的目标是使用量化的小型模型(Falcon 3-1B、H1-0.5B)进行边缘/离线推理。

在以下情况下避免使用 Falcon:您的法务团队需要稳定、可预测的开源条款(可修改的 AUP 阻碍了企业采用),您需要一个包含适配器和微调的大型社区生态系统(Llama 或 Qwen 拥有更多),您主要构建中文或代码密集型任务(Qwen 在这两方面均优于 Falcon),或者您需要一个原生支持 200 多种语言的单一模型(Llama 4 训练的语言数量超过任何 Falcon 3 模型)。

开始使用 Falcon

所有 Falcon 模型均可在 huggingface.co/tiiuae 获取。对于一般聊天用途,推荐从 Falcon 3-7B-Instruct 模型开始:14T Token 训练,32K 上下文,兼容 Llama 架构,易于框架集成(Hugging Face Transformers、Ollama、llama.cpp)。对于阿拉伯语应用程序,Falcon-Arabic-7B-Instruct 是专属选择。对于长上下文或内存受限的部署,Falcon H1-7B 是目前推荐的选项。

TII 在 falconllm.tii.ae 维护了一个托管的 Playground,无需本地设置即可进行交互式测试。对于生产环境的自行托管,Falcon 3 模型兼容标准量化工具(GPTQ、AWQ、llama.cpp GGUF),并且 TII 发布了预量化的检查点,包括针对极端内存限制的 1.58-bit 变体。

在构建商业应用程序之前,请在 falconllm.tii.ae/terms-and-conditions.html 查看 Falcon License 和可接受使用政策。鉴于 AUP 是可修改的,建议对任何嵌入式或托管产品的使用进行法律审查。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 Falcon 的精选合集。

相关文章

与 Falcon 相关的指南和文章。