跳到主要内容
Vantaige
Phi screenshot

Microsoft 的 Phi 系列证明了数据质量胜过规模。Phi-4 世代(14B,MIT 许可证)在数学和推理方面表现出色,超越了其体量限制,并能在消费级硬件上运行。可免费下载,也可在 Azure AI Foundry 上使用付费的托管推理服务。

使用场景:AI 聊天与助手
功能:APIOpen Source

Microsoft 的 Phi 系列是一组小型语言模型,其核心理念在于:精心策划的合成训练数据能够打造出超越参数量远大于自身的竞争对手的模型。Phi 由 Microsoft Research 开发并基于 MIT 许可证发布,从 2023 年的 1.3B Phi-1 发展到如今的 Phi-4 世代。截至 2026 年初,该系列涵盖了 3.8B 的 mini 变体、5.6B 的多模态模型、14B 的旗舰模型,以及 2026 年 3 月发布的 15B 推理视觉模型。所有权重均可在 Hugging Face 的 microsoft 组织下免费获取,且全部采用 MIT 许可证,这意味着商业使用、微调和重新分发均不受限制。早期 Phi 项目的首席研究员 Sebastien Bubeck(前 Microsoft 生成式 AI 研究副总裁)于 2024 年 10 月离职加入 OpenAI,将接力棒交给了继续推动该系列向前发展的团队。

当前的产品阵容为开发者在不同硬件预算下提供了有意义的选择。量化为 4-bit 后,Phi-4 (14B) 可以在配备 8GB VRAM 的消费级 GPU 上处理数学、推理和代码任务。Phi-4-mini (3.8B) 支持 128K 上下文窗口和函数调用,使其成为边缘部署的可靠选项。Phi-4-multimodal (5.6B) 可处理文本、音频和图像,截至 2025 年 2 月,它以 6.14% 的词错误率登顶 HuggingFace OpenASR 排行榜。Phi-4-reasoning 和 Phi-4-reasoning-plus(均为 14B)使用 o3-mini 生成的推理轨迹进行监督微调,其中 plus 变体增加了基于结果的强化学习,以实现更长、更高准确率的推理链。最新成员 Phi-4-reasoning-vision-15B(2026 年 3 月 4 日发布)将多模态推理扩展到了 UI 理解和科学问题。所有模型均可通过 Ollama、Hugging Face Transformers、Azure AI Foundry、GitHub Models 以及兼容 llama.cpp 的运行时进行部署。

Phi 概览(2026 年 4 月)

Phi-4 世代涵盖四个主要的部署目标:

  • Phi-4 (14B):仅解码器的密集型 Transformer。MIT 许可证。16K 上下文。MMLU 84.8,GPQA 56.1,MATH 80.4,HumanEval 82.6。在 9.8 万亿个 token 上进行训练,包含大量合成的数学、编码和推理数据。2024 年 12 月 12 日作为研究预览版在 Azure AI Foundry 上发布;2025 年 1 月在 MIT 许可证下开源权重。

  • Phi-4-mini (3.8B):分组查询注意力机制,200K 词汇表,128K 上下文,支持函数调用。2025 年 2 月 26 日发布。边缘和 IoT 部署的首选。

  • Phi-4-multimodal (5.6B):文本、音频和图像输入;文本输出。ASR 领域的领导者(6.14% WER)。2025 年 2 月 26 日发布。

  • Phi-4-reasoning / Phi-4-reasoning-plus (14B):基于 o3-mini 演示训练的推理链模型。2025 年 4 月/5 月发布。在多个推理基准测试中超越了 DeepSeek-R1-Distill-Llama-70B。

  • Phi-4-reasoning-vision-15B:15B 多模态推理模型。MIT 许可证。2026 年 3 月 4 日发布。能够处理带有视觉输入的数学、科学和 UI 理解任务。

Phi-4 的训练在 1,920 块 H100-80G GPU 上运行了 21 天。大约 8% 的训练数据是多语言的;其余主要为英语。Phi-4 基础模型的数据截止日期为 2024 年 6 月;部分后续变体为 2024 年 8 月。

Phi 的真正优势

合成数据理论在结构化任务上取得了最显著的成效。Phi-4 (14B) 在 MATH 基准测试中得分为 80.4,在 HumanEval 中得分为 82.6,这些数据击败了体积是其两到五倍的模型。对于在消费级硬件上运行量化模型的开发者来说,这是核心吸引力:一个能够适应 8GB VRAM 且能可靠处理实际编码和数学问题的模型。

“到目前为止,我在使用量化的 Phi-4 12B 和 Ollama 时取得了巨大的成功。它和 Llama 3.1 8B 一样快,但结果(主观上)质量更高。” - accrual,Hacker News,2024 年 12 月

MIT 许可证是一个真正的差异化优势。Gemma 采用 Google 的 Gemma 许可证(在达到一定规模时有报告要求),Llama 采用 Meta 的 Llama 许可证(允许商业使用,但对高流量部署有附加条件),而 Phi-4 的 MIT 许可证是这三者中最纯粹的,非常适合将模型嵌入商业产品且无需承担法律审查成本的团队。

Phi-4-mini 可以说是该系列中最被低估的模型。凭借 3.8B 的参数量、128K 的上下文窗口以及可靠的函数调用能力,它非常适合 Phi-4 基础模型无法胜任的边缘代理用例(16K 上下文对于文档繁重的任务来说是一个硬性限制)。Microsoft 专门发布了一份关于通过 Ollama 使用 Phi-4-mini 在 IoT 设备上构建 AI 代理的教程,社区对这种特定的部署模式反响热烈。

“这些看起来相当不可思议……Phi-4 的发布使其脱颖而出,成为 ~7B 以下唯一的竞争者。” - refulgentis,Hacker News,2025 年 5 月(关于 Phi-4-reasoning 模型)

Phi 的局限性:用户经常遇到的故障模式

基准测试得分与现实世界指令遵循能力之间的差距是 Phi 最持久的问题。这个问题在 Phi-4 之前就存在,且尚未完全解决。在 2025 年 1 月的一项记录测试中,一位开发者让 Phi-4 进行了 30 场国际象棋比赛,模型必须遵循受限的提示词。Phi-4 取得了零胜零平的成绩,平均在 7.7 步后就打破了提示词规则,生成的 token 数量几乎是 Gemma 2 9B 的六倍,错误率是其十倍。该开发者总结道:“我对那些在评估中表现出色的小型模型在现实生活中的整体印象并不好。”这种冗长的模式也延伸到了推理模型中。Simon Willison 在 2025 年 5 月测试了 Phi-4-reasoning,并指出它在回应一个简单的“hi”问候时生成了 56 句推理,他将这种模式描述为“过度思考的倾向”。

Phi-4 基础模型 16K 的上下文上限是一个经常被抱怨的问题。Hugging Face 上一个名为“有限的上下文长度 - Yarn/Rope?”的讨论帖捕捉到了这种挫败感:在 Phi-4 以 16K 发布时,Llama 3.2 和 Gemma 3 都提供了 128K。Phi-4-mini 后来通过 128K 修复了这个问题,但旗舰模型的上下文相对于竞争对手仍然有限。对于任何涉及长文档、代码库或多轮上下文的任务来说,这都是一个硬性限制。

多语言使用是另一个痛点。由于只有大约 8% 的多语言训练数据,Phi-4 在非英语提示词上的表现不佳。需要中文、阿拉伯语或其他语言的用户报告称,他们需要进行微调或切换到原生支持 140 种语言的 Gemma 3。

最后,自 Phi-3 以来,对基准测试的怀疑一直伴随着 Phi 系列。多位社区成员指出,这些模型显示出基准测试数据污染的迹象。Microsoft 在 Phi-4 技术报告中直接回应了这一点,描述了改进的数据去污程序,但这种看法在一些评估者中依然存在。一位 HN 评论者在 2024 年 12 月直言不讳地指出:“Phi 模型总是有着出色的基准测试得分,但在现实世界的用例中,它们总是让我失望。”

Phi vs. Llama 3.2 vs. Gemma 3

Phi-4 (14B, MIT) 是一个仅解码器的密集型 Transformer,主要在合成的英语数据上进行训练。其核心优势在于单位参数的数学和推理性能。其核心局限性是基础模型的 16K 上下文以及极少的多语言训练。

Llama 3.2 (Meta, Llama 许可证) 提供了 1B、3B 纯文本变体以及 11B、90B 多模态变体。关键的机制差异在于上下文:Llama 3.2 支持 128K token,而 Phi-4 只有 16K。Llama 3.2 使用分组查询注意力机制 (GQA),将 KV 缓存内存减少到传统架构的 1/8。其下游生态系统是无与伦比的:llama.cpp、vLLM、Ollama、TGI 以及所有主流推理运行时都原生支持 Llama。在 MMLU 上,Llama 3.2 3B 的得分约为 61.8%,而 14B 的 Phi-4 为 84.8%,但当参数预算不受限制时,Llama 3.3 70B 在一般任务上超越了 Phi-4。

Gemma 3 (Google DeepMind, Gemma 许可证) 从 Google 的 Gemini 架构中蒸馏而来,采用了“窄而深”的设计,有别于 Llama 的“宽而浅”的方法。Gemma 3 提供了 1B、4B、12B 和 27B 变体,全部具备 128K 上下文。4B+ 变体包含原生图像输入,这是 Phi-4-mini 完全缺乏的(只有单独的 Phi-4-multimodal 模型处理视觉)。Gemma 3 涵盖 140 种语言,而 Phi-4 的语料库主要为英语。其许可证不是 MIT:Gemma 的条款要求对超过 7 亿 MAU 的部署进行报告,并包含 MIT 所没有的附加条件。对于大多数团队来说,这不是问题,但为了在大规模应用时保持法律上的简便性,Phi-4 的 MIT 许可证更胜一筹。

实用总结:如果上下文长度很重要(文档 RAG、长对话),请选择 Llama 3.2 或 Gemma 3。如果多语言很重要,请选择 Gemma 3。如果看重 MIT 许可证的纯粹性,且目标是在小体积下实现数学/推理能力,Phi-4 是最强大的选择。

付费层级值得吗?

Phi 没有付费订阅。模型可免费下载和运行。Azure AI Foundry 上的托管推理按 token 计费,没有最低消费承诺:

  • Phi-4-mini(托管):输入 $0.000075/1K tokens,输出 $0.0003/1K tokens。该系列中最实惠的选项。

  • Phi-4(托管):输入 $0.000125/1K tokens,输出 $0.0005/1K tokens。

  • Phi-4-multimodal(文本/图像):输入 $0.00008/1K tokens,输出 $0.00032/1K tokens。

  • Phi-4-multimodal(音频):输入 $0.004/1K tokens,输出 $0.00032/1K tokens。

  • 微调:训练 $0.003/1K tokens。微调模型托管:$0.80/小时。

对于自行托管的团队,除了基础设施外,成本为零。量化的 4-bit Phi-4 (14B) 可以在配备 8GB VRAM 的单块消费级 GPU 上运行。对于希望获得托管推理而无需管理 GPU 容量的团队,Azure 的按 token 费率在同等能力级别的模型中处于市场最低水平。决策很简单:如果您有硬件和工程能力,可以免费自行托管;如果希望以极低的成本获得托管的便利性,请使用 Azure。

最佳用例(以及何时应避免使用)

Phi 非常适合:

  • 边缘和 IoT 代理部署:拥有 3.8B 参数、128K 上下文和函数调用能力的 Phi-4-mini 专为此而生。Microsoft 已经发布了基于 Ollama 的边缘代理专用教程。

  • 数学和结构化推理:14B 模型在 MATH 基准测试中获得 80.4 分是其核心亮点。对于辅导系统、具备数学推理能力的编码助手以及英语科学问答,Phi-4 是最强大的小型模型选项。

  • 隐私优先或物理隔离部署:MIT 许可证,无遥测要求,完全在本地运行。受监管行业(医疗保健、金融)中无法将数据发送到云 API 的团队在这里有了一条可行的路径。

  • 研究和微调:透明的训练方法(记录在 Microsoft Research 技术报告中)和 MIT 许可证使 Phi 成为学术和商业微调项目的天然起点。

在以下情况下请跳过 Phi:

  • 您需要处理超过基础模型 16K token 限制的长文档、代码库或多轮对话(请使用具备 128K 上下文的 Gemma 3 或 Llama 3.2)。

  • 您的用户或内容主要为非英语(Gemma 3 的 140 种语言覆盖范围要广得多)。

  • 您正在构建一个生产级代理管道,其中严格、简洁的指令遵循至关重要。社区测试人员记录的冗长和偶尔的指令遵循失败在复杂的代理循环中是一个真正的风险。

  • 您希望获得最广泛的推理引擎支持和最大的微调衍生品社区(Llama 在这方面遥遥领先)。

开始使用 Phi

最快的途径是 Ollama:使用 ollama pull phi4 获取 14B 基础模型,或使用 ollama pull phi4-mini 获取 3.8B 变体,两者均无需帐户即可使用。对于 Hugging Face,microsoft/phi-4 和 microsoft/Phi-4-mini-instruct 仓库包含了模型卡片和 transformers 管道示例。模型使用 ChatML 格式的 token。对于 Azure AI Foundry,在模型目录中找到任何 Phi-4 变体,并通过托管的按 token 计费推理进行部署,无需配置 GPU。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 Phi 的精选合集。

相关文章

与 Phi 相关的指南和文章。