跳到主要内容
Vantaige
Kimi screenshot
Kimi logo

Kimi

免费增值

Moonshot AI 的 Kimi K2.6 是一款开源权重模型,它在幕后悄然驱动了 Cursor 的 Composer 2,以 58.6% 的成绩登顶 SWE-Bench Pro,并支持 300 个智能体组成的自主集群,而其每 Token 成本仅为 Claude Sonnet 的一小部分。冗长啰嗦、幻觉率以及与语言相关的审查机制是其真正的局限所在。

功能:Long context (256K tokens)Agentic tool-callingAgent Swarm (up to 300 sub-agents)Open weights (Modified MIT)Multimodal input (K2.5+)API accessMulti-document synthesisCode generation

当 Cursor 在 2026 年 3 月推出 Composer 2 时,营销文案将其描述为通过“持续预训练结合强化学习”打造的“前沿级编程智能”。当时并未提及任何第三方模型。然而不到 24 小时,开发者 Mark Kretschmann 拦截了 Cursor 的 API 流量,并发现了模型标识符:kimi-k2p5-rl-0317-s515-fast。Composer 2 实际上就是 Kimi K2.5——一款由总部位于北京的 Moonshot AI 开发、并针对编程任务进行了强化学习(RL)微调的模型。Cursor 联合创始人 Aman Sanger 公开承认:“我们一开始没有在博客中提及基于 Kimi,这是一个失误。” 随后并未发生任何法律纠纷;Moonshot 向 Cursor 团队表示祝贺,并确认了通过 Fireworks AI 达成的授权商业合作。

这一事件之所以成为新闻焦点,是因为它背后的含义:一家资金雄厚、估值超过 20 亿美元、预计月收入达 1.6 亿美元的美国公司,竟然选择了一款中国开源权重模型作为其旗舰产品的基础。这比任何基准测试都更具信号意义。以下是这向我们揭示的关于 Kimi K2.5 和 K2.6 在 2026 年 4 月的真实地位,以及真正的陷阱所在。

Kimi 概览(2026 年 4 月)

Moonshot AI 在不到一年的时间里发布了五个重要的模型版本。Kimi K2 于 2025 年 7 月发布,是一款拥有 1 万亿参数的 Mixture-of-Experts 模型,每个 Token 激活 320 亿参数,在 HuggingFace 上开源权重,并明确专注于智能体(Agentic)用例。紧接着在 2025 年 11 月推出了 K2 Thinking,增加了思维链推理和 256K 上下文窗口。2026 年 1 月的 K2.5 增加了原生多模态输入(文本加视觉),并将智能体集群(Agent Swarm)扩展到 100 个子智能体。2026 年 4 月 20 日发布的 K2.6 是当前的生产版本:支持 300 个子智能体、4,000 个协调步骤,SWE-Bench Pro 得分为 58.6%(高于 GPT-5.4 的 57.7% 和 Claude Opus 4.6 的 53.4%),并在 LM Council 排行榜上以 54 分的成绩位列开源权重模型第一。

所有 K2 系列的权重均在 Modified MIT License 下发布,允许商业使用和微调。但对于大型团队来说,有一个例外条款至关重要:任何月收入超过 2000 万美元或月活跃用户超过 1 亿的商业产品,必须在其 UI 中“显著展示 Kimi K2.x”。正是这一条款让 Cursor 惹上了麻烦。

kimi.com 上的消费者产品提供免费层和三个付费层(Moderato、Allegretto、Vivace)。API 可以直接通过 Moonshot 获取,也可以通过 OpenRouter、Groq、Cloudflare Workers AI 和 NVIDIA NIM 等聚合平台获取。

Kimi 的真正优势

其最明显的优势可分为三个领域:大上下文代码处理、智能体编排以及规模化成本效益。

大上下文代码分析。 Kimi K2 的 128K–256K 上下文窗口允许在一次请求中摄取整个中型代码库,而无需分块。r/LocalLLaMA 上的早期采用主要是由开发者加载完整的存储库树进行重构审查所推动的。Hacker News 上的一位开发者在生产智能体工作流中将 Kimi 直接与 Claude 进行了比较,得出的结论是它“在能力上低于 Sonnet 和 Opus 4.0,但在工具调用上优于 Gemini 2.5 Pro”,并且“如果你不想每月在 Claude Max 上花费 100 或 200 美元,它真的值得一试”。另一份比较说明指出:Kimi“编写的代码比 Claude 过度设计的解决方案更简单、更具可读性”,代价是可能会遗漏一些微妙的边缘情况。

智能体编排。 K2 在架构设计之初就是为工具调用和多步自主循环而生的,而非后期改造。60.2% 的 BrowseComp 得分反映了其将智能体任务作为一等目标的训练策略。Kilo Code 的两周评测发现,K2.5“在架构规划方面迅速攀升至顶级表现者地位”,直到账单中暴露出冗长啰嗦的问题。K2.6 支持 300 个智能体集群处理 4,000 个协调步骤,是 2026 年 4 月可用的最强大的开源权重智能体系统。

性价比。 通过 OpenRouter 调用 K2.6 的价格为每百万 Token 输入 0.74 美元 / 输出 4.66 美元(注:此为第三方聚合平台定价,请与 Moonshot 官方 API 核实),在输入 Token 方面,Kimi 比 Claude Sonnet 便宜约 4-5 倍。对于运行高并发推理或构建成本敏感型产品的团队来说,只要能控制住冗长啰嗦的问题(见下文),这种差距是具有实质意义的。

“在能力上低于 Sonnet 和 Opus 4.0,但在工具调用上优于 Gemini 2.5 Pro”,并且“如果你不想每月在 Claude Max 上花费 100 或 200 美元,它真的值得一试”。—— Hacker News 评论者,r/LocalLLaMA 相关讨论帖,2025 年 7 月

Kimi 的短板与用户常遇的故障模式

冗长带来的成本陷阱。 这是 Kimi K2.5 档案中最具实际意义的细节。Kilo Code 的两周生产评测发现,在一组任务中,同类模型产生的中位数输出为 1400 万 Token,而 K2.5 生成了 8900 万输出 Token,冗长倍数高达 6 倍。该模型存在过度生成的问题:在直接回答后附加冗长的解释、主动提供边缘情况评论、重复上下文。实际结果是,当模型输出的 Token 数量是任务所需数量的六倍时,Kimi 最便宜的单 Token 定价可能会产生最昂贵的账单。一个定价为 2 美元/百万输出 Token 但只生成 1400 万 Token 的模型,其成本低于定价为 0.74 美元/百万输出 Token 却生成 8900 万 Token 的模型。论坛用户直言不讳地总结道:“问它一个是非题,它能写出三个段落。”

Kilo Code 在其评测中的总结:K2.5“在架构规划方面迅速攀升至顶级表现者地位”,但由于冗长啰嗦,“使用量激增至每天超过 500 亿 Token”,抵消了价格优势。

幻觉率。 Artificial Analysis 知识指数对 Kimi K2.5 的评分为 -11,而 Claude 为 +10。这是一项第三方测量,而非 Moonshot 的营销数据。这意味着在事实检索和引用准确性方面,该模型明显逊色于在代码基准测试中与之竞争的闭源前沿模型。Kimi 适合对摄取的文档进行“查找和总结”工作;但在没有基础步骤的情况下,对于“从记忆中验证和引用”的任务,它的可靠性较低。

免费层速率限制。 kimi.com 的免费层限制非常严格,以至于许多用户在完成基本对话之前就触及了限制。一位 Hacker News 用户报告说:“顺便说一句,网络聊天的限制极低。在得到一个合理的答案之前,我两次碰到了限制,最后放弃了。”API 有一个独立的速率限制结构,与累计充值金额挂钩,这让习惯了固定 RPM 层级的开发者感到困惑。

“顺便说一句,网络聊天的限制极低。在得到一个合理的答案之前,我两次碰到了限制,最后放弃了。”—— Hacker News 评论者,2025 年 7 月

智能体集群协调故障。 多智能体架构是其主打的差异化优势,但根据多位开发者的报告,顺序任务协调“有时会在协调崩溃时失败”。处理同一数据集的子智能体会产生“略有不同的列定义”,需要下游进行清理。当子智能体的输出是并行且独立时,集群最为可靠;但在具有状态依赖的顺序管道中,它会出现故障。

第三方主机上的 API 不稳定性。 NVIDIA NIM 上的用户报告称,Kimi K2.5 生成 400(错误请求)和 429(请求过多)错误是持续存在的问题,而非孤立的峰值。Moonshot 自己的 API 更稳定,但仍受制于基于层级的速率限制,这与西方 API 的惯例不同。

Kimi vs. DeepSeek-V3/R1 vs. GPT-4o

Kimi K2 vs. DeepSeek-V3/R1。 两者都使用了带有 Multi-head Latent Attention 的 Mixture-of-Experts 架构。Kimi K2 总参数量为 1 万亿,每个 Token 激活 320 亿;DeepSeek-V3 总参数量为 6710 亿,激活 370 亿。Kimi 的分布更广,384 个专家,每个 Token 选择 8 个,160K 词表,使用 MuonClip 优化器;而 DeepSeek 为 256 个专家,选择 2 个,使用 AdamW。每次前向传播的路由开销更大,但每次推理的 KV-cache 内存更低。DeepSeek R1 的训练成本约为 29.4 万美元;Kimi K2 的成本约为 460 万美元,15 倍的差异反映了深思熟虑的训练策略。核心分歧在于:DeepSeek R1 是为数学和逻辑推理而训练的;而 Kimi K2 将工具调用和自主智能体循环视为一等训练目标。DeepSeek 的 MIT 许可证没有收入或 MAU 门槛;而 Kimi 的 Modified MIT License 则有。

Kimi K2 vs. GPT-4o。 Nathan Lambert(Interconnects.ai)在评测 K2 Thinking 时指出,中国实验室“缺乏对常见用户行为的反馈循环”,而这是 OpenAI 和 Anthropic 多年来建立的 RLHF 数据优势。GPT-4o 的价格约为每百万 Token 2.50 美元/10 美元,比 Kimi K2.6 贵 3-4 倍,但其幻觉表现要好得多,在分布外指令遵循方面也更一致。特别是在智能体编程方面,Kimi K2.6 目前在 SWE-Bench Pro 上略高于 GPT-5.4,但该基准测试并不能代表所有任务类型。

对于成本敏感且你能控制冗长问题的高并发智能体编程,Kimi K2 是开源权重的首选。对于以事实可靠性为优先的广泛对话和研究工作,GPT-4o 或 Claude 仍然是更好的默认选择。

付费层值得吗?

kimi.com 的免费层确实非常受限。Moderato、Allegretto 和 Vivace 计划的配额尚未得到独立验证。Moonshot 也没有公布每个层级的具体 Token 数量。完整的 2M+ Token 上下文窗口被限制在付费层之后。对于生产用途,API 途径(直接来自 Moonshot 或通过 OpenRouter)更加透明:按 Token 定价,速率限制有文档说明,且模型访问权限完全相同。

Kimi K2.6 的价格为每百万输入/输出 Token 0.74 美元/4.66 美元(通过第三方聚合平台 OpenRouter;生产环境承诺请与 Moonshot 官方 API 核实),低于 GPT-4o、Claude Sonnet 和大多数前沿级模型。但冗长警告依然适用:如果 K2 在你的任务上的输出量是价格高出 3 倍的模型的 3-6 倍,那么经济效益就会发生逆转。对于重复输入,上下文缓存命中的成本约为每百万 Token 0.15 美元。

最佳用例(以及何时应避开)

在以下情况使用 Kimi: 你需要在自己的基础设施上部署开源权重模型,权重已在 HuggingFace 上发布,且 Modified MIT License 允许大规模商业微调(正如 Cursor 所展示的那样)。你正在运行智能体编程工作流,其中 SWE-Bench 性能比幻觉率更重要。你需要在生产规模下进行大上下文文档摄取,但不想承担 Claude Sonnet 的高昂价格。你想为特定任务微调一个强大的基础模型(受限于每月 2000 万美元的收入门槛)。

在以下情况避开 Kimi: 事实准确性不容妥协,Artificial Analysis 的 -11 知识指数与闭源模型相比是一个真正的差距。你需要简洁、可预测的输出,冗长问题需要明确的提示工程来控制。你为中文用户提供涉及政治相关主题的服务:NIST CAISI(2025 年 12 月)发现,在中文语境下约有 26% 的内容与中共论点一致,英文为 7%,在敏感政治话题上“在中文语境下受到高度审查”。你需要西方提供商的企业级 SLA、音频生成或原生图像合成。Kimi 不提供这些功能。

Modified MIT License 的商业条款:月收入接近 2000 万美元的产品必须展示 Kimi 模型名称,Cursor 事件证实了这一条款会被强制执行。

开始使用 Kimi

最快的途径是 kimi.com,需要手机验证。如需 API 访问,请在 platform.kimi.ai 注册,充值额度,并通过兼容 OpenAI 的端点(https://api.moonshot.cn/v1,Bearer Token 认证)进行查询。K2.6 也可以通过 OpenRouter 的 moonshotai/kimi-k2.6 获取。

对于自托管,K2.6 权重在 HuggingFace 上以 Modified MIT License 发布。1 万亿参数的模型需要庞大的基础设施;发布的权重中内置了 INT4 量化感知训练,降低了内存需求。服务配置可在 Moonshot 的 GitHub 上找到:github.com/MoonshotAI/Kimi-K2。提供 iOS 和 Android 应用程序。截至 2026 年 4 月,尚无浏览器扩展。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Kimi 相关的指南和文章。