Qwen3.6-27B 仅需 16.8 GB 显存即可提供接近前沿水平的编程性能,单张 RTX 4090 即可轻松运行,且表现超越了其 397B 的前代模型。整个开源权重系列均采用 Apache 2.0 许可,使其成为 2026 年商业使用许可最纯粹的中国大语言模型(LLM)。
2026 年 4 月 22 日,Alibaba 的 Qwen 团队发布了 Qwen3.6-27B。这是一款拥有 270 亿参数的稠密模型,在 SWE-bench Verified 上获得了 77.2% 的高分,在编程基准测试中超越了其前代 3970 亿参数的 MoE 模型,同时显存占用仅为 16.8 GB。这意味着它可以在单张消费级 RTX 4090 显卡上轻松运行。多年来系统追踪本地 LLM 性能的 Simon Willison 在发布当天对其进行了测试,并称其为“16.8GB 本地模型的杰出成果。” 仅凭 27B 模型在对编程智能体至关重要的基准测试中击败 397B 模型这一数据点,就足以让 Qwen 成为 2026 年 4 月最引人注目的开源权重模型。
更广泛的 Qwen 系列绝非小众项目。截至 2026 年初,Alibaba 报告称其在 Hugging Face 上的累计下载量已达 7 亿次,且 Qwen 的月下载量在 2025 年 10 月就已超越 Meta 的 Llama。仅在 2026 年 2 月,Qwen 就产生了 1.536 亿次下载,是 Meta、DeepSeek、OpenAI、Mistral 和 Nvidia 下载量总和的两倍多。您现在看到的,不仅是全球下载量最大的开源 AI 模型系列,同时也是一款生产级的托管 API 产品。
Qwen 概览(2026 年 4 月)
Qwen 系列涵盖了几个不同的产品层级。在消费者端,qwen.ai(前身为 chat.qwen.ai)提供免费的网页界面,可访问 Qwen3 系列模型,包括图像和视频理解、文档处理、网络搜索、工具调用以及代码工件(code artifacts)。在开发者端,DashScope / Alibaba Cloud Model Studio API 提供编程访问接口,Qwen-Turbo 的起步价为每百万输入 token $0.05。而支撑这两者的底层则是开源权重层:可从 Hugging Face 下载的 Apache 2.0 模型,您可以完全在自己的硬件上运行,无需向任何人付费,且可无限制地进行修改。
目前适用于大多数用例的开源权重旗舰模型是 Qwen3.6-27B(2026 年 4 月 22 日发布,Apache 2.0)。对于需要更大规模的团队,Qwen3.5-397B-A17B(MoE,Apache 2.0)是上一代旗舰,总参数量为 3970 亿,每个 token 激活 170 亿参数。对于边缘或移动端部署,Qwen3.5 小型系列最低可至 0.8B 参数,占用 3 GB 空间,目标硬件为 iPhone 15 Pro。对于追求极致性能的纯闭源 API 访问,Qwen3.6-Max-Preview(2026 年 4 月 20 日发布)凭借 1M token 的上下文窗口在六项编程基准测试中占据榜首,不过截至 2026 年 4 月 23 日,其 API 定价尚未公开敲定。
所有开源权重的 Qwen3+ 模型均支持混合思考/非思考模式切换:单个模型权重即可在每次请求时,于快速指令模式和扩展的思维链(chain-of-thought)推理模式之间切换。无需单独部署,该功能随 QwQ-32B(2025 年 3 月)引入,现已成为整个系列的标配。
Qwen 的核心优势
编程能力是其最显著的优势。Qwen3.6-27B 在 SWE-bench 上 77.2% 的得分并非孤立的基准测试胜利,早期的 Qwen3.6-35B-A3B MoE(2026 年 4 月 16 日发布)在同一基准测试中也获得了 73.4% 的成绩。专用的 Qwen-Coder 变体则更进一步:Qwen3-Coder-30B-A3B 专为需要编程专用检查点(checkpoint)而非通用指令模型的团队提供。Simon Willison 在 4 月 22 日的测试表明,在本地硬件上其读取速度约为 54 tokens/秒,生成速度约为 25 tokens/秒,完全满足交互式使用的实际需求。
多语言能力是其第二个结构性优势,并且这是在架构层面原生融入的,而非后期拼凑。所有 Qwen3 模型都在涵盖 119 种语言和方言的 36 万亿 token 上进行了训练。Qwen3.5 更是将此扩展到了 201 种语言。其 BBPE 分词器(tokenizer)使用了 151,669 个 token 的词表,大约是传统 BPE 词表的四倍,这意味着中日韩(CJK)字符的编码效率约为每个 token 1.5–1.8 个字符,而不是每个 token 1 个字符。对于使用日语、韩语或中文并按 token 支付 API 费用的团队来说,这种差异在账单上是清晰可见的。
Qwen-MT (Qwen3-MT) 模型是一款专用的翻译专家模型,采用 MoE 架构,覆盖 92 种语言,定价约为每百万 token $0.50。在 Alibaba 的基准测试中,人类评估员在 10 种主要语言的翻译表现上,认为 Qwen3-MT 优于 GPT-4.1-mini 和 Gemini-2.5-Flash。对于使用专有数据进行微调的组织而言,Apache 2.0 许可加上通过 Unsloth 提供的 QLoRA 支持(训练速度提升 2 倍,显存占用减少 70%),使得 Qwen3-8B 和 Qwen3-14B 成为非常实用的起点。
Qwen 的局限性与常见故障模式
在生产环境中,最严重的问题是本地推理栈中工具调用(tool calling)的可靠性。Qwen3 系列使用基于 XML 的工具调用格式,而大多数推理服务器预期的是 JSON 格式。这种不匹配需要手动配置聊天模板,无法自动完成。此外,尽管 Qwen 自己的模型卡片明确建议设置 presence_penalty=1.5 以防止思考模式下的重复循环,但 Ollama 会静默丢弃 presence_penalty 和 repetition_penalty 参数。该问题记录在 Ollama GitHub 的 #14493 号 issue 中,获得了社区的大量点赞,但截至 2026 年 4 月底仍未解决。
“Ollama 中的三个错误使其智能体功能完全失效。API 在不报错的情况下接收了惩罚参数并将其静默丢弃,尽管模型卡片明确建议使用 presence_penalty=1.5 来防止思考过程中的重复循环。”——Ollama GitHub issue #14493,2026 年
量化质量是第二个实际的故障模式。社区共识是:Q4_K_M 是最低可行级别;对于任何对可靠性要求较高的任务,应使用 Q8。2026 年 4 月的一个 CUDA 13.2 错误导致 Qwen3.x 模型的 4-bit 及更低精度的 GGUF 量化版本输出乱码。在 e5m2 下的 KV 缓存量化会导致重复循环。这些都是 2026 年 4 月期间活跃存在的问题,建议关注 r/LocalLLaMA 社区动态,而不是依赖默认设置。
API 区域碎片化给非中国用户带来了摩擦。免费层仅限新加坡区域。新加坡、美国弗吉尼亚和北京的 API 密钥不可互换。中国大陆(Qwen-Max 输入为 $0.345/M)与新加坡($1.60/M)之间的价格差异高达 4.6 倍,这在商业上是合理的,但却一直是社区困惑的根源。
Qwen 对比 DeepSeek-V3/R1 与 Llama 4
许可是大多数团队首先应考虑的机制差异。Qwen3+ 开源权重采用 Apache 2.0 许可,完全允许商业使用,没有基于规模的限制,没有使用上限,也无需强制署名。Meta 的 Llama 许可包含在超过特定商业阈值时激活的限制,并屡次引发法律上的不确定性。DeepSeek 使用自定义许可,需要更仔细地阅读。对于超大规模或白标(white-label)部署,Qwen 的 Apache 2.0 许可是这三者中最纯粹的。
DeepSeek-V3.2 运行 6850 亿总参数,每个 token 激活 370 亿参数,并使用多头潜在注意力(MLA)来实现比 Qwen 的分组查询注意力(GQA)更激进的 KV 缓存压缩,这在超长上下文中具有真正的效率优势。更大的架构差异在于推理:DeepSeek 维护独立的 R1(推理)和 V3(指令)分支。而 Qwen3 的混合切换功能允许单个权重文件处理这两种模式,只需一次部署,无需分支。
Llama 4(Scout:总参数 1090 亿,激活 170 亿)每个 token 激活 2 个较大的专家模型,而 Qwen 则是 8 个较小的专家模型,这是一种更常规的设计。Llama 的分词器在英语上具有竞争力,但在中日韩(CJK)字符上的效率不如 Qwen 拥有 151K 词表的 BBPE。对于亚洲语言市场,分词器的差异直接体现在每个 token 的 API 成本上。Qwen3.5 在训练中覆盖了 201 种语言;而 Llama 4 则主要针对英语进行了优化。
审查机制:模型权重与 API 的差异
2025 年 1 月,研究员 @xlr8harder 在没有 Alibaba API 层的情况下,对本地运行的开源中国 AI 模型进行了数百个政治敏感问题的测试。关于 Qwen2.5-72B 的发现非常明确:
“我使用涵盖各种主题的数百个问题,对两个开源中国 AI 模型进行了偏见和审查测试,并分享一些初步观察结果:最让我感兴趣的是:qwen 2.5 72b 基本上没有审查,而 deepseek-v3 显然有。”——@xlr8harder,X/Twitter,2025 年 1 月 27 日
这与托管 API 的行为形成了鲜明对比。研究员 leonardlin 于 2024 年 6 月在 Hugging Face 博客上撰文,分析了经过“去对齐”(abliteration,一种从模型权重中移除拒绝向量的技术)处理后的 Qwen2-7B-Instruct。研究结果记录了一种依赖于语言的不对称性:在中文环境下运行的模型,在回答有关新疆拘留营的问题时,会给出明确符合中共立场的叙述,将所谓的拘留营描述为敌对势力的捏造。而同一个模型在英文环境下运行时则直接拒绝回答。这并非对两种语言施加了对称的审查。这是中文环境下的宣传与英文环境下的沉默,是两种不同类型的内容压制在同时、反向运作。
实际结论是:模型权重比托管 API 要纯粹得多。Alibaba 的 API 层应用了训练后的对齐控制,而这些控制并不存在于下载的模型权重中。如果您正在构建的产品需要以任何事实准确性来讨论中国政治历史、台湾、新疆或天安门广场,解决方案是针对您打算使用的特定模型代系进行本地测试,并理解从内容策略的角度来看,API 和本地模型并非同一产品。社区维护的 Dolphin Qwen2 系列为需要它的应用程序完全移除了对齐层。请注意,@xlr8harder 的测试是针对 Qwen2.5 而非 Qwen3 进行的;截至 2026 年 4 月,新一代模型尚未采用同等方法进行系统性的重新测试。
Qwen 适合哪些用户
最明确的适用对象是拥有 RTX 4090 或 A100 的开发者,他们希望完全在本地硬件上运行接近前沿水平的编程性能,无需支付 API 费用,且在允许无附加条件商业使用的许可下进行。Qwen3.6-27B 的发布使这一局面与半年前截然不同。在 2026 年 4 月之前,运行一个能与顶级托管 API 竞争的模型,要么需要多 GPU 设置,要么必须接受显著的性能妥协。而“在 4090 上运行 27B”的故事极大地填补了这一差距。
第二个明确的适用对象是向亚洲语言市场扩张的团队。Qwen 的训练语料库(36 万亿 token,119 种语言)、分词器设计以及专用的 Qwen-MT 翻译模型都是为这一用例量身定制的,这是英语优先模型所不具备的。分词器效率带来的单 token 成本优势是实实在在的,并且在规模化应用时会产生复利效应。
第三个适用对象是需要 Apache 2.0 以获得法律清晰度的组织、白标产品、无法接受使用限制的企业采购,或者 Meta 的 Llama 许可条款或 DeepSeek 的自定义许可会产生摩擦的项目。Qwen3+ 是目前可用的、许可最纯粹的接近前沿水平的开源模型系列。
如果您的产品需要通过托管 API 在中国政治话题上表现出可靠、经过测试的行为,那么 Qwen 并不适合。如上所述的审查细微差别意味着您需要清楚自己处于哪种部署模式并对其进行过测试。如果您需要开箱即用的无缝 OpenAI API 兼容性,它同样不适合,因为工具调用格式的差异、思考模式参数以及 Ollama 的集成错误意味着存在实际的设置摩擦。对于基础设施预算紧张且需要一个在本地栈中“开箱即用”的模型的团队来说,与拥有更成熟本地推理工具的模型相比,他们可能会发现集成工作带来的负担超过了性能上的收益。
2025 年 3 月发布的 QwQ-32B 以 320 亿参数匹敌了 DeepSeek-R1(6710 亿参数),并推动 Alibaba 股价单日飙升 8%,这为后续发展奠定了基调:不断发布新版本,压缩前沿性能所需的计算资源和成本。Qwen3.6-27B 便是最新的例证。一个 27B 模型,在您的 GPU 上运行,成本为 $0,采用 Apache 2.0 许可。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Qwen 相关的指南和文章。

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Claude Code vs Cursor vs Codex vs Devin vs Replit Agent 3: 2026 Scorecard
