
OpenEvidence 是一个专为经过认证的医生提供的免费 AI 医学搜索平台。它综合了来自 NEJM、JAMA 和 Cochrane 的同行评审证据,在诊疗现场解答临床问题,每天有 40% 的美国医生在使用。
OpenEvidence 是一款专为执业临床医生打造的 AI 驱动型医学搜索引擎,旨在取代床旁手动搜索 PubMed 和缓慢翻阅 UpToDate 的繁琐过程。该平台由哈佛大学博士、Kensho(被 S&P Global 以 5.5 亿美元收购)前创始人 Daniel Nadler 与哈佛大学机器学习研究员 Zachary Ziegler 于 2022 年共同创立,能够在几秒钟内将经过同行评审的医学文献综合成带有引用的自然语言答案。它对任何经过 NPI 认证的美国医生免费开放,其资金来源于制药和医疗器械广告,而非订阅费用。
截至 2026 年 5 月,其核心产品拥有两种模式。Quick Consult 可处理大多数诊疗现场问题,在 10 秒内返回基于证据且带有直接期刊引用的答案。DeepConsult 于 2025 年 7 月推出,是一个自主 AI 推理代理,可在几分钟内交叉引用多项研究并提供全面的多源综合信息,它更像是一份文献综述,而不仅仅是检索。两者均运行在来自 JAMA Network、NEJM Group、NCCN、ACC、Cochrane 和 AAFP 的授权全文内容之上。该平台支持 Web、iOS 和 Android,提供原生小组件以便在床旁快速访问,并提供用于机构集成的 API。第三款产品 Coding Intelligence 于 2026 年 3 月推出,旨在帮助医生识别病历中编码不足的诊断,并挽回遗漏的报销款项。
2026 年 5 月的 OpenEvidence 究竟是什么
OpenEvidence 处于医学文献检索与 AI 综合的交汇点。它不是聊天机器人、文档工具或鉴别诊断引擎。它是一个检索增强生成(RAG)系统,基于授权的同行评审内容进行训练和事实核查,并以医生认证作为访问门槛。
该平台的内容合作关系使其有别于应用于医学领域的通用 AI 工具。2025 年 6 月 5 日宣布的 JAMA Network 协议,赋予了 OpenEvidence 对 JAMA、JAMA Network Open 以及所有 11 种 JAMA 专科期刊(包括全文和多媒体)的授权访问权限。同时达成的 NEJM Group 协议涵盖了自 1990 年以来 NEJM、NEJM Evidence、NEJM AI、NEJM Catalyst 和 NEJM Journal Watch 的所有内容。这些不是网络抓取的摘要,而是授权的全文集成。对于一款免费工具来说,这样的内容储备确实非同寻常。
按照任何医疗软件的标准来看,其增长速度都异常迅猛。2026 年 3 月 10 日,该公司在 24 小时内达到了 100 万次临床咨询。截至 2026 年初,它每月处理来自 10,000 多家医院和医疗中心的 757,000 名认证医生的超过 2000 万次咨询。该 AI 在 2025 年的 USMLE 考试中达到了 100% 的准确率(高于 2023 年的 90%),尽管委员会考试表现与真实的亚专科准确率是两码事(详见“痛点与担忧”部分)。
“OpenEvidence 比 UpToDate 更新更及时。而且无论如何它都更有用,因为它是交互式的,你可以向它提问,并获得关于特定医疗[病例]的非常具体的答案。” —— Antonio Jorge Forte 博士(医学博士),Mayo Clinic MayoExpert 主任,2025 年
OpenEvidence 与 UpToDate 和 Glass Health 的定位对比
临床决策支持领域有两个有意义的比较基准:长期占据机构主导地位的 UpToDate,以及新兴的 AI 原生挑战者 Glass Health。OpenEvidence 占据了与两者截然不同的定位。
UpToDate (Wolters Kluwer) 是一个由人类编写的参考数据库,而非 AI 综合工具。其内容由专家编辑委员会撰写并进行同行评审,组织成结构化的主题专著,涵盖药物剂量、鉴别诊断算法和详细的亚专科内容。医生订阅费用约为每年 600 美元(通常由医院许可证覆盖)。UpToDate 的优势在于其可审计性和深度:每一个主张都可以追溯到具名的专家编辑。其弱点在于格式。它是一个供你阅读的参考资料,而不是一个供你提问的系统。它没有自然语言界面,没有跨论文的综合能力,也无法回答针对特定患者的新型组合问题。对于注重速度的全科床旁问题,OpenEvidence 速度更快,且引用同样详实。而对于复杂的亚专科深度问题,UpToDate 的精选编辑内容仍然优于 AI 综合。
Glass Health 是一个 AI 原生临床平台,它采取了不同的方法:推理优先而非检索优先。OpenEvidence 回答的是“文献对 X 有何看法”,而 Glass Health 回答的是“鉴于这些症状,可能的诊断是什么,计划应该是什么”。它生成鉴别诊断、临床计划,并在 Max 层级(200 美元/月)直接与 Epic、eClinicalWorks 和 Athena 集成,以实现 EHR 工作流自动化。Glass Health 没有 OpenEvidence 所拥有的 JAMA/NEJM 期刊授权,而且它不是免费的。对于需要诊断支持和临床规划而非文献检索的医生来说,Glass Health 是更好的选择。而对于零成本的基于文献的证据检索,OpenEvidence 毫无悬念地胜出。这些工具越来越显得互补而非竞争:许多临床医生两者都在使用。
有关专注于环境文档而非证据检索的 AI 工具的相关比较,请参阅 Abridge、Suki AI 和 Nabla。对于另一种具有不同架构的临床推理 AI,Hippocratic AI 侧重于面向患者的健康沟通,而非医生临床支持。
OpenEvidence 内部的 AI 究竟是如何运作的
OpenEvidence 是一个 RAG 系统,而不是一个在没有事实核查的情况下部署的微调医学模型。每一个答案都是基于授权的全文内容生成的,而不是基于冻结的训练集。这种区别对于准确性和避免幻觉至关重要:系统无法自信地断言其授权语料库中不存在的内容,并且每一个主张都会显示其来源引用,以便临床医生进行验证。
Quick Consult 处理直接的临床问题,从授权语料库中检索相关部分,并生成带有引用的综合答案,通常在 10 秒内完成。DeepConsult 在架构上有所不同:它作为一个自主代理运行,将查询分解为子问题,执行多次检索,并在多步推理循环中综合各项研究的发现。这需要几分钟的时间,并产生一份篇幅更长、更细致入微的输出,堪比初级住院医师的文献综述。
医生认证通过国家提供者标识符(NPI)查询强制执行。该平台不通过此机制验证非美国临床医生,这给国际用户带来了访问阻力,也意味着 757,000 的用户数字几乎完全代表了美国医生群体。
“过去一周我一直在使用 OpenEvidence——它太棒了!能够快速缩小结果范围,并找到我自己用 Google/PubMed 搜索无法找到的信息。” —— John Lee 博士(医学博士),哈佛医学院教员,App Store,2025 年
医生们不断提出的痛点与担忧
OpenEvidence 的增长轨迹毋庸置疑,但该产品并非没有真正的局限性。在评论和临床反馈中,有几个问题反复出现。
规模化下的服务器可靠性。 每月处理超过 2000 万次咨询,该平台在临床高峰时段经历过崩溃和超时。多位 App Store 评论者描述,在繁忙的白天时段,提问 1-3 个问题后会话就会中断。在 OpenEvidence 目前的运营规模下,这是一个结构性工程问题,而不是一个小故障。
亚专科准确率差距。 OpenEvidence 高调宣传其 100% 的 USMLE 成绩。2025 年 11 月发表在 medRxiv 上的一篇预印本论文(Jagarapu 等人,doi: 10.64898/2025.11.29.25341091)在 MedXpertQA 委员会考试数据集的复杂亚专科问题上测试了该平台,发现 DeepConsult 的准确率为 41%,Quick Consult 为 34%。作为背景,在同一数据集上测试的 11 个领先的大型语言模型得分为 14-46%,因此这一差距反映了整个领域的难题,而非 OpenEvidence 特有的失败。但这确实意味着,对于处理边缘病例的亚专科研究员或主治专科医生来说,该工具的可靠性远低于其全科表现所暗示的水平。
广告模式。 OpenEvidence 的免费访问由制药和医疗器械广告提供资金,其 CPM 为 70-150 美元,远高于典型的数字广告费率。该公司坚称临床内容和广告是严格分离的。包括医疗信息学者和独立时事通讯(Out-of-Pocket、Krafty Librarian)在内的批评者指出,Practice Fusion 案件仍然是一个警示参考:该公司因在其 EHR 中嵌入阿片类药物处方警报而被罚款 1.45 亿美元,这些警报在干预前被触发了 2.3 亿次。OpenEvidence 不是 Practice Fusion,该公司的广告政策明确禁止广告影响临床答案。人们的担忧是结构性的:在医生决定治疗方案的精确时刻投放制药广告,造成了一种在任何其他医学参考语境中都不寻常的接近性。
提示词敏感性。 用户指出,模糊或表述不佳的临床问题会返回肤浅的答案。该平台对精确的临床语言有更好的反馈,这有利于经验丰富的医生,而不是仍在培养提问技巧的医学生或住院医师。
它不具备的功能。 OpenEvidence 不计算药物剂量、不检查药物相互作用、不生成鉴别诊断,也不生成临床文档。这些功能需要单独的工具。对于需要集成临床工作流而非文献检索的医生来说,这意味着 OpenEvidence 是与其他工具并列使用,而不是取代它们。
OpenEvidence 适合谁,谁又该使用其他工具
OpenEvidence 最适合初级保健医生、住院医师、普通内科医生和急诊科医生,他们需要在诊疗现场或附近快速获得带有引用的全科临床问题答案。它非常适合作为临床问题工作流的第一步:向 OpenEvidence 提问,获取带有引用的文献综合,然后根据需要进行验证或深入挖掘。免费的定价消除了美国医生的所有访问障碍,这也是其普及如此之快的原因。
医学生和住院医师受益于该工具的证据基础,特别是在培训期间建立文献意识方面。引用的透明度显示了主张的来源,使其具有教育意义,而不仅仅是生成答案。
该工具不太适合在专科文献边缘处理复杂病例的亚专科主治医生,2025 年 12 月的准确率数据表明在这方面存在明显的可靠性差距。对于合规或伦理团队对临床决策附近的制药广告有顾虑的机构,或者无法完成 NPI 认证的非美国临床医生来说,它也不是合适的工具。
需要药物剂量、相互作用或鉴别诊断支持的临床医生应将 OpenEvidence 与专用工具结合使用,而不是将其视为完整的临床决策支持解决方案。对于专门专注于临床推理和诊断规划的 AI 工具,Glass Health 填补了 OpenEvidence 刻意留下的空白。对于具有不同权衡的通用医疗 AI,Hippocratic AI 侧重于面向患者的健康沟通,而非医生临床支持,这是医疗 AI 技术栈的不同部分。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 OpenEvidence 相关的指南和文章。

SOAP Notes to Patient Summary With ChatGPT: A HIPAA-Safe Pattern (2026)

Gemini Deep Research for a Thesis Literature Review in One Day (2026)

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)

Google vs OpenAI vs Anthropic Agents: The May 2026 Platform Showdown
