

Elicit 是一款 AI 科研助手,能够通过语义而非仅仅是关键词来检索 1.38 亿篇学术论文。它可以将研究中的结构化数据提取到表格中,自动化文献筛选流程,并支持导出至 Zotero。主要用户群体为博士生和系统评价团队。
Elicit 是一款专为学术文献检索和数据提取打造的 AI 科研助手。它由非营利性 AI 安全研究组织 Ought 开发(该组织由前 Stanford Computation and Cognition Lab 研究员 Andreas Stuhlmüller 创立),并于 2023 年 9 月分拆为一家独立的公益公司。Elicit 解决的核心痛点是:学术研究人员平均需要花费四周时间手动筛选论文,才能完成一项系统评价。通过在包含 1.38 亿篇论文和 54.5 万项临床试验的数据库中运行基于自然语言的语义查询,Elicit 将这一筛选周期从数周缩短至数小时。
该工具的核心价值在于结构化提取:研究人员可以添加自定义列,同时从数十篇论文中提取样本量、干预措施描述、结果指标和方法学注释。每一个提取的数据点都会链接回源论文中高亮显示的段落,从而加快人工核对的速度。Elicit 还能生成自动化研究报告(Automated Research Reports),将表格导出为 CSV、BibTeX 和 RIS 格式,以便直接导入 Zotero、Mendeley 或 EndNote,并支持上传 PDF,以便在私人文档库中进行类似聊天的问答。付费版本提供高精度模式(High-Accuracy Mode),使用高级 LLM 后端处理复杂的提取任务。截至 2025 年 2 月,Elicit 在以 1 亿美元估值完成 2200 万美元 A 轮融资后,宣布其月活跃研究人员达到 40 万。
2026 年 4 月的 Elicit 究竟是什么
Elicit 并不是一个披着科研外衣的通用型 AI 聊天机器人。它是一款结构化的文献工作流工具。这一区别至关重要:当你输入查询时,Elicit 不会利用自身知识生成长篇大论。它会在 OpenAlex 和 Semantic Scholar 索引的语料库中进行检索,根据与你问题的语义相关性对论文进行排序,并从摘要和全文(如果可用)中提取指定字段。
其主打功能是提取表格(extraction table)。你可以从 35 个预设选项(人群、干预措施、样本量、研究设计、随访期、效应量)中定义列,或者通过自定义自然语言提示词(“这篇论文使用了什么统计方法来处理混杂因素?”)来定义列,Elicit 会在每一行中填充来自相应论文并附带引用的文本片段。最终生成的是一个可导出和分析的结构化矩阵,类似于研究助理阅读 40 篇论文后制作的内容,但生成时间只需几分钟,而不是几天。
系统评价(Systematic Review)工作流则更进一步:它增加了一个筛选阶段(包含 AI 建议理由的纳入/排除),生成符合 PRISMA 标准的流程图,并生成总结报告。正是这一流程吸引了临床研究人员、公共卫生团队和证据综合小组使用该平台。Elicit 在 2025 年 2 月的 A 轮融资公告中,将医疗保健、政策和制药列为学术界之外的核心拓展市场。
Elicit 与 Consensus 和 SciSpace 的定位对比
截至 2026 年 4 月,有三款工具主导着 AI 辅助学术研究领域。它们共享 Semantic Scholar 的底层论文语料库,但追求不同的工作流,且机制存在显著差异。
Consensus 专为快速验证主张而构建,而非系统性的数据收集。其核心机制是二元的“是/否共识计(Yes/No Consensus Meter)”,通过汇总相关研究的发现,在几秒钟内回答单一的研究问题。Consensus 还在结果旁边显示 SJR(SCImago Journal Ranking)分数和 SciScore 指标,为研究人员提供 Elicit 完全缺乏的期刊质量内置信号。Elicit 跨越数十篇论文构建多列提取表格,而 Consensus 则对单一科学主张给出快速结论。Consensus 的入门价格为 $20/mo,而 Elicit 为 $12/mo,且两款工具均不支持英语以外的语言。
SciSpace 采用 PDF 优先的方法。其核心优势在于解释单篇复杂的论文:上传一篇论文,让 AI 逐步解析方程式、解释统计表格,或用通俗易懂的语言总结晦涩的方法部分。SciSpace 的付费计划支持多达 50 个自定义提取列(Elicit 最多 10 个),包含内置的写作助手(Elicit 完全没有写作支持),并提供专门的引文生成器。其 $20/mo 的入门价格高于 Elicit,且免费计划在某些方面比 Elicit 更受限。SciSpace 的模块化界面将工具划分为多个面板,而 Elicit 的界面则极简且呈线性。机制上的选择归结为工作流的优先级:当你需要深入理解单篇论文时,使用 SciSpace;当你需要为正式综述从大量文献中提取一致的数据时,使用 Elicit。
“Elicit 的开发初衷并不是为你提供深度的分析和综合。它可能会遗漏人类专家能够捕捉到的研究之间的细微差别或复杂关系。但是,核对信息要比从头收集信息容易得多。” - Boris Nikolaev,研究员,Medium,2025
Elicit 内部的 AI 是如何运作的
Elicit 的搜索层使用向量嵌入将查询意图与论文摘要进行匹配,而不是依赖关键词共现。这就是为什么 Elicit 能够找到与你的查询词使用不同术语的相关论文,这在研究领域至关重要,因为同一概念在不同学科或不同历史时期往往有不同的名称。
提取列会对每篇论文运行单独的推理通道。对于每一个“论文-列”对,Elicit 会将相关的论文部分连同你的列定义一起发送给语言模型后端。模型提取最相关的片段,Elicit 则存储来源位置。在高精度模式(仅限付费版本)下,Elicit 会将需要复杂解释的列请求路由给能力更强的 LLM 后端。积分系统反映了这一点:简单的提取列成本很低,而高精度列每篇论文消耗的积分要多得多。
PDF 上传功能增加了一个检索增强生成层。当你与上传的论文对话时,Elicit 会检索与你问题最相关的段落,并将它们传递给 LLM,指示其仅根据文档进行回答。每个回答都会显示来源归属。这就是为什么在针对特定论文的问题上,Elicit 的引文准确率大大高于通用 AI 工具,尽管对于你计划发表的任何主张,它仍然需要人工核对。
研究人员持续关注的准确性与可重复性问题
Elicit 的营销宣传声称其提取准确率达到 80-90%。然而,2025 年发表的学术研究描绘了一幅更为复杂的画面,每位研究人员在将该工具用于正式工作之前都应了解这一点。
2025 年 6 月发表在 Cochrane Evidence Synthesis and Methods 上的一项比较研究(Bianchi 等人)分析了 Elicit 与人类审稿人在 20 项随机对照试验中的提取结果。结果显示:在研究的所有七个变量中,Elicit 提取的信息仅在 20.7% 的情况下与人类审稿人“完全一致”,在 45.7% 的情况下“部分一致”(缺失信息),而在 4.3% 的情况下存在主动“偏差”(数据错误)。关键在于,临床研究中最重要的单一变量“干预效果”的提取,有 95% 仅被评为部分一致。该研究得出结论:“必须由人类审稿人进行核对,以确保 Elicit 完整且正确地捕获了所有相关信息。”
另一项 Cochrane 研究(Lau 等人,2025)发现,Elicit 在文献检索中的平均敏感度约为 39.5%,这意味着该工具在全面检索中会遗漏大约 60% 的潜在相关论文。Elicit 的精确度较高,为 41.8%,但敏感度才是系统评价的关键。作者得出结论,Elicit“检索的敏感度不够高,无法取代传统的文献检索。”
“Elicit 应该作为研究的脚手架,而不是权威来源。用户需要接受指导,以审视 AI 的输出并理解其透明度限制,特别是在数据来源和搜索方法学文档方面。” - Deakin University Library,AI 工具评估指南,2025
其他已记录的限制包括:Elicit 无法从 PDF 中的图表、流程图或可视化数据表中提取信息。其检索过程无法以符合 PRISMA 标准的系统评价报告所需的结构化、文档化方式进行重现。该工具仅支持英语,限制了其在多语言研究环境中的实用性。
这些并不是避免使用 Elicit 的理由。它们是正确使用它的理由:将其作为筛选和加速层,而不是替代人工审查。了解该工具实际性能特征的研究人员能够持续从中获得价值;而对输出结果照单全收的研究人员则会引发下游问题。
Elicit 适合哪些人群
实证领域的博士生和研究人员是 Elicit 的主要用户群。如果你的研究涉及结构化数据(临床试验、实验研究、调查),Elicit 的提取表格对于初步筛选和数据收集具有真正的变革意义。生物医学、心理学、社会科学和机器学习领域的研究人员能获得最大价值。在术语随数十年文献演变的领域,Elicit 的语义搜索表现尤为出色。
临床研究、公共卫生和政策领域的系统评价和证据综合团队使用 Elicit 的 Pro 和 Team 版本来完成完整的系统评价流程:筛选、提取和报告生成。导出兼容 PRISMA 的文档的能力(工作流中内置了人工核对环节)使其非常实用,即使存在敏感度方面的限制。
在以下情况下请跳过 Elicit:如果你主要从事人文学科、法律或定性社会科学研究,这些领域的论文使用叙事推理而非结构化数据,Elicit 的提取表格几乎没有附加价值。如果你需要为正式的、可发表的系统评价提供全面、可重复的检索覆盖率,且不打算补充 PubMed、Scopus 或 Web of Science 中的传统数据库检索,请跳过它。如果你只是一个偶尔需要针对单一问题获得有科学依据的快速答案的普通用户,Consensus 会是更好的选择。如果你的研究语言不是英语,请跳过它。
免费版本每月两份报告的上限意味着,大多数尝试该工具的研究人员会在一个下午内触及天花板,并需要决定是否购买付费计划。每年计费的 $10/mo Plus 计划是大多数独立研究人员的最终选择。对于每月进行多项系统评价的团队来说,每年计费的 $42/mo Pro 计划则是合适的入门选择。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Elicit 相关的指南和文章。

Perplexity AI Tutorial: Maximize Your Research Workflows

Gemini Deep Research for a Thesis Literature Review in One Day (2026)

The Personal AI Productivity Stack (2026): One Tool Per Job, Nothing Extra

TAM SAM SOM Market Sizing With Perplexity: The Sourcing Pattern That Survives Pushback (2026)

The Perplexity Due-Diligence Prompt Library: 10 Prompts That Surface Red Flags (2026)
