

AgentQL 是由 TinyFish 开发的 Web 自然语言查询层。开发者可以使用纯英语编写数据查询,而无需使用脆弱的 CSS 选择器,AgentQL 的 AI 引擎会在任何实时网页上解析这些查询,并返回类型化的结构化数据。
AgentQL 是一个查询语言和 API 平台,用于从网页中提取结构化数据,而无需编写 CSS 选择器、XPath 或正则表达式。AgentQL 由成立于 2024 年的帕洛阿尔托初创公司 TinyFish 开发,它允许开发者用纯英语描述他们想要的数据(例如:{ product_name, price, in_stock }),其 AI 引擎会将该描述与任何实时页面上的实际元素进行匹配。结果将以类型化的结构化 JSON 格式返回,可直接用于 AI 代理或数据管道。TinyFish 于 2025 年 8 月筹集了 4700 万美元的 A 轮融资,由 ICONIQ Capital 领投,旨在将该平台扩展到大规模的企业级 Web 自动化领域。
AgentQL 提供 Python SDK、JavaScript SDK 和 REST API。这些 SDK 与 Playwright 集成以实现全面的浏览器控制,支持需要身份验证的页面、JavaScript 渲染的 SPA(单页应用)以及包括无限滚动在内的分页内容。名为 AgentQL Debugger 的 Chrome 扩展程序允许开发者实时针对活动页面编写和测试查询。该平台还支持 PDF 解析、在页面布局发生增量变化时自适应的自愈查询,以及与 LangChain、LlamaIndex、LangFlow、Dify、AgentStack、MCP (Model Context Protocol) 和 Zapier 的集成。免费的 Starter 层级每月为团队提供 50 次 API 调用以评估该工具;每月 $99 的 Professional 计划包含 10,000 次调用和 500 小时的远程浏览器时间。
AgentQL 在 2026 年 5 月的实际功能
AgentQL 解决的核心问题是选择器的脆弱性。传统的网络爬虫依赖于 CSS 类和 HTML ID,而网站所有者可能会在没有警告的情况下更改这些内容。当网站重新设计时,每一个手动编写的选择器都会失效。AgentQL 的方法是完全跳过选择器。你无需定位 .product-price__value,只需编写 { price },AI 就会根据页面的语义内容解析该查询。由于查询针对的是含义而非标记,因此它能自动适应增量式的布局变化。
AgentQL 的查询语法受到 GraphQL 的启发:你定义所需数据的形状,结果就会与该形状匹配。嵌套对象、数组和可选字段都能按预期工作。对于提取之外的 Web 自动化,Playwright SDK 支持通过描述点击元素(无需选择器)、填写表单以及导航多步流程。这正是 AgentQL 对需要与 Web 交互(而不仅仅是读取)的 AI 代理如此有用的原因。
REST API 选项处理从公共页面提取数据的常见情况,无需启动浏览器。它接收一个 URL 和一个查询,并返回结构化的 JSON。对于需要身份验证的页面或需要 JavaScript 渲染的网站,则由 Playwright SDK 接管。PDF 提取通过相同的查询语言处理,包括 PDF 内部的表格。Chrome 调试器扩展允许开发者在活动的浏览器标签页上迭代查询,与在开发者控制台中编写选择器相比,这大大缩短了反馈循环。
AgentQL 于 2024 年 8 月 20 日在 Product Hunt 上公开发布,以 723 张赞成票同时赢得了当日最佳产品第一名和当周最佳产品第一名。在发布当天,一位开发者指出创建帐户只能使用 Google SSO。团队在同一天就发布了 GitHub SSO,这种响应速度奠定了 TinyFish 处理开发者反馈的基调。整整一年后,即 2025 年 8 月 20 日,TinyFish 宣布了 4700 万美元的 A 轮融资,以将平台扩展到企业级部署。
"AgentQL 可能是迄今为止我用过的最简单的 Web 数据提取工具。" - Shawn Pang, Product Hunt, 2024 年 8 月 20 日
"你的查询越具体,你的响应就会越准确、越一致。" - Andrew Chen (TinyFish 团队), Product Hunt, 2024 年 8 月 20 日
AgentQL 与 Firecrawl 和 Stagehand 的定位对比
Firecrawl 和 AgentQL 表面上看起来很相似,但解决的是不同的问题。Firecrawl 是一个抓取优先、输出给 LLM 的工具:你给它一个 URL,它会以干净的 Markdown 或 JSON 格式返回整个页面内容,准备好输入到 LLM 上下文窗口中。它擅长为 RAG 管道或文档搜索摄取整个网站。AgentQL 是一个查询优先、即时结构化的工具:你准确定义所需的类型化字段,它只从任何页面(包括经过身份验证和动态渲染的页面)提取这些字段。Firecrawl 在全页摄取方面速度更快;而 AgentQL 在关注数据模式的结构化数据提取方面更加精确。
Firecrawl 的开源核心(MIT 许可证)也是一个显著的区别。想要自托管或检查提取管道的开发者可以使用 Firecrawl。AgentQL 是一个封闭的 API,其提取模型不可用于自托管。Firecrawl 的付费计划起价为每月 $16。AgentQL 的 Professional 计划为每月 $99。对于预算有限且需要 LLM 就绪内容的团队来说,Firecrawl 通常是赢家。对于构建需要从布局不断变化的网页中获取精确类型化输出的代理的团队来说,AgentQL 具有优势。
由 Browserbase 开发的 Stagehand 是一个浏览器自动化框架,专为需要对 Web 执行操作(而不仅仅是读取)的 AI 代理而构建。Stagehand 使用执行/提取/观察循环,在 Playwright 之上为代理提供了一个推理层。AgentQL 也通过其 Playwright SDK 支持 Web 交互,但其查询语言的范围更严格地限定在提取上。Stagehand 对于复杂的多步代理工作流来说更广泛、更灵活;AgentQL 对于可重复的数据提取任务来说更具结构化和可预测性。Stagehand 是开源的(MIT);Stagehand 的生产部署需要 Browserbase,这增加了成本。对于纯粹的提取用例,AgentQL 独立的 API 更易于集成。
Apify 采用了第三种方法:一个包含数千个针对特定网站(LinkedIn、Amazon、特定数据源)的预构建“Actors”的市场,加上一个内置代理管理、调度和反机器人处理的云执行环境。AgentQL 是一个原语层,而不是一个市场。你使用 AgentQL 的查询语言构建自己的提取逻辑;没有预构建的特定网站爬虫。Apify 在具有现有 Actors 的已知目标上扩展性更好。AgentQL 在没有预构建爬虫的任意页面上具有更好的泛化能力。
代理循环的实际情况
开发者最常采用的模式是:安装 Python SDK,使用 API 密钥进行身份验证,启动 Playwright 浏览器会话,导航到页面,并使用查询字符串调用 page.query_data()。该调用返回一个与查询形状匹配的 Python 字典。对于单个页面,整个提取过程只需 10-15 行代码;扩展到多页抓取需要添加导航逻辑,但提取调用在每个页面上都保持不变。
对于 LangChain 用户,AgentQL 提供了原生的一流工具集成。代理使用 URL 和查询调用 AgentQL 工具,该工具将结构化数据直接返回到代理的响应链中。LlamaIndex 的集成工作原理类似。对于已经运行 LangChain 代理的团队来说,将 AgentQL 添加到管道中只需一个下午的工作量。
对于公共页面,REST API 路径甚至更简单:只需一个包含 URL 和查询的 HTTP POST 请求,无需设置浏览器。这非常适合不需要完整浏览器环境的无服务器函数或轻量级数据作业。代价是重度依赖 JavaScript 的 SPA 可能无法完全渲染,并且需要身份验证的页面超出了 REST API 的处理范围。
Chrome 调试器扩展显著改变了迭代工作流。开发者无需编写查询、运行脚本、检查输出并进行调整,而是直接在浏览器中针对活动页面编写查询并实时查看结果。这使得每次循环的迭代时间从几分钟缩短到几秒钟。这是 AgentQL 工具集中最被低估的部分。
工作流中可能遇到阻碍的地方:对于具有激进反机器人检测的网站所需的隐身模式,在 AgentQL 自己的文档中被标记为实验性功能。它可能不适用于所有网站,并且在激活时会减慢提取速度。针对受 Cloudflare 或 Akamai 保护的网站的团队将遇到失败,这需要在 AgentQL 堆栈之外进行手动代理配置,或者切换到 Apify 或 Bright Data 以获取反机器人基础设施。
AgentQL 是为谁构建的
AgentQL 最适合构建 AI 代理或数据管道的开发者,这些开发者需要定期从网页中提取类型化的结构化数据。当目标网站更新其 HTML 时,无选择器的方法可节省数周的维护工作。LangChain 和 LlamaIndex 的集成使其成为已经处于 LLM 代理生态系统中的团队的自然选择。对于运行竞争对手价格监控的电子商务团队来说,自愈查询行为意味着网站重新设计不会立即破坏整个提取管道。
酒店、旅游和零售行业的企业团队是 TinyFish 专门针对的用例。A 轮融资材料描述了酒店代理从数千个缺乏 API 的小型酒店网站汇总库存,以及旅游公司在竞争对手网站上运行实时定价监控。这些都是高容量、高价值的提取作业,维护每个网站的爬虫成本很高,而 AgentQL 的泛化优势在大规模应用时会成倍增加。
具有 Playwright 经验的开发者会发现学习曲线极低。查询语言非常简单,不到一小时即可上手,并且游乐场环境允许初学者在不编写代码的情况下进行探索。
AgentQL 不是什么
AgentQL 不是一个全页 LLM 摄取工具。如果你需要抓取整篇文章、文档网站或博客以进行 RAG 或 LLM 训练,Firecrawl 的 Markdown 输出会更合适。AgentQL 提取特定的结构化字段;它不返回用于 LLM 消费的原始页面内容。
对于高容量提取,它不是一个廉价的选项。Starter 层级每月的 50 次调用仅供评估使用。在 Professional 定价(每月 $99,包含 10,000 次调用)下,超出配额的繁重工作负载将产生每次调用 $0.015 的超额费用。每月 100,000 次调用仅超额费用就超过 $1,500。以这种规模运行的团队应评估 Enterprise 定价,或考虑使用 Crawl4AI 等自托管替代方案,或结合本地运行的 LLM 使用 Playwright 进行提取。
它不是针对具有激进反机器人保护的网站的解决方案。实验性的隐身模式被明确指出是不可靠的。没有代理基础设施而针对此类网站的团队将被屏蔽。AgentQL 不包含 Apify 捆绑到其平台中的代理轮换、住宅代理或验证码解决基础设施。
而且它不是开源的。需要检查提取模型、为数据隐私进行自托管或避免供应商锁定的开发者,需要转而考虑 Firecrawl、Stagehand 或 Crawl4AI。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 AgentQL 相关的指南和文章。

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

How AI Agents Work: Architecture & Implementation Guide (2025)

AI Agents for Business: What They Actually Are and 12 Things You Can Automate Today

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
