Saltar al contenido principal
Vantaige
AgentQL screenshot
AgentQL logo

AgentQL

Freemium

AgentQL es una capa de consulta en lenguaje natural para la web, desarrollada por TinyFish. Los desarrolladores escriben consultas de datos en inglés sencillo en lugar de selectores CSS frágiles, y el motor de IA de AgentQL las resuelve en cualquier página web en vivo, devolviendo datos estructurados y tipados.

Funciones:API

AgentQL es un lenguaje de consulta y una plataforma API para extraer datos estructurados de páginas web sin escribir selectores CSS, XPath o expresiones regulares. Desarrollado por TinyFish, una startup de Palo Alto fundada en 2024, AgentQL permite a los desarrolladores describir los datos que desean en inglés sencillo (por ejemplo: { product_name, price, in_stock }) y su motor de IA asocia esa descripción con los elementos reales en cualquier página en vivo. El resultado se devuelve como un JSON estructurado y tipado, listo para usarse en un agente de IA o en un flujo de datos. TinyFish recaudó $47 millones en una ronda de financiación Serie A en agosto de 2025, liderada por ICONIQ Capital, para escalar la plataforma hacia la automatización web empresarial a gran escala.

AgentQL se distribuye como un SDK de Python, un SDK de JavaScript y una REST API. Los SDK se integran con Playwright para un control total del navegador, admitiendo páginas autenticadas, SPA renderizadas con JavaScript y contenido paginado, incluido el desplazamiento infinito. Una extensión de Chrome llamada AgentQL Debugger permite a los desarrolladores escribir y probar consultas en páginas en vivo en tiempo real. La plataforma también admite el análisis de PDF, consultas de autorreparación que se adaptan cuando los diseños de página cambian de forma incremental, e integraciones con LangChain, LlamaIndex, LangFlow, Dify, AgentStack, MCP (Model Context Protocol) y Zapier. El nivel gratuito Starter ofrece a los equipos 50 llamadas a la API al mes para evaluar la herramienta; el plan Professional de $99/mes incluye 10,000 llamadas y 500 horas de tiempo de navegador remoto.

Lo que realmente hace AgentQL en mayo de 2026

El problema central que resuelve AgentQL es la fragilidad de los selectores. Los web scrapers tradicionales dependen de clases CSS e ID de HTML que los propietarios de los sitios cambian sin previo aviso. Cuando un sitio se rediseña, todos los selectores escritos a mano se rompen. El enfoque de AgentQL es omitir los selectores por completo. En lugar de apuntar a .product-price__value, escribes { price } y la IA resuelve esa consulta frente al contenido semántico de la página. Debido a que la consulta se centra en el significado en lugar del marcado, sobrevive automáticamente a los cambios incrementales de diseño.

La sintaxis de consulta de AgentQL está inspirada en GraphQL: defines la forma de los datos que deseas y el resultado coincide con esa forma. Los objetos anidados, las matrices y los campos opcionales funcionan como se espera. Para la automatización web más allá de la extracción, el SDK de Playwright admite hacer clic en elementos por descripción (sin necesidad de selector), completar formularios y navegar por flujos de varios pasos. Esto es lo que hace que AgentQL sea útil para los agentes de IA que necesitan interactuar con la web, no solo leerla.

La opción de la REST API maneja el caso común de extraer datos de páginas públicas sin iniciar un navegador. Toma una URL y una consulta, y devuelve un JSON estructurado. Para páginas autenticadas o sitios que requieren renderizado de JavaScript, el SDK de Playwright toma el control. La extracción de PDF se maneja a través del mismo lenguaje de consulta, incluidas las tablas dentro de los PDF. La extensión del depurador de Chrome permite a los desarrolladores iterar sobre consultas en una pestaña del navegador en vivo, lo que acorta considerablemente el ciclo de retroalimentación en comparación con escribir selectores en una consola de desarrollo.

AgentQL se lanzó públicamente en Product Hunt el 20 de agosto de 2024, ganando tanto el #1 Product of the Day como el #1 Product of the Week con 723 votos a favor. El día del lanzamiento, un desarrollador señaló que solo estaba disponible el SSO de Google para la creación de cuentas. El equipo implementó el SSO de GitHub el mismo día, un tiempo de respuesta que marcó la pauta de cómo TinyFish maneja los comentarios de los desarrolladores. Exactamente un año después, el 20 de agosto de 2025, TinyFish anunció la Serie A de $47 millones para expandir la plataforma hacia implementaciones empresariales.

"AgentQL es probablemente la herramienta de extracción de datos web más fácil que he usado en mi vida". - Shawn Pang, Product Hunt, 20 de agosto de 2024
"Cuanto más específicas sean tus consultas, más precisas y consistentes serán tus respuestas". - Andrew Chen (equipo de TinyFish), Product Hunt, 20 de agosto de 2024

Dónde se sitúa AgentQL frente a Firecrawl y Stagehand

Firecrawl y AgentQL parecen similares a simple vista, pero resuelven problemas diferentes. Firecrawl es una herramienta centrada en el rastreo con salida para LLM: le das una URL y devuelve el contenido completo de la página como Markdown o JSON limpio, listo para alimentar la ventana de contexto de un LLM. Destaca en la ingesta de sitios enteros para flujos de RAG o búsqueda de documentos. AgentQL es una herramienta centrada en la consulta y la estructura inmediata: defines exactamente qué campos tipados necesitas y extrae solo esos de cualquier página, incluidas las autenticadas y las renderizadas dinámicamente. Firecrawl es más rápido para la ingesta de páginas completas; AgentQL es más preciso para la extracción de datos estructurados donde el esquema es importante.

El núcleo de código abierto de Firecrawl (licencia MIT) también es una diferencia significativa. Los desarrolladores que deseen autoalojar o inspeccionar el flujo de extracción pueden hacerlo con Firecrawl. AgentQL es una API cerrada y el modelo de extracción no está disponible para autoalojamiento. Los planes de pago de Firecrawl comienzan en $16/mes. El plan Professional de AgentQL cuesta $99/mes. Para los equipos con un presupuesto ajustado que necesitan contenido listo para LLM, Firecrawl suele ser la mejor opción. Para los equipos que construyen agentes que necesitan resultados tipados precisos de páginas web con diseños cambiantes, AgentQL tiene ventaja.

Stagehand, desarrollado por Browserbase, es un framework de automatización de navegadores creado para agentes de IA que necesitan actuar en la web, no solo leerla. Stagehand utiliza un bucle de actuar/extraer/observar, dando a los agentes una capa de razonamiento sobre Playwright. AgentQL también permite la interacción web a través de su SDK de Playwright, pero su lenguaje de consulta está más enfocado en la extracción. Stagehand es más amplio y flexible para flujos de trabajo de agentes complejos de varios pasos; AgentQL es más estructurado y predecible para tareas de extracción de datos repetibles. Stagehand es de código abierto (MIT); las implementaciones de producción de Stagehand requieren Browserbase, lo que añade costes. La API independiente de AgentQL es más sencilla de integrar para casos de uso de extracción puros.

Apify adopta un tercer enfoque: un mercado de miles de "Actors" preconstruidos para sitios específicos (LinkedIn, Amazon, fuentes de datos específicas), además de un entorno de ejecución en la nube con gestión de proxies, programación y manejo de antibots integrados. AgentQL es una capa de primitivas, no un mercado. Construyes tu propia lógica de extracción con el lenguaje de consulta de AgentQL; no hay scrapers preconstruidos específicos para sitios. Apify escala mejor para objetivos conocidos con Actors existentes. AgentQL se generaliza mejor en páginas arbitrarias donde no existe un scraper preconstruido.

Cómo es la realidad del bucle del agente

El patrón más común que adoptan los desarrolladores: instalar el SDK de Python, autenticarse con una clave API, iniciar una sesión de navegador de Playwright, navegar a una página y llamar a page.query_data() con una cadena de consulta. La llamada devuelve un dict de Python que coincide con la forma de la consulta. Toda la extracción requiere de 10 a 15 líneas de código para una sola página; escalar a rastreos de varias páginas requiere agregar lógica de navegación, pero la llamada de extracción sigue siendo la misma en cada página.

Para los usuarios de LangChain, AgentQL ofrece una integración de herramientas de primer nivel. El agente llama a la herramienta AgentQL con una URL y una consulta, y la herramienta devuelve datos estructurados directamente en la cadena de respuesta del agente. La integración con LlamaIndex funciona de manera similar. Para los equipos que ya ejecutan agentes de LangChain, agregar AgentQL a un flujo de trabajo es tarea de una tarde.

La ruta de la REST API es aún más sencilla para las páginas públicas: un solo HTTP POST con la URL y la consulta, sin necesidad de configurar el navegador. Esto funciona bien para funciones sin servidor (serverless) o trabajos de datos ligeros que no necesitan un entorno de navegador completo. La desventaja es que las SPA con mucho JavaScript pueden no renderizarse por completo, y las páginas autenticadas quedan fuera del alcance de la REST API.

La extensión del depurador de Chrome cambia significativamente el flujo de trabajo de iteración. En lugar de escribir una consulta, ejecutar un script, verificar el resultado y ajustar, los desarrolladores escriben consultas directamente en el navegador frente a la página en vivo y ven los resultados en tiempo real. Esto reduce el tiempo de iteración de minutos por ciclo a segundos. Es la parte más subestimada del conjunto de herramientas de AgentQL.

Donde el flujo de trabajo se complica: el modo sigiloso (stealth mode), necesario para sitios con detección agresiva de bots, está marcado como experimental en la propia documentación de AgentQL. Puede que no funcione para todos los sitios web y ralentiza la extracción cuando está activo. Los equipos que apunten a sitios protegidos por Cloudflare o Akamai encontrarán fallos que requieren configuración manual de proxies fuera de la pila de AgentQL, o un cambio a Apify o Bright Data para la infraestructura antibot.

Para quién está creado AgentQL

AgentQL es ideal para desarrolladores que construyen agentes de IA o flujos de datos que necesitan extraer datos estructurados y tipados de páginas web de forma recurrente. El enfoque sin selectores ahorra semanas de trabajo de mantenimiento cuando los sitios objetivo actualizan su HTML. Las integraciones con LangChain y LlamaIndex lo convierten en una opción natural para los equipos que ya están en el ecosistema de agentes LLM. Para los equipos de comercio electrónico que ejecutan monitoreo de precios de la competencia, el comportamiento de consulta de autorreparación significa que el rediseño de un sitio no rompe inmediatamente todo el flujo de extracción.

Los equipos empresariales en hostelería, viajes y comercio minorista son los casos de uso a los que TinyFish se dirige específicamente. Los materiales de financiación de la Serie A describían agentes de hostelería que agregaban inventario de miles de sitios de pequeños hoteles que carecen de API, y empresas de viajes que ejecutaban vigilancia de precios en tiempo real en sitios de la competencia. Estos son trabajos de extracción de alto volumen y alto valor donde el coste de mantener scrapers por sitio es significativo, y la ventaja de generalización de AgentQL se multiplica a escala.

Los desarrolladores con experiencia previa en Playwright encontrarán que la curva de aprendizaje es mínima. El lenguaje de consulta es lo suficientemente simple como para comenzar en menos de una hora, y el entorno de pruebas (playground) permite a los principiantes explorar sin escribir código primero.

Lo que AgentQL no es

AgentQL no es una herramienta de ingesta de LLM de página completa. Si necesitas extraer un artículo completo, un sitio de documentación o un blog para RAG o entrenamiento de LLM, la salida en Markdown de Firecrawl es una mejor opción. AgentQL extrae campos estructurados específicos; no devuelve el contenido sin procesar de la página para el consumo de LLM.

No es una opción barata para la extracción de alto volumen. Las 50 llamadas/mes del nivel Starter son solo para evaluación. Con el precio del plan Professional ($99/mes por 10,000 llamadas), las cargas de trabajo pesadas que superan la cuota alcanzan un excedente de $0.015/llamada. 100,000 llamadas/mes cuestan más de $1,500 solo en excedentes. Los equipos que operan a esa escala deberían evaluar los precios Enterprise o considerar alternativas autoalojadas como Crawl4AI o Playwright con un LLM de ejecución local para la extracción.

No es una solución para sitios con protección antibot agresiva. El modo sigiloso experimental es explícitamente poco fiable. Los equipos que apunten a dichos sitios sin infraestructura de proxies serán bloqueados. AgentQL no incluye rotación de proxies, proxies residenciales ni la infraestructura de resolución de CAPTCHA que Apify integra en su plataforma.

Y no es de código abierto. Los desarrolladores que necesiten inspeccionar el modelo de extracción, autoalojar por privacidad de datos o evitar la dependencia del proveedor (vendor lock-in) tendrán que buscar en su lugar opciones como Firecrawl, Stagehand o Crawl4AI.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con AgentQL.