Aller au contenu principal
Vantaige
AgentQL screenshot
AgentQL logo

AgentQL

Freemium

AgentQL est une couche de requêtes en langage naturel pour le web, développée par TinyFish. Les développeurs rédigent des requêtes de données en anglais courant au lieu de sélecteurs CSS fragiles, et le moteur d'IA d'AgentQL les résout sur n'importe quelle page web en direct, renvoyant des données structurées et typées.

Fonctionnalités :API

AgentQL est un langage de requête et une plateforme API permettant d'extraire des données structurées de pages web sans écrire de sélecteurs CSS, XPath ou regex. Développé par TinyFish, une startup de Palo Alto fondée en 2024, AgentQL permet aux développeurs de décrire les données qu'ils souhaitent en anglais courant (par exemple : { product_name, price, in_stock }) et son moteur d'IA fait correspondre cette description aux éléments réels sur n'importe quelle page en direct. Le résultat est renvoyé sous forme de JSON structuré et typé, prêt à être utilisé dans un agent IA ou un pipeline de données. TinyFish a levé $47 millions en financement de série A en août 2025, mené par ICONIQ Capital, pour faire évoluer la plateforme vers l'automatisation web d'entreprise à grande échelle.

AgentQL est disponible sous forme de SDK Python, de SDK JavaScript et d'API REST. Les SDK s'intègrent à Playwright pour un contrôle total du navigateur, prenant en charge les pages authentifiées, les SPA rendues en JavaScript et le contenu paginé, y compris le défilement infini. Une extension Chrome appelée AgentQL Debugger permet aux développeurs d'écrire et de tester des requêtes sur des pages en direct et en temps réel. La plateforme prend également en charge l'analyse de PDF, les requêtes auto-réparatrices qui s'adaptent lorsque les mises en page changent de manière incrémentielle, ainsi que des intégrations avec LangChain, LlamaIndex, LangFlow, Dify, AgentStack, MCP (Model Context Protocol) et Zapier. Le niveau gratuit Starter offre aux équipes 50 appels d'API par mois pour évaluer l'outil ; le forfait Professional à $99/month inclut 10,000 appels et 500 heures de temps de navigateur à distance.

Ce que fait réellement AgentQL en mai 2026

Le problème fondamental qu'AgentQL résout est la fragilité des sélecteurs. Les web scrapers traditionnels dépendent des classes CSS et des identifiants HTML que les propriétaires de sites modifient sans préavis. Lorsqu'un site est repensé, chaque sélecteur écrit à la main se casse. L'approche d'AgentQL consiste à ignorer complètement les sélecteurs. Au lieu de cibler .product-price__value, vous écrivez { price } et l'IA résout cette requête par rapport au contenu sémantique de la page. Étant donné que la requête cible le sens plutôt que le balisage, elle survit automatiquement aux modifications incrémentielles de mise en page.

La syntaxe de requête d'AgentQL s'inspire de GraphQL : vous définissez la structure des données que vous souhaitez, et le résultat correspond à cette structure. Les objets imbriqués, les tableaux et les champs facultatifs fonctionnent tous comme prévu. Pour l'automatisation web au-delà de l'extraction, le SDK Playwright prend en charge le clic sur des éléments par description (aucun sélecteur nécessaire), le remplissage de formulaires et la navigation dans des flux à plusieurs étapes. C'est ce qui rend AgentQL utile pour les agents IA qui doivent interagir avec le web, et pas seulement le lire.

L'option API REST gère le cas courant de l'extraction de données à partir de pages publiques sans lancer de navigateur. Elle prend une URL et une requête, et renvoie un JSON structuré. Pour les pages authentifiées ou les sites nécessitant un rendu JavaScript, le SDK Playwright prend le relais. L'extraction de PDF est gérée via le même langage de requête, y compris les tableaux à l'intérieur des PDF. L'extension de débogage Chrome permet aux développeurs d'itérer sur des requêtes par rapport à un onglet de navigateur en direct, ce qui raccourcit considérablement la boucle de rétroaction par rapport à l'écriture de sélecteurs dans une console de développement.

AgentQL a été lancé publiquement sur Product Hunt le 20 août 2024, remportant à la fois le titre de Produit du jour n°1 et de Produit de la semaine n°1 avec 723 votes positifs. Le jour du lancement, un développeur a fait remarquer que seul le SSO Google était disponible pour la création de compte. L'équipe a déployé le SSO GitHub le jour même, un temps de réponse qui a donné le ton sur la façon dont TinyFish gère les retours des développeurs. Un an plus tard jour pour jour, le 20 août 2025, TinyFish a annoncé la série A de $47 millions pour étendre la plateforme aux déploiements d'entreprise.

"AgentQL est probablement l'outil d'extraction de données web le plus simple que j'aie jamais utilisé." - Shawn Pang, Product Hunt, 20 août 2024
"Plus vos requêtes sont spécifiques, plus vos réponses seront précises et cohérentes." - Andrew Chen (équipe TinyFish), Product Hunt, 20 août 2024

Où se situe AgentQL par rapport à Firecrawl et Stagehand

Firecrawl et AgentQL se ressemblent en apparence, mais résolvent des problèmes différents. Firecrawl est un outil axé sur l'exploration (crawl-first) avec une sortie pour LLM : vous lui donnez une URL et il renvoie le contenu complet de la page sous forme de Markdown ou de JSON propre, prêt à alimenter la fenêtre de contexte d'un LLM. Il excelle dans l'ingestion de sites entiers pour les pipelines RAG ou la recherche de documents. AgentQL est un outil axé sur la requête (query-first) et la structuration immédiate : vous définissez exactement les champs typés dont vous avez besoin, et il n'extrait que ceux-ci de n'importe quelle page, y compris celles qui sont authentifiées et rendues dynamiquement. Firecrawl est plus rapide pour l'ingestion de pages complètes ; AgentQL est plus précis pour l'extraction de données structurées lorsque le schéma est important pour vous.

Le cœur open-source de Firecrawl (licence MIT) constitue également une différence significative. Les développeurs qui souhaitent auto-héberger ou inspecter le pipeline d'extraction peuvent le faire avec Firecrawl. AgentQL est une API fermée, et le modèle d'extraction n'est pas disponible pour l'auto-hébergement. Les forfaits payants de Firecrawl commencent à $16/month. Le forfait Professional d'AgentQL est à $99/month. Pour les équipes disposant d'un budget limité et ayant besoin de contenu prêt pour les LLM, Firecrawl l'emporte souvent. Pour les équipes créant des agents qui nécessitent une sortie typée précise à partir de pages web dont la mise en page change, AgentQL a l'avantage.

Stagehand, développé par Browserbase, est un framework d'automatisation de navigateur conçu pour les agents IA qui doivent agir sur le web, et pas seulement le lire. Stagehand utilise une boucle agir/extraire/observer, offrant aux agents une couche de raisonnement par-dessus Playwright. AgentQL permet également l'interaction web via son SDK Playwright, mais son langage de requête est plus strictement limité à l'extraction. Stagehand est plus large et plus flexible pour les flux de travail d'agents complexes à plusieurs étapes ; AgentQL est plus structuré et prévisible pour les tâches d'extraction de données répétables. Stagehand est open-source (MIT) ; les déploiements en production de Stagehand nécessitent Browserbase, ce qui ajoute des coûts. L'API autonome d'AgentQL est plus simple à intégrer pour les cas d'utilisation d'extraction pure.

Apify adopte une troisième approche : une place de marché de milliers d'« Actors » préconçus pour des sites spécifiques (LinkedIn, Amazon, sources de données spécifiques), plus un environnement d'exécution cloud avec gestion de proxy, planification et gestion anti-bot intégrées. AgentQL est une couche de primitives, pas une place de marché. Vous créez votre propre logique d'extraction avec le langage de requête d'AgentQL ; il n'y a pas de scrapers préconçus spécifiques à un site. Apify évolue mieux pour les cibles connues avec des Actors existants. AgentQL se généralise mieux sur des pages arbitraires où aucun scraper préconçu n'existe.

À quoi ressemble la réalité de la boucle d'agent

Le modèle le plus courant adopté par les développeurs : installer le SDK Python, s'authentifier avec une clé API, lancer une session de navigateur Playwright, naviguer vers une page et appeler page.query_data() avec une chaîne de requête. L'appel renvoie un dictionnaire Python correspondant à la structure de la requête. L'extraction complète prend 10 à 15 lignes de code pour une seule page ; la mise à l'échelle vers des explorations multipages nécessite l'ajout d'une logique de navigation, mais l'appel d'extraction reste le même sur chaque page.

Pour les utilisateurs de LangChain, AgentQL propose une intégration d'outil de premier ordre. L'agent appelle l'outil AgentQL avec une URL et une requête, et l'outil renvoie des données structurées directement dans la chaîne de réponse de l'agent. L'intégration de LlamaIndex fonctionne de manière similaire. Pour les équipes exécutant déjà des agents LangChain, l'ajout d'AgentQL à un pipeline représente une après-midi de travail.

La voie de l'API REST est encore plus simple pour les pages publiques : un seul HTTP POST avec l'URL et la requête, aucune configuration de navigateur n'est requise. Cela fonctionne bien pour les fonctions serverless ou les tâches de données légères qui n'ont pas besoin d'un environnement de navigateur complet. Le compromis est que les SPA fortement chargées en JavaScript peuvent ne pas s'afficher complètement, et les pages authentifiées sont hors de portée pour l'API REST.

L'extension de débogage Chrome modifie considérablement le flux de travail d'itération. Au lieu d'écrire une requête, d'exécuter un script, de vérifier la sortie et d'ajuster, les développeurs écrivent des requêtes directement dans le navigateur sur la page en direct et voient les résultats en temps réel. Cela réduit le temps d'itération de plusieurs minutes par cycle à quelques secondes. C'est la partie la plus sous-estimée de l'ensemble d'outils AgentQL.

Là où le flux de travail devient chaotique : le mode furtif (stealth mode), nécessaire pour les sites dotés d'une détection anti-bot agressive, est signalé comme expérimental dans la propre documentation d'AgentQL. Il peut ne pas fonctionner pour tous les sites web et ralentit l'extraction lorsqu'il est actif. Les équipes ciblant des sites protégés par Cloudflare ou Akamai rencontreront des échecs qui nécessitent une configuration manuelle de proxy en dehors de la pile AgentQL, ou un passage à Apify ou Bright Data pour l'infrastructure anti-bot.

À qui s'adresse AgentQL

AgentQL convient parfaitement aux développeurs créant des agents IA ou des pipelines de données qui doivent extraire des données structurées et typées de pages web de manière récurrente. L'approche sans sélecteur permet d'économiser des semaines de travail de maintenance lorsque les sites cibles mettent à jour leur HTML. Les intégrations LangChain et LlamaIndex en font un choix naturel pour les équipes déjà présentes dans l'écosystème des agents LLM. Pour les équipes e-commerce effectuant une surveillance des prix des concurrents, le comportement de requête auto-réparatrice signifie qu'une refonte de site ne casse pas immédiatement l'ensemble du pipeline d'extraction.

Les équipes d'entreprise dans l'hôtellerie, les voyages et la vente au détail sont les cas d'utilisation que TinyFish cible spécifiquement. Les documents de financement de la série A décrivaient des agents hôteliers agrégeant l'inventaire de milliers de petits sites d'hôtels dépourvus d'API, et des agences de voyages effectuant une surveillance des prix en temps réel sur les sites concurrents. Il s'agit de tâches d'extraction à volume élevé et à forte valeur ajoutée où le coût de maintenance des scrapers par site est important, et l'avantage de généralisation d'AgentQL se démultiplie à grande échelle.

Les développeurs ayant déjà une expérience avec Playwright trouveront la courbe d'apprentissage minime. Le langage de requête est suffisamment simple pour démarrer en moins d'une heure, et l'environnement de test (playground) permet aux débutants d'explorer sans avoir à écrire de code au préalable.

Ce que n'est pas AgentQL

AgentQL n'est pas un outil d'ingestion LLM de page complète. Si vous avez besoin de scraper un article entier, un site de documentation ou un blog pour le RAG ou l'entraînement de LLM, la sortie Markdown de Firecrawl est plus adaptée. AgentQL extrait des champs structurés spécifiques ; il ne renvoie pas le contenu brut de la page pour la consommation des LLM.

Ce n'est pas une option bon marché pour l'extraction à volume élevé. Les 50 appels/mois du niveau Starter sont uniquement destinés à l'évaluation. Au tarif Professional ($99/month pour 10,000 appels), les charges de travail lourdes qui dépassent le quota atteignent un dépassement de $0.015/call. 100,000 appels/mois coûtent plus de $1,500 rien qu'en dépassements. Les équipes fonctionnant à cette échelle devraient évaluer la tarification Enterprise ou envisager des alternatives auto-hébergées comme Crawl4AI ou Playwright avec un LLM exécuté localement pour l'extraction.

Ce n'est pas une solution pour les sites dotés d'une protection anti-bot agressive. Le mode furtif expérimental est explicitement peu fiable. Les équipes ciblant de tels sites sans infrastructure de proxy seront bloquées. AgentQL n'inclut pas la rotation de proxy, les proxys résidentiels ou l'infrastructure de résolution de CAPTCHA qu'Apify intègre dans sa plateforme.

Et ce n'est pas open-source. Les développeurs qui ont besoin d'inspecter le modèle d'extraction, de s'auto-héberger pour la confidentialité des données ou d'éviter la dépendance vis-à-vis d'un fournisseur devront plutôt se tourner vers Firecrawl, Stagehand ou Crawl4AI.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Articles associés

Guides et articles en lien avec AgentQL.