Saltar al contenido principal
Vantaige
Stagehand screenshot
Stagehand logo

Stagehand

Gratis

Stagehand es un SDK de TypeScript con licencia MIT de Browserbase que añade control del navegador en lenguaje natural (act, extract, observe) sobre CDP, permitiendo a los desarrolladores crear agentes de navegador que sobreviven a los cambios de interfaz sin necesidad de mantener selectores.

Funciones:APIOpen Source

Stagehand es un SDK de automatización de navegadores de código abierto creado por Browserbase que cierra la brecha entre los frágiles scripts de selectores CSS y los impredecibles agentes totalmente autónomos. Lanzado en octubre de 2024 y ahora en su versión v3, ofrece a los desarrolladores de TypeScript y Python tres primitivas componibles, act(), extract() y observe(), además de un modo agent() autónomo, cada uno respaldado por el LLM de su elección. Mientras que un script tradicional de Playwright codifica de forma rígida page.click('#submit-btn') y se rompe en el momento en que un diseñador cambia el nombre de una clase, Stagehand resuelve act("click the submit button") contra el DOM en vivo durante el tiempo de ejecución, por lo que el script sobrevive a las actualizaciones trimestrales de la interfaz de usuario con cero mantenimiento.

El framework tiene licencia MIT y es gratuito para ejecutarse localmente contra cualquier instancia de Chromium. Se integra con el entorno de ejecución en la nube gestionado de Browserbase (opcional, de pago) para proxies residenciales, navegación oculta (stealth), resolución de CAPTCHA y grabación de sesiones. Stagehand es compatible con OpenAI, Anthropic Claude y Google Gemini a través del Vercel AI SDK, y la arquitectura directa del Chrome DevTools Protocol (CDP) de la v3 lo hace agnóstico tanto al modelo como al controlador. A partir de abril de 2026, el repositorio de GitHub cuenta con 22,400 estrellas, 1,500 bifurcaciones (forks) y 57 lanzamientos, con una versión para Python lanzada junto con la Serie B de $40M de Browserbase en junio de 2025.

Lo que Stagehand realmente hace en abril de 2026

Stagehand v3, lanzado el 29 de octubre de 2025, eliminó por completo la dependencia estricta de Playwright y reconstruyó el framework sobre la comunicación directa con CDP. El cambio de arquitectura fue significativo: Stagehand ya no hereda las suposiciones centradas en pruebas de Playwright, y es compatible con Puppeteer, Playwright, Bun o cualquier otro controlador compatible con CDP como un backend modular. En interacciones con iframes y shadow-root, donde las herramientas basadas en selectores tienen más dificultades, la v3 es un 44.11% más rápida que la v2.

Las cuatro primitivas realizan un trabajo distinto. act() ejecuta acciones del navegador a partir de inglés sencillo ("click the next page button", "fill the email field with [email protected]"). extract() extrae datos estructurados de una página y los valida contra un esquema de Zod, por lo que obtienes objetos tipados en lugar de HTML sin procesar. observe() muestra qué elementos interactivos existen en una página antes de comprometerte con una acción, lo cual es útil para la lógica condicional y las comprobaciones de seguridad. agent(), añadido en la v2, ejecuta flujos de trabajo de múltiples pasos de forma autónoma cuando deseas una ejecución de extremo a extremo sin orquestar cada paso manualmente.

La v3 también introdujo un constructor de contexto que alimenta a los modelos solo con el subconjunto relevante del DOM por acción, en lugar de volcar la página completa. Esto reduce sustancialmente el desperdicio de tokens y hace que el costo por acción sea más predecible. El almacenamiento en caché del lado del servidor, añadido en la v3.1.0 (febrero de 2026), guarda los resultados de act/extract/observe para que las ejecuciones repetidas a través del mismo flujo omitan por completo la inferencia del LLM una vez que el flujo de trabajo se estabiliza.

"Nuestros flujos de trabajo con Stagehand v3 son notablemente más rápidos cuando se ejecutan lado a lado con la v2. Ahora obtenemos observabilidad detallada e informes a nivel de token por acción." - Steve Austin, cofundador y CTO en Benny, blog de lanzamiento de Stagehand v3, octubre de 2025

El soporte de modelos cubre GPT-4o, Claude 3.7 Sonnet, Gemini 2.0 y versiones más recientes de cada familia. El hallazgo interno del equipo: Claude maneja mejor los pasos que requieren mucho razonamiento, las variantes de GPT-4o ejecutan acciones precisas de manera más confiable y Gemini se adapta a las tareas de observación. El diseño agnóstico de modelos del framework permite enrutar diferentes primitivas a diferentes modelos dentro de un solo script, aunque la mayoría de los equipos eligen uno y se mantienen consistentes.

Dónde se sitúa Stagehand frente a Playwright y Browser-Use

Playwright (sin IA) es la línea base contra la que compite toda herramienta de automatización de navegadores con IA. Es puramente determinista: cada acción requiere un selector explícito o un localizador de roles, cero costo de LLM por acción y una velocidad de ejecución inferior a 100ms por paso. En interfaces de usuario estables, los scripts de Playwright escritos a mano completan las tareas al 92-98%. El costo de esa confiabilidad es el mantenimiento: cada rediseño importante de la interfaz rompe entre el 15-25% de los selectores, lo que requiere que un ingeniero actualice los scripts. Playwright tiene más de 70,000 estrellas en GitHub, una herramienta madura de generación de código que graba sesiones en scripts y un ecosistema de primer nivel para el rastreo y la grabación de video. Es el sustrato que Stagehand envolvió originalmente y que la mayoría de los equipos todavía usan para el 80% predecible de sus pasos de automatización. El patrón de producción práctico que ha surgido es Playwright para la navegación determinista y los flujos de inicio de sesión, y Stagehand para la extracción dinámica y los pasos de acción intermedios.

Browser-Use es la alternativa centrada en Python con una filosofía diferente. Mientras que Stagehand es híbrido (tú decides qué pasos son impulsados por IA), Browser-Use ejecuta un bucle de agente totalmente autónomo donde el LLM recibe el estado de la página, decide qué hacer a continuación e itera hasta alcanzar el objetivo. Es compatible con modelos locales de Ollama, lo que significa cero costo de inferencia para los equipos dispuestos a ejecutar su propio hardware. Browser-Use superó las 80,000 estrellas en GitHub a principios de 2026, impulsado en gran medida por desarrolladores de Python que encuentran su API más simple y accesible. La contrapartida es la previsibilidad: Browser-Use vuelve a razonar desde cero en cada ejecución, por lo que el mismo objetivo puede producir diferentes rutas de ejecución en días distintos. El modelo de almacenamiento en caché y las primitivas explícitas de Stagehand lo hacen más repetible en producción, donde necesitas auditar qué hizo el script y por qué. Para tareas web exploratorias y abiertas donde la secuencia de pasos no es fija, Browser-Use suele ser la mejor opción. Para los pipelines de producción donde ejecutas el mismo flujo de trabajo 500 veces al día y necesitas una ejecución confiable y depurable, Stagehand es el ganador.

Una tercera categoría que vale la pena destacar es AgentQL, que adopta un enfoque de lenguaje de consulta en lugar de un enfoque de llamada a métodos. AgentQL utiliza una sintaxis inspirada en GraphQL para describir los elementos de la página de forma declarativa, mientras que Stagehand utiliza código imperativo con argumentos en lenguaje natural. Ambos se asientan sobre una infraestructura de navegador similar, pero el modelo mental difiere significativamente. Los equipos con fuertes patrones de TypeScript tienden a preferir Stagehand; los equipos que desean expresar esquemas de datos como consultas tienden a preferir AgentQL. La API act/extract/observe de Stagehand es más fácil de razonar al depurar.

Cómo es la realidad del flujo de trabajo de los agentes

La mayoría de las configuraciones de producción de Stagehand siguen un patrón predecible. Los pasos deterministas y bien comprendidos (autenticarse, navegar a la página de destino, establecer filtros) utilizan llamadas simples de Playwright o Stagehand con selectores explícitos. Los pasos donde la estructura de la página varía (tablas cargadas dinámicamente, componentes shadow-DOM, datos autenticados detrás de flujos de múltiples pasos) llaman a las primitivas de IA de Stagehand. Este enfoque híbrido mantiene los costos de LLM manejables: a $0.002-$0.02 por llamada a act/extract, un flujo de trabajo con cinco pasos de IA cuesta menos de $0.10 por ejecución, lo cual es viable. Ejecutar cada uno de los pasos a través de IA es donde los equipos se meten en problemas con las matemáticas a gran escala.

La depuración es diferente a depurar Playwright puro. Cuando una llamada a act() falla o malinterpreta una instrucción ambigua, el error surge como una excepción en tiempo de ejecución con la acción interpretada del modelo registrada, pero leer los rastros de decisión de la IA es una habilidad diferente a leer una falta de coincidencia de selectores. La API de Stagehand (lanzada en junio de 2026) trasladó parte de este trabajo de traducción a una infraestructura gestionada con registros de acciones legibles por humanos y observabilidad a nivel de token por paso, lo que aborda directamente la queja de "caja negra" del hilo inicial en Hacker News.

"No creo que pudiera argumentar de manera plausible el uso de LLMs en tiempo de ejecución en nuestra suite de pruebas en el trabajo. El enfoque correcto sería usar IA para ayudar a escribir el código de prueba de Playwright, no reemplazar la parte determinista." - mpalmer, Hacker News, 9 de enero de 2025

Este escepticismo del hilo de lanzamiento en Hacker News resultó ser parcialmente correcto y parcialmente incorrecto. Para las suites de pruebas CI/CD donde el determinismo no es negociable, el enfoque de LLM en tiempo de ejecución de Stagehand sigue siendo difícil de vender. Para los pipelines de automatización de producción donde el costo de mantenimiento es el verdadero enemigo, la compensación ha demostrado valer la pena para una parte significativa de los equipos. La distinción arquitectónica importante es que Stagehand es principalmente una herramienta de automatización de navegadores que resulta funcionar bien en contextos de prueba, no un framework de pruebas con funciones de IA añadidas.

La verdadera complejidad operativa surge cuando necesitas capacidades de infraestructura de navegador que Stagehand no proporciona de forma nativa. La detección de bots, la resolución de CAPTCHA, los proxies residenciales, la grabación de sesiones, la ejecución multirregión y el manejo de datos compatible con HIPAA requieren el entorno de ejecución gestionado de pago de Browserbase o una importante configuración personalizada. Los equipos que construyen automatizaciones internas simples pueden ejecutar Stagehand contra una instancia local de Chromium y pagar solo los costos de su API de LLM. Los equipos que construyen agentes web de nivel de producción generalmente necesitan ambos.

Para quién está diseñado Stagehand

Los desarrolladores de TypeScript que construyen agentes de navegador para la automatización de producción son la audiencia principal. Los ingenieros de QA que desean escribir pruebas en lenguaje natural legible por humanos, sin comprometerse con el mantenimiento de selectores de Playwright, son una fuerte audiencia secundaria. Los equipos que ya tienen bases de código de Playwright y desean aumentar pasos específicos con razonamiento de IA (en lugar de reemplazar toda la pila) son un tercer segmento donde Stagehand se integra limpiamente.

Stagehand también encaja de forma natural en los frameworks de agentes de IA. Sus primitivas act/extract/observe se asignan bien a las llamadas a herramientas en arquitecturas del estilo de OpenAI Agents SDK, donde un agente de planificación decide qué acciones web tomar y Stagehand las ejecuta. Los equipos que construyen pipelines de datos que incluyen datos web junto con fuentes estructuradas a menudo combinan Stagehand para la extracción con herramientas como Firecrawl (para la extracción limpia de documentos) o Apify (para una infraestructura de scraping escalable). Stagehand maneja los escenarios autenticados, con mucho JavaScript y de llenado de formularios que los rastreadores estáticos no pueden alcanzar.

El hito de la Serie B (junio de 2025) y las más de 500,000 descargas semanales en NPM confirman que Stagehand se ha graduado de ser un prometedor experimento de código abierto a un framework con adopción genuina en producción y un equipo financiado detrás. La arquitectura CDP de la v3 elimina la dependencia de un upstream específico (Playwright), lo que reduce el riesgo de que los cambios en los componentes internos de Playwright rompan el comportamiento de Stagehand.

Lo que Stagehand no es

Stagehand no es un reemplazo de Playwright en la automatización de alto volumen y sensible a los costos. Con 10,000 extracciones por día, las tarifas de LLM rondan los $50-200/día con modelos de nivel medio, incluso con almacenamiento en caché. Para ese volumen con estructuras de página estables y bien comprendidas, mantener los selectores de Playwright es más barato. El punto de equilibrio donde los ahorros de mantenimiento de Stagehand superan sus costos de LLM depende en gran medida de la frecuencia con la que los sitios objetivo cambian su DOM y de lo costoso que sea el tiempo de tus ingenieros.

Stagehand no es una herramienta centrada en lo local o en la privacidad. Requiere credenciales de API de LLM en la nube para cada paso impulsado por IA. El soporte de Browser-Use para Ollama lo convierte en la mejor opción para los equipos que no pueden enviar el contenido de la página a APIs externas debido a requisitos de residencia de datos o políticas de seguridad.

No es una herramienta sin código (no-code) de apuntar y hacer clic. Stagehand es un SDK para desarrolladores. Escribes código en TypeScript (o Python). El lenguaje natural está dentro de las llamadas a métodos, no en un constructor visual de flujos de trabajo. Los equipos sin capacidad de ingeniería deberían considerar el producto Director.ai de Browserbase (lanzado en junio de 2025) para una interfaz de agente de navegador sin código.

No es un reemplazo completo para la navegación supervisada por humanos en contextos sensibles. Las transacciones financieras, el ingreso de datos de atención médica y los flujos de trabajo de documentos legales requieren pasos de aprobación, registros de auditoría y herramientas de cumplimiento que Stagehand no proporciona de forma predeterminada. El framework es infraestructura, no un producto de cumplimiento.

Por último, Stagehand no es adecuado para tareas de investigación exploratorias y abiertas donde la secuencia exacta de acciones del navegador no se conoce de antemano. Si tu objetivo es "encontrar el mejor precio para X en estos 12 sitios" sin un flujo de trabajo fijo, el bucle de razonamiento autónomo de Browser-Use maneja la exploración web dirigida a objetivos de manera más natural que el modelo de primitivas componibles de Stagehand. Para flujos de trabajo de producción repetibles con pasos definidos y resultados medibles, el enfoque híbrido de Stagehand vale la pena. Para tareas de investigación difusas y de múltiples turnos, un framework más agéntico puede serte más útil.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Stagehand.

Artículos relacionados

Guías y artículos relacionados con Stagehand.