

Stagehand عبارة عن حزمة تطوير برمجيات (SDK) للغة TypeScript بترخيص MIT من Browserbase، تضيف تحكماً في المتصفح باللغة الطبيعية (act، extract، observe) فوق بروتوكول CDP، مما يتيح للمطورين بناء وكلاء متصفح يصمدون أمام تغييرات واجهة المستخدم دون الحاجة لصيانة المحددات (selectors).
Stagehand عبارة عن حزمة تطوير برمجيات (SDK) مفتوحة المصدر لأتمتة المتصفحات من تطوير Browserbase، تسد الفجوة بين نصوص محددات CSS (CSS-selector) الهشة والوكلاء المستقلين بالكامل غير المتوقعين. تم إطلاقها في أكتوبر 2024 ووصلت الآن إلى الإصدار v3، وهي تمنح مطوري TypeScript و Python ثلاث وظائف أساسية قابلة للتركيب: act()، و extract()، و observe()، بالإضافة إلى وضع agent() المستقل، وكل منها مدعوم بنموذج اللغة الكبير (LLM) الذي تختاره. فبينما يقوم نص Playwright التقليدي ببرمجة page.click('#submit-btn') بشكل ثابت ويتعطل بمجرد أن يقوم المصمم بإعادة تسمية فئة (class)، يقوم Stagehand بتحليل act("click the submit button") مقابل نموذج كائن المستند (DOM) الحي في وقت التشغيل، مما يجعل النص البرمجي يصمد أمام التحديثات الفصلية لواجهة المستخدم دون أي صيانة.
إطار العمل مرخص بموجب MIT ومجاني للتشغيل محلياً على أي نسخة Chromium. ويتكامل مع بيئة التشغيل السحابية المدارة من Browserbase (اختيارية ومدفوعة) للحصول على وكلاء سكنيين (residential proxies)، والتصفح الخفي، وحل اختبارات CAPTCHA، وتسجيل الجلسات. يدعم Stagehand نماذج OpenAI، و Anthropic Claude، و Google Gemini عبر Vercel AI SDK، كما أن بنية بروتوكول أدوات مطوري Chrome (CDP) المباشرة في الإصدار v3 تجعله مستقلاً عن النماذج والمحركات. اعتباراً من أبريل 2026، حصد مستودع GitHub على 22,400 نجمة، و 1,500 تفريعة (fork)، و 57 إصداراً، مع إطلاق نسخة Python بالتزامن مع جولة التمويل Series B لشركة Browserbase بقيمة $40M في يونيو 2025.
ما الذي يفعله Stagehand فعلياً في أبريل 2026
أزال الإصدار Stagehand v3، الصادر في 29 أكتوبر 2025، الاعتماد الكلي على Playwright وأعاد بناء إطار العمل على اتصال CDP المباشر. كان هذا التغيير في البنية المعمارية كبيراً: لم يعد Stagehand يرث افتراضات Playwright التي تركز على الاختبار أولاً، وأصبح يدعم Puppeteer، أو Playwright، أو Bun، أو أي محرك آخر متوافق مع CDP كواجهة خلفية معيارية. وفيما يتعلق بتفاعلات iframes و shadow-root، حيث تواجه الأدوات القائمة على المحددات أكبر الصعوبات، فإن الإصدار v3 أسرع بنسبة 44.11% من الإصدار v2.
تؤدي كل وظيفة من الوظائف الأساسية الأربع مهمة مميزة. تقوم act() بتنفيذ إجراءات المتصفح من خلال تعليمات باللغة الإنجليزية البسيطة ("click the next page button"، "fill the email field with [email protected]"). وتقوم extract() بسحب البيانات المهيكلة من الصفحة والتحقق من صحتها مقابل مخطط Zod، بحيث تحصل على كائنات مكتوبة (typed objects) بدلاً من كود HTML الخام. وتُظهر observe() العناصر التفاعلية الموجودة على الصفحة قبل الالتزام بأي إجراء، وهي مفيدة للمنطق الشرطي وفحوصات الأمان. أما agent()، التي تمت إضافتها في الإصدار v2، فتقوم بتشغيل مسارات عمل متعددة الخطوات بشكل مستقل عندما ترغب في تنفيذ شامل دون تنسيق كل خطوة يدوياً.
كما قدم الإصدار V3 منشئ سياق (context builder) يغذي النماذج فقط بالجزء الفرعي ذي الصلة من DOM لكل إجراء، بدلاً من تفريغ الصفحة بالكامل. يقلل هذا من إهدار الرموز (tokens) بشكل كبير ويجعل التكلفة لكل إجراء أكثر قابلية للتنبؤ. التخزين المؤقت من جانب الخادم (Server-side caching)، الذي تمت إضافته في الإصدار v3.1.0 (فبراير 2026)، يحفظ نتائج act/extract/observe بحيث تتخطى عمليات التشغيل المتكررة لنفس المسار استنتاج LLM بالكامل بمجرد استقرار مسار العمل.
"مسارات عمل Stagehand v3 الخاصة بنا أصبحت أسرع بشكل ملحوظ عند تشغيلها جنباً إلى جنب مع الإصدار v2. نحصل الآن على قابلية مراقبة مفصلة وتقارير على مستوى الرموز (token-level) لكل إجراء." - Steve Austin، المؤسس المشارك والمدير التقني في Benny، مدونة إطلاق Stagehand v3، أكتوبر 2025
يشمل دعم النماذج GPT-4o، و Claude 3.7 Sonnet، و Gemini 2.0، والإصدارات الأحدث في كل عائلة. وتشير النتائج الداخلية للفريق إلى أن: Claude يتعامل مع الخطوات التي تتطلب تفكيراً عميقاً بشكل أفضل، بينما تنفذ متغيرات GPT-4o الإجراءات الدقيقة بموثوقية أعلى، ويناسب Gemini مهام المراقبة. يتيح لك التصميم المستقل عن النماذج لإطار العمل توجيه وظائف أساسية مختلفة إلى نماذج مختلفة داخل نفس النص البرمجي، على الرغم من أن معظم الفرق تختار نموذجاً واحداً وتلتزم به.
موقع Stagehand مقارنة بـ Playwright و Browser-Use
يُعد Playwright (بدون ذكاء اصطناعي) هو المعيار الأساسي الذي تتنافس معه كل أداة أتمتة متصفح تعتمد على الذكاء الاصطناعي. إنه حتمي تماماً: يتطلب كل إجراء محدداً صريحاً (selector) أو محدد دور (role locator)، بتكلفة LLM صفرية لكل إجراء، وسرعة تنفيذ تقل عن 100ms لكل خطوة. على واجهات المستخدم المستقرة، تنجز نصوص Playwright المكتوبة يدوياً المهام بنسبة 92-98%. لكن تكلفة هذه الموثوقية هي الصيانة: كل إعادة تصميم رئيسية لواجهة المستخدم تؤدي إلى تعطل 15-25% من المحددات، مما يتطلب من المهندس تحديث النصوص البرمجية. يمتلك Playwright أكثر من 70,000 نجمة على GitHub، وأداة ناضجة لتوليد الأكواد (codegen) تسجل الجلسات في نصوص برمجية، ونظاماً بيئياً من الدرجة الأولى للتتبع وتسجيل الفيديو. إنه الأساس الذي غلفه Stagehand في الأصل والذي لا تزال معظم الفرق تستخدمه لـ 80% من خطوات الأتمتة القابلة للتنبؤ. النمط العملي للإنتاج الذي ظهر هو استخدام Playwright لعمليات التنقل الحتمية وتسجيل الدخول، واستخدام Stagehand لخطوات الاستخراج والإجراءات الديناميكية في المنتصف.
يُعد Browser-Use البديل الذي يركز على Python بفلسفة مختلفة. فبينما يُعتبر Stagehand هجيناً (أنت من يقرر أي الخطوات تعتمد على الذكاء الاصطناعي)، يقوم Browser-Use بتشغيل حلقة وكيل مستقلة بالكامل حيث يتلقى LLM حالة الصفحة، ويقرر ما يجب فعله تالياً، ويكرر العملية حتى يتم الوصول إلى الهدف. وهو يدعم نماذج Ollama المحلية، مما يعني تكلفة استنتاج صفرية للفرق المستعدة لتشغيل أجهزتها الخاصة. تجاوز Browser-Use حاجز 80,000 نجمة على GitHub بحلول أوائل 2026، مدفوعاً بشكل كبير بمطوري Python الذين يجدون واجهة برمجة التطبيقات (API) الأبسط الخاصة به أكثر سهولة في الاستخدام. المقايضة هنا هي قابلية التنبؤ: يعيد Browser-Use التفكير من الصفر في كل عملية تشغيل، لذا يمكن لنفس الهدف أن ينتج مسارات تنفيذ مختلفة في أيام مختلفة. نموذج التخزين المؤقت والوظائف الأساسية الصريحة في Stagehand تجعله أكثر قابلية للتكرار في بيئة الإنتاج، حيث تحتاج إلى تدقيق ما فعله النص البرمجي ولماذا. بالنسبة لمهام الويب الاستكشافية والمفتوحة حيث لا يكون تسلسل الخطوات ثابتاً، غالباً ما يكون Browser-Use هو الخيار الأفضل. أما بالنسبة لمسارات الإنتاج حيث تقوم بتشغيل نفس مسار العمل 500 مرة في اليوم وتحتاج إلى تنفيذ موثوق وقابل لتصحيح الأخطاء، فإن Stagehand هو الفائز.
الفئة الثالثة الجديرة بالملاحظة هي AgentQL، والتي تتبنى نهج لغة الاستعلام (query-language) بدلاً من نهج استدعاء الأساليب (method-call). يستخدم AgentQL صيغة مستوحاة من GraphQL لوصف عناصر الصفحة بشكل تعريفي، بينما يستخدم Stagehand كوداً حتمياً مع وسائط باللغة الطبيعية. كلاهما يعتمد على بنية تحتية مشابهة للمتصفح، لكن النموذج الذهني يختلف بشكل كبير. تميل الفرق التي تمتلك أنماط TypeScript قوية إلى تفضيل Stagehand؛ بينما تميل الفرق التي ترغب في التعبير عن مخططات البيانات كاستعلامات إلى تفضيل AgentQL. واجهة برمجة التطبيقات act/extract/observe الخاصة بـ Stagehand أسهل في الفهم عند تصحيح الأخطاء.
كيف يبدو واقع مسار عمل الوكيل
تتبع معظم إعدادات Stagehand في بيئة الإنتاج نمطاً يمكن التنبؤ به. تستخدم الخطوات الحتمية والمفهومة جيداً (المصادقة، الانتقال إلى الصفحة المستهدفة، تعيين عوامل التصفية) استدعاءات Playwright أو Stagehand العادية مع محددات صريحة. أما الخطوات التي يختلف فيها هيكل الصفحة (الجداول المحملة ديناميكياً، مكونات shadow-DOM، البيانات المصادق عليها خلف مسارات متعددة الخطوات) فتستدعي وظائف الذكاء الاصطناعي الأساسية لـ Stagehand. يحافظ هذا النهج الهجين على تكاليف LLM ضمن حدود معقولة: بتكلفة تتراوح بين $0.002 و $0.02 لكل استدعاء act/extract، فإن مسار عمل بخمس خطوات ذكاء اصطناعي يكلف أقل من $0.10 لكل تشغيل، وهو أمر قابل للتطبيق. تشغيل كل خطوة من خلال الذكاء الاصطناعي هو ما يوقع الفرق في مشاكل حسابية عند التوسع.
يختلف تصحيح الأخطاء عن تصحيح أخطاء Playwright الخالص. عندما يفشل استدعاء act() أو يسيء تفسير تعليمة غامضة، يظهر الخطأ كاستثناء في وقت التشغيل (runtime exception) مع تسجيل الإجراء المفسر للنموذج، لكن قراءة تتبعات قرارات الذكاء الاصطناعي هي مهارة مختلفة عن قراءة عدم تطابق المحددات. نقلت واجهة برمجة تطبيقات Stagehand (الصادرة في يونيو 2026) بعضاً من أعمال الترجمة هذه إلى بنية تحتية مدارة مع سجلات إجراءات قابلة للقراءة من قبل البشر وقابلية مراقبة على مستوى الرموز لكل خطوة، مما يعالج بشكل مباشر شكوى "الصندوق الأسود" من سلسلة نقاشات HN المبكرة.
"لا أعتقد أنه يمكنني تقديم حجة مقنعة لاستخدام نماذج LLM في وقت التشغيل في مجموعة الاختبار الخاصة بنا في العمل. النهج الصحيح هو استخدام الذكاء الاصطناعي للمساعدة في كتابة كود اختبار Playwright، وليس استبدال الجزء الحتمي." - mpalmer، Hacker News، 9 يناير 2025
تبين أن هذا التشكيك من سلسلة نقاشات الإطلاق على HN كان صحيحاً جزئياً وخاطئاً جزئياً. بالنسبة لمجموعات اختبار CI/CD حيث تكون الحتمية أمراً غير قابل للتفاوض، لا يزال نهج LLM في وقت التشغيل الخاص بـ Stagehand صعب التسويق. أما بالنسبة لمسارات أتمتة الإنتاج حيث تكون تكلفة الصيانة هي العدو الحقيقي، فقد أثبتت المقايضة جدارتها لشريحة كبيرة من الفرق. التمييز المعماري المهم هو أن Stagehand هو في الأساس أداة أتمتة متصفح تصادف أنها تعمل بشكل جيد في سياقات الاختبار، وليس إطار عمل للاختبار تمت إضافة ميزات الذكاء الاصطناعي إليه.
يأتي التعقيد التشغيلي الحقيقي عندما تحتاج إلى إمكانات البنية التحتية للمتصفح التي لا يوفرها Stagehand بشكل أصلي. اكتشاف الروبوتات، وحل اختبارات CAPTCHA، والوكلاء السكنيين، وتسجيل الجلسات، والتنفيذ متعدد المناطق، ومعالجة البيانات المتوافقة مع HIPAA، كلها تتطلب إما بيئة التشغيل المدارة المدفوعة Browserbase أو تجهيزات مخصصة كبيرة. يمكن للفرق التي تبني أتمتة داخلية بسيطة تشغيل Stagehand على نسخة Chromium محلية ودفع تكاليف واجهة برمجة تطبيقات LLM الخاصة بهم فقط. أما الفرق التي تبني وكلاء ويب على مستوى الإنتاج فتحتاج عادةً إلى كليهما.
لمن تم بناء Stagehand
مطورو TypeScript الذين يبنون وكلاء متصفح لأتمتة الإنتاج هم الجمهور الأساسي. مهندسو ضمان الجودة (QA) الذين يرغبون في كتابة اختبارات بلغة طبيعية قابلة للقراءة من قبل البشر، دون الالتزام بصيانة محددات Playwright، هم جمهور ثانوي قوي. الفرق التي تمتلك بالفعل قواعد برمجية لـ Playwright وترغب في تعزيز خطوات معينة بالتفكير المنطقي للذكاء الاصطناعي (بدلاً من استبدال الحزمة بأكملها) هي شريحة ثالثة يندمج معها Stagehand بسلاسة.
يتناسب Stagehand أيضاً بشكل طبيعي مع أطر عمل وكلاء الذكاء الاصطناعي. تتوافق وظائفه الأساسية act/extract/observe بشكل جيد مع استدعاءات الأدوات في البنى المعمارية المشابهة لـ OpenAI Agents SDK، حيث يقرر وكيل التخطيط إجراءات الويب التي يجب اتخاذها ويقوم Stagehand بتنفيذها. غالباً ما تجمع الفرق التي تبني مسارات بيانات تتضمن بيانات الويب إلى جانب المصادر المهيكلة بين Stagehand للاستخراج وأدوات مثل Firecrawl (لاستخراج المستندات النظيفة) أو Apify (للبنية التحتية القابلة للتوسع في استخراج البيانات). يتعامل Stagehand مع السيناريوهات المصادق عليها، والمليئة بـ JavaScript، وتعبئة النماذج التي لا يمكن لزواحف الويب الثابتة الوصول إليها.
يؤكد إنجاز جولة التمويل Series B (يونيو 2025) وأكثر من 500,000 تنزيل أسبوعي على NPM أن Stagehand قد تخرج من كونه تجربة مفتوحة المصدر واعدة ليصبح إطار عمل يحظى باعتماد حقيقي في بيئة الإنتاج ويدعمه فريق ممول. تزيل بنية CDP في الإصدار v3 الاعتماد على مصدر محدد (Playwright)، مما يقلل من خطر أن تؤدي التغييرات في الأجزاء الداخلية لـ Playwright إلى كسر سلوك Stagehand.
ما لا يمثله Stagehand
لا يُعد Stagehand بديلاً لـ Playwright في الأتمتة ذات الحجم الكبير والحساسة للتكلفة. عند 10,000 عملية استخراج يومياً، تتراوح رسوم LLM بين $50 و $200 يومياً مع النماذج متوسطة المستوى، حتى مع التخزين المؤقت. بالنسبة لهذا الحجم مع هياكل صفحات مستقرة ومفهومة جيداً، فإن صيانة محددات Playwright تكون أرخص. تعتمد نقطة التعادل حيث تفوق وفورات صيانة Stagehand تكاليف LLM الخاصة به بشكل كبير على مدى تكرار تغيير المواقع المستهدفة لـ DOM الخاص بها ومدى تكلفة وقت مهندسيك.
لا يُعد Stagehand أداة تركز على التشغيل المحلي أولاً أو الخصوصية أولاً. فهو يتطلب بيانات اعتماد واجهة برمجة تطبيقات LLM السحابية لكل خطوة تعتمد على الذكاء الاصطناعي. دعم Browser-Use لـ Ollama يجعله الخيار الأفضل للفرق التي لا تستطيع إرسال محتوى الصفحة إلى واجهات برمجة تطبيقات خارجية بسبب متطلبات إقامة البيانات أو السياسة الأمنية.
إنه ليس أداة بدون كود (no-code) تعتمد على التأشير والنقر. Stagehand عبارة عن حزمة تطوير برمجيات (SDK) للمطورين. أنت تكتب كود TypeScript (أو Python). اللغة الطبيعية موجودة داخل استدعاءات الأساليب، وليس في منشئ مسارات عمل مرئي. يجب على الفرق التي لا تمتلك قدرات هندسية إلقاء نظرة على منتج Director.ai من Browserbase (الصادر في يونيو 2025) للحصول على واجهة وكيل متصفح بدون كود.
إنه ليس بديلاً كاملاً للتصفح الخاضع لإشراف بشري في السياقات الحساسة. تتطلب المعاملات المالية، وإدخال بيانات الرعاية الصحية، ومسارات عمل المستندات القانونية خطوات موافقة، وسجلات تدقيق، وأدوات امتثال لا يوفرها Stagehand بشكل جاهز. إطار العمل هو بنية تحتية، وليس منتج امتثال.
أخيراً، لا يُعد Stagehand مناسباً تماماً لمهام البحث الاستكشافية والمفتوحة حيث لا يكون التسلسل الدقيق لإجراءات المتصفح معروفاً مسبقاً. إذا كان هدفك هو "العثور على أفضل سعر لـ X عبر هذه المواقع الـ 12" دون مسار عمل ثابت، فإن حلقة التفكير المستقلة في Browser-Use تتعامل مع استكشاف الويب الموجه نحو الهدف بشكل طبيعي أكثر من نموذج الوظائف الأساسية القابلة للتركيب في Stagehand. بالنسبة لمسارات عمل الإنتاج القابلة للتكرار بخطوات محددة ونتائج قابلة للقياس، فإن النهج الهجين لـ Stagehand يؤتي ثماره. أما بالنسبة لمهام البحث الغامضة ومتعددة الأدوار، فقد يخدمك إطار عمل أكثر استقلالية (agentic) بشكل أفضل.
تقييمات المستخدمين
لا توجد تقييمات بعد. كن أول من يشارك تجربته!
سجّل الدخول لكتابة تقييم.
ظهرت في مجموعات
قوائم منتقاة تتضمّن Stagehand.
مقالات ذات صلة
أدلة ومقالات ذات صلة بـ Stagehand.

AI User Testing in 2026: The Tools That Test Your Product While You Sleep

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Turn Any AI Agent Into a Superagent: The 12-Integration Stack (2026)

AI Agents for Business: What They Actually Are and 12 Things You Can Automate Today

Ship Your First MCP Server in 20 Minutes (2026)
