تخطَّ إلى المحتوى الرئيسي
Vantaige
Together AI screenshot

تعتبر Together AI السحابة المفضلة لاستنتاج النماذج مفتوحة المصدر، حيث تقدم أكثر من 200 نموذج بما في ذلك Llama 4 Maverick و DeepSeek-R1 و Qwen مع واجهات برمجة تطبيقات (APIs) متوافقة مع OpenAI، وتسعير لكل رمز (per-token)، وضبط دقيق كامل وبتقنية LoRA، وتأجير مجموعات وحدات معالجة الرسومات (GPU)، وبيئة Code Sandbox متكاملة لسير عمل الوكلاء الذكيين.

حالات الاستخدام:البرمجة والتطوير
الميزات:API

تُعد Together AI منصة سحابية مصممة خصيصاً لاستضافة النماذج مفتوحة المصدر. تأسست شركة Together Computer, Inc. في عام 2022 ويقع مقرها الرئيسي في سان فرانسيسكو، وتدير ما تطلق عليه "AI Native Cloud": وهي بيئة متكاملة لتشغيل الاستنتاج، والضبط الدقيق للنماذج المخصصة، واستئجار أجهزة GPU المخصصة، وبناء تطبيقات الذكاء الاصطناعي القائمة على الوكلاء. بفضل جولة التمويل من السلسلة B بقيمة $305 مليون التي جمعتها في فبراير 2025 بتقييم بلغ $3.3 مليار (بقيادة General Catalyst، مع دعم من NVIDIA و Kleiner Perkins)، رسخت Together AI مكانتها كطبقة سحابية محايدة أساسية لنظام الذكاء الاصطناعي مفتوح المصدر، حيث تخدم أكثر من 450,000 مطور اعتباراً من أوائل عام 2025.

تمنح المنصة المطورين وصولاً عبر واجهة برمجة التطبيقات (API) إلى أكثر من 200 نموذج مفتوح المصدر تم اختياره بعناية، بما في ذلك Llama 4 Maverick و Scout و DeepSeek-R1 و DeepSeek-V3.1 و Qwen3.5 ومتغيرات Mistral ونماذج صور FLUX و Whisper للصوت. تتوافق واجهة برمجة التطبيقات تماماً مع OpenAI، مما يعني أنه يمكنك استبدال استدعاءات OpenAI SDK بتغيير نقطة نهاية (endpoint) واحدة فقط. وإلى جانب الاستنتاج، تقدم Together AI ضبطاً دقيقاً بتقنية LoRA وبالمعلمات الكاملة، ومثيلات GPU مخصصة (H100 و H200 و B200)، وتأجير مجموعات GPU عند الطلب، وبيئة Code Sandbox متكاملة لتنفيذ التعليمات البرمجية بأمان في سير عمل الوكلاء، والتي تم الاستحواذ عليها من CodeSandbox في ديسمبر 2024.

ما الذي تقدمه Together AI فعلياً في أبريل 2026

في جوهرها، تُعد Together AI بوابة واجهة برمجة تطبيقات (API) وطبقة حوسبة للنماذج مفتوحة المصدر. تقوم باستدعاء نقطة نهاية، وتحديد نموذج، وتلقي الرموز بسرعات تصل إلى 354 رمزاً في الثانية على النماذج المحسنة مثل Kimi K2.5 و 95 رمزاً في الثانية على Llama 3.3 70B في ظل ظروف الحوسبة بدون خادم (serverless) القياسية. يقلل وضع الاستنتاج الدفعي (Batch Inference) التكاليف بنسبة 50% لأعباء العمل غير المتزامنة، ويدعم ما يصل إلى 30 مليار رمز في قائمة الانتظار لكل تشغيل للنموذج.

يقبل مسار الضبط الدقيق مجموعات بيانات JSONL ويدعم كلاً من LoRA (فعال من حيث المعلمات، بتكلفة $0.48 لكل مليون رمز للنماذج التي تصل إلى 16B) والضبط الدقيق الكامل ($1.20 لكل مليون رمز)، مع إمكانية تصدير الأوزان المدربة مباشرة إلى Hugging Face. تتيح لك نقاط نهاية الاستنتاج المخصصة تثبيت وحدة معالجة رسومات واحدة (H100 بسعر $3.99/ساعة، H200 بسعر $5.49/ساعة، B200 بسعر $9.95/ساعة) لنموذجك المخصص أو المستضاف لضمان إنتاجية ثابتة.

أضاف الاستحواذ على CodeSandbox في ديسمبر 2024 إمكانية جديدة ومهمة. توفر Together Code Sandbox أجهزة افتراضية معزولة في أقل من 3 ثوانٍ، قابلة للاستئناف من وضع الإسبات في 511 مللي ثانية (P95)، مع إمكانية توسيع بيئات الحماية (sandboxes) لتصل إلى 64 vCPUs و 128 GB RAM. يتيح ذلك لوكلاء البرمجة بالذكاء الاصطناعي تنفيذ التعليمات البرمجية المُنشأة بأمان دون المساس بأنظمة الإنتاج. على سبيل المثال، استخدمت HeroUI بيئة Together Code Sandbox لتقليل وقت تطوير HeroUI Chat من 5 أشهر إلى أسبوعين، مع انخفاض وقت بدء تشغيل الجهاز الافتراضي من دقيقتين إلى أقل من ثانيتين.

توفر المنصة أيضاً مساحة تخزين مُدارة (بدون رسوم خروج بيانات بسعر $0.16/GiB/شهر) وإمكانية الوصول إلى تأجير مجموعات GPU: مثل NVIDIA HGX H100 بسعر $3.49/ساعة، و HGX H200 بسعر $4.19/ساعة، و HGX B200 بسعر $7.49/ساعة عند الطلب، مع توفر أسعار محجوزة للالتزامات لمدة 6 أشهر عبر فريق المبيعات.

على الجانب البحثي، تنشر Together أعمالاً متعلقة بالأنظمة معترف بها في ICLR و ICML و NeurIPS و MLSys. يحقق عملهم في FlashAttention-4 أداءً أسرع بما يصل إلى 1.3x مقارنة بـ cuDNN على NVIDIA Blackwell، وتوفر مسرعات التعلم في وقت التشغيل ATLAS الخاصة بهم استنتاجاً أسرع لنماذج LLM بما يصل إلى 4x في المعايير الداخلية.

"نحن نعتمد على واجهة برمجة تطبيقات الاستنتاج الدفعي (Batch Inference API) لمعالجة كميات كبيرة جداً من الطلبات. تتيح لنا حدود المعدل العالية، التي تصل إلى 30B رمز في قائمة الانتظار، إجراء تجارب ضخمة دون اختناقات، وتكتمل المهام باستمرار في وقت أقل بكثير من اتفاقية مستوى الخدمة (SLA) البالغة 24 ساعة، وغالباً في غضون ساعات قليلة." - مستخدم مؤسسي، مدونة Together AI، 2025

موقع Together AI مقارنة بـ Replicate و Fireworks AI

تهيمن ثلاث منصات على نقاشات المطورين حول استضافة النماذج مفتوحة المصدر: Together AI و Replicate و Fireworks AI. وهي تختلف جوهرياً في فلسفة اختيار النماذج، وتصميم واجهة برمجة التطبيقات، وسرعة الاستنتاج، وما تبدو عليه الخدمات "ما بعد الاستنتاج".

تدير Replicate سوقاً مجتمعياً للنماذج يضم أكثر من 50,000 نموذج معبأ بـ Cog، مقارنة بـ 200 نموذج مختار بعناية لدى Together. إذا كنت بحاجة إلى نموذج بحثي متخصص، أو متغير Stable Diffusion مضبوط بدقة، أو مسار عمل منشور من قبل المجتمع، فمن المرجح جداً أن تجده في Replicate. تستضيف Replicate أيضاً نماذج مغلقة المصدر (GPT-4 و Claude و Gemini) إلى جانب الخيارات مفتوحة المصدر، وهو ما لا تفعله Together AI. ومع ذلك، تستخدم Replicate تنسيق REST API خاصاً غير متوافق مع OpenAI، مما يعني أن الترحيل من تكامل OpenAI يتطلب المزيد من التغييرات في التعليمات البرمجية. تقوم Replicate بالفوترة لكل ثانية من حوسبة GPU (مثل T4 بسعر $0.000225/ثانية، و A100 بسعر $0.001400/ثانية)، وهو أقل قابلية للتنبؤ لأعباء العمل النصية مقارنة بتسعير Together لكل رمز. في ظل أحمال العمل المتزامنة عالية الإنتاجية، تتوسع Replicate أيضاً بكفاءة أقل: وجدت إحدى مقارنات المطورين أنها "تباطأت بشكل كبير مع زيادة الطلبات المتزامنة"، بينما "توسعت Together AI بشكل أفضل للمهام عالية الإنتاجية". تفتقر Replicate إلى مسار ضبط دقيق على مستوى الإنتاج يعادل سير عمل LoRA أو الضبط الدقيق الكامل في Together.

تُعد Fireworks AI أقرب منافس مباشر لـ Together. تستخدم Fireworks أنوية FireAttention CUDA مخصصة تدفع سرعة الاستنتاج إلى ما هو أعلى من التحسين العام لوحدات GPU في Together: في معايير الربع الأول من عام 2026 من TokenMix، حققت Fireworks وقت استجابة للرمز الأول (TTFT P50) قدره 150ms مقابل 220ms في Together على نموذج Llama 3.3 70B، وإنتاجية تبلغ حوالي 145 رمزاً/ثانية مقابل 95 رمزاً/ثانية في Together على نفس النموذج. بالنسبة لواجهات برمجة تطبيقات الإنتاج الحساسة لزمن الوصول، تتمتع Fireworks بميزة سرعة قابلة للقياس. ومع ذلك، تمتلك Together AI كتالوجاً أوسع (أكثر من 200 نموذج مقابل أكثر من 100 في Fireworks) وتقدم ضبطاً دقيقاً كاملاً إلى جانب LoRA، بينما تتخصص Fireworks في LoRA مع خدمة multi-LoRA (محولات متعددة مضبوطة بدقة على نفس النموذج الأساسي في وقت واحد). لا يوجد مكافئ مباشر لمنتج تأجير مجموعات GPU من Together (مجموعات NVLink ذاتية الخدمة، وآلاف وحدات GPU) في Fireworks. التسعير لكل رمز لنموذج Llama 70B متطابق تقريباً: Together بسعر $0.88/1M رمز مقابل Fireworks بسعر $0.90/1M رمز.

"قدمت منصة Together Enterprise Platform انخفاضاً بمقدار 2x في زمن الوصول إلى الرمز الأول (TTFT) وخفضت تكاليفنا بحوالي الثلث." - مستخدم مؤسسي، دراسة حالة Together AI، 2025

كيف يبدو واقع سير العمل

بالنسبة لمعظم المهندسين، تبدأ التجربة اليومية بتغيير سطر واحد في واجهة برمجة التطبيقات. قم بتوجيه عنوان URL الأساسي في OpenAI SDK الخاص بك إلى نقطة نهاية Together AI، وقم بتعيين مفتاح API الخاص بك، واستدعِ Llama 4 Maverick بسعر $0.27 لكل مليون رمز إدخال بدلاً من GPT-4o بسعر $2.50. زمن الوصول مناسب للإنتاج: يبلغ TTFT P50 حوالي 220ms، و P95 حوالي 450ms لاستجابة مكونة من 500 رمز.

يتطلب الضبط الدقيق إعداداً أكثر تعمداً. تقوم بإعداد مجموعة بيانات JSONL، وتحديد نموذج أساسي، والاختيار بين LoRA (أسرع، وأرخص، وجيد لمعظم التعديلات الخاصة بالمهام) والضبط الدقيق الكامل (أبطأ، وأكثر تكلفة، وأفضل لتحولات المجال)، ثم إرسال مهمة تدريب عبر واجهة برمجة التطبيقات أو واجهة الويب. الوثائق الخاصة بالأساسيات قوية؛ لكن الوثائق الخاصة بضبط المعلمات الفائقة (hyperparameter tuning) المتقدمة نادرة لدرجة أن المطورين يلجأون بانتظام إلى المنتديات للحصول على إرشادات. تصدير الأوزان إلى Hugging Face عملية مباشرة بمجرد اكتمال التدريب.

يُعد سير عمل Code Sandbox أحدث وموجهاً نحو التطبيقات القائمة على الوكلاء: يقوم نموذج LLM الخاص بك بإنشاء تعليمات برمجية، وتقوم حزمة Code Sandbox SDK بتوفير جهاز افتراضي معزول في أقل من 3 ثوانٍ، وتنفذ التعليمات البرمجية، وتعيد المخرجات القياسية (stdout) ومخرجات الملفات، ثم تقوم بتفكيك الجهاز الافتراضي أو أخذ لقطة له. بسعر $0.03 لكل جلسة و $0.0446/ساعة لكل vCPU، تعتبر الجوانب الاقتصادية معقولة لأدوات البرمجة بالذكاء الاصطناعي.

تكمن الصعوبة في سير العمل في المراقبة. لا توفر Together AI لوحة معلومات LLMOps أصلية. لا يوجد تسجيل مدمج للمطالبات، أو إسناد التكلفة لكل مستخدم، أو تنبيهات للحالات الشاذة. تقوم الفرق التي تبني تطبيقات الإنتاج بشكل روتيني بدمج أدوات مثل LangSmith أو Helicone أو Langfuse لسد هذه الفجوة. كما تصل الباقة المجانية إلى حدود المعدل (60 طلباً/دقيقة) مما قد يفاجئ المطورين الذين يختبرون ميزة ما ويجدون أنها مقيدة فجأة قبل الترقية إلى خطة مدفوعة.

لمن صُممت Together AI

تستهدف Together AI ملفاً شخصياً محدداً: المهندسون وفرق تعلم الآلة (ML) الذين قرروا بالفعل البناء على نماذج مفتوحة المصدر ويريدون بنية تحتية مُدارة بدلاً من خوادم GPU ذاتية الاستضافة. يغطي ذلك نطاقاً واسعاً: شركة ناشئة تستبدل OpenAI بـ Llama 4 لخفض تكاليف API بنسبة 80%، أو فريق ML يقوم بضبط دقيق لنموذج خاص بالرعاية الصحية على بيانات سريرية خاصة، أو مؤسسة تقوم بتشغيل 50 مليار رمز شهرياً من خلال الاستنتاج الدفعي لمعالجة المستندات، أو شركة ناشئة لمساعد برمجة بالذكاء الاصطناعي تحتاج إلى بيئة حماية لتنفيذ التعليمات البرمجية دون الحاجة إلى بنائها داخلياً.

تناسب المنصة فرق علوم البيانات بشكل جيد أيضاً. تتوفر التضمينات (Embeddings) لمسارات RAG، ونماذج الرؤية لفهم الصور، ونموذج Llama 4 Maverick متعدد الوسائط للمنتجات التي تمزج بين المدخلات النصية والصورية، وكل ذلك متاح تحت نفس مفتاح API وحساب الفوترة. تجعل طبقة التخزين الخالية من رسوم خروج البيانات من العملي تخزين مجموعات بيانات التدريب وأوزان النماذج على البنية التحتية لـ Together دون تراكم تكاليف نقل البيانات.

ما لا تقدمه Together AI

إن Together AI ليست منتجاً بدون تعليمات برمجية (no-code). لا يوجد منشئ سير عمل مرئي، ولا محدد نماذج بالسحب والإفلات، ولا إعداد موجه للمستخدمين غير التقنيين. إذا كنت لا تستطيع كتابة كود Python أو استدعاء REST API، فلن تقدم لك المنصة أي قيمة.

كما أنها ليست أداة للمراقبة (observability). إذا كنت بحاجة إلى عمليات LLMOps للإنتاج (لوحات معلومات التكلفة، وتسجيل كل طلب، ومدرجات تكرارية لزمن الوصول، وإدارة إصدارات المطالبات)، فستحتاج إلى تكامل مع جهة خارجية. المراقبة الأصلية في Together أساسية لدرجة أن العديد من مواقع المراجعة تشير إليها كفجوة كبيرة.

لا تستضيف Together AI نماذج احتكارية مغلقة المصدر. إذا كان فريقك يقيم GPT-4 و Claude و Gemini إلى جانب الخيارات مفتوحة المصدر ويريد بوابة API واحدة للجميع، فستحتاج إلى طبقة توجيه منفصلة أو مزود مختلف. رهان Together ينصب بالكامل على النظام البيئي مفتوح المصدر.

أخيراً، لا تُعد Together AI الخيار الأمثل للاستنتاج المحسن للسرعة للتطبيقات التي تهم فيها كل 50 مللي ثانية. إذا كان TTFT P50 البالغ 150ms مقابل 220ms هو العامل الحاسم، فإن أنوية الاستنتاج المخصصة من Fireworks AI تتفوق في المعايير الحالية. تُعد Together الخيار الأفضل عندما يكون اتساع النماذج، وعمق الضبط الدقيق، ونطاق البنية التحتية (مجموعات GPU، و Code Sandbox، والتخزين) أكثر أهمية من السرعة المجردة.

تقييمات المستخدمين

لا توجد تقييمات بعد. كن أول من يشارك تجربته!

سجّل الدخول لكتابة تقييم.

مقالات ذات صلة

أدلة ومقالات ذات صلة بـ Together AI.