ذكاء اصطناعي13 سبتمبر 20263 دقائق قراءة

نموذج واحد أو عدة نماذج داخل منتجك؟ توجيه المهام بين نماذج الذكاء الاصطناعي

للمطوّرين وأصحاب المنتجات: كيف توزع مهام منتجك بين نماذج ذكاء اصطناعي كبيرة وصغيرة حسب الجودة والسرعة والتكلفة، وكيف تبني اختبارات تقييم قبل تغيير أي نموذج.

🔀

أغلب المنتجات تبدأ بقرار سريع: «نستخدم أقوى نموذج متاح لكل شي». يشتغل ممتاز في التجربة، وبعد ما يزيد المستخدمون تجي الفاتورة، ويلاحظ الفريق إن نصف الاستدعاءات كانت تصنيف رسالة لثلاث فئات — مهمة ما تحتاج أقوى نموذج في العالم. اختيار النموذج مو قرار واحد للمنتج، هو قرار لكل مهمة داخله.

فكّك منتجك إلى مهام

قبل مقارنة النماذج، اكتب قائمة بكل مكان يستدعي فيه منتجك نموذجاً لغوياً، وصنّف كل مهمة على ثلاثة محاور: كم تحتاج استنتاجاً معقداً؟ كم حساسة للتأخير (المستخدم ينتظر أو تشتغل في الخلفية)؟ وكم مرة تتكرر؟

  • تصنيف وتوجيه واستخراج حقول: غالباً يكفيها نموذج صغير سريع.
  • ردود محادثة عادية على أسئلة من قاعدة معرفة: نموذج متوسط غالباً.
  • تحليل معقد، كتابة كود، تخطيط متعدد الخطوات، قرارات وكيل: نموذج قوي.
  • مهام خلفية ضخمة غير عاجلة: ابحث عن خيارات المعالجة الدفعية (batch) الأرخص إن توفرت.

أنماط التوجيه الشائعة

  • توجيه ثابت: كل نوع مهمة مربوط بنموذج محدد في الكود. بسيط وواضح، وكافٍ لأغلب المنتجات.
  • مصنّف أولاً: نموذج صغير يقرأ الطلب ويقرر: بسيط يروح للصغير، معقد يروح للكبير.
  • التصعيد عند الفشل: جرّب الصغير، ولو فشل التحقق من المخرج (صيغة غلط، ثقة منخفضة) أعد بالكبير.
  • منسق ومنفذون: نموذج قوي يخطط، ونماذج أصغر تنفذ الخطوات البسيطة.

بدون اختبارات تقييم، أنت تخمّن

أخطر شي تسويه: تبدّل النموذج لأنه «أرخص وقالوا إنه قريب في الأداء». الأداء العام في المقارنات المنشورة ما يعني أداءه على مهمتك وبياناتك ولغتك. قبل أي تغيير، ابنِ مجموعة تقييم (evals) بسيطة:

  • عينة من مدخلات حقيقية متنوعة من منتجك، تشمل الحالات الصعبة والعربية العامية.
  • لكل مدخل: المخرج المتوقع أو معايير واضحة للحكم عليه.
  • تقييم آلي حيث أمكن (صيغة JSON صحيحة، الفئة الصحيحة)، وتقييم بشري أو بنموذج آخر للنصوص الحرة.
  • تشغيل المجموعة على كل نموذج مرشح، وتسجيل الجودة والتأخير والتكلفة التقديرية.

عوامل غير الجودة

  • التأخير: الوقت حتى أول كلمة مهم في المحادثة، والوقت الكلي مهم في الخلفية.
  • طول السياق: هل تحتاج تمرر مستندات طويلة؟
  • دعم الأدوات والمخرجات المنظمة بشكل موثوق.
  • سياسات البيانات: الاحتفاظ بالمدخلات، ومكان المعالجة، ومتطلبات عملائك.
  • التخزين المؤقت للبرومبت (prompt caching) لو عندك تعليمات طويلة ثابتة تتكرر — قد يخفض التكلفة بشكل ملحوظ.
  • الاعتماد على مزوّد واحد: صمّم طبقة تجريد بسيطة تسهّل التبديل.

لا تبالغ في التحسين مبكراً

في مرحلة MVP، نموذج واحد جيد لكل شي قرار معقول: تركيزك على إثبات إن المنتج مطلوب. التوجيه يستحق لما يصير عندك حجم استخدام حقيقي، وبيانات تعرف منها وين تذهب التكلفة، ومجموعة تقييم تحميك من التراجع. التوجيه بدون قياس مجرد تعقيد إضافي.

مثال: منتج خدمة عملاء لمتاجر إلكترونية

تخيل منصة SaaS ترد على رسائل عملاء المتاجر. كل رسالة تمر بثلاث مراحل. الأولى تصنيف: هل هي تتبع طلب، إرجاع، سؤال عن منتج، شكوى، أو شي آخر؟ مهمة قصيرة متكررة جداً، نموذج صغير سريع يكفيها، ومخرجها فئة واحدة يسهل التحقق منها. الثانية الرد: للأسئلة المعتادة من قاعدة المعرفة، نموذج متوسط يكتب رداً طبيعياً بالعربي. الثالثة الحالات المعقدة: شكوى متشعبة أو طلب فيه تعارض مع السياسة، هنا يستحق النموذج الأقوى، أو التحويل لإنسان.

  • التصنيف: الأسرع والأرخص، ويُقيَّم آلياً بدقة الفئة.
  • الرد المعتاد: توازن بين الجودة والتكلفة، ويُقيَّم بعينة بشرية.
  • الحالات المعقدة: الجودة أولاً، والحجم قليل أصلاً فالتكلفة محتملة.
  • لو المصنّف غير واثق، الرسالة تُعامل كحالة معقدة احتياطاً.

بهذا التوزيع، أغلب الحجم يمر على نماذج أرخص، والنموذج الأغلى يشتغل فقط وين يفرق فعلاً.

في منصة أزهل الرقمية نبني أنظمة SaaS ووكلاء ذكاء اصطناعي، ونختار النموذج لكل مهمة حسب طبيعتها لا حسب الضجة. لو منتجك يستخدم الذكاء الاصطناعي والتكلفة أو الجودة مو واضحة لك، تواصل معنا على واتساب ونراجعها معك.

جاهز تبدأ مشروعك مع أزهل؟

تواصل معنا الحين، وخلنا نطلّع فكرتك على أرض الواقع.