IBM Research يختبر توجيه وكلاء الذكاء الاصطناعي عبر التكلفة والكمون والدقة
قال منشور على Hugging Face من IBM Research إن توجيه نماذج وكلاء الذكاء الاصطناعي في المؤسسات يجب أن يحسن التكلفة والجودة والكمون معا بعد أن عكست اختبارات AppWorld مقارنة بسيطة لأسعار الرموز.

يتحول توجيه النماذج في وكلاء الذكاء الاصطناعي داخل المؤسسات إلى مسألة تكلفة وأنظمة تشغيل، لا إلى اختيار بسيط بين نموذج كبير وآخر صغير. في منشور على Hugging Face بتاريخ 15 يوليو كتبه Yara Rizk وEyal Shnarch وJason Tsay وMerve Unuvar من ibm-research، قال الفريق إن أنظمة التوجيه يجب أن توازن بين سلوك التخزين المؤقت وشكل عبء العمل والكمون وقواعد الحوكمة قبل تحديد النموذج الذي يعالج المهمة.
تكمن أهمية المنشور في أنه يختبر افتراضا شائعا لدى الشركات: أسعار الرموز الأقل لا تعني بالضرورة تكلفة تشغيل أقل. استخدم مثال IBM Research أعباء عمل لوكلاء ذكاء اصطناعي، حيث يمكن للسياق المتكرر وخطوات الأدوات أن تغير منحنى التكلفة الحقيقي بعد بدء تنفيذ الطلب.
تكاليف AppWorld تعاكس افتراض أسعار الرموز
عبر 417 مهمة في AppWorld Test Challenge باستخدام وكيل CodeAct نفسه، قال منشور Hugging Face إن Sonnet كلف 79 دولارا إجمالا، أو 0.19 دولار لكل مهمة، بينما كلف GPT-4.1 مبلغ 155 دولارا، أو 0.37 دولار لكل مهمة. وكتب المؤلفون أن النتيجة خالفت ما توحي به جداول الأسعار لأن GPT-4.1 لديه أسعار رموز معلنة أقل ولأن Sonnet احتاج إلى نحو ثلاثة أضعاف خطوات الاستدلال.
قدم التخزين المؤقت التفسير التشغيلي. يمكن لأعباء عمل الوكلاء أن تعيد استخدام أجزاء كبيرة من السياق نفسه عبر الخطوات، وقال المنشور إن أسعار قراءة التخزين المؤقت الأقل لدى Sonnet سمحت له بالاستفادة أكثر من هذا النمط. وبالنسبة للشركات التي تنشر وكلاء متعددة الخطوات، تصبح المقارنة المهمة هي تكلفة سير العمل الكامل لا السعر الاسمي لمطالبة واحدة.
صعوبة التوجيه تظهر بعد بدء التنفيذ
جادل المنشور نفسه بأن التوجيه حسب صعوبة المهمة يتعطل عندما تبدو المهمة بسيطة عند المدخل لكنها تتوسع أثناء التنفيذ. فطلب تلخيص عقد، على سبيل المثال، قد يستدعي الاسترجاع وفحوص الامتثال واستدعاء الأدوات وجولات من المراجعة، بينما قد يتعامل نموذج أصغر متخصص بكفاءة مع مطالبة تقنية.
يغير ذلك وظيفة نظام التوجيه. قدم IBM Research التوجيه في الإنتاج بوصفه موازنة بين التكلفة والجودة والكمون والامتثال والاعتمادية، مع قيود مؤسسية مثل إقامة البيانات وقواعد الخصوصية وقوائم النماذج المعتمدة التي قد تتجاوز النموذج الذي يبدو أفضل للمهمة.
يضيف الكمون طبقة أخرى. قال المنشور إن عبء التوجيه وموقع العتاد وحمل نقطة النهاية ودفء التخزين المؤقت يمكن أن تهيمن على التجربة التي يشعر بها المستخدم. التوجيه مرة واحدة لكل مهمة يحد من العبء، بينما يمنح التوجيه في كل خطوة مرونة أكبر لكنه يضيف نقاط قرار وتعقيدا تشغيليا.
IBM Research يختبر موجها قائما على التحسين
قال المؤلفون إن الموجه توقف عن التعامل مع اختيار النموذج كتصنيف، وبدأ يحسن عبر التكلفة والجودة والكمون. في AppWorld Test Challenge مع وكيل CodeAct، قال IBM Research إن إعدادا محسنا للكمون حقق دقة 84% مقابل 93 دولارا و83s، بما يمثل خفضا في التكلفة بنسبة 21% وخفضا في الكمون بنسبة 9% مقارنة بتشغيل Opus وحده، مع انخفاض في الدقة قدره 4%.
وقال المنشور أيضا إن طبقة التحسين استخدمت نحو 6 ms و2 kB من الذاكرة لكل مهمة، ما يحد من خطر أن يصبح الموجه نفسه عنق زجاجة. وبحسب المقارنة نفسها، وصل موجه تقليدي قائم على الصعوبة إلى نطاق دقة مشابه بتكلفة أعلى لأنه لم يبحث في مساحة المفاضلات الأوسع.
بالنسبة إلى فرق الذكاء الاصطناعي في المؤسسات، تعني النتيجة العملية أن التوجيه لا يمكن الحكم عليه فقط من خلال ما إذا كان المصنف قد اختار أقوى نموذج. يجب أن تشمل نقطة التشغيل حالة البنية التحتية واقتصاديات التخزين المؤقت وحدود الحوكمة والكمون الذي يراه المستخدم. ولم ينشر المنشور التصميم التقني الكامل للموجه أو جدول الإعدادات الأساسي أو نتائج نشر لدى العملاء؛ وتبقى هذه التفاصيل خارج السجل العام إلى أن يصدر IBM Research المتابعة التي وعد بها.


















