Analysis
CAPACITY TEST:

IBM Research يختبر توجيه وكلاء الذكاء الاصطناعي عبر التكلفة والكمون والدقة

موجز التحرير

قال منشور على Hugging Face من IBM Research إن توجيه نماذج وكلاء الذكاء الاصطناعي في المؤسسات يجب أن يحسن التكلفة والجودة والكمون معا بعد أن عكست اختبارات AppWorld مقارنة بسيطة لأسعار الرموز.

تمت المراجعة مقابل مواد المصدرتحرير مكتب الذكاء الاصطناعي والمؤسسات في SendTech Times
IBM Research يختبر توجيه وكلاء الذكاء الاصطناعي عبر التكلفة والكمون والدقة
مصدر الصورة: Hugging Face Blog / IBM Research

يتحول توجيه النماذج في وكلاء الذكاء الاصطناعي داخل المؤسسات إلى مسألة تكلفة وأنظمة تشغيل، لا إلى اختيار بسيط بين نموذج كبير وآخر صغير. في منشور على Hugging Face بتاريخ 15 يوليو كتبه Yara Rizk وEyal Shnarch وJason Tsay وMerve Unuvar من ibm-research، قال الفريق إن أنظمة التوجيه يجب أن توازن بين سلوك التخزين المؤقت وشكل عبء العمل والكمون وقواعد الحوكمة قبل تحديد النموذج الذي يعالج المهمة.

تكمن أهمية المنشور في أنه يختبر افتراضا شائعا لدى الشركات: أسعار الرموز الأقل لا تعني بالضرورة تكلفة تشغيل أقل. استخدم مثال IBM Research أعباء عمل لوكلاء ذكاء اصطناعي، حيث يمكن للسياق المتكرر وخطوات الأدوات أن تغير منحنى التكلفة الحقيقي بعد بدء تنفيذ الطلب.

تكاليف AppWorld تعاكس افتراض أسعار الرموز

عبر 417 مهمة في AppWorld Test Challenge باستخدام وكيل CodeAct نفسه، قال منشور Hugging Face إن Sonnet كلف 79 دولارا إجمالا، أو 0.19 دولار لكل مهمة، بينما كلف GPT-4.1 مبلغ 155 دولارا، أو 0.37 دولار لكل مهمة. وكتب المؤلفون أن النتيجة خالفت ما توحي به جداول الأسعار لأن GPT-4.1 لديه أسعار رموز معلنة أقل ولأن Sonnet احتاج إلى نحو ثلاثة أضعاف خطوات الاستدلال.

قدم التخزين المؤقت التفسير التشغيلي. يمكن لأعباء عمل الوكلاء أن تعيد استخدام أجزاء كبيرة من السياق نفسه عبر الخطوات، وقال المنشور إن أسعار قراءة التخزين المؤقت الأقل لدى Sonnet سمحت له بالاستفادة أكثر من هذا النمط. وبالنسبة للشركات التي تنشر وكلاء متعددة الخطوات، تصبح المقارنة المهمة هي تكلفة سير العمل الكامل لا السعر الاسمي لمطالبة واحدة.

صعوبة التوجيه تظهر بعد بدء التنفيذ

جادل المنشور نفسه بأن التوجيه حسب صعوبة المهمة يتعطل عندما تبدو المهمة بسيطة عند المدخل لكنها تتوسع أثناء التنفيذ. فطلب تلخيص عقد، على سبيل المثال، قد يستدعي الاسترجاع وفحوص الامتثال واستدعاء الأدوات وجولات من المراجعة، بينما قد يتعامل نموذج أصغر متخصص بكفاءة مع مطالبة تقنية.

يغير ذلك وظيفة نظام التوجيه. قدم IBM Research التوجيه في الإنتاج بوصفه موازنة بين التكلفة والجودة والكمون والامتثال والاعتمادية، مع قيود مؤسسية مثل إقامة البيانات وقواعد الخصوصية وقوائم النماذج المعتمدة التي قد تتجاوز النموذج الذي يبدو أفضل للمهمة.

يضيف الكمون طبقة أخرى. قال المنشور إن عبء التوجيه وموقع العتاد وحمل نقطة النهاية ودفء التخزين المؤقت يمكن أن تهيمن على التجربة التي يشعر بها المستخدم. التوجيه مرة واحدة لكل مهمة يحد من العبء، بينما يمنح التوجيه في كل خطوة مرونة أكبر لكنه يضيف نقاط قرار وتعقيدا تشغيليا.

IBM Research يختبر موجها قائما على التحسين

قال المؤلفون إن الموجه توقف عن التعامل مع اختيار النموذج كتصنيف، وبدأ يحسن عبر التكلفة والجودة والكمون. في AppWorld Test Challenge مع وكيل CodeAct، قال IBM Research إن إعدادا محسنا للكمون حقق دقة 84% مقابل 93 دولارا و83s، بما يمثل خفضا في التكلفة بنسبة 21% وخفضا في الكمون بنسبة 9% مقارنة بتشغيل Opus وحده، مع انخفاض في الدقة قدره 4%.

وقال المنشور أيضا إن طبقة التحسين استخدمت نحو 6 ms و2 kB من الذاكرة لكل مهمة، ما يحد من خطر أن يصبح الموجه نفسه عنق زجاجة. وبحسب المقارنة نفسها، وصل موجه تقليدي قائم على الصعوبة إلى نطاق دقة مشابه بتكلفة أعلى لأنه لم يبحث في مساحة المفاضلات الأوسع.

بالنسبة إلى فرق الذكاء الاصطناعي في المؤسسات، تعني النتيجة العملية أن التوجيه لا يمكن الحكم عليه فقط من خلال ما إذا كان المصنف قد اختار أقوى نموذج. يجب أن تشمل نقطة التشغيل حالة البنية التحتية واقتصاديات التخزين المؤقت وحدود الحوكمة والكمون الذي يراه المستخدم. ولم ينشر المنشور التصميم التقني الكامل للموجه أو جدول الإعدادات الأساسي أو نتائج نشر لدى العملاء؛ وتبقى هذه التفاصيل خارج السجل العام إلى أن يصدر IBM Research المتابعة التي وعد بها.

شارك هذا المقال
inXf

مقالات ذات صلة

المزيد
Perplexity تجعل كفاءة الذكاء الاصطناعي الاختبار التالي للمنصات الوكيلة
الذكاء الاصطناعي

Perplexity تجعل كفاءة الذكاء الاصطناعي الاختبار التالي للمنصات الوكيلة

يربط الرئيس التنفيذي لشركة Perplexity، أرافيند سرينيفاس، المرحلة التالية من المنافسة في الذكاء الاصطناعي بمقياس قيمة الرموز لكل واط لكل مستخدم. وتدفع الشركة منتج Personal Computer كطبقة تنسيق تختار النموذج المناسب وتحدد طريقة تعاون الوكلاء ومكان معالجة الطلب. والاختبار العملي هو ما إذا كان نهج Perplexity المحايد بين النماذج قادراً على إنتاج قيمة مستدامة بينما تطور المنصات الكبرى وكلاءها الخاصة.

Niteshift تستهدف AI coding المؤسسي بطبقة بنية محايدة للنماذج
الذكاء الاصطناعي

Niteshift تستهدف AI coding المؤسسي بطبقة بنية محايدة للنماذج

جمعت Niteshift تمويلا قدره $7 million لبناء AI coding cloud يوجه العمل بين النماذج، مع عرض يركز على التحكم والتحقق وتقليل الاعتماد على مختبرات frontier AI.

OpenSearch Foundation تعرض طبقة بيانات للذكاء الاصطناعي من دون إثبات عائد العملاء
الذكاء الاصطناعي

OpenSearch Foundation تعرض طبقة بيانات للذكاء الاصطناعي من دون إثبات عائد العملاء

وصف مسؤولون في Linux Foundation منصة OpenSearch بأنها طبقة بيانات مفتوحة لبحث الذكاء الاصطناعي والمراقبة ورصد الأمن مع ارتفاع نطاق الاستعلامات التي تنفذها الوكلاء. وذكرت المقابلة 100,000 استعلام خلال دقيقة واحدة وفحوصا أمنية عبر 152 مستودعا، لكنها لم تسم عمليات نشر لدى العملاء أو وفورات مدققة.

Microsoft تجد أن أسعار نماذج الذكاء الاصطناعي الأرخص قد ترفع تكاليف الوكلاء
الذكاء الاصطناعي

Microsoft تجد أن أسعار نماذج الذكاء الاصطناعي الأرخص قد ترفع تكاليف الوكلاء

قالت Microsoft إن أسعار الرموز الأقل في Claude Sonnet 5 لم تزل قفزات تكلفة وكلاء الذكاء الاصطناعي عند مقارنة نماذج Claude داخل GitHub Copilot.

Oracle تضيف أداة بناء أصلية للذكاء الاصطناعي لتطبيقات Fusion الوكيلة
الذكاء الاصطناعي

Oracle تضيف أداة بناء أصلية للذكاء الاصطناعي لتطبيقات Fusion الوكيلة

قالت Yahoo Tech، نقلا عن Verdict، إن Oracle قدمت أداة بناء أصلية للذكاء الاصطناعي داخل AI Agent Studio for Fusion Applications. وتدعم الأداة مسارات بلا كود ومنخفضة الكود وبرمجية، وتعمل داخل Oracle Fusion Cloud Applications، وتتيح توسيع أكثر من 1,000 وكيل قائم و22 من Fusion Agentic Applications.

هيتاشي تختبر Claude في ذكاء اصطناعي للبنية التحتية الحساسة
الذكاء الاصطناعي

هيتاشي تختبر Claude في ذكاء اصطناعي للبنية التحتية الحساسة

أبرمت هيتاشي شراكة مع أنثروبيك لتعزيز Lumada 3.0 وإدخال Claude في بيئات بنية تحتية حرجة. تشمل الخطة حلول HMAX والأمن السيبراني ونشر Claude بين نحو 290 ألف موظف وتدريب نحو 100 ألف متخصص في الذكاء الاصطناعي. والاختبار الرئيسي هو ما إذا كان الذكاء الاصطناعي التوليدي الموجه للسلامة سيصبح موثوقاً بما يكفي لسير العمل التشغيلي المنظم.

التالي

المزيد من الأخبار

كل الأخبار
Coratia تحصل على طلب بحري بقيمة Rs 66 crore لروبوتات تحت الماءرأس المال والسياسات21 يوليو 2026Coratia تحصل على طلب بحري بقيمة Rs 66 crore لروبوتات تحت الماءأفادت YourStory بأن Coratia Technologies حصلت على عقد من البحرية الهندية بقيمة Rs 66 crore لمركبات ROV محلية تحت الماء، ناقلة الشركة الناشئة من نماذج التفتيش إلى التسليم الدفاعي.نمو مراكز البيانات في Finland يواجه اختبارات الشبكة واستعادة الحرارةالسحابة ومراكز البيانات20 يوليو 2026نمو مراكز البيانات في Finland يواجه اختبارات الشبكة واستعادة الحرارةتجذب Finland مشروعات مراكز بيانات الذكاء الاصطناعي بفضل الكهرباء منخفضة الكربون والطقس البارد والأراضي المتاحة، بحسب Data Center Knowledge، لكن الربط بالشبكة والتصاريح وقواعد استعادة الحرارة باتت تحدد مقدار السعة التي ستدخل التشغيل.Bank of Korea يوسع اختبار CBDC إلى تسعة بنوك في سبتمبرالتقنية المالية والمدفوعات الرقمية20 يوليو 2026Bank of Korea يوسع اختبار CBDC إلى تسعة بنوك في سبتمبرذكرت CoinDesk أن Bank of Korea سينقل برنامج CBDC إلى اختبار معاملات حقيقية في سبتمبر مع تسعة بنوك مشاركة، باستخدام بنية BOK بينما تصدر البنوك رموز الودائع وتديرها.SAP تنهي صفقة Prior Labs لنماذج الذكاء الاصطناعي الجدوليةالذكاء الاصطناعي20 يوليو 2026SAP تنهي صفقة Prior Labs لنماذج الذكاء الاصطناعي الجدوليةذكرت TNW أن SAP أكملت استحواذها على Prior Labs التي تتخذ من Freiburg مقرا لها وتلتزم بأكثر من مليار يورو على مدى أربع سنوات لنماذج أساس جدولية. وقال التقرير إن Prior Labs ستحتفظ بعلامتها ومقرها في Freiburg ونماذجها المفتوحة المصدر، بينما لم تفصح SAP عن أول عمليات نشر مدمجة لدى العملاء أو مواعيد إطلاق المنتجات.Google DeepMind تبني عمل المرونة الحيوية للذكاء الاصطناعي حول أكثر من 15 شراكةالذكاء الاصطناعي20 يوليو 2026Google DeepMind تبني عمل المرونة الحيوية للذكاء الاصطناعي حول أكثر من 15 شراكةذكرت AI News أن Google DeepMind وIsomorphic Labs عرضتا برنامجا للمرونة الحيوية مبنيا حول أكثر من 15 شراكة مع جهات حكومية ومنظمات أمن حيوي ومجموعات بحثية. ويغطي التحديث منع إساءة استخدام الذكاء الاصطناعي ورصد التفشي والاستجابة، بينما لم تُكشف أدلة النشر الميداني أو الضمانات النهائية.Sateliot تسعى إلى 150 مليون يورو لخدمة 5G من الأقمار إلى الهواتف بحلول 2028الاتصالات والربط الشبكي20 يوليو 2026Sateliot تسعى إلى 150 مليون يورو لخدمة 5G من الأقمار إلى الهواتف بحلول 2028ذكرت TNW أن Sateliot تسعى إلى جمع ما يصل إلى 150 مليون يورو لبناء خدمة 5G من الأقمار الصناعية إلى الهواتف الذكية بحلول 2028، بينما بقي المستثمر الرئيسي وحصة الدين وأهلية خطط الطيف المنافسة غير محسومة.Raidium تطلق عارض أشعة بالذكاء الاصطناعي في Moffitt قبل موافقة FDAالذكاء الاصطناعي20 يوليو 2026Raidium تطلق عارض أشعة بالذكاء الاصطناعي في Moffitt قبل موافقة FDAذكرت TNW أن Raidium Read بدأ استخدامه في Moffitt Cancer Center للتجارب السريرية والبحث، بينما لا تزال موافقة FDA 510(k) متوقعة قبل نهاية 2026.خطة الشبكة الدنماركية تمنح المستشفيات أولوية على مراكز البياناترأس المال والسياسات20 يوليو 2026خطة الشبكة الدنماركية تمنح المستشفيات أولوية على مراكز البياناتقد تمنح خطة الشبكة الطارئة في الدنمارك أولوية للمستشفيات والدفاع وخدمات الطوارئ على معظم مشاريع مراكز البيانات، بينما تقول Energinet إن طلبات الاتصال تبلغ 60GW مقابل حمل ذروة يزيد قليلا على 7GW.مستودعات GitHub مزيفة حولت ثقة المطورين إلى مسار لتوزيع BoryptGrabالأمن السيبراني20 يوليو 2026مستودعات GitHub مزيفة حولت ثقة المطورين إلى مسار لتوزيع BoryptGrabحوّلت حملة مستودعات GitHub مزيفة صفحات مصقولة إلى مسار لتنزيل برمجية BoryptGrab، بحسب مقال DeveloperTech عن بحث Arctic Wolf Labs. وقال مقال DeveloperTech عن بحث Arctic Wolf Labs إن المختبر رصد 292 مستودعا منتحلا على الأقل وثمانية وسبعين محولا نشطا أثناء التحليل، مع أرشيفات ZIP متغيرة وتحميل DLL جانبي دفع المدافعين نحو فحص منشأ الملفات لا الاكتفاء بالثقة في مظهر صفحات المستودعات.دراسة IBM ترصد مخاطر تبديل مزودي الذكاء الاصطناعي في الإماراترأس المال والسياسات20 يوليو 2026دراسة IBM ترصد مخاطر تبديل مزودي الذكاء الاصطناعي في الإماراتتقول دراسة IBM Institute for Business Value التي نقلتها Middle East AI News إن 88 في المئة من المسؤولين التنفيذيين الإماراتيين المشمولين بالمسح سيجدون صعوبة في تبديل مزود الذكاء الاصطناعي أو النموذج الأساسي، بينما لا يفهم 96 في المئة بالكامل تبعيات الذكاء الاصطناعي عبر المزودين والنماذج والبنية التحتية.معاملات Regions Bank الرقمية تصل إلى 80% بعد ترقية الهاتف المحمولالتقنية المالية والمدفوعات الرقمية19 يوليو 2026معاملات Regions Bank الرقمية تصل إلى 80% بعد ترقية الهاتف المحمولذكرت PYMNTS أن مواد الربع الثاني لـRegions Bank أدرجت المعاملات الرقمية عند 80% من نشاط العملاء، مع ارتفاع مستخدمي الهاتف المحمول وعمليات الدخول واستخدام Zelle وحجم محادثات العملاء بينما يستمر تحديث الأنظمة الأساسية.Microsoft و3M تنقلان تقنية EBO البصرية إلى مراكز بيانات Azureالسحابة ومراكز البيانات19 يوليو 2026Microsoft و3M تنقلان تقنية EBO البصرية إلى مراكز بيانات Azureذكرت Capacity أن Microsoft تخطط لنشر تقنية Expanded Beam Optical من 3M في مراكز بيانات Azure، بينما ستستخدم 3M أدوات الذكاء الاصطناعي من Microsoft في خدمة العملاء والتمويل والمبيعات والتسويق.