الخلاصة
- مايكروسوفت تتيح نموذج Microsoft-Decision-1 للتصنيف والتوجيه واتخاذ القرار في Foundry وOpenRouter بسعر 0.042 دولار للمليون رمز إدخال
- النموذج مبني على Qwen3.5-9B بتدريب لاحق، ويعيد احتمالاً معايراً لكل خيار من خيارات ثابتة بدل توليد نص
- الشركات تحصل على طبقة قرار رخيصة لتوجيه الوكلاء وتصنيف البيانات وتحكيم الردود دون استدعاء النماذج الكبيرة في كل طلب
خبر:
نموذج جديد يرد باحتمال رقمي معاير بدل الجملة، أتاحته مايكروسوفت في Microsoft Foundry وعبر OpenRouter تحت اسم Microsoft-Decision-1 لمهام التوجيه والتصنيف وترتيب الأولويات والتحقق والتحكم في سير العمل. تقول الشركة إنه سجّل أعلى دقة في مقارنة شملت 36 معياراً ونحو 150,000 سؤال، وإنه أسرع 35 مرة من GPT-6 Sol في زمن الاستجابة. رموز الإخراج مجانية.
تفصيل:
- الأساس التقني: بنت مايكروسوفت النموذج على Qwen3.5-9B من علي بابا بتدريب لاحق لتسجيل القرار في مرور واحد، وتقول إنها ستعيد بناءه قريباً على نماذج أخرى بينها نماذج Microsoft AI وOpenAI. يُستدعى عبر واجهة برمجية منظمة تحدد مجموعة خيارات ثابتة، فيعيد احتمالاً معايراً لكل خيار منها.
- أنواع القرار: يدعم النموذج أسئلة نعم أو لا، والاختيار من عدة بدائل، والتقييم على مقياس مرتب، إضافة إلى تقييم استجابات الذكاء الاصطناعي وأفعال الوكلاء وفق معايير محددة. وتقدمه مايكروسوفت بديلاً لاستخدام نموذج لغوي عام في كل خطوة تحكيم أو فرز داخل أنظمة الوكلاء.
- الأرقام المعلنة: بحسب مايكروسوفت سجّل النموذج أعلى دقة عبر 36 معياراً ونحو 150,000 سؤال حُجبت عن التدريب، وكان الأسرع بين النماذج المقيسة بفارق 2.5 مرة عن الوصيف H2O-Lightning-4B v1.1 و35 مرة عن GPT-6 Sol. واختبرت الشركة نماذج من صدارة لوحة JevBench على 36 معياراً إضافياً وتقول إن نموذجها تصدرها أيضاً.
- المتانة والسلامة: عبر 8 أنواع من التغييرات على صياغة الأسئلة انقلبت القرارات في 1.3% من الحالات في المتوسط، وبقيت ثابتة بالكامل عند إعادة صياغة أوصاف الخيارات أو عكس ترتيبها أو خلطها. واختبرت الشركة النموذج على 5,250 طلباً عبر 11 معياراً للمحتوى الضار وكسر الحماية وحقن الأوامر.
- الاستخدام الداخلي: صنّف فريق أبحاث Xbox أكثر من 10,000 ملاحظة من اللاعبين بجودة وصفتها مايكروسوفت بالمنافسة لـGPT-6 Sol، وبسرعة تفوق 14 مرة وكلفة أقل 200 مرة. واستخدمه فريق Copilot لمراقبة جودة الردود بسرعة أعلى 100 مرة، وسجّل في Microsoft Discovery اتساقاً أعلى 46 مرة من تقييم مبني على نموذج لغوي.
- التسعير والإتاحة: 0.042 دولار لكل مليون رمز إدخال، ولا تُحتسب رموز الإخراج. النموذج متاح الآن في Microsoft Foundry وعبر OpenRouter، مع توثيق على Microsoft Learn ومقطعي عرض يقارنانه بـGPT-6 Sol في تصنيف الاستعلامات وفي مهمة شراء حقيبة ظهر عبر واجهة حاسوب.
- حالات الاستخدام: تقترح مايكروسوفت النموذج لضوابط الوكلاء وتوجيه النماذج ووسم البيانات والتحكيم الآلي وتحليل النية وتوجيه الحوادث والتحقق من البيانات والتوصيات وملاءمة البحث وتصفية المحتوى وفحص الكود والفرز الأمني واستخدام الحاسوب والروبوتات والاكتشاف العلمي، أي كل موضع يحتاج قراراً سريعاً من خيارات محددة.
- المنافسون في المقارنة: ضم ملحق التدوينة نماذج Quyet-1.0-Large وSurogate Rune 26B-A4B وGPT-6 Luna Decisions وdeck-31B وH2O-Lightning-4B وStrands-Decider 2B، وأضافت مايكروسوفت لاحقاً نتائج JevBench للدقة والمعايرة. الشركة لم تنشر رقماً مقاساً للمعايرة، واكتفت بوصف الهدف: توقع بنسبة 90% يصيب نحو 9 مرات من 10.
ماذا بعد؟
إعادة بناء النموذج على نماذج Microsoft AI وOpenAI، وهو ما وعدت به مايكروسوفت قريباً دون موعد محدد، وأي تحديث لاحق لجدول المعايير بعد إضافة نتائج JevBench للدقة والمعايرة.