EN

Kimi K3 يضع الصين قرب قمة الذكاء الاصطناعي

Sukaina Khalid

1- نموذج Kimi K3 الصيني حلّ خلف أفضل نماذج OpenAI وAnthropic بفارق محدود في تقييم مستقل، وتقدم على أنظمة بارزة في اختبارات محددة.
2- النموذج أظهر قوة خاصة في البرمجة والعمل باستخدام الأدوات، مستفيداً من 2.8 تريليون معامل وسياق يستوعب مليون رمز.
3- كلفة التشغيل والسرعة المتوسطة وعدم إتاحة أوزانه للفحص حتى الآن تمنع اعتبار نتائجه تفوقاً صينياً شاملاً.

الخبر

نموذج Kimi K3 الذي أطلقته شركة Moonshot AI الصينية دخل الطبقة الأولى عالمياً في اختبارات الذكاء الاصطناعي، بعدما سجل 57 نقطة في مؤشر Artificial Analysis، مقابل 60 نقطة لنموذج Claude Fable 5 من Anthropic و59 نقطة لـGPT‑5.6 Sol من OpenAI.

النتيجة تضع K3 على مسافة محدودة من النموذجين المتصدرين، ومتقدماً على أنظمة بارزة بينها Claude Opus 4.8، لكنها لا تثبت تفوقه العام على أفضل النماذج الأميركية.

وتتركز أبرز نقاط قوة النموذج في البرمجة والعمل الوكيلي؛ أي المهمات التي تتطلب استخدام أدوات وتنفيذ خطوات مترابطة، بينما تظل كلفته ومتطلبات تشغيله ومدى استقرار أدائه خارج الاختبارات عوامل لم تُحسم بعد.

تفصيل

  1. الحجم والبنية:
    تقول Moonshot إن K3 يضم 2.8 تريليون معامل، ويدعم فهم الصور واستخدام الأدوات وسياقاً يصل إلى مليون رمز. ويعتمد آلية هجينة تسمى Kimi Delta Attention، صُممت لخفض متطلبات الذاكرة عند معالجة السياقات الطويلة.
  2. الترتيب العام:
    منحه Artificial Analysis 57 نقطة في مؤشر مركب يختبر الاستدلال والمعرفة والبرمجة والعمل الوكيلي. وبلغت نتيجة Claude Fable 5 نحو 60 نقطة، وGPT‑5.6 Sol نحو 59 نقطة، ما يبقي K3 خلفهما بفارق محدود.
  3. البرمجة:
    أظهر النموذج أداءً قوياً في اختبارات إنشاء واجهات وتطبيقات الويب على Arena، وهي بيئة يقارن فيها المستخدمون نتائج النماذج مباشرة. لكن التفوق في البرمجة الأمامية لا يعني تفوقاً مماثلاً في جميع المهمات المعرفية أو التحليلية.
  4. السياق الطويل:
    يسمح سياق المليون رمز بإدخال مستودعات برمجية أو مجموعات كبيرة من الوثائق في جلسة واحدة. لكن حجم السياق لا يقيس وحده قدرة النموذج على العثور على التفاصيل الصحيحة أو استخدامها بدقة.
  5. الكلفة:
    تسعّر Moonshot مليون رمز إدخال عند 3 دولارات، ومليون رمز إخراج عند 15 دولاراً. وقدّر Artificial Analysis كلفة المهمة الموزونة بنحو 0.95 دولار، مقابل 1.04 دولار لـGPT‑5.6 Sol و2.75 دولار لـClaude Fable 5، لكنها أعلى من كلفة نماذج أصغر.
  6. السرعة:
    بلغت سرعة الإخراج نحو 62 رمزاً في الثانية، وهي أقل من متوسط النماذج المقارنة على Artificial Analysis. كما أن ميل نماذج الاستدلال إلى إنتاج عدد أكبر من الرموز قد يقلص جزءاً من وفورات السعر المعلن.
  7. الانفتاح:
    تصف Moonshot K3 بأنه أول نموذج مفتوح المصدر في فئة 2.8 تريليون معامل، لكن أوزانه لم تكن متاحة علناً للفحص وقت إعداد التقرير. ولذلك لا يمكن حتى الآن التحقق مستقلاً من بنيته أو إعادة إنتاج نتائجه.

بين السطور

أهمية Kimi K3 لا تكمن في إثبات أن الصين تجاوزت الولايات المتحدة، بل في إظهار أن الفارق بين أفضل مختبرات البلدين لم يعد كبيراً أو ثابتاً.

فالصين لم تعد تنافس فقط عبر نماذج منخفضة الكلفة، بل باتت تقدم أنظمة تقترب من القمة في البرمجة والاستدلال والعمل باستخدام الأدوات. وهذا يضغط على النموذج التجاري للشركات الأميركية التي تعتمد على إبقاء أقوى أنظمتها مغلقة وعالية السعر.

لكن ضخامة K3 قد تكون نقطة قوة وقيداً في الوقت نفسه. فإتاحة الأوزان تمنح الشركات قدرة أكبر على التخصيص، بينما تجعل متطلبات الحوسبة تشغيله المستقل بعيداً عن متناول المؤسسات الصغيرة.

كما ينبغي التعامل بحذر مع جداول الإطلاق؛ لأن بعض المقارنات تستخدم نماذج داخل أدوات ووكلاء مختلفين، ما يجعل تحديد مقدار التفوق العائد إلى النموذج نفسه أمراً صعباً.

ماذا بعد؟

  • إتاحة أوزان النموذج وتفاصيل رخصته وبنيته للفحص المستقل.
  • اختبار قدرته على إعادة إنتاج النتائج خارج بيئة Moonshot وأدواتها.
  • قياس استقرار أدائه في مهمات واقعية طويلة، لا في اختبارات منفردة فقط.
  • تحديد العتاد والكلفة الفعلية اللازمين لتشغيله داخل المؤسسات.
  • مراقبة ما إذا كانت OpenAI وAnthropic ستخفضان الأسعار أو توسعان إتاحة نماذجهما رداً على المنافسة الصينية.

ماذا تقرأ بعد ذلك

واشنطن وطهران تقتربان من حرب أوسع بعد مقتل جنود أمريكيين

الليلة 8 : الحرب نحو منعطف أخطر والسعودية وقطر في قائمة الأهداف