الخلاصة
- باحثون من يونيفرسيتي كوليدج لندن وهواوي يطرحون Memento 3، وكيلاً يتعلم بكتاب قواعد وكود قابل للتحقق دون إعادة تدريب النموذج
- الوكيل أكمل كل مستويات ألعاب ARC-AGI-3 العامة بكفاءة 100.0 وتفوق على Claude Opus 5 بـ59.3 نقطة
- الطريقة تنقل التعلم من أوزان النموذج إلى ذاكرة خارجية مقروءة وقابلة للتدقيق، وتقدمها الورقة بديلاً لإعادة التدريب
خبر:
نتيجة كاملة على ARC-AGI-3 سجّلها وكيل يُبقي نموذجه اللغوي مجمّداً ويتعلم عبر كتاب قواعد يكتبه بنفسه ثم يترجمه إلى كود بايثون. الورقة، المنشورة على arXiv من باحثين في يونيفرسيتي كوليدج لندن ومختبر Noah’s Ark التابع لهواوي، تقول إن الوكيل أحادي النموذج أكمل كل مستويات الألعاب العامة الـ25 بمتوسط كفاءة 100.0 مستخدماً 44% من أفعال البشر، وإنه فاز في أتاري Pong بنتيجة 21:0 دون استدعاء النموذج أثناء اللعب.
تفصيل:
- الفكرة: يصف الوكيل فرضياته عن البيئة في كتاب قواعد بلغة طبيعية محفوظ في ملف Markdown، ثم يترجمها إلى وحدة كود بايثون يستخدمها للتنبؤ والتخطيط. تسمي الورقة هذا التصميم Code as Model، وتعدّ كتاب القواعد ذاكرة دلالية دائمة تبقى خارج أوزان النموذج اللغوي ولا تتغير بتغيره.
- حلقة التعلم: دورة مستمرة من الملاحظة والتأمل ومراجعة القواعد والترجمة إلى كود ثم التحقق، تحدّث كتاب القواعد والكود معاً بينما يبقى النموذج اللغوي دون أي تعديل في أوزانه. ويعيد الوكيل كتابة وحدة بايثون كلما أخفقت تنبؤاتها في مطابقة ما حدث فعلاً في البيئة.
- التحقق قبل الاعتماد: لا يُقبل برنامج مرشح إلا بشرطين: أن يحكم النموذج اللغوي بأنه مطابق لكتاب القواعد، وأن تعيد إعادة التشغيل الدقيقة إنتاج الانتقالات المسجلة من البيئة. وتضيف الورقة امتداداً سكانياً يشغّل عدة نماذج للعالم بالتوازي تتشارك أدلة التفاعل في ما بينها.
- النتيجة على ARC-AGI-3: أكمل الوكيل أحادي النموذج كل مستوى في الألعاب العامة الـ25 بمتوسط كفاءة أفعال نسبية للبشر (RHAE) بلغ 100.0، وهو سقف المقياس، مستخدماً 44% فقط من عدد الأفعال التي احتاجها البشر لإنجاز المهام نفسها، بحسب ما تورده الورقة.
- المقارنة: بحسب الورقة تفوق Memento 3 بـ59.3 نقطة في متوسط RHAE على Claude Opus 5 من أنثروبيك عند تشغيله بمنصة ARC Prize القياسية. الباحثون لم يسمّوا النموذج اللغوي المجمّد الذي بنوا عليه وكيلهم، ولم تذكر صفحة الملخص ما إذا كان الكود منشوراً.
- أتاري Pong: تعلّم الوكيل متحكم تغذية راجعة فاز 21:0 في كل من ثلاث حلقات تقييم بافتتاحات مختلفة، دون أي استدعاء للنموذج اللغوي أثناء التنفيذ، أي أن المعرفة المكتسبة تحولت إلى برنامج مستقل يعمل وحده بعد انتهاء مرحلة التعلم.
- الفريق: الورقة من هاويو جاو وجون وانغ من يونيفرسيتي كوليدج لندن، وتشنغشو يو وتشيوان هي وراسول توتونوف وويلين لو من مختبر Noah’s Ark التابع لهواوي في المملكة المتحدة، وهيثم بوعمار المشترك بين الجهتين، ومنغ فانغ من جامعة ليفربول، ونُشرت على arXiv في 8 أكتوبر 2026.
- السلسلة: تقدم الورقة Memento 3 بوصفه الامتداد القائم على نموذج العالم لسلسلة Memento، ويقوم على اقتران كتاب القواعد المكتوب بلغة طبيعية مع كود قابل للتنفيذ، بحيث يصبح النموذج الذي يبنيه الوكيل عن بيئته شيئاً يمكن قراءته وتشغيله والتحقق منه خطوة بخطوة.
- الحدود: يذكر الباحثون أن التزام الوكيل بفرضية واحدة قد يوجّه الاستكشاف بعيداً عن الأدلة التي تدحضها. والنتائج المعلنة تغطي الألعاب العامة الـ25 في ARC-AGI-3 ولعبة أتاري واحدة، وهو نطاق التقييم الذي حددته الورقة لنفسها.