لم تعد سرعة سباق الذكاء الاصطناعي تُقاس فقط بحجم النموذج أو نتيجته في اختبار معياري. في 25 سبتمبر 2026 نشرت Anthropic مقترحًا لثلاثة مؤشرات تكشف ما يحدث داخل المختبرات الحدودية: مقدار البحث والتطوير الذي ينفذه الذكاء الاصطناعي بنفسه، ومدى مراقبة الوكلاء أثناء العمل، وحصة القدرة الحاسوبية المخصصة للأمان. اللافت في اللقطة المنشورة أن الذكاء الاصطناعي «يقود» بالفعل 26% من أعمال البحث والتطوير لدى الشركة، بينما يشارك في أكثر من 90% منها بدرجة تعاون أو أعلى.

هذه الأرقام لا تثبت أن نموذجًا يبني خليفته وحده، ولا تصلح لإعلان وصول «الذكاء الفائق». لكنها تنقل النقاش من الانطباعات والتصريحات التسويقية إلى قياسات يمكن متابعتها بمرور الوقت. وإذا تبنتها مختبرات أخرى بمنهجية قابلة للتحقق، فقد نحصل لأول مرة على عدّاد حقيقي يبيّن سرعة أتمتة صناعة الذكاء الاصطناعي من الداخل.

لماذا نحتاج إلى قياس ما يحدث داخل المختبر؟

26% من أبحاث الذكاء الاصطناعي تقودها الآلة: مقياس جديد لسرعة المختبرات — تريندات تقنية

يعرف الجمهور عادةً ما يصل إليه بعد انتهاء التطوير: اسم نموذج جديد، نتيجة اختبار، سعر واجهة برمجية أو عرض لقدرة مبهرة. لكن هذه المخرجات لا تقول كيف صُنعت، ولا مقدار العمل الذي نفذه البشر مقارنة بالوكلاء، ولا إن كانت أدوات الرقابة تتوسع بسرعة مماثلة.

المشكلة تصبح أهم عندما تُستخدم النماذج الحالية لتطوير النماذج التالية. فالتسارع هنا قد يكون تراكميًا: أداة أفضل تساعد الباحثين على بناء أداة أفضل منها في وقت أقصر، ثم تتكرر الدورة. من دون مؤشرات داخلية، لن يلاحظ المراقبون التسارع إلا بعد ظهور نتائجه.

السؤال المهم لم يعد: هل يستخدم الباحثون الذكاء الاصطناعي؟ بل: أي جزء من دورة بناء النموذج أصبح يقوده الذكاء الاصطناعي، ومن يراقب قراراته، وبأي موارد؟

المؤشر الأول: من يساعد من في البحث والتطوير؟

أنشأت Anthropic نموذجًا أوليًا باسم مؤشر أتمتة البحث والتطوير. تبدأ المنهجية بحصر أنواع العمل داخل دورة تطوير النماذج، ثم تقييم درجة أتمتة كل مهمة على سلم من ست درجات يبدأ من عدم استخدام الذكاء الاصطناعي وينتهي بالتشغيل الذاتي الكامل.

ست درجات بدل إجابة نعم أو لا

التقييم التفصيلي يمنع خلط حالات مختلفة جذريًا. استخدام نموذج لتلخيص مستند ليس مثل تفويض وكيل بإصلاح منصة تقييم كاملة. الدرجات الأساسية هي:

المستوى دور الذكاء الاصطناعي دور الإنسان
AL0 لا يشارك ينفذ المهمة كاملة
AL1–AL2 مساعدة محدودة أو واضحة يظل المنفذ والقائد
AL3 يتعاون وينفذ أجزاء كبيرة يوجّه عن قرب
AL4 يقود المهمة من وصف عالي المستوى يشرف ويراجع
AL5 يعمل ذاتيًا من البداية للنهاية خارج الحلقة التشغيلية

بحسب بيانات أغسطس 2026، لم يصل أي جزء مقاس من العمل إلى AL5. لكن النموذج كان في مستوى «يقود» AL4 لنحو 26% من أعمال البحث والتطوير، بينما تجاوزت نسبة الأعمال عند مستوى «يتعاون» AL3 أو أعلى حاجز 90%.

هذا الفارق مهم. فالرقم الأول يصف الأعمال التي يستطيع الوكيل إنجاز معظمها من توجيه عالي المستوى، أما الثاني فيشمل العمل المشترك المكثف مع البشر. لذلك لا يصح اختصار النتيجة إلى أن «الذكاء الاصطناعي يقوم بـ90% من البحث»؛ الأدق أنه حاضر بدرجة تعاون مؤثرة أو أعلى في تلك النسبة.

كيف بُنيت الخريطة؟

اعتمدت الشركة على عينة من سجلات العمل الداخلية خلال يوليو، واستُخدم وكيل بحثي لاستخراج نحو 15 ألف مهمة تفصيلية. نُظمت المهام بعد ذلك في شجرة تضم 542 عقدة، منها 378 مهمة نهائية مثل تشخيص أعطال منصات التقييم وسياسات الشبكات وتحليل حوادث التشغيل.

ثم وُزنت الفئات بحسب الوقت البشري التقريبي المخصص لها، حتى لا تساوي مهمة صغيرة مجالًا يعمل فيه فريق كبير. المنهجية ليست مثالية؛ فالنموذج يشارك في جمع الأدلة وتقييمها، ما يفتح احتمال أن يرث «الحكم» أخطاء الأداة التي يقيسها. ولهذا تصبح المراجعة الخارجية عنصرًا أساسيًا لا تفصيلًا إضافيًا.

المؤشر الثاني: هل الرقابة تواكب عدد الوكلاء؟

تشير اللقطة المنشورة إلى وجود نحو 30 ألف وكيل يعملون في البحث والهندسة في اللحظة نفسها على أكثر المنصات الداخلية استخدامًا لدى الشركة. الرقم لا يعني 30 ألف موظف افتراضي مستقل، لكنه يوضح حجم التنفيذ المتوازي الذي أصبحت أنظمة الرقابة مطالبة بمتابعته.

تقترح المنهجية ثلاثة قياسات عملية:

  1. التغطية: ما نسبة أفعال الوكلاء التي تمر على نظام مراقبة؟
  2. زمن المراجعة: كم يستغرق اكتشاف الفعل وتقييمه آليًا ثم بشريًا؟
  3. معدل الحظر أو التصعيد: كم فعلًا مُنع أو حُوّل إلى مراجعة أعمق؟

تقول Anthropic إن جميع أفعال الوكلاء على المنصة المقاسة تمر عبر مراقب فوري قبل التنفيذ، كما تُرسل للمراجعة اللاحقة. ومن أكثر من مليار قرار خلال أغسطس، حُظر نحو 0.002%، أي قرابة قرار واحد من كل 47 ألفًا. وتُرفع نحو 50 حالة عالية الأولوية أسبوعيًا إلى مراجعين بشريين بعد مراحل التصفية الآلية.

النسبة الصغيرة ليست دليلًا تلقائيًا على الأمان ولا على الخطر. قد تعني أن السلوك السيئ نادر، أو أن قواعد الحظر ضيقة، أو أن الوكلاء يعملون في مهام منخفضة المخاطر. القيمة الحقيقية تظهر عند نشر تعريفات واضحة للحظر، وقياس قدرة النظام على التقاط سلوكيات ضارة معروفة عبر اختبارات مستقلة.

المؤشر الثالث: أين تذهب القدرة الحاسوبية؟

القدرة الحاسوبية مدخل أسهل في القياس من مفاهيم مثل «النية» أو «جودة المحاذاة». لذلك اقترح التقرير تتبع توزيعها بين تدريب القدرات، وخدمة المستخدمين، وأبحاث الأمان والتقييم.

في أسبوع العينة من 13 إلى 20 يوليو، خُصص نحو 6% من حوسبة البحث والتطوير لأعمال الأمان، وارتفعت النسبة إلى قرابة 12% داخل البحث والتطوير الذي يقوده الذكاء الاصطناعي. وتصف الشركة هذه التقديرات بأنها محافظة؛ فالعمل الذي يخدم القدرات والأمان معًا لم يُحسب ضمن الأمان.

لكن الحوسبة ليست مرآة كاملة للاهتمام. قد يحتاج بحث تفسير مهم إلى وقت باحثين طويل وتجارب صغيرة، بينما يستهلك تدريب واحد قدرًا هائلًا من العتاد. لهذا يصلح المؤشر لمقارنة الاتجاه عبر الزمن أو بين مختبرات تستخدم التعريف نفسه، ولا يصلح وحده للحكم على جودة برنامج الأمان.

ماذا يتغير إذا نشرت المختبرات هذه الأرقام؟

النشر المنتظم قد يحول ثلاثة نقاشات غامضة إلى أسئلة قابلة للتدقيق:

  • هل ترتفع أتمتة البحث أسرع من تغطية المراقبة؟
  • هل تقل مدة المراجعة مع زيادة عدد الوكلاء أم تتراكم الحالات؟
  • هل تنمو حصة حوسبة الأمان مع نمو حوسبة القدرات؟
  • هل تُراجع المنهجية جهة مستقلة، أم يقيس النموذج أداءه بنفسه فقط؟

يمكن كذلك ربط حدود تنظيمية بمؤشرات واضحة، مثل فرض نافذة اختبار إضافية عندما تتجاوز نسبة الأعمال التي «يقودها» الذكاء الاصطناعي حدًا متفقًا عليه. هذا أكثر قابلية للتطبيق من انتظار حادثة كبيرة ثم محاولة استنتاج مستوى التسارع بأثر رجعي.

ما الذي ينبغي ألا نفهمه من الأرقام؟

أولًا، 26% لا تعني أن ربع شركة كاملة يعمل ذاتيًا؛ القياس يخص أعمال البحث والتطوير المشمولة بالمنهجية. ثانيًا، المشاركة في أكثر من 90% لا تساوي الاستقلال، لأن مستوى التعاون يتضمن توجيهًا بشريًا قريبًا. ثالثًا، الأرقام صادرة عن شركة تقيس أنظمتها، وليست معيارًا صناعيًا مستقلًا بعد.

كما أن المقارنة بين شركتين ستكون مضللة إذا اختلف تعريف المهمة أو الأمان أو طريقة الوزن. المطلوب ليس جدول ترتيب جديدًا، بل قاموس مشترك، وسجلات قابلة للتدقيق، وجهات خارجية تستطيع الوصول إلى أدلة كافية من دون كشف أسرار تجارية حساسة.

أسئلة شائعة

هل بدأ الذكاء الاصطناعي يبني نفسه بالكامل؟

لا. البيانات المنشورة تقول صراحة إن المستوى الذاتي الكامل لم يظهر في أي مجموعة أعمال مقاسة. الموجود هو قيادة أجزاء معتبرة من العمل تحت إشراف بشري، وتعاون واسع في بقية الدورة.

هل رقم الحظر المنخفض يعني أن الوكلاء آمنون؟

ليس بمفرده. يجب معرفة ما الذي يراقبه النظام، ونسبة التغطية، وقدرته على اكتشاف اختبارات سلوك ضار معروفة، وعدد الحالات التي تفلت منه. معدل الحظر مؤشر تشغيل وليس شهادة أمان.

لماذا يهم هذا مطور التطبيقات العادي؟

لأن المقاييس نفسها قابلة للتطبيق على فرق أصغر. إذا كان تطبيقك يشغل وكلاء ينفذون أوامر أو يغيرون بيانات، فقِس نسبة الأفعال المراقبة، ووقت مراجعة التنبيهات، ومعدل التصعيد بدل الاكتفاء بتسجيل المحادثات.

الخلاصة

أهم ما في إعلان 25 سبتمبر ليس رقم 26% وحده، بل محاولة إنشاء لوحة عدادات لما كان يحدث خلف أبواب مغلقة. قياس أتمتة البحث، وتغطية مراقبة الوكلاء، وتوزيع الحوسبة يتيح رؤية ما إذا كانت قدرات البناء الذاتي تتسارع أسرع من أدوات السيطرة عليها. المنهجية ما زالت أولية وتحتاج إلى تعريفات مشتركة وتحقق مستقل، لكنها تقدم سؤالًا أدق للصناعة: هل نستطيع قياس سرعة السباق قبل أن تصبح نتائجه أسرع من قدرتنا على فهمها؟