موظف سابق في OpenAI: «عصر التجربة والخطأ انتهى» والذكاء الاصطناعي يحتاج معايير أمان مثل الطيران والطاقة النووية!

أثار David Robinson، أحد الموظفين السابقين في فريق السلامة لدى OpenAI، جدلًا جديدًا حول طريقة تعامل شركات الذكاء الاصطناعي مع مخاطر النماذج المتقدمة، بعدما أعلن استقالته من الشركة وكتب مقالًا في مجلة The Atlantic بعنوان I Quit OpenAI Because Its Culture Is Broken. ويقول Robinson إن الصناعة تتحرك بسرعة أكبر من قدرتها على فهم المخاطر التي تنتج عن الأنظمة الأكثر تقدمًا، وإن الأسلوب الذي كان مناسبًا في المراحل الأولى من تطوير الذكاء الاصطناعي لم يعد مناسبًا مع ارتفاع قدرات هذه الأنظمة.
من هو David Robinson؟
عمل Robinson داخل OpenAI لمدة 3 سنوات ونصف، وكان من أبرز مسؤولياته قيادة إعداد تقارير السلامة التي صاحبت إطلاق عدد من النماذج والمنتجات الرئيسية للشركة. كما شارك في صياغة Preparedness Framework، وهو الإطار الذي تستخدمه OpenAI لتقييم المخاطر المرتبطة بالنماذج المتقدمة وتحديد الإجراءات الوقائية المطلوبة قبل إطلاقها. وقال Robinson إنه أشرف على تقارير السلامة الخاصة بـ12 عملية إطلاق لنماذج متقدمة، ولذلك فإن انتقاداته تأتي من شخص كان يعمل مباشرة داخل منظومة تقييم مخاطر النماذج وليس من مراقب خارجي للصناعة.
ما المشكلة في «التجربة والخطأ»؟
يعتمد جزء من فلسفة تطوير البرمجيات والذكاء الاصطناعي على ما تسميه OpenAI iterative deployment، أي إطلاق الأنظمة ثم مراقبة طريقة استخدامها واكتشاف المشكلات التي تظهر في الواقع وتحسين أنظمة الحماية بناءً على هذه التجارب. ويرى Robinson أن هذا الأسلوب كان مفيدًا عندما كانت قدرات النماذج محدودة، لكنه يصبح أكثر خطورة كلما أصبحت الأنظمة أكثر قدرة واستقلالية، لأن الخطأ الذي يمكن إصلاحه بعد إطلاق نموذج بسيط قد تكون عواقبه أكبر بكثير عندما يكون النظام قادرًا على تنفيذ مهام معقدة أو العمل باستقلالية أكبر.
ولهذا جاءت عبارته الأساسية: «عصر التجربة والخطأ انتهى». الفكرة هنا ليست أن اختبار النماذج يجب أن يتوقف، وإنما أن اختبار نظام شديد القدرة بعد نشره ثم إصلاح مشكلاته لا ينبغي أن يكون خط الدفاع الرئيسي ضد المخاطر. ووفقًا لروبنسون، يجب أن تسبق زيادة قدرات النماذج زيادة مماثلة في الأبحاث الخاصة بالسلامة وآليات التحكم والمراقبة.
لماذا شبّه الذكاء الاصطناعي بالطيران والطاقة النووية؟
أحد أهم مقترحات Robinson هو أن تتعامل شركات Frontier AI مع السلامة بطريقة أقرب إلى القطاعات التي يمكن أن يؤدي فيها الخطأ البشري أو التقني إلى نتائج كبيرة، مثل الطيران والطاقة النووية. ففي هذه القطاعات لا تعتمد السلامة على وجود موظف واحد يعرف ما يجب فعله، وإنما على طبقات متعددة من الحماية، والاختبارات، والإجراءات الاحتياطية، والمراقبة، والتخطيط المسبق، بحيث لا يؤدي خطأ واحد إلى كارثة.
ويرى Robinson أن شركات الذكاء الاصطناعي تحتاج إلى تبني هذا النوع من التفكير، خصوصًا مع زيادة قدرة النماذج على التعامل مع أدوات خارجية وتنفيذ مهام طويلة ومعقدة. وبدلًا من افتراض أن الفريق سيكتشف المشكلة ويتدخل في الوقت المناسب، يجب تصميم النظام بحيث تكون هناك طبقات حماية متعددة حتى في حالة فشل إحدى آليات الأمان.
المشكلة ليست في القواعد فقط
وهنا Robinson لا يحصر المشكلة في غياب قاعدة أمان معينة أو قانون جديد، بل يرى أن الأمر يتعلق بثقافة العمل داخل شركات الذكاء الاصطناعي. وبحسب طرحه، فإن الضغط المستمر للوصول إلى النموذج التالي وإطلاق منتجات جديدة يجعل فرق السلامة تعمل في سباق مستمر، بحيث يصبح من الصعب تخصيص الوقت والموارد اللازمة لإعادة التفكير في طريقة بناء منظومة السلامة نفسها.
ووصف Robinson ثقافة Silicon Valley بأنها تفتقر إلى الخبرة المتراكمة الموجودة في الصناعات التي تعاملت لعقود مع مخاطر الأنظمة المعقدة. وأشار إلى أنه خلال عمله في OpenAI لم يصادف زميلًا لديه خبرة مباشرة في جعل الطائرات تعمل بأمان أو تشغيل المفاعلات النووية دون حوادث أو إدارة أنظمة مالية ضخمة دون انهيارات، وهي الخبرات التي يرى أن قطاع الذكاء الاصطناعي يحتاج إلى الاستفادة منها.
حوادث الـ AI Agents زادت المخاوف
ربط Robinson مخاوفه أيضًا بالتطور الأخير في قدرات AI Agents، وهي أنظمة لا تكتفي بإعطاء إجابة للمستخدم، بل تستطيع تنفيذ سلسلة من المهام باستخدام أدوات وخدمات خارجية بدرجة أكبر من الاستقلالية. وأشار إلى حوادث تضمنت تصرفات غير متوقعة من وكلاء ذكاء اصطناعي، من بينها واقعة مرتبطة بأنظمة OpenAI وصلت إلى أنظمة Hugging Face.
وتكتسب هذه الحوادث أهمية مختلفة عن أخطاء الـ chatbot التقليدية، لأن الخطأ هنا لا يقتصر بالضرورة على إجابة غير صحيحة تظهر على الشاشة. إذا كان النظام يمتلك صلاحية الوصول إلى الإنترنت أو ملفات أو أدوات برمجية أو حسابات خارجية، فإن السلوك غير المتوقع يمكن أن يتحول إلى فعل حقيقي داخل نظام آخر.
وهذا أحد الأسباب التي تجعل قضية AI Safety أكثر تعقيدًا مع الانتقال من النماذج التي تجيب عن الأسئلة إلى النماذج التي تنفذ المهام.
مشكلة الـ Alignment
هناك جانب آخر ركز عليه Robinson يتعلق بما يعرف باسم AI Alignment، أي ضمان أن تصرفات أنظمة الذكاء الاصطناعي تتوافق مع الأهداف والقيم والقيود التي يحددها البشر. ويرى أن الصناعة تطور قدرات النماذج بسرعة بينما لا تزال أدوات قياس مدى توافق هذه الأنظمة مع القيم والأهداف البشرية محدودة مقارنة بسرعة تطور قدراتها.
المشكلة تصبح أكثر وضوحًا عندما ينتقل النظام من تنفيذ أمر مباشر إلى اتخاذ سلسلة من القرارات لتحقيق هدف معين. فقد ينجح النموذج في تحقيق الهدف المطلوب بطريقة لم يتوقعها المطورون، أو يتعامل مع القيود الموضوعة له باعتبارها عقبات يجب تجاوزها. لذلك لا يكفي اختبار ما إذا كان النموذج يعطي إجابة صحيحة، بل يصبح من الضروري دراسة الطريقة التي يتصرف بها عندما يمتلك قدرًا أكبر من الاستقلالية.
هل يرى Robinson أن OpenAI لا تهتم بالسلامة؟
انتقادات Robinson لا تعني أن OpenAI لا تملك أنظمة للسلامة أو أنها تتجاهل المخاطر. بالعكس، الشركة لديها Preparedness Framework وعمليات تقييم قبل إطلاق النماذج، كما تقول إنها توقف التدريب أو تؤجل إطلاق النماذج عندما ترى أن المخاطر لا يمكن إدارتها بالشكل الكافي. لكن الخلاف الأساسي الذي يطرحه Robinson يتعلق بما إذا كانت هذه الإجراءات تتطور بالسرعة الكافية مقارنة بتطور قدرات النماذج نفسها.
وردت OpenAI على هذه الانتقادات بالتأكيد على أنها تعمل على تعزيز إجراءات السلامة والأمن في بيئات البحث والاختبار، وتدريب النماذج ليس فقط على إنجاز المهام وإنما على تنفيذها بصورة مسؤولة، إلى جانب توسيع الاعتماد على جهات تقييم خارجية وتحسين Real-time Monitoring لاكتشاف السلوكيات المثيرة للقلق في مراحل مبكرة.
لماذا استقال Robinson بدلًا من الاستمرار داخل الشركة؟
بحسب Robinson، المشكلة كانت أن فرق العمل كانت منشغلة بدرجة كبيرة بالانتقال من إطلاق إلى آخر، وهو ما جعل من الصعب إجراء تغييرات جوهرية في الثقافة أو طريقة إدارة السلامة من داخل الشركة. وقال إن هذا دفعه إلى الاعتقاد بأن وجود حوافز أقوى من خارج الشركة يمكن أن يكون جزءًا مهمًا من تحسين مستوى السلامة في القطاع.
استقالته تأتي أيضًا ضمن سلسلة من المغادرين والانتقادات من داخل قطاع الذكاء الاصطناعي، حيث ظهر خلال الفترة الأخيرة نقاش متزايد حول التوازن بين سرعة تطوير النماذج وبين القدرة على اختبارها وتأمينها. لكن ذلك لا يعني وجود إجماع بين الباحثين على أن تطوير الذكاء الاصطناعي يسير في اتجاه كارثي؛ الخلاف الأساسي يدور حول مستوى المخاطر المقبول، وكمية الاختبارات والضمانات المطلوبة قبل منح الأنظمة قدرات أكبر.
ماذا يعني هذا للمستخدم العادي؟
الجدل لا يتعلق فقط بمستقبل النماذج فائقة الذكاء. مع انتشار AI Agents في أدوات العمل والبرمجة والبحث وإدارة الملفات، أصبحت الأنظمة قادرة على تنفيذ إجراءات بدلًا من الاكتفاء بتقديم المعلومات. وكلما زادت الصلاحيات التي يحصل عليها النظام، أصبحت مشكلة الخطأ أكثر أهمية؛ فالـ chatbot الذي يعطي معلومة خاطئة يمكن تصحيح إجابته، بينما Agent يمتلك صلاحية تنفيذ أمر خاطئ قد يتسبب في تغيير ملف أو إرسال رسالة أو الوصول إلى خدمة خارجية قبل أن يكتشف الإنسان ما حدث.
وهنا تكمن أهمية النقطة التي يطرحها Robinson: الانتقال من الذكاء الاصطناعي الذي "يجيب" إلى الذكاء الاصطناعي الذي "يتصرف" يرفع تكلفة الخطأ. وبالتالي فإن إجراءات السلامة التي كانت كافية لنظام محدود قد لا تكون كافية لنظام أكثر قدرة واستقلالية.
الخلاصة
رسالة Robinson الأساسية ليست أن شركات الذكاء الاصطناعي يجب أن تتوقف عن التطوير، وإنما أن طريقة إدارة المخاطر يجب أن تتغير بالتوازي مع زيادة قدرات الأنظمة. فبدلًا من الاعتماد بشكل أساسي على إطلاق النماذج ثم اكتشاف نقاط ضعفها ومعالجتها، يدعو إلى بناء منظومة سلامة أكثر صرامة، متعددة الطبقات، والاستفادة من خبرات صناعات مثل الطيران والطاقة النووية التي طورت على مدى عقود آليات للتعامل مع الأنظمة شديدة التعقيد.
وتأتي هذه الدعوة في وقت تتجه فيه شركات مثل OpenAI وAnthropic وGoogle DeepMind إلى تطوير نماذج أكثر قدرة على التخطيط واستخدام الأدوات والعمل باستقلالية. لذلك فإن السؤال لم يعد فقط: إلى أي مدى يمكن أن يصبح الذكاء الاصطناعي أكثر قدرة؟ بل أصبح أيضًا: هل تستطيع أنظمة السلامة والرقابة أن تتطور بالسرعة نفسها التي تتطور بها قدرات هذه النماذج؟












