رغم أن نماذج الذكاء الاصطناعي الجديدة من OpenAI، والمعروفة باسم o3 وo4-mini، تعد من أحدث ما توصلت إليه الشركة في مجال القدرات المنطقية والتحليلية، إلا أن المفاجأة كانت في ارتفاع معدل "الهلاوس" أو المعلومات المختلقة التي تصدر عنها مقارنة بنماذج الشركة السابقة.

تعد الهلاوس هي واحدة من أبرز التحديات التي تواجه الذكاء الاصطناعي اليوم، وتعني تقديم معلومات خاطئة أو غير واقعية بثقة تامة، ورغم أن التوقعات كانت تشير إلى تحسن هذه النقطة مع كل جيل جديد، إلا أن o3 وo4-mini كسرا هذه القاعدة.

OpenAI تطلق جيلا جديدا من الذكاء الاصطناعي يعتمد على التفكير قبل الإجابةOpenAI تطور شبكة اجتماعية جديدة على غرار إكس

وفقا لتقارير OpenAI الداخلية، أظهرت النماذج الجديدة أداء مميزا في بعض المهام مثل حل المشكلات الرياضية وكتابة الشيفرات البرمجية، ولكن بسبب ميلها لتقديم عدد أكبر من "الادعاءات" أو المعلومات، فإن ذلك يؤدي أيضا إلى زيادة احتمالية وقوعها في الخطأ والهلاوس.

على سبيل المثال، أظهر نموذج o3 معدل هلاوس وصل إلى 33% عند اختباره على معيار داخلي لدى OpenAI يعرف بـPersonQA، والذي يقيس مدى دقة معرفة النموذج بالمعلومات عن الأشخاص، وهذا المعدل يعادل ضعف ما سجلته النماذج السابقة مثل o1 وo3-mini، أما o4-mini فقد كان الأسوأ، حيث بلغ معدل الهلاوس لديه 48%.

الباحثون قلقون

مشكلة الهلاوس لم تمر دون ملاحظة من المختبرات الخارجية، حيث لاحظت مؤسسة Transluce غير الربحية، والمتخصصة في أبحاث الذكاء الاصطناعي، أن نموذج o3 يخترع خطوات وهمية يدعي القيام بها، مثل "تشغيل كود على جهاز ماك بوك برو"، رغم أن النموذج لا يملك هذه الإمكانية التقنية.

وقالت سارة شفيتمان، الشريكة المؤسسة لـ Transluce، إن هذا السلوك قد يجعل النموذج أقل موثوقية في بعض السيناريوهات، خاصة في المجالات التي تتطلب دقة عالية مثل القانون أو الطب.

أما الأستاذ الجامعي في جامعة ستانفورد والمدير التنفيذي لمنصة Workera، كيان كتانفوروش، فأوضح أن فريقه يختبر نموذج o3 في عمليات كتابة الكود، وأكد أنه متفوق على المنافسين من حيث الكفاءة، لكنه يعاني من اختلاق روابط مواقع إلكترونية غير موجودة.


من الحلول المطروحة لتقليل الهلاوس، تمكين النماذج من الوصول إلى الإنترنت عند الحاجة، إذ يظهر نموذج GPT-4o، عند تمكين ميزة البحث عبر الإنترنت، دقة تصل إلى 90% في اختبارات مثل SimpleQA.

لكن إذا استمر الاتجاه نحو النماذج المنطقية ذات القدرات التحليلية المرتفعة، فقد يعني ذلك ارتفاعا إضافيا في معدلات الهلاوس، ما يجعل حل هذه المعضلة أكثر إلحاحا من أي وقت مضى.

وأكد متحدث باسم OpenAI، نيكو فيليكس، أن "مشكلة الهلاوس لا تزال من أولويات فرق البحث لدينا، ونعمل باستمرار على تحسين دقة وموثوقية النماذج".

المصدر

المصدر: صدى البلد

كلمات دلالية: الذكاء الاصطناعي الهلاوس النماذج الجديدة المزيد الذکاء الاصطناعی

إقرأ أيضاً:

هل يتفوق على ChatGPT؟.. أنثروبيك توسع قدرات كلود الصوتية بتحديث لافت

بعد أسابيع من إطلاق OpenAI عائلة جديدة من نماذج المحادثة وتحديث الوضع الصوتي في ChatGPT، كشفت شركة أنثروبيك Anthropic، عن تحديث جديد يهدف إلى جعل مساعدها “كلود” أكثر كفاءة في التفاعل الصوتي. 

وأعلنت أنثروبيك، أن المستخدمين أصبح بإمكانهم الاختيار بين نماذج Opus وSonnet وHaiku عند استخدام الوضع الصوتي.

Claude يراقبك.. أنثروبيك تطلق ميزة تكشف كيف تستخدم الذكاء الاصطناعيكلود يصبح أكثر ذكاء.. أنثروبيك تطلق Cowork على الهواتف والويب

وكان الوضع الصوتي في “كلود”، الذي أطلق العام الماضي واعتمد على نموذج Haiku، يوفر استجابات سريعة، لكنه لم يكن مناسبا للمهام المعقدة. 

ومع التحديث الجديد، سيعتمد الوضع الصوتي تلقائيا على آخر نموذج استخدمه المستخدم في المحادثات النصية، مع تشغيل أسرع إصدار متاح منه افتراضيا.

كلود

وأوضحت أنثروبيك أن التحديث الجديد يجعل “كلود” أكثر قدرة على إدارة المحادثات الطويلة، بما في ذلك تقديم ملاحظات حول أسلوب التواصل، والمساعدة في التحضير لعروض تقديمية للعملاء، إضافة إلى دعم جلسات العصف الذهني المتعلقة بأبحاث السوق وتطوير المنتجات.

كما أصبح الوضع الصوتي قادرا على التكامل مع مجموعة من التطبيقات، مثل جيميل وتقويم جوجل وSlack وCanva وNotion، ما يتيح للمستخدمين تنفيذ مهام مباشرة عبر الأوامر الصوتية، مثل تعديل مواعيد الاجتماعات، وصياغة رسائل البريد الإلكتروني، وإنشاء مستندات.

ويعد هذا التكامل أحد أبرز الفروقات مقارنة بالوضع الصوتي في ChatGPT، الذي شهد تحسينات في أسلوب المحادثة، لكنه لا يزال لا يوفر القدرة على استخدام أدوات خارجية لإنجاز المهام بشكل مباشر.

وفي وقت سابق من هذا العام، أضافت أنثروبيك دعما تجريبيا للغات متعددة في الوضع الصوتي، وأكدت أن المستخدمين بات بإمكانهم التحدث بعدة لغات، مع ضرورة تحديد اللغة يدويا. 

وتشمل اللغات المدعومة حاليا الإنجليزية، والفرنسية، والألمانية، والهندية، والإندونيسية، والإيطالية، واليابانية، والكورية، والبرتغالية (البرازيلية)، والإسبانية (بنسختيها اللاتينية والإسبانية).

ويتوفر التحديث الجديد لجميع المستخدمين ضمن المرحلة التجريبية على مختلف المنصات، إلا أن المستخدمين المجانيين سيقتصر استخدامهم على نموذج Haiku مع إمكانية ربط تطبيق واحد فقط.

ورغم هذه الإضافات، لم تجر أنثروبيك أي تغييرات على نموذج الصوت نفسه، كما لم تكشف عن البنية التقنية المستخدمة لتشغيله، ما يعني أن المستخدمين قد لا يلاحظون تحسينات في جودة المحادثة، مثل التعامل الأفضل مع المقاطعات، وهي من الميزات التي ركزت عليها OpenAI في تحديثاتها الأخيرة.

طباعة شارك أنثروبيك كلود الوضع الصوتي

مقالات مشابهة

  • أنثروبيك تراهن على نموذج ذكاء اصطناعي جديد أقل تكلفة
  • إيلون ماسك: الذكاء الاصطناعي سيتجاوز مجموع ذكاء البشر خلال 5 سنوات
  • احذر من طبيبك المجاني.. هل يغني الذكاء الاصطناعي عن المعالج النفسي؟
  • هل يكرر الاحتلال نموذج بيت حانون في الضفة الغربية؟
  • بعد 300 مليون سؤال.. شات جي بي تي يدخل عالم الصحة بقوة
  • هل يتفوق على ChatGPT؟.. أنثروبيك توسع قدرات كلود الصوتية بتحديث لافت
  • طارق رضوان :معتمد جمال نموذج رائع بمجال التدريب
  • النائب إيهاب منصور: الحكومة تتفنّن في تعذيب المواطنين بالعدادات الكودية
  • OpenAI يواجه القضاء بسبب "نصيحة طبية خطيرة"
  • ترامب: إيران تريد التفاوض لكنها غير مستعدة لاتفاق في الوقت الحالي