أعلنت شركة OpenAI أن إطلاق نموذج GPT-6 Astra يمثل بداية عصر الذكاء الاصطناعي العام، وذلك في وقت أُجبرت فيه على التخلي عن طرح النموذج المخطط له GPT-6.1 Astra بسبب مخاوف تتعلق بالسلامة.

تضارب نتائج المعايير والتقييمات التقنية

صرح رئيس الشركة غريغ بروكمان في مؤتمر صحفي بتاريخ 3 سبتمبر بأن هذا النموذج قد يمثل لحظة ابتكار الذكاء العام. حققت أسترا نتيجة 99.9% في معيار ARC-AGI-3 باستخدام أداة برمجية خاصة غير متاحة للمنافسين، بينما انخفضت النتيجة إلى 62.7% عند استخدام الأداة القياسية المحايدة.

أكد رئيس مؤسسة ARC Prize أن تشبع المعيار لا يُعد دليلاً على تحقيق الذكاء الاصطناعي العام. أظهرت مسودة سابقة للنتائج درجة 98.6% قبل تعديلها لاحقاً إلى 99.9% على الموقع الرسمي، وأرجع باحثون من ستانفورد التباين في الأرقام إلى ممارسة تحسين النتائج عبر تكرار التقييمات بشروط مختلفة.

الأداء العملي وكفاءة البرمجيات

سجل النموذج 98% في اختبار FrontierMath Tier 4 و100% في اختبار ExploitBench للأمن السيبراني. تفوقت أسترا على الكفاءة البشرية في 96% من مستويات الاختبار بمتوسط إجراءات أقل بنسبة 51.7%، وزادت كفاءتها في استخدام الرموز بنسبة 70% مقارنة بسابقها GPT-5.6 Sol في هندسة البرمجيات.

بلغ تقييم أسترا 61 نقطة في مؤشر Artificial Analysis المستقل دون تحسن عن الجيل السابق. تراجع ترتيب النموذج في معيار GDPval-AA v2 الذي يقيس مهام العمل الواقعية في 44 مهنة، ولم يتجاوز نطاق مهامه في اختبارات الأمن، عكس سابقه الذي تجاوز الحدود في نصف الحالات تقريباً.

تعديلات بيانات الهلوسة وتكاليف الاستخدام

انخفض معدل الهلوسة في الاختبارات الداخلية إلى 4.2% مقارنة بـ 12.2% للنموذج السابق. عدلت الشركة معدل الهلوسة المنشور من 4.2% إلى 2.0% ثم تراجعت عن ذلك بعد الإطلاق، مما أثار تساؤلات حول دقة البيانات المعلنة.

ارتفع سعر واجهة برمجة التطبيقات للنموذج الجديد بنسبة 250% ليصل إلى 10 دولارات للإدخال و50 للإخراج. أصبح تنفيذ المهام العامة مكلفاً بنسبة 75% أكثر رغم انخفاض استهلاك رموز الإخراج بنسبة 10%.

تحذيرات الخبراء من المخاطر والحوكمة

حذر ديفيد وود من لندن فيوتشرستس من ضرورة الحوكمة لمواكبة تطور الأنظمة المستقلة. أشار الخبراء إلى أن الجمع بين الذكاء والاستخدام المستقل للحاسوب يتطلب حذراً شديداً لتجنب سوء الفهم.