حساب کاربری ندارید؟ ثبت نام کنید

هوش مصنوعی Claude Opus 5 رکورد ARC-AGI-3 را شکست؛ عبور مدل جدید آنتروپیک از GPT-5.6 با جهشی بزرگ

نوشته

4 ساعت قبل | بدون دیدگاه | بنچمارک، هوش مصنوعی

مدل هوش مصنوعی Claude Opus 5 از شرکت آنتروپیک با ثبت رکوردی جدید در بنچمارک ARC-AGI-3، به صدر جدول ارزیابی مدل‌های هوش مصنوعی رسید. بر اساس اعلام سازندگان این بنچمارک، عملکرد چشمگیر Opus 5 بیش از هر چیز به توانایی بالاتر در استدلال (Reasoning) نسبت داده می‌شود؛ قابلیتی که باعث شده این مدل با اختلاف قابل توجهی از رقبایی مانند GPT-5.6 Sol (Max) پیشی بگیرد.

خلاصه خبر در یک نگاه

🔷 مدل هوش مصنوعی Claude Opus 5 موفق شد در بنچمارک ARC-AGI-3 امتیاز 30.2 درصد را ثبت کند.

🔷 رکورد قبلی با امتیاز 7.8 درصد در اختیار GPT-5.6 Sol (Max) بود.

🔷 مدل Opus 5 پنج محیطی را حل کرد که پیش از این هیچ مدل هوش مصنوعی موفق به حل آن‌ها نشده بود.

🔷 پژوهشگران عملکرد این مدل را نتیجه بهبود توانایی استدلال، برنامه‌ریزی و کشف قوانین جدید می‌دانند.

🔷 برخی آزمایش‌های مستقل نشان می‌دهند میزان پیشرفت این مدل در سایر بنچمارک‌ها کمتر از ARC-AGI-3 بوده است.

هوش مصنوعی Claude Opus 5 با اختلاف زیاد صدرنشین ARC-AGI-3 شد

بر اساس نتایج منتشرشده توسط ARC Prize، مدل Claude Opus 5 توانست امتیاز 30.2 درصد را در بنچمارک ARC-AGI-3 کسب کند. این در حالی است که رکورد پیشین با امتیاز 7.8 درصد در اختیار GPT-5.6 Sol (Max) از OpenAI قرار داشت.

همچنین این مدل موفق شد پنج محیط آزمایشی را حل کند که پیش از این هیچ مدل دیگری قادر به حل آن‌ها نبود. در چهار مورد از این محیط‌ها، عملکرد Opus 5 به سطح انسان یا بالاتر از آن رسید.

این نتیجه حتی Claude Opus 5 را بالاتر از مدل‌های موسوم به Fable-class قرار می‌دهد که طبق اعلام ARC Prize حدود 20 درصد امتیاز کسب کرده‌اند.

دلیل برتری Opus 5 چیست؟

تحلیل ARC Prize نشان می‌دهد دلیل اصلی این جهش، تقویت توانایی استدلال منطقی است؛ قابلیتی که امکان برنامه‌ریزی، اکتشاف مستقل و اجرای مراحل مختلف در محیط‌های ناشناخته را فراهم می‌کند.

پژوهشگران همچنین به رفتارهای جدیدی در Claude Opus 5 اشاره کرده‌اند که تاکنون در مدل‌های دیگر مشاهده نشده بود. از جمله این موارد می‌توان به:

  • تبدیل مستقل مسائل به نمادگذاری جبری
  • فرمول‌بندی خودکار معادلات بازاندیشی (Reflection Equations)
  • تحلیل و برنامه‌ریزی مرحله‌به‌مرحله برای حل مسائل جدید

عملکرد Claude Opus 5 در سایر نسخه‌های ARC-AGI

علاوه بر ARC-AGI-3، این مدل در نسخه‌های قدیمی‌تر نیز عملکرد بسیار خوبی داشته است:

بنچمارک امتیاز Claude Opus 5
ARC-AGI-3 30.2٪
ARC-AGI-2 90.4٪
ARC-AGI-1 97.5٪

بر اساس اعلام ARC Prize، امتیازهای ARC-AGI-1 و ARC-AGI-2 با بهترین نتایج قبلی برابری می‌کنند، هرچند هزینه اجرای آن‌ها اندکی بیشتر بوده است.

بنچمارک ARC-AGI-3 چه چیزی را اندازه‌گیری می‌کند؟

بنچمارک ARC-AGI-3 برای سنجش توانایی مدل‌های هوش مصنوعی در حل مسائل جدید و ناآشنا طراحی شده است؛ مسائلی که مدل در زمان آموزش با آن‌ها مواجه نشده است.

در این آزمون، مدل باید قوانین یک محیط تعاملی را کشف کند، برای حل مسئله برنامه‌ریزی انجام دهد و اقدامات لازم را مرحله‌به‌مرحله اجرا کند. هدف اصلی این بنچمارک، ارزیابی استدلال عمومی است، نه میزان اطلاعات حفظ‌شده توسط مدل.

آیا بهبود عملکرد ناشی از آموزش هدفمند بوده است؟

شرکت Anthropic تاکنون دلیل دقیق این پیشرفت را اعلام نکرده است، اما تحلیل ARC Prize احتمال می‌دهد استفاده از برچسب‌گذاری هدفمند داده‌ها و یادگیری تقویتی (Reinforcement Learning) در این پیشرفت نقش داشته باشد.

از آنجا که توسعه Claude Opus 5 پس از عمومی شدن قالب ARC-AGI-3 انجام شده، این احتمال مطرح شده است که مهندسان Anthropic توانسته باشند آموزش مدل را برای مهارت‌های موردنیاز این بنچمارک بهینه کنند. با این حال، هیچ مدرکی مبنی بر آموزش مستقیم مدل روی مسائل اصلی این آزمون ارائه نشده است.

آزمایش‌های مستقل؛ پیشرفت کمتر در بنچمارک Witness

در مقابل، نتایج آزمایش‌های مستقل روی بنچمارک خصوصی Witness که توسط Guanghan Ning توسعه یافته، نشان می‌دهد میزان پیشرفت Claude Opus 5 نسبت به نسخه قبلی خود به اندازه نتایج ARC-AGI-3 چشمگیر نبوده است.

این مدل در Witness امتیاز 43.4 را کسب کرد و از نظر آماری عملکردی مشابه مدل‌های Kimi K3 و Fable 5 داشت.

به گفته Ning، این الگو می‌تواند نشان‌دهنده آموزش هدفمند روی دسته خاصی از مسائل باشد، هرچند این آزمایش به‌تنهایی نمی‌تواند نوع داده‌های آموزشی مورد استفاده Anthropic را مشخص کند.

🔴 همچنین بخوانید: نتایج بنچمارک Claude Opus 5 از قدرتمندترین مدل هوش مصنوعی حکایت دارد؛ عملکرد بهتر از Fable 5 با هزینه کمتر

پژوهشگران: هنوز نمی‌توان نتیجه‌گیری قطعی کرد

گرگ کامرادت (Greg Kamradt)، یکی از پژوهشگران ARC-AGI-3، معتقد است نتایج Witness لزوماً به معنای محدود بودن پیشرفت Claude Opus 5 نیست.

او می‌گوید عملکرد بهتر در محیط‌های مبتنی بر نوآوری می‌تواند نشانه انتقال واقعی توانایی استدلال باشد و یک نتیجه ضعیف در یک بازی خاص برای رد پیشرفت کلی مدل کافی نیست.

نینگ نیز بعداً توضیح داد که Claude Opus 5 توانسته است به بنچمارک Witness نیز تعمیم پیدا کند، اما میزان این پیشرفت نسبت به ARC-AGI-3 کمتر بوده است. به اعتقاد او، همان‌طور که بنچمارک‌های برنامه‌نویسی در طول زمان تکامل یافتند، بنچمارک‌های استدلال تعاملی نیز به‌مرور پیچیده‌تر خواهند شد و مدل‌ها برای عملکرد بهتر در آن‌ها آموزش خواهند دید.

جمع‌بندی

نتایج جدید نشان می‌دهد Claude Opus 5 با اختلاف قابل توجهی در صدر بنچمارک ARC-AGI-3 قرار گرفته و توانسته توانایی‌های استدلالی خود را در حل مسائل ناشناخته به نمایش بگذارد. با این حال، برخی آزمایش‌های مستقل نشان می‌دهند برای قضاوت درباره میزان تعمیم این پیشرفت به سایر حوزه‌ها، همچنان به بررسی‌های بیشتری نیاز است.

نظر شما چیست؟ آیا نتایج ARC-AGI-3 را می‌توان نشانه‌ای از نزدیک‌تر شدن مدل‌های هوش مصنوعی به هوش عمومی (AGI) دانست یا هنوز برای چنین نتیجه‌گیری زود است؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
رپورتاژ آگهی پربازده
رپورتاژ آگهی پربازده
امیرحسین ملکی