حساب کاربری ندارید؟ ثبت نام کنید

نتایج بنچمارک Claude Opus 5 از قدرتمندترین مدل هوش مصنوعی حکایت دارد؛ عملکرد بهتر از Fable 5 با هزینه کمتر

نوشته

7 ساعت قبل | بدون دیدگاه | بنچمارک، هوش مصنوعی

نتایج چندین بنچمارک معتبر نشان می‌دهد Claude Opus 5 از شرکت Anthropic اکنون یکی از قدرتمندترین مدل‌های هوش مصنوعی جهان است. این مدل در حوزه‌هایی مانند برنامه‌نویسی، تحلیل، انجام وظایف اداری و استدلال علمی عملکردی بهتر از بسیاری از رقبا از جمله Claude Fable 5، GPT-5.6 Sol و Kimi K3 ارائه کرده و در بسیاری از موارد با هزینه اجرای کمتر به این نتایج دست یافته است.

خلاصه خبر در یک نگاه

🔷 مدل هوش مصنوعی جدید Claude Opus 5 با امتیاز 61 در صدر شاخص Intelligence Index قرار گرفت.

🔷 این مدل در برنامه‌نویسی و انجام وظایف اداری نیز جزو بهترین مدل‌های هوش مصنوعی جهان است.

🔷 هزینه اجرای بسیاری از وظایف با Opus 5 کمتر از Claude Fable 5 گزارش شده است.

🔷 نقطه ضعف اصلی Opus 5 همچنان دقت اطلاعات و نرخ بالاتر توهم (Hallucination) نسبت به Fable 5 است.

🔷 تحلیل مؤسسات مستقل نشان می‌دهد رقابت میان مدل‌های پیشرفته هوش مصنوعی همچنان بسیار نزدیک است.

مدل هوش مصنوعی Claude Opus 5 در صدر شاخص Intelligence Index

بر اساس ارزیابی مؤسسه Artificial Analysis، مدل Claude Opus 5 موفق شد در Artificial Analysis Intelligence Index امتیاز 61 را کسب کند.

این شاخص عملکرد مدل‌های هوش مصنوعی را در 9 آزمون مختلف شامل کارهای دانشی، برنامه‌نویسی، استدلال علمی و دقت اطلاعات ارزیابی می‌کند.

مدل امتیاز
Claude Opus 5 61
Claude Fable 5 60
GPT-5.6 Sol 59
Kimi K3 57
Claude Opus 4.8 56

طبق اعلام Artificial Analysis، این ارزیابی پیش از عرضه عمومی مدل و با همکاری شرکت Anthropic انجام شده است.

بنچمارک Claude Opus 5

بنچمارک Claude Opus 5

عملکرد قدرتمند در برنامه‌نویسی

در شاخص Artificial Analysis Coding Index، نسخه Claude Opus 5 xhigh همراه با Claude Code موفق شد به طور مشترک با GPT-5.6 Sol + Codex رتبه نخست را کسب کند.

همچنین در آزمون Terminal-Bench v2.1 که توانایی مدل‌ها را در انجام خودکار وظایف مهندسی نرم‌افزار در محیط ترمینال ارزیابی می‌کند، نسخه max این مدل امتیاز 89 درصد را به دست آورد و با GPT-5.6 Sol برابر شد.

استدلال علمی؛ عملکرد خوب اما نه بهترین

در آزمون بسیار دشوار Humanity’s Last Exam، Claude Opus 5 امتیاز 53 درصد را ثبت کرد که با Claude Fable 5 برابر است.

در بنچمارک فیزیک CritPt نیز این مدل عملکردی مشابه Fable 5 داشت، اما همچنان پایین‌تر از مدل‌های GPT-5.6 Sol ،GPT-5.5 Pro و GPT-5.6 Terra قرار گرفت.

نرخ Hallucination همچنان یکی از نقاط ضعف

اگرچه Claude Opus 5 نسبت به نسخه Opus 4.8 در آزمون AA-Omniscience حدود 7 امتیاز بهبود یافته است، اما هنوز از Claude Fable 5 عقب‌تر قرار دارد.

بر اساس این گزارش، Opus 5 هنگام اطمینان نداشتن نیز بیشتر پاسخ می‌دهد؛ موضوعی که باعث شده نرخ Hallucination یا تولید اطلاعات نادرست آن با 14 واحد افزایش به حدود 50 درصد برسد.

Epoch AI: رقابت مدل‌های پیشرفته بسیار نزدیک است

مؤسسه پژوهشی Epoch AI نیز Claude Opus 5 را مورد ارزیابی قرار داده است.

این مدل در شاخص Epoch Capability Index امتیاز 159 را کسب کرد که تنها اندکی پایین‌تر از Claude Fable 5 با امتیاز 161 است.

در بخش ویژه مهندسی نرم‌افزار (SWE-ECI)، Opus 5 با Fable 5 برابر شد و عملکردی بهتر از GPT-5.6 Terra و Claude Opus 4.8 ثبت کرد. در این شاخص، GPT-5.6 Sol همچنان صدرنشین باقی ماند.

بنچمارک Claude Opus 5

سطوح استدلال پایین‌تر، ارزش خرید بیشتری دارند

بررسی‌های Vals.ai نشان می‌دهد استفاده از بالاترین سطح استدلال همیشه بهترین نتیجه را ارائه نمی‌دهد.

در بنچمارک Vibe Code Bench، نتایج به شکل زیر بوده است:

سطح استدلال امتیاز
Low 76.7٪
Medium 82٪
High 89.8٪
xhigh 88.3٪
Max 88.4٪

به گفته پژوهشگران، سطوح بالاتر استدلال معمولاً پاسخ‌های پیچیده‌تری تولید می‌کنند که احتمال خطا در آن‌ها بیشتر است. به همین دلیل، سطح High در بسیاری از وظایف برنامه‌نویسی بهترین تعادل میان کیفیت، سرعت و هزینه را ارائه می‌دهد.

بنچمارک Claude Opus 5

عملکرد در وظایف اداری و تحلیل اطلاعات

یکی از مهم‌ترین نقاط قوت Claude Opus 5 عملکرد آن در بنچمارک AA-Briefcase است؛ آزمونی که توانایی مدل‌های هوش مصنوعی را در انجام کارهای اداری مانند:

  • تهیه گزارش‌های تحقیقاتی
  • ساخت ارائه (Presentation)
  • تحلیل فایل‌های گسترده و صفحات گسترده (Spreadsheet)
  • جمع‌بندی و تحلیل داده‌ها

ارزیابی می‌کند.

در این بنچمارک، نسخه max مدل به امتیاز 1720 Elo رسید؛ یعنی 146 امتیاز بالاتر از Claude Fable 5.

همچنین سه سطح استدلال max، xhigh و high رتبه‌های اول تا سوم این آزمون را به خود اختصاص دادند.

بنچمارک Claude Opus 5

بنچمارک Claude Opus 5

هزینه کمتر نسبت به Claude Fable 5

بر اساس داده‌های Artificial Analysis، میانگین هزینه انجام هر وظیفه در AA-Briefcase برای مدل‌های مختلف به شرح زیر است:

مدل هزینه هر وظیفه
Claude Fable 5 22.30 دلار
Claude Opus 5 (max) 17.79 دلار
Claude Opus 5 (xhigh) 14.26 دلار
Claude Opus 5 (high) 10.41 دلار

نسخه high نه تنها هزینه‌ای کمتر از نصف Claude Fable 5 دارد، بلکه همچنان امتیاز بالاتری نیز کسب می‌کند.

جمع‌بندی

آنتروپیک Claude Opus 5 با صدرنشینی در چندین بنچمارک معتبر، جایگاه خود را به‌عنوان یکی از قدرتمندترین مدل‌های هوش مصنوعی تثبیت کرده است. این مدل در برنامه‌نویسی، تحلیل اطلاعات و انجام وظایف اداری عملکردی بسیار قوی دارد و در بسیاری از سناریوها با هزینه‌ای کمتر از Claude Fable 5 به نتایج بهتری می‌رسد. با این حال، نرخ بالاتر Hallucination و رقابت نزدیک با مدل‌های دیگر نشان می‌دهد بازار مدل‌های پیشرفته هوش مصنوعی همچنان رقابتی و بدون برنده مطلق باقی مانده است.

🔴 همچنین بخوانید: مدل هوش مصنوعی GLM-5.2 با شکست Claude Fable 5، جایگاه نخست در طراحی وب را از آن خود کرد

🔴 همچنین بخوانید: اجرای بازی Generals به‌صورت پورت روی آیفون و آیپد با کمک هوش مصنوعی Claude Fable 5

نظر شما چیست؟ آیا کاهش هزینه در کنار افزایش توانایی‌های استدلالی می‌تواند Claude Opus 5 را به انتخاب اصلی توسعه‌دهندگان و شرکت‌ها تبدیل کند؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
رپورتاژ آگهی پربازده
رپورتاژ آگهی پربازده
امیرحسین ملکی