نتایج چندین بنچمارک معتبر نشان میدهد Claude Opus 5 از شرکت Anthropic اکنون یکی از قدرتمندترین مدلهای هوش مصنوعی جهان است. این مدل در حوزههایی مانند برنامهنویسی، تحلیل، انجام وظایف اداری و استدلال علمی عملکردی بهتر از بسیاری از رقبا از جمله Claude Fable 5، GPT-5.6 Sol و Kimi K3 ارائه کرده و در بسیاری از موارد با هزینه اجرای کمتر به این نتایج دست یافته است.
🔷 مدل هوش مصنوعی جدید Claude Opus 5 با امتیاز 61 در صدر شاخص Intelligence Index قرار گرفت.
🔷 این مدل در برنامهنویسی و انجام وظایف اداری نیز جزو بهترین مدلهای هوش مصنوعی جهان است.
🔷 هزینه اجرای بسیاری از وظایف با Opus 5 کمتر از Claude Fable 5 گزارش شده است.
🔷 نقطه ضعف اصلی Opus 5 همچنان دقت اطلاعات و نرخ بالاتر توهم (Hallucination) نسبت به Fable 5 است.
🔷 تحلیل مؤسسات مستقل نشان میدهد رقابت میان مدلهای پیشرفته هوش مصنوعی همچنان بسیار نزدیک است.
بر اساس ارزیابی مؤسسه Artificial Analysis، مدل Claude Opus 5 موفق شد در Artificial Analysis Intelligence Index امتیاز 61 را کسب کند.
این شاخص عملکرد مدلهای هوش مصنوعی را در 9 آزمون مختلف شامل کارهای دانشی، برنامهنویسی، استدلال علمی و دقت اطلاعات ارزیابی میکند.
| مدل | امتیاز |
|---|---|
| Claude Opus 5 | 61 |
| Claude Fable 5 | 60 |
| GPT-5.6 Sol | 59 |
| Kimi K3 | 57 |
| Claude Opus 4.8 | 56 |
طبق اعلام Artificial Analysis، این ارزیابی پیش از عرضه عمومی مدل و با همکاری شرکت Anthropic انجام شده است.
در شاخص Artificial Analysis Coding Index، نسخه Claude Opus 5 xhigh همراه با Claude Code موفق شد به طور مشترک با GPT-5.6 Sol + Codex رتبه نخست را کسب کند.
همچنین در آزمون Terminal-Bench v2.1 که توانایی مدلها را در انجام خودکار وظایف مهندسی نرمافزار در محیط ترمینال ارزیابی میکند، نسخه max این مدل امتیاز 89 درصد را به دست آورد و با GPT-5.6 Sol برابر شد.
در آزمون بسیار دشوار Humanity’s Last Exam، Claude Opus 5 امتیاز 53 درصد را ثبت کرد که با Claude Fable 5 برابر است.
در بنچمارک فیزیک CritPt نیز این مدل عملکردی مشابه Fable 5 داشت، اما همچنان پایینتر از مدلهای GPT-5.6 Sol ،GPT-5.5 Pro و GPT-5.6 Terra قرار گرفت.
اگرچه Claude Opus 5 نسبت به نسخه Opus 4.8 در آزمون AA-Omniscience حدود 7 امتیاز بهبود یافته است، اما هنوز از Claude Fable 5 عقبتر قرار دارد.
بر اساس این گزارش، Opus 5 هنگام اطمینان نداشتن نیز بیشتر پاسخ میدهد؛ موضوعی که باعث شده نرخ Hallucination یا تولید اطلاعات نادرست آن با 14 واحد افزایش به حدود 50 درصد برسد.
مؤسسه پژوهشی Epoch AI نیز Claude Opus 5 را مورد ارزیابی قرار داده است.
این مدل در شاخص Epoch Capability Index امتیاز 159 را کسب کرد که تنها اندکی پایینتر از Claude Fable 5 با امتیاز 161 است.
در بخش ویژه مهندسی نرمافزار (SWE-ECI)، Opus 5 با Fable 5 برابر شد و عملکردی بهتر از GPT-5.6 Terra و Claude Opus 4.8 ثبت کرد. در این شاخص، GPT-5.6 Sol همچنان صدرنشین باقی ماند.
بررسیهای Vals.ai نشان میدهد استفاده از بالاترین سطح استدلال همیشه بهترین نتیجه را ارائه نمیدهد.
در بنچمارک Vibe Code Bench، نتایج به شکل زیر بوده است:
| سطح استدلال | امتیاز |
|---|---|
| Low | 76.7٪ |
| Medium | 82٪ |
| High | 89.8٪ |
| xhigh | 88.3٪ |
| Max | 88.4٪ |
به گفته پژوهشگران، سطوح بالاتر استدلال معمولاً پاسخهای پیچیدهتری تولید میکنند که احتمال خطا در آنها بیشتر است. به همین دلیل، سطح High در بسیاری از وظایف برنامهنویسی بهترین تعادل میان کیفیت، سرعت و هزینه را ارائه میدهد.
یکی از مهمترین نقاط قوت Claude Opus 5 عملکرد آن در بنچمارک AA-Briefcase است؛ آزمونی که توانایی مدلهای هوش مصنوعی را در انجام کارهای اداری مانند:
ارزیابی میکند.
در این بنچمارک، نسخه max مدل به امتیاز 1720 Elo رسید؛ یعنی 146 امتیاز بالاتر از Claude Fable 5.
همچنین سه سطح استدلال max، xhigh و high رتبههای اول تا سوم این آزمون را به خود اختصاص دادند.
بر اساس دادههای Artificial Analysis، میانگین هزینه انجام هر وظیفه در AA-Briefcase برای مدلهای مختلف به شرح زیر است:
| مدل | هزینه هر وظیفه |
|---|---|
| Claude Fable 5 | 22.30 دلار |
| Claude Opus 5 (max) | 17.79 دلار |
| Claude Opus 5 (xhigh) | 14.26 دلار |
| Claude Opus 5 (high) | 10.41 دلار |
نسخه high نه تنها هزینهای کمتر از نصف Claude Fable 5 دارد، بلکه همچنان امتیاز بالاتری نیز کسب میکند.
آنتروپیک Claude Opus 5 با صدرنشینی در چندین بنچمارک معتبر، جایگاه خود را بهعنوان یکی از قدرتمندترین مدلهای هوش مصنوعی تثبیت کرده است. این مدل در برنامهنویسی، تحلیل اطلاعات و انجام وظایف اداری عملکردی بسیار قوی دارد و در بسیاری از سناریوها با هزینهای کمتر از Claude Fable 5 به نتایج بهتری میرسد. با این حال، نرخ بالاتر Hallucination و رقابت نزدیک با مدلهای دیگر نشان میدهد بازار مدلهای پیشرفته هوش مصنوعی همچنان رقابتی و بدون برنده مطلق باقی مانده است.
🔴 همچنین بخوانید: مدل هوش مصنوعی GLM-5.2 با شکست Claude Fable 5، جایگاه نخست در طراحی وب را از آن خود کرد
🔴 همچنین بخوانید: اجرای بازی Generals بهصورت پورت روی آیفون و آیپد با کمک هوش مصنوعی Claude Fable 5
نظر شما چیست؟ آیا کاهش هزینه در کنار افزایش تواناییهای استدلالی میتواند Claude Opus 5 را به انتخاب اصلی توسعهدهندگان و شرکتها تبدیل کند؟