شرکت OpenAI از GPT-6 Astra بهعنوان قدرتمندترین مدل هوش مصنوعی خود تا امروز رونمایی کرده است. گرگ بروکمن، یکی از مدیران OpenAI، گفته است این مدل شاید همین حالا واجد شرایط AGI باشد یا دستکم به آن بسیار نزدیک شده باشد؛ مفهومی که در تعریف OpenAI به سامانهای اشاره دارد که در بیشتر کارهای اقتصادی ارزشمند از انسانها عملکرد بهتری داشته باشد.
🔷 هوش مصنوعی GPT-6 Astra بهعنوان قدرتمندترین مدل OpenAI معرفی شده است.
🔷 این مدل ابتدا از طریق برنامه Daybreak در اختیار برخی سازمانهای منتخب قرار میگیرد و سپس برای کاربران گستردهتر عرضه میشود.
🔷 آسترا روی بیش از ۱۰۰ هزار GPU در تأسیسات Stargate در تگزاس آموزش داده شده است.
🔷 مدل جدید در طیف گستردهای از آزمونها، از استدلال و ریاضیات تا کدنویسی، مهندسی و امنیت سایبری، امتیازهای بالایی کسب کرده است.
🔷 مدل GPT-6 Astra در آزمون ExploitBench امتیاز ۱۰۰ درصد گرفته و OpenAI میگوید دو آسیبپذیری ناشناخته را در جریان ارزیابی پیدا کرده است.
🔷 قیمت استاندارد API برای Astra برابر با ۱۰ دلار بهازای هر یک میلیون توکن ورودی و ۵۰ دلار برای هر یک میلیون توکن خروجی است.
🔷 اوپنایآی همزمان قابلیت جدیدی برای مدیریت Contextهای طولانی در محیط Codex آزمایش میکند.
مدل GPT-6 Astra ابتدا از طریق برنامه Daybreak در اختیار برخی سازمانهای منتخب قرار میگیرد. OpenAI اعلام کرده است که دسترسی گستردهتر برای کاربران Plus ،Pro ،Business و Enterprise در روزهای آینده انجام خواهد شد.
آسترا همچنین از طریق API و پلتفرمهای ابری مانند AWS Bedrock و Microsoft Azure قابل دسترسی خواهد بود.
کاربران Pro ،Business و Enterprise به نسخه قدرتمندتر GPT-6 Astra Pro نیز دسترسی خواهند داشت؛ البته مدیران Workspaceهای سازمانی باید این مدل را بهصورت دستی فعال کنند.
مدل Astra روی بیش از ۱۰۰ هزار GPU در تأسیسات Stargate در تگزاس پیشآموزش داده شده است. Aidan Clark، پژوهشگر OpenAI، این پروژه را بزرگترین اجرای آموزشی تاریخ این شرکت توصیف کرده است.
به گفته Clark، جهش قابلیتها از Sol به Astra از جهش نسلهای قبلی به Sol بیشتر بوده است. یکی از دلایل این موضوع آن است که مدلهای هوش مصنوعی قبلی نیز در فرایند نظارت بر آموزش نقش داشتهاند.
بر اساس آزمونهایی که OpenAI منتشر کرده، Astra در طیف گستردهای از حوزهها عملکرد بالایی دارد و در بسیاری از ارزیابیها از GPT-5.6 Sol و مدلهای Fable شرکت Anthropic بهتر ظاهر شده است.
اوپنایآی Astra را مدلی معرفی میکند که میتواند کامپیوتر را تا حد زیادی مشابه انسان کنترل کند. در آزمون OSWorld 2.0 که توانایی استفاده از کامپیوتر را ارزیابی میکند، Astra به امتیاز ۷۲.۶ درصد رسیده است؛ درحالیکه Sol امتیاز ۶۵.۷ درصد را کسب کرده بود.
آسترا برای هر وظیفه در این آزمون حدود ۴۰ دقیقه زمان صرف کرده، درحالیکه زمان موردنیاز Sol حدود ۷۵ دقیقه گزارش شده است.
اوپنایآی درباره این قابلیت ادعا میکند که تقریباً هر کاری را که کاربر بتواند با کامپیوتر انجام دهد، Astra نیز میتواند انجام دهد.
مدل GPT-6 Astra در آزمونهای کدنویسی نیز عملکرد قدرتمندی نشان داده است. در Terminal Bench 4.0 به امتیاز ۵۷.۷ درصد، در DeepSWE v1.1 به ۷۴.۱ درصد و در FrontierCode 1.1 Extended به ۶۴.۵ درصد رسیده است.
در آزمون داخلی Database Migration نیز Astra امتیاز ۶۳.۹ درصد را به دست آورده است. OpenAI همچنین اعلام کرده است که در تنظیمات برتر Astra، هزینه تخمینی API برای هر وظیفه در DeepSWE v1.1 حدود ۵۷ درصد کمتر از Sol است.
آسترا در FrontierMath Tier 4 v2 امتیاز ۹۷.۶ درصد و در GPQA Diamond امتیاز ۹۶ درصد کسب کرده است. در آزمون ARC-AGI-3 نیز امتیاز ۹۹.۹ درصد برای این مدل ثبت شده است؛ البته منبع تأکید میکند که این نتیجه تحت شرایط آزمایشی خود OpenAI به دست آمده است.
اوپنایآی میگوید Astra در کارهای علمی نیز بهبودهایی ایجاد کرده و یک نتیجه ریاضی در زمینه Prime Gap را ارتقا داده و در ارزیابیهای زیستشناسی، شیمی، پزشکی و فیزیک رکوردهای جدیدی ثبت کرده است.
آسترا در آزمون MRCR v2 با Contextهای بسیار طولانی نیز عملکرد بالایی داشته است. در نسخه ۲۵۶K تا ۵۱۲K این آزمون، امتیاز مدل به ۱۰۰ درصد و در بازه ۵۱۲K تا ۱M به ۹۶.۳ درصد رسیده است؛ درحالیکه Sol بهترتیب امتیازهای ۹۱.۵ و ۷۳.۸ درصد را کسب کرده است.
اوپنایآی همچنین در حال بهروزرسانی محیط کدنویسی Codex است. قابلیت آزمایشی جدید به مدل اجازه میدهد در طول جلسات طولانی و در چند پنجره Context یادداشتهایی ایجاد کند، بهجای اینکه هر بار تمام اطلاعات را در یک خلاصه واحد فشرده کند.
پنجرههای Context قبلی نیز همچنان قابل جستوجو خواهند بود تا Astra بتواند حتی در صورت ثبتنشدن یک الزام یا نتیجه آزمایش در یادداشتها، آن را از پیامهای قبلی پیدا کند. OpenAI قصد دارد این قابلیت را در هفتههای آینده به حالت پیشفرض تبدیل کند.
مدل GPT-6 Astra در حالت استاندارد API با قیمت ۱۰ دلار بهازای هر یک میلیون توکن ورودی و ۵۰ دلار بهازای هر یک میلیون توکن خروجی عرضه شده است.
حالت Fast که سرعتی حدود ۲.۵ برابر بیشتر ارائه میدهد، قیمت را دو برابر میکند. در نتیجه Astra از نظر قیمت توکن حدود ۲.۵ برابر گرانتر از GPT-5.6 Sol است و در محدوده قیمتی Fable 5.1 از Anthropic قرار میگیرد.
بروکمن معتقد است مقایسه مدلها بر اساس قیمت توکن دیگر معیار مناسبی نیست؛ زیرا توکنهای شرکتهای مختلف یکسان نیستند و حتی میان خانوادههای مختلف مدلهای یک شرکت نیز الزاماً قابل مقایسه نیستند. از دید او، معیار مهمتر هزینه تکمیل هر وظیفه است.
بروکمن در یک نشست خبری گفت لحظه مشخص و واضحی برای رسیدن به AGI وجود ندارد. به گفته او، تیم OpenAI در زمان تأسیس شرکت تصور میکرد روزی آستانهای مشخص وجود خواهد داشت که همه بتوانند آن را تشخیص دهند، اما روند پیشرفت هوش مصنوعی به شکلی تدریجیتر از انتظار پیش رفته است.
بااینحال، بروکمن در پایان نشست گفت: «به عصر AGI خوش آمدید.» سم آلتمن، مدیرعامل OpenAI، نیز پیشتر گفته بود انتظار دارد تا پایان سال مدلی داشته باشد که با تعریف او بتوان آن را AGI نامید.
آسترا نخستین مدلی است که OpenAI آن را طبق Preparedness Framework در سطح «Critical» طبقهبندی میکند. این سطح به قابلیت مدل برای شناسایی آسیبپذیریهای ناشناخته و ساخت زنجیرههای Exploit در سیستمهای بهخوبی محافظتشده، در صورت فراهمبودن ابزار و دسترسی مناسب، مربوط میشود.
اوپنایآی در عین حال اذعان کرده است که نظارت بر استدلالهای نوشتاری Astra نسبت به GPT-5.6 Sol دشوارتر شده است.
در آزمون ExploitBench که توانایی مدل در کشف و بهرهبرداری از آسیبپذیریهای نرمافزاری واقعی را اندازهگیری میکند، Astra امتیاز کامل ۱۰۰ درصد گرفته است.
اوپنایآی میگوید Astra در جریان ارزیابی دو آسیبپذیری ناشناخته را پیدا کرده و این موارد به فروشندگان نرمافزارهای آسیبدیده گزارش شدهاند. کارشناسان انسانی نیز تأیید کردهاند که Astra میتواند آسیبپذیریهای جدید از نوع Zero-Day را در چند دسته نرمافزاری، از مرورگرها تا سیستمعاملها، شناسایی کند.
پیشرفتهترین قابلیتهای امنیت سایبری Astra در حال حاضر فقط برای مدافعان مورد اعتماد در برنامه Daybreak Blue در دسترس هستند. OpenAI پیش از عرضه مدل نیز برای انجام آزمایشهای ایمنی بیشتر، انتشار Astra را به تعویق انداخته بود.
این قابلیتها ماهیت دوگانه دارند؛ عاملی که میتواند بهصورت خودکار یک آسیبپذیری را برای مدافع پیدا کند و به رفع آن کمک کند، در صورت سوءاستفاده میتواند برای شناسایی و بهرهبرداری از همان آسیبپذیری نیز مورد استفاده قرار بگیرد.
به نظر شما GPT-6 Astra واقعاً میتواند نقطه عطفی در مسیر AGI باشد یا هنوز برای چنین ادعایی زود است؟