گوگل از Gemini 4 Argon بهعنوان آغاز «عصر بعدی هوش پیشرو» خود رونمایی کرد؛ مدلی که برای استدلال عمیق در فرایندهای پیچیده و طولانی هوش مصنوعی طراحی شده است. مدل جدید پس از لغو Gemini 3.5 Pro و تمرکز گوگل بر Gemini 3.8 Flash از راه میرسد و علاوه بر تواناییهای پیشرفته در برنامهنویسی و استدلال، سقف خروجی یک میلیون توکن دارد.
🔹 مدل هوش مصنوعی Gemini 4 Argon برای استدلال عمیق، برنامهنویسی، کارهای دانشی، دفاع سایبری و نویسندگی خلاق طراحی شده است.
🔹 سقف خروجی مدل از ۶۴ هزار به یک میلیون توکن افزایش یافته و قابلیتهای چندوجهی، استدلالی و کدنویسی آن گسترش یافتهاند.
🔹 گوگل امتیاز ۷۷.۹ درصدی DeepSWE v1.1 و امتیازهای برتر در چند بنچمارک تخصصی را برای Argon اعلام کرده است.
🔹 عرضه عمومی بهزودی از مشترکان Google AI Ultra و مشتریان پولی API آغاز میشود و قیمت مقدماتی ورودی و خروجی بهترتیب ۲ و ۱۰ دلار بهازای هر یک میلیون توکن است.
🔹 گوگل همزمان تدابیری برای مقابله با سوءاستفاده، Prompt Injection و رفتارهای ناهمسو در این مدل در نظر گرفته است.
گوگل با معرفی Gemini 4 Argon از یک شیوه نامگذاری جدید نیز استفاده کرده است. این شرکت میخواهد مدل تازه خود را با قابلیتهایی در سطح مدلهای پیشرو برای برنامهنویسی، کارهای دانشی، دفاع امنیت سایبری و نویسندگی خلاق ارائه کند.
یکی از مهمترین تغییرات، افزایش چشمگیر سقف خروجی است. Gemini 4 Argon میتواند تا یک میلیون توکن خروجی تولید کند؛ در حالی که سقف قبلی ۶۴ هزار توکن بود. این افزایش در کنار قابلیتهای توسعهیافته کدنویسی، استدلال و پردازش چندوجهی برای انجام وظایف پیچیدهتر و طولانیتر در نظر گرفته شده است.
گوگل میگوید وقتی مدل فضای کافی برای تفکر عمیق و تولید صدها هزار توکن در یک مسیر واحد داشته باشد، میتواند سطح جدیدی از عمق استدلال را برای حل یکباره مسائل دشوار ارائه دهد.
براساس نتایجی که گوگل منتشر کرده است، Gemini 4 Argon در بنچمارک DeepSWE v1.1 امتیاز ۷۷.۹ درصد را ثبت کرده است. در اطلاعات ارائهشده، Claude Opus 5.5 با ۷۴.۲ درصد و GPT-6 Astra با ۷۴.۱ درصد پس از آن قرار دارند.
گوگل همچنین Argon را برای دستیابی به توانایی بالا در دفاع امنیت سایبری آموزش داده و از پیشرفت قابل توجه آن در مقایسه با Gemini 3.8 Flash Cyber خبر داده است.
براساس اعلام این شرکت، مدل جدید در بنچمارک CWE-bench v1 که توانایی رفع آسیبپذیریهای امنیتی را ارزیابی میکند، امتیاز ۶۸ درصد را کسب کرده و بهطور مشترک بالاترین امتیاز را به دست آورده است.
گوگل قصد دارد Gemini 4 Argon را بدون محدودیتهای محافظتی سایبری در اختیار مدافعان مورد اعتماد و تیمهای داخلی خود قرار دهد تا بتوانند از تمام قابلیتهای پیشرفته مدل در زمینه دفاع امنیت سایبری استفاده کنند.
در حال حاضر Argon از طریق برنامه Fairwind در اختیار گروهی از آزمایشکنندگان مورد اعتماد و متخصصان دفاع سایبری قرار گرفته است.
تواناییهای Gemini 4 Argon تنها به برنامهنویسی محدود نمیشوند. گوگل از عملکرد پیشرو این مدل در ارزیابیهای تخصصی دیگری مانند Vals Finance Agent v2 برای تحقیقات مالی چندمرحلهای و Harvey’s Legal Agent Benchmark برای تحقیق و نگارش حقوقی خبر داده است.
در بنچمارک AutomationBench متعلق به Zapier که اجرای سرتاسری وظایف در بخشهای اصلی کسبوکار را اندازهگیری میکند، Argon امتیاز ۵۱.۳ درصد را ثبت کرده است.
این مدل در LVBench نیز که توانایی درک ویدیوهای طولانی را ارزیابی میکند، به امتیاز ۹۱.۷ درصد رسیده است؛ نتیجهای که در اطلاعات منتشرشده بهعنوان عملکرد پیشرو توصیف شده است.
عرضه گسترده Gemini 4 Argon قرار است بهزودی آغاز شود و مشترکان Google AI Ultra و مشتریان پولی API نخستین گروههایی خواهند بود که به مدل دسترسی پیدا میکنند.
| نوع پردازش | قیمت مقدماتی | قیمت پس از دوره مقدماتی |
|---|---|---|
| یک میلیون توکن ورودی | ۲ دلار | ۴ دلار |
| یک میلیون توکن خروجی | ۱۰ دلار | ۲۰ دلار |
توکنهای ورودی کششده نیز در دوره مقدماتی با ۹۵ درصد تخفیف نسبت به قیمت توکن ورودی محاسبه خواهند شد.
گوگل پیش از عرضه گسترده Argon روی چند حوزه ایمنی تمرکز کرده است. یکی از آنها مقابله با سوءاستفادههای مرتبط با حملات سایبری یا تهدیدهای شیمیایی، زیستی، رادیولوژیکی و هستهای است. این شرکت میگوید روشهای نظارت بر فعالسازیهای داخلی مدل را برای شناسایی سوءاستفاده بهبود داده است.
حوزه دیگر، مقابله با حملات Prompt Injection است. گوگل Argon را مقاومترین مدل خود در برابر Prompt Injection غیرمستقیم توصیف کرده و از عملکرد پیشرو آن در بنچمارک Indirect Prompt Injection یا IPI شرکت Gray Swan خبر داده است.
گوگل همچنین محیطهای سندباکس خود را پیش از شروع آموزشها یا ارزیابیهای پرخطر، ایزوله و مهروموم میکند تا مقاومت زیرساختها افزایش یابد.
یکی دیگر از اقدامات گوگل به نظارت بر ناهمسویی احتمالی مدل مربوط میشود. این شرکت از سازوکارهایی استفاده میکند که زنجیره استدلال و اقدامات Argon را زیر نظر میگیرند و در صورت لزوم اجرای فرایند را متوقف میکنند.
گوگل میگوید سیستم مشابهی در جریان آموزش مدل نیز استفاده شده است تا هشدارهای لازم برای یک تیم اختصاصی واکنش به حوادث ارسال شوند. این شرکت همچنین تلاش کرده یافتههای حاصل از این نظارت دوباره وارد فرایند آموزش نشوند تا خطر یادگیری روشهای دور زدن سیستم نظارتی توسط Argon کاهش پیدا کند.
مدل Gemini 4 Argon پیش از عرضه گسترده، در فرایندهای داخلی گوگل مورد استفاده قرار گرفته است و هزاران کارمند این شرکت از تواناییهای آن در وظایف تخصصی برنامهنویسی، تحقیقات عمیق و نگارش استفاده کردهاند.
یکی از نمونههای اعلامشده به بهینهسازی حافظه مربوط میشود. گروهی از عاملهای Argon دادههای پروفایلسازی زیرساخت گوگل را در مقیاس کل ناوگان تحلیل کردند تا بهینهسازیهای حافظه را بهصورت خودکار شناسایی و اعمال کنند.
به گفته گوگل، اجرای این تغییرات تاکنون بیش از ۳۰۰ TiB حافظه را در دیتاسنترهای این شرکت آزاد کرده و مجموع صرفهجویی احتمالی بین ۵۰۰ TiB تا یک PiB برآورد شده است.
عاملهای Argon در پروژههای بزرگ مهاجرت و بهینهسازی کد نیز فعالیت میکنند. گوگل از این مدل برای انتقال کدهای C و ++C به Rust استفاده کرده است؛ پروژههایی که از دهها هزار خط کد در کتابخانههایی مانند re2 و libgav1 تا بیش از ۸۰۰ هزار خط کد در هسته Zircon سیستمعامل Fuchsia را شامل میشوند.
با توجه به اهمیت این سیستمها، بازنویسیهای انجامشده پیش از ورود به محیط عملیاتی تحت ممیزیهای خودکار و دستی، آزمایشهای شبیهسازی و بررسیهای دقیق قرار میگیرند.
در پروژه libgav1، نرمافزار متنباز گوگل برای رمزگشایی ویدیو، عاملهای Argon یک نسخه موجود مبتنی بر Rust را بررسی و ۳۲ هزار خط کد SIMD را جایگزین کردند.
عاملهای مدل با اجرای چندین مرحله آزمایش مبتنی بر پروفایل، بررسی خروجی کامپایلر و تولید کد امن Rust شرایطی ایجاد کردند که کامپایلر بتواند کد را بهطور خودکار برداریسازی کند.
نتیجه نهایی، یک رمزگشای ویدیویی با ایمنی حافظه بود که به گفته گوگل، ۲.۷ برابر سریعتر از نسخه قبلی Rust اجرا میشود و در عین حال خروجی ویدیویی یکسانی ارائه میدهد. این بهبود عملکرد نسخه Rust را به پیادهسازی بهینهشده ++C نزدیکتر کرده است.
Gemini 4 Argon با سقف خروجی یک میلیون توکن، تواناییهای گستردهتر در استدلال و برنامهنویسی و تمرکز ویژه بر وظایف طولانی و پیچیده معرفی شده است. گوگل پیش از عرضه گسترده، مدل را در پروژههای داخلی بزرگی از بهینهسازی حافظه دیتاسنترها تا مهاجرت کدهای C و ++C به Rust به کار گرفته و همزمان مجموعهای از تدابیر ایمنی را برای کنترل استفاده از قابلیتهای پیشرفته آن در نظر گرفته است.
به نظر شما سقف خروجی یک میلیون توکنی Gemini 4 Argon بیشتر در چه نوع پروژههایی میتواند کاربرد عملی داشته باشد؟