گوگل بهتازگی مدل پرچمدار Gemini 4 Argon را با نتایج قابلتوجه در بنچمارکها معرفی کرده است؛ بااینحال، گزارشی از بلومبرگ نشان میدهد که برخی کارکنان گوگل معتقدند عملکرد این مدل در استفادههای واقعی همیشه با امتیازهای بنچمارک آن همخوانی ندارد و در بعضی وظایف برنامهنویسی نیز با مشکل مواجه میشود. گوگل این برداشت درباره عملکرد ضعیف مدل در حوزههایی مانند کدنویسی را رد کرده است.
🔹 گوگل مدل پرچمدار Gemini 4 Argon را با نتایج قدرتمند در مجموعهای از بنچمارکها معرفی کرده است.
🔹 طبق گزارش بلومبرگ، برخی کارکنان گوگل میگویند عملکرد واقعی مدل همیشه با نتایج بنچمارکها مطابقت ندارد.
🔹 برخی کارکنان از مشکل Gemini 4 در انجام تعدادی از وظایف برنامهنویسی خبر دادهاند، اما گوگل این ادعا درباره عملکرد ضعیف در کدنویسی را رد میکند.
🔹 سقف خروجی Gemini 4 Argon به یک میلیون توکن افزایش یافته و گوگل از توانایی بالای آن در دفاع سایبری خبر داده است.
🔹 قیمت مدل ۴ دلار بهازای هر یک میلیون توکن ورودی و ۲۰ دلار بهازای هر یک میلیون توکن خروجی است و قیمت دوره آغازین نصف این مبالغ خواهد بود.
گوگل بهتازگی از Gemini 4 Argon بهعنوان مدل جدید پیشرو خود رونمایی کرده است. این شرکت هنگام معرفی مدل، نتایجی را به نمایش گذاشت که براساس آنها Gemini 4 در بسیاری از حوزههای کلیدی از مدلهای رقیب، از جمله GPT-6 Astra شرکت OpenAI، عملکرد بهتری داشته است.
بااینحال، گزارش بلومبرگ به نقل از برخی کارکنان گوگل تصویر متفاوتی از عملکرد مدل در شرایط واقعی ارائه میدهد. براساس این گزارش، تعدادی از کارکنان دریافتهاند که عملکرد Gemini 4 هنگام استفاده عملی همیشه با امتیازهای بالای آن در بنچمارکها همخوانی ندارد.
در این گزارش همچنین به نقل از کارکنان آمده است که مدل هنگام استفاده واقعی عملکرد ضعیفتری نشان میدهد و در انجام برخی وظایف برنامهنویسی با مشکل مواجه میشود.
گوگل در واکنش به این ادعاها به بلومبرگ گفته است که توصیف Gemini 4 بهعنوان مدلی با عملکرد ضعیف در حوزههایی مانند برنامهنویسی دقیق نیست.
کورای کاووکچواوغلو، مدیر Google DeepMind، نیز پیشتر در اواخر سپتامبر گفته بود که این شرکت همواره در مرز تواناییهای فناوری هوش مصنوعی باقی خواهد ماند.
دیدگاه کارکنان گوگل درباره مدل جدید نیز یکسان نیست. طبق گزارش، یکی از کارکنان گفته است که در داخل شرکت اجماع گستردهای درباره قرار داشتن Gemini 4 در سطح مدلهای پیشرو وجود دارد. در مقابل، برخی دیگر نگران هستند که Gemini همچنان از مدلهای رقیب شرکتهای Anthropic و OpenAI عقب بماند.
در نتیجه، گزارش بلومبرگ از وجود اختلافنظر داخلی درباره میزان برتری و عملکرد واقعی Gemini 4 حکایت دارد.
مدل Gemini 4 Argon در کنار نتایج بنچمارک، چند ارتقای قابلتوجه نیز دریافت کرده است. یکی از مهمترین تغییرات، افزایش سقف خروجی به یک میلیون توکن است.
گوگل همچنین اعلام کرده است که این مدل توانایی بالایی در حوزه دفاع امنیت سایبری دارد و در برخی کاربردهای دیگر نیز عملکرد پیشرو ارائه میدهد.
هزینه استفاده از Gemini 4 Argon برابر با ۴ دلار بهازای هر یک میلیون توکن ورودی و ۲۰ دلار بهازای هر یک میلیون توکن خروجی تعیین شده است.
گوگل برای دوره آغازین عرضه، قیمت پایینتری در نظر گرفته و هزینه استفاده از مدل در این دوره نصف قیمت اصلی خواهد بود.
| نوع استفاده | قیمت اصلی بهازای یک میلیون توکن | قیمت دوره آغازین |
|---|---|---|
| توکن ورودی | ۴ دلار | ۲ دلار |
| توکن خروجی | ۲۰ دلار | ۱۰ دلار |
گزارش بلومبرگ نشان میدهد که در داخل گوگل درباره میزان تطابق عملکرد واقعی Gemini 4 Argon با نتایج بنچمارکهای آن دیدگاههای متفاوتی وجود دارد. برخی کارکنان به مشکلاتی در استفاده عملی و وظایف برنامهنویسی اشاره کردهاند، درحالیکه گوگل چنین توصیفی از عملکرد مدل را دقیق نمیداند و گروهی دیگر از کارکنان نیز Gemini 4 را در سطح مدلهای پیشرو ارزیابی میکنند.
به نظر شما برای ارزیابی مدلهای هوش مصنوعی، نتایج بنچمارکها تا چه اندازه میتوانند عملکرد واقعی آنها در کارهای روزمره و برنامهنویسی را نشان دهند؟