🔷 بایتدنس در حال آموزش مدل هوش مصنوعی جدیدی با حداکثر ۱۰ تریلیون پارامتر است.
🔷 این مدل میتواند حدود سه برابر بزرگتر از Kimi K3 باشد.
🔷 سه منبع مطلع به فایننشال تایمز گفتهاند مدل اکنون در مرحله پیشآموزش قرار دارد.
🔷 یکی از منابع میگوید بایتدنس بیش از یک سال است از روش Distillation استفاده نکرده است.
🔷 ایلان ماسک نیز پیشتر از آموزش نسخههایی از Grok با ۶ و ۱۰ تریلیون پارامتر خبر داده بود.
بر اساس گزارش Financial Times، مدل جدید بایتدنس اکنون در مرحله Pretraining یا پیشآموزش قرار دارد. طبق گفته سه منبع مطلع، این مرحله معمولاً بین سه تا شش ماه طول میکشد.
اگر اطلاعات منتشرشده درست باشد، مدل جدید بایتدنس با حداکثر ۱۰ تریلیون پارامتر، حدود سه برابر بزرگتر از Kimi K3 خواهد بود؛ مدلی که در حال حاضر بهعنوان بزرگترین مدل هوش مصنوعی چین شناخته میشود.
چنین مقیاسی میتواند مدل آینده بایتدنس را از نظر تعداد پارامترها به برخی از بزرگترین سیستمهای هوش مصنوعی شرکتهای پیشرو در جهان نزدیک کند. برآوردهای صنعتی، مدل Mythos 5 شرکت Anthropic را حدود ۸ تریلیون پارامتر تخمین میزنند؛ هرچند آنتروپیک تاکنون تعداد پارامترهای مدلهای خود را بهصورت رسمی اعلام نکرده است.
تعداد پارامترها یکی از معیارهای مهم در مقیاس مدلهای هوش مصنوعی است، اما بهتنهایی عملکرد یک مدل را تعیین نمیکند. پارامترها ظرفیت مدل برای ذخیره و پردازش الگوهای آموختهشده را مشخص میکنند، اما کیفیت دادههای آموزشی و روشهای آموزش نیز نقش مهمی در توانایی نهایی مدل دارند.
بنابراین حتی یک مدل ۱۰ تریلیون پارامتری لزوماً در همه وظایف از مدلهای کوچکتر بهتر عمل نخواهد کرد و برای ارزیابی واقعی آن باید نتایج بنچمارکها و عملکرد عملی مدل منتشر شود.
یکی از منابع فایننشال تایمز ادعا کرده است که بایتدنس بیش از یک سال است از روش Distillation استفاده نکرده است. در این روش، یک مدل هوش مصنوعی با استفاده از خروجیهای مدلهای دیگر آموزش داده میشود تا بتواند بخشی از تواناییهای آنها را با هزینه و اندازه کمتر به دست آورد.
ادعای کنار گذاشتن این روش میتواند نشان دهد بایتدنس تلاش دارد مدل جدید خود را تا حد امکان بر پایه دادهها و فرایند آموزشی مستقل توسعه دهد؛ با این حال، این موضوع نیز بر اساس اظهارات منابع ناشناس مطرح شده و تأیید رسمی ندارد.
طبق این گزارش، ژانگ ییمینگ، بنیانگذار بایتدنس، به تیم حدود ۲۰۰۰ نفره Seed این شرکت گفته است که در بلندمدت برای دستیابی به قابلیتهایی در سطح بهترین مدلهای جهان تلاش کنند.
تیم Seed یکی از بخشهای اصلی بایتدنس در حوزه توسعه هوش مصنوعی محسوب میشود و ساخت چنین مدل بزرگی میتواند نشاندهنده افزایش سرمایهگذاری این شرکت روی رقابت جهانی در حوزه مدلهای هوش مصنوعی باشد.
بایتدنس تنها شرکتی نیست که روی چنین مقیاس بزرگی کار میکند. ایلان ماسک نیز پیشتر اعلام کرده بود که xAI در حال آموزش نسخههایی از Grok با ۶ و ۱۰ تریلیون پارامتر روی ابررایانه Colossus 2 است.
این روند نشان میدهد رقابت شرکتهای بزرگ هوش مصنوعی فقط به توسعه مدلهای بهتر محدود نشده و افزایش چشمگیر مقیاس مدلها و زیرساخت محاسباتی مورد نیاز برای آموزش آنها نیز به یکی از محورهای اصلی رقابت تبدیل شده است.
گزارش جدید نشان میدهد بایتدنس احتمالاً روی یکی از بزرگترین مدلهای هوش مصنوعی جهان کار میکند؛ مدلی که میتواند حداکثر ۱۰ تریلیون پارامتر داشته باشد. این پروژه هنوز در مرحله پیشآموزش قرار دارد و جزئیات رسمی درباره معماری، زمان عرضه و عملکرد آن منتشر نشده است. در صورت تأیید این اطلاعات، بایتدنس با پروژه جدید خود وارد رقابت مستقیمتری با شرکتهایی مانند xAI و دیگر بازیگران بزرگ صنعت هوش مصنوعی خواهد شد.
نظر شما چیست؟ آیا افزایش مدلهای هوش مصنوعی به مقیاس ۱۰ تریلیون پارامتر میتواند جهش بزرگی در توانایی آنها ایجاد کند یا کیفیت داده و روش آموزش اهمیت بیشتری دارد؟