حساب کاربری ندارید؟ ثبت نام کنید

بزرگترین مدل هوش مصنوعی چین توسط Bytedance در حال توسعه است

نوشته

4 ساعت قبل | بدون دیدگاه | هوش مصنوعی

شرکت بایت‌دنس (ByteDance)، مالک تیک‌تاک، طبق گزارشی از فایننشال تایمز در حال آموزش یک مدل هوش مصنوعی با حداکثر ۱۰ تریلیون پارامتر است. در صورت صحت این گزارش، مدل جدید بایت‌دنس حدود سه برابر بزرگ‌تر از Kimi K3 شرکت Moonshot خواهد بود و می‌تواند این شرکت چینی را در جمع توسعه‌دهندگان بزرگ‌ترین مدل‌های هوش مصنوعی جهان قرار دهد.

خلاصه خبر در یک نگاه

🔷 بایت‌دنس در حال آموزش مدل هوش مصنوعی جدیدی با حداکثر ۱۰ تریلیون پارامتر است.

🔷 این مدل می‌تواند حدود سه برابر بزرگ‌تر از Kimi K3 باشد.

🔷 سه منبع مطلع به فایننشال تایمز گفته‌اند مدل اکنون در مرحله پیش‌آموزش قرار دارد.

🔷 یکی از منابع می‌گوید بایت‌دنس بیش از یک سال است از روش Distillation استفاده نکرده است.

🔷 ایلان ماسک نیز پیش‌تر از آموزش نسخه‌هایی از Grok با ۶ و ۱۰ تریلیون پارامتر خبر داده بود.

مدل ۱۰ تریلیون پارامتری بایت‌دنس در حال آموزش است

بر اساس گزارش Financial Times، مدل جدید بایت‌دنس اکنون در مرحله Pretraining یا پیش‌آموزش قرار دارد. طبق گفته سه منبع مطلع، این مرحله معمولاً بین سه تا شش ماه طول می‌کشد.

اگر اطلاعات منتشرشده درست باشد، مدل جدید بایت‌دنس با حداکثر ۱۰ تریلیون پارامتر، حدود سه برابر بزرگ‌تر از Kimi K3 خواهد بود؛ مدلی که در حال حاضر به‌عنوان بزرگ‌ترین مدل هوش مصنوعی چین شناخته می‌شود.

چنین مقیاسی می‌تواند مدل آینده بایت‌دنس را از نظر تعداد پارامترها به برخی از بزرگ‌ترین سیستم‌های هوش مصنوعی شرکت‌های پیشرو در جهان نزدیک کند. برآوردهای صنعتی، مدل Mythos 5 شرکت Anthropic را حدود ۸ تریلیون پارامتر تخمین می‌زنند؛ هرچند آنتروپیک تاکنون تعداد پارامترهای مدل‌های خود را به‌صورت رسمی اعلام نکرده است.

آیا تعداد پارامتر بیشتر به معنای هوش مصنوعی بهتر است؟

تعداد پارامترها یکی از معیارهای مهم در مقیاس مدل‌های هوش مصنوعی است، اما به‌تنهایی عملکرد یک مدل را تعیین نمی‌کند. پارامترها ظرفیت مدل برای ذخیره و پردازش الگوهای آموخته‌شده را مشخص می‌کنند، اما کیفیت داده‌های آموزشی و روش‌های آموزش نیز نقش مهمی در توانایی نهایی مدل دارند.

بنابراین حتی یک مدل ۱۰ تریلیون پارامتری لزوماً در همه وظایف از مدل‌های کوچک‌تر بهتر عمل نخواهد کرد و برای ارزیابی واقعی آن باید نتایج بنچمارک‌ها و عملکرد عملی مدل منتشر شود.

بایت‌دنس از خروجی مدل‌های دیگر استفاده نمی‌کند؟

یکی از منابع فایننشال تایمز ادعا کرده است که بایت‌دنس بیش از یک سال است از روش Distillation استفاده نکرده است. در این روش، یک مدل هوش مصنوعی با استفاده از خروجی‌های مدل‌های دیگر آموزش داده می‌شود تا بتواند بخشی از توانایی‌های آن‌ها را با هزینه و اندازه کمتر به دست آورد.

ادعای کنار گذاشتن این روش می‌تواند نشان دهد بایت‌دنس تلاش دارد مدل جدید خود را تا حد امکان بر پایه داده‌ها و فرایند آموزشی مستقل توسعه دهد؛ با این حال، این موضوع نیز بر اساس اظهارات منابع ناشناس مطرح شده و تأیید رسمی ندارد.

مدل هوش مصنوعی چینی Bytedance

مدل هوش مصنوعی چینی Bytedance

هدف بایت‌دنس؛ رقابت در سطح جهانی

طبق این گزارش، ژانگ ییمینگ، بنیان‌گذار بایت‌دنس، به تیم حدود ۲۰۰۰ نفره Seed این شرکت گفته است که در بلندمدت برای دستیابی به قابلیت‌هایی در سطح بهترین مدل‌های جهان تلاش کنند.

تیم Seed یکی از بخش‌های اصلی بایت‌دنس در حوزه توسعه هوش مصنوعی محسوب می‌شود و ساخت چنین مدل بزرگی می‌تواند نشان‌دهنده افزایش سرمایه‌گذاری این شرکت روی رقابت جهانی در حوزه مدل‌های هوش مصنوعی باشد.

هوش مصنوعی Grok نیز در حال حرکت به سمت مدل‌های چند تریلیون پارامتری است

بایت‌دنس تنها شرکتی نیست که روی چنین مقیاس بزرگی کار می‌کند. ایلان ماسک نیز پیش‌تر اعلام کرده بود که xAI در حال آموزش نسخه‌هایی از Grok با ۶ و ۱۰ تریلیون پارامتر روی ابررایانه Colossus 2 است.

این روند نشان می‌دهد رقابت شرکت‌های بزرگ هوش مصنوعی فقط به توسعه مدل‌های بهتر محدود نشده و افزایش چشمگیر مقیاس مدل‌ها و زیرساخت محاسباتی مورد نیاز برای آموزش آن‌ها نیز به یکی از محورهای اصلی رقابت تبدیل شده است.

جمع‌بندی

گزارش جدید نشان می‌دهد بایت‌دنس احتمالاً روی یکی از بزرگ‌ترین مدل‌های هوش مصنوعی جهان کار می‌کند؛ مدلی که می‌تواند حداکثر ۱۰ تریلیون پارامتر داشته باشد. این پروژه هنوز در مرحله پیش‌آموزش قرار دارد و جزئیات رسمی درباره معماری، زمان عرضه و عملکرد آن منتشر نشده است. در صورت تأیید این اطلاعات، بایت‌دنس با پروژه جدید خود وارد رقابت مستقیم‌تری با شرکت‌هایی مانند xAI و دیگر بازیگران بزرگ صنعت هوش مصنوعی خواهد شد.

نظر شما چیست؟ آیا افزایش مدل‌های هوش مصنوعی به مقیاس ۱۰ تریلیون پارامتر می‌تواند جهش بزرگی در توانایی آن‌ها ایجاد کند یا کیفیت داده و روش آموزش اهمیت بیشتری دارد؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
رپورتاژ آگهی پربازده
رپورتاژ آگهی پربازده
امیرحسین ملکی