حساب کاربری ندارید؟ ثبت نام کنید

مدل هوش مصنوعی Qwen-Image-2.1 منتشر شد؛ تولید و ویرایش تصویر با ۷ میلیارد پارامتر

نوشته

2 ساعت قبل | بدون دیدگاه | هوش مصنوعی

تیم هوش مصنوعی Qwen در علی‌بابا از Qwen-Image-2.1 رونمایی کرده است؛ یک مدل با وزن‌های باز برای تولید و ویرایش تصویر که بخش تولید تصویر آن تنها ۷ میلیارد پارامتر دارد. به ادعای Qwen، این مدل در بنچمارک اختصاصی این تیم از بیشتر مدل‌های بسته عملکرد بهتری داشته است، هرچند هنوز نتایج بنچمارک‌های مستقل برای تأیید این ادعا منتشر نشده‌اند.

خلاصه خبر در یک نگاه

🔹 مدل هوش مصنوعی Qwen-Image-2.1 با وزن‌های باز برای تولید و ویرایش تصویر منتشر شده و بخش تولید تصویر آن ۷ میلیارد پارامتر دارد.
🔹 این مدل به‌صورت بومی از تولید و ویرایش تصاویر شفاف با فرمت RGBA پشتیبانی می‌کند.
🔹 امکان استفاده هم‌زمان از حداکثر ۱۰ تصویر مرجع برای ساخت پرتره گروهی، پرو مجازی لباس و طراحی فضا وجود دارد.
🔹 تغییرات معماری و استفاده مجدد از KV Cache برای افزایش سرعت پردازش، به‌خصوص هنگام کار با چند تصویر مرجع، به کار گرفته شده‌اند.
🔹 مجوز پژوهشی Qwen-Image-2.1 استفاده تجاری را ممنوع می‌کند و کسب‌وکارها به مجوز جداگانه Qwen نیاز دارند.

مدل هوش مصنوعی Qwen-Image-2.1 با ۷ میلیارد پارامتر چه عملکردی دارد؟

مدل Qwen-Image-2.1 تازه‌ترین مدل Qwen برای تولید و ویرایش تصاویر است که با وزن‌های باز منتشر شده است. بخش تولید تصویر این مدل تنها ۷ میلیارد پارامتر دارد؛ ابعادی که امکان اجرای آن را روی کارت‌های گرافیک قدرتمند مصرفی مانند GeForce RTX 3090 نیز فراهم می‌کند.

تیم Qwen ادعا می‌کند مدل جدید در بنچمارک اختصاصی این شرکت از بیشتر مدل‌های بسته عملکرد بهتری داشته است. بااین‌حال، بنچمارک‌های مستقل هنوز منتشر نشده‌اند و در نتیجه ارزیابی مستقل این ادعا همچنان باقی مانده است.

تولید و ویرایش تصاویر شفاف با پشتیبانی بومی از RGBA

یکی از قابلیت‌های مهم Qwen-Image-2.1، پشتیبانی بومی از تصاویر شفاف RGBA در هر دو فرایند تولید و ویرایش است. این قابلیت به کاربران اجازه می‌دهد اشیای مختلف را از تصویر جدا کنند یا متن موجود روی لایه‌های شفاف را تغییر دهند.

در نتیجه، مدل می‌تواند مستقیما با شفافیت تصویر کار کند و این ویژگی را نه‌تنها هنگام ویرایش، بلکه در مرحله تولید تصویر نیز در اختیار کاربر قرار دهد.

مدل هوش مصنوعی Qwen-Image-2.1

پشتیبانی از حداکثر ۱۰ تصویر مرجع

مدل Qwen-Image-2.1 می‌تواند حداکثر ۱۰ تصویر مرجع را به‌صورت هم‌زمان دریافت کند. این قابلیت برای سناریوهایی که به ترکیب اطلاعات بصری چند منبع نیاز دارند، در نظر گرفته شده است.

برای نمونه، می‌توان از تصاویر جداگانه چند فرد برای ساخت یک پرتره گروهی استفاده کرد. پرو مجازی لباس و طراحی فضای داخلی نیز از دیگر کاربردهای مطرح‌شده برای قابلیت چندتصویری این مدل هستند.

ویرایش موضعی تصویر با ماسک و علامت‌گذاری

کاربران برای مشخص کردن بخش مورد نظر جهت ویرایش می‌توانند از دایره‌ها، ماسک‌ها یا نشانه‌های نقاشی‌شده روی تصویر استفاده کنند. به این ترتیب، مدل می‌تواند تغییرات را روی ناحیه مشخص‌شده متمرکز کند و ویرایش‌های موضعی انجام دهد.

این روش در کنار پشتیبانی از تصاویر مرجع متعدد، امکان هدایت دقیق‌تر فرایند ویرایش را فراهم می‌کند.

افزایش سرعت Qwen-Image-2.1 با استفاده مجدد از KV Cache

تیم Qwen می‌گوید تغییرات معماری و قابلیت استفاده مجدد از KV Cache باعث افزایش سرعت استنتاج در Qwen-Image-2.1 شده‌اند. این بهینه‌سازی به‌خصوص هنگام پردازش چند تصویر مرجع به‌صورت هم‌زمان اهمیت بیشتری پیدا می‌کند.

ترکیب این بهینه‌سازی‌ها با بخش تولید تصویر ۷ میلیارد پارامتری باعث شده است مدل جدید امکان اجرا روی سخت‌افزارهای مصرفی قدرتمند مانند RTX 3090 را نیز داشته باشد.

مدل هوش مصنوعی Qwen-Image-2.1

مدل هوش مصنوعی Qwen-Image-2.1

مدل Qwen-Image-2.1 از کجا قابل دریافت است؟

وزن‌های مدل Qwen-Image-2.1 از طریق Hugging Face، GitHub و ModelScope منتشر شده‌اند. یک نسخه آزمایشی نیز در Hugging Face در دسترس قرار گرفته است تا کاربران بتوانند قابلیت‌های مدل را امتحان کنند.

مجوز Qwen-Image-2.1 اجازه استفاده تجاری نمی‌دهد

با وجود انتشار وزن‌های مدل، مجوز پژوهشی Qwen-Image-2.1 استفاده تجاری از آن را مجاز نمی‌داند. بنابراین، انتشار وزن‌های مدل به معنای امکان استفاده آزادانه از آن در محصولات و خدمات تجاری نیست.

کسب‌وکارهایی که قصد استفاده تجاری از Qwen-Image-2.1 را دارند، باید برای دریافت مجوز جداگانه با Qwen اقدام کنند.

جمع‌بندی

مدل هوش مصنوعی Qwen-Image-2.1 با تمرکز بر تولید و ویرایش تصویر، پشتیبانی بومی از شفافیت RGBA، استفاده از حداکثر ۱۰ تصویر مرجع و امکان ویرایش موضعی منتشر شده است. بخش تولید تصویر ۷ میلیارد پارامتری و بهینه‌سازی‌های مربوط به KV Cache نیز امکان اجرای آن روی سخت‌افزارهای مصرفی قدرتمند را فراهم می‌کنند، هرچند ادعاهای مربوط به عملکرد مدل هنوز به ارزیابی مستقل نیاز دارند.

به نظر شما پشتیبانی بومی از تصاویر شفاف و امکان استفاده هم‌زمان از ۱۰ تصویر مرجع تا چه اندازه Qwen-Image-2.1 را برای ویرایش حرفه‌ای تصاویر کاربردی‌تر می‌کند؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
مطالب اخیر
امیرحسین ملکی