تیم هوش مصنوعی Qwen در علیبابا از Qwen-Image-2.1 رونمایی کرده است؛ یک مدل با وزنهای باز برای تولید و ویرایش تصویر که بخش تولید تصویر آن تنها ۷ میلیارد پارامتر دارد. به ادعای Qwen، این مدل در بنچمارک اختصاصی این تیم از بیشتر مدلهای بسته عملکرد بهتری داشته است، هرچند هنوز نتایج بنچمارکهای مستقل برای تأیید این ادعا منتشر نشدهاند.
🔹 مدل هوش مصنوعی Qwen-Image-2.1 با وزنهای باز برای تولید و ویرایش تصویر منتشر شده و بخش تولید تصویر آن ۷ میلیارد پارامتر دارد.
🔹 این مدل بهصورت بومی از تولید و ویرایش تصاویر شفاف با فرمت RGBA پشتیبانی میکند.
🔹 امکان استفاده همزمان از حداکثر ۱۰ تصویر مرجع برای ساخت پرتره گروهی، پرو مجازی لباس و طراحی فضا وجود دارد.
🔹 تغییرات معماری و استفاده مجدد از KV Cache برای افزایش سرعت پردازش، بهخصوص هنگام کار با چند تصویر مرجع، به کار گرفته شدهاند.
🔹 مجوز پژوهشی Qwen-Image-2.1 استفاده تجاری را ممنوع میکند و کسبوکارها به مجوز جداگانه Qwen نیاز دارند.
مدل Qwen-Image-2.1 تازهترین مدل Qwen برای تولید و ویرایش تصاویر است که با وزنهای باز منتشر شده است. بخش تولید تصویر این مدل تنها ۷ میلیارد پارامتر دارد؛ ابعادی که امکان اجرای آن را روی کارتهای گرافیک قدرتمند مصرفی مانند GeForce RTX 3090 نیز فراهم میکند.
تیم Qwen ادعا میکند مدل جدید در بنچمارک اختصاصی این شرکت از بیشتر مدلهای بسته عملکرد بهتری داشته است. بااینحال، بنچمارکهای مستقل هنوز منتشر نشدهاند و در نتیجه ارزیابی مستقل این ادعا همچنان باقی مانده است.
یکی از قابلیتهای مهم Qwen-Image-2.1، پشتیبانی بومی از تصاویر شفاف RGBA در هر دو فرایند تولید و ویرایش است. این قابلیت به کاربران اجازه میدهد اشیای مختلف را از تصویر جدا کنند یا متن موجود روی لایههای شفاف را تغییر دهند.
در نتیجه، مدل میتواند مستقیما با شفافیت تصویر کار کند و این ویژگی را نهتنها هنگام ویرایش، بلکه در مرحله تولید تصویر نیز در اختیار کاربر قرار دهد.
مدل Qwen-Image-2.1 میتواند حداکثر ۱۰ تصویر مرجع را بهصورت همزمان دریافت کند. این قابلیت برای سناریوهایی که به ترکیب اطلاعات بصری چند منبع نیاز دارند، در نظر گرفته شده است.
برای نمونه، میتوان از تصاویر جداگانه چند فرد برای ساخت یک پرتره گروهی استفاده کرد. پرو مجازی لباس و طراحی فضای داخلی نیز از دیگر کاربردهای مطرحشده برای قابلیت چندتصویری این مدل هستند.
کاربران برای مشخص کردن بخش مورد نظر جهت ویرایش میتوانند از دایرهها، ماسکها یا نشانههای نقاشیشده روی تصویر استفاده کنند. به این ترتیب، مدل میتواند تغییرات را روی ناحیه مشخصشده متمرکز کند و ویرایشهای موضعی انجام دهد.
این روش در کنار پشتیبانی از تصاویر مرجع متعدد، امکان هدایت دقیقتر فرایند ویرایش را فراهم میکند.
تیم Qwen میگوید تغییرات معماری و قابلیت استفاده مجدد از KV Cache باعث افزایش سرعت استنتاج در Qwen-Image-2.1 شدهاند. این بهینهسازی بهخصوص هنگام پردازش چند تصویر مرجع بهصورت همزمان اهمیت بیشتری پیدا میکند.
ترکیب این بهینهسازیها با بخش تولید تصویر ۷ میلیارد پارامتری باعث شده است مدل جدید امکان اجرا روی سختافزارهای مصرفی قدرتمند مانند RTX 3090 را نیز داشته باشد.
وزنهای مدل Qwen-Image-2.1 از طریق Hugging Face، GitHub و ModelScope منتشر شدهاند. یک نسخه آزمایشی نیز در Hugging Face در دسترس قرار گرفته است تا کاربران بتوانند قابلیتهای مدل را امتحان کنند.
با وجود انتشار وزنهای مدل، مجوز پژوهشی Qwen-Image-2.1 استفاده تجاری از آن را مجاز نمیداند. بنابراین، انتشار وزنهای مدل به معنای امکان استفاده آزادانه از آن در محصولات و خدمات تجاری نیست.
کسبوکارهایی که قصد استفاده تجاری از Qwen-Image-2.1 را دارند، باید برای دریافت مجوز جداگانه با Qwen اقدام کنند.
مدل هوش مصنوعی Qwen-Image-2.1 با تمرکز بر تولید و ویرایش تصویر، پشتیبانی بومی از شفافیت RGBA، استفاده از حداکثر ۱۰ تصویر مرجع و امکان ویرایش موضعی منتشر شده است. بخش تولید تصویر ۷ میلیارد پارامتری و بهینهسازیهای مربوط به KV Cache نیز امکان اجرای آن روی سختافزارهای مصرفی قدرتمند را فراهم میکنند، هرچند ادعاهای مربوط به عملکرد مدل هنوز به ارزیابی مستقل نیاز دارند.
به نظر شما پشتیبانی بومی از تصاویر شفاف و امکان استفاده همزمان از ۱۰ تصویر مرجع تا چه اندازه Qwen-Image-2.1 را برای ویرایش حرفهای تصاویر کاربردیتر میکند؟