تصویرگر مدل علی بابا Qwen Image 2.1 با ۷ میلیارد پارامتر معرفی کرد. مدلی با قابلیت اجرای لوکال با نانو موز 2 گوگل رقابت می کند.
به گزارش سرویس هوش مصنوعی مجردالبته این ادعاها بر اساس معیار داخلی علی بابا مطرح شده است و برای رسیدن به نتیجه قطعی نیاز به تست های مستقل بیشتری است.
با این حال، گزارشهای اولیه نشان میدهد که Qwen Image 2.1 یک مدل توانمند است که از ویژگیهایی مانند پشتیبانی بومی برای پسزمینه شفاف و ترکیب تصویر بر اساس تصاویر مرجع چندگانه بهره میبرد.
با این حال، تغییر شرایط مجوز Qwen Image 2.1 توجه برخی از کاربران را به خود جلب کرده است. برخلاف نسخه قبلی، مجوز جدید صراحتاً فروش مجدد تجاری خود مدل را ممنوع می کند.
بنابراین، هر شخص یا شرکتی که بخواهد مدل را برای چنین هدفی توزیع کند، باید مجوز جداگانه ای را مستقیماً از توسعه دهنده دریافت کند.
رقابت با مدل های برتر تولید تصویر
Qwen Image 2.1 دارای چندین ویژگی جدید است که کاربردهای آن را گسترش داده و رقابت با گزینه های پیشرو در بازار را آسان تر می کند.
این مدل به صورت بومی از شفافیت پشتیبانی می کند و می تواند تصاویر را با پس زمینه شفاف رندر کند.
این ویژگی برای هنرمندانی خبرجو است که می خواهند از تصاویر تولید شده با هوش مصنوعی در پروژه های دیگر استفاده کنند یا محصولاتی مانند برچسب های چاپی را تولید کنند.
قابلیت ویرایش تصویر نیز بهبود یافته است و مدل می تواند تا 10 تصویر مرجع استفاده کند.
به عنوان مثال کاربر می تواند تصویر یک فرد را به مدل بدهد و سپس تصاویر چند لباس را به مدل اضافه کند تا تصویری از همان فرد با لباس مورد نظر ایجاد کند.
تیم Qwen میگوید که این مدل در تصاویر مختلف، از جمله زمانی که افراد و محصولات را نشان میدهد، یکپارچگی و سازگاری را حفظ میکند.
با این حال، ویژگی برجسته Qwen Image 2.1 اندازه کوچک آن است. قسمت تولید تصویر این مدل تنها ۷ میلیارد پارامتر دارد که آن را به یکی از کوچکترین مدل ها در این زمینه تبدیل می کند.
در مقایسه منتشر شده توسط توسعه دهندگان، تنها مدل LongCat-Image Meituan پارامترهای کمتری دارد و با 6 میلیارد پارامتر عرضه می شود.
اکثر مدل های دیگر چندین برابر بزرگتر هستند یا وزن آنها در دسترس عموم نیست.
توسعه دهندگان Qwen ادعا می کنند که مدل آنها می تواند به طور مستقیم با این مدل های اختصاصی رقابت کند.
در بنچمارک داخلی Qwen Image، این مدل امتیاز 60.2 را کسب کرده است. در همین ارزیابی، GPT Image 2.5 Sunburst از OpenAI 67 امتیاز، مدل Muse Image امتیاز 62.34 و Nano Banana 2.0 گوگل 59.82 امتیاز کسب کردند.
نتایج اولیه بنچمارک AI Arena نشان می دهد که عملکرد Qwen Image 2.1 تحت شرایط ارزیابی مختلف به اندازه نتایج داخلی درخشان نیست، اما همچنان به رقبای خود نزدیک است.
این مدل در AI Arena 1228 امتیاز کسب کرد در حالی که Nano Banana 2 دارای 1260 امتیاز است. مدل Muse Image با امتیاز 1276 چندین رتبه بالاتر است و GPT 65 Sunburst با امتیاز 1423 در بالای جدول قرار دارد.
این نتایج هنوز مقدماتی هستند و برای تایید یا رد کامل ادعاهای تیم Qwen به آزمایشات بیشتری نیاز است.
با این حال، داده های فعلی تا حد زیادی با این ادعاها سازگار است. اگرچه تعداد پارامترهای مدل های اختصاصی مشخص نیست، اما Qwen Image 2.1 با وجود وزن نسبتاً کم، فاصله کمی با آنها دارد.
بیشتر بخوانید: تراشه هوش مصنوعی جدید علی بابا معرفی شد
اجرای مدل بر روی سخت افزار شخصی
گزارشهای برخی از کاربران اولیه نشان میدهد که Qwen Image 2.1 روی کارتهای گرافیک مصرفکننده نیز عملکرد خوبی دارد.
کاربر هکر نیوز Vunderba، توسعهدهنده وبسایت GenAI Showdown، میگوید که توانسته یک تصویر 1 مگاپیکسلی را با این مدل و یک کارت گرافیک RTX 4090 در حدود پنج ثانیه تبدیل کند.
کاربر دیگری به نام cgs019283 در زیر ردیت Stable Diffusion عملکرد این مدل را تحسین کرد و گفت که Qwen Image 2.1 می تواند تصاویر 1 مگاپیکسلی را در حدود 25 ثانیه در کارت های گرافیک جدید سری RTX 50 انویدیا مانند RTX 5070 و RTX 5 تولید کند.
با این حال، به گفته وی، استفاده از تعداد زیادی از تصاویر مرجع می تواند زمان پردازش را تا حد زیادی افزایش دهد. در تست های این کاربر، ویرایش تصویر کندترین ویژگی مدل بود.
برخی از کاربران حتی موفق شده اند این مدل را بر روی سخت افزار قدیمی تر و ضعیف تر اجرا کنند. یکی از آنها ادعا می کند که با کارت گرافیک Nvidia RTX 3060 و 64 گیگابایت حافظه، تصاویر 2K را در حدود 50 ثانیه تولید می کند.
کاربر دیگری نیز به کارت گرافیک قدرتمند RTX 6000 Pro دسترسی دارد و می گوید که این سخت افزار می تواند تنها در چند ثانیه تصاویری با وضوح 1024 در 1024 پیکسل تولید کند.
با وجود این نتایج، راه اندازی و استفاده از هوش مصنوعی به صورت محلی هنوز به آسانی پلتفرم های ابری مانند Nano Banana گوگل و مدل های تصویر GPT OpenAI نیست.
با این حال، نتایج اولیه در نگاه اول قابل توجه است. اگر قابلیتهای این مدل در آزمایشهای دقیقتر تأیید شود، Qwen Image 2.1 میتواند یک رقیب جدی برای کاربرانی باشد که به تولید سریع تصاویر با کیفیت بالا، اجرای محلی، کنترل کامل و عدم نیاز به حسابهای ابری یا اشتراک پولی اهمیت میدهند.
بیشتر بخوانید: علی بابا 2 مدل جدید هوش مصنوعی معرفی کرد
ابهامات مربوط به مجوز استفاده
در میان بحث های کاربران اولیه Qwen Image 2.1، موضوع مجوز استفاده از مدل بارها مطرح شده است. به نظر می رسد متن مجوز تا حدودی مبهم است و در بخشی از آن آمده است:
به شما مجوزی محدود، غیر انحصاری، جهانی، غیرقابل انتقال و بدون حق امتیاز تحت حقوق مالکیت معنوی ما یا سایر حقوق مندرج در مواد ارائه شده توسط ما برای استفاده، تکثیر، توزیع، کپی، تغییر یا ایجاد آثار مشتق بر اساس چنین موادی برای اهداف غیرتجاری اعطا شده است.
این عبارت تا حد زیادی موضوع را روشن می کند. محتوایی که کاربران با مدل تولید میکنند، به نظر نمیرسد در تعریف «مواد» دارای مجوز باشد و در نتیجه، این بند نباید شامل خروجی تولید شده باشد.
اما این مجوز بدین معناست که فروش مجدد خود مدل بدون اخذ مجوز از علی بابا امکان پذیر نیست.
این شرایط با مجوز آپاچی که تحت آن نسخه اصلی Qwen Image منتشر شد متفاوت است و همچنین ممکن است سوالاتی را در مورد تعریف مدل “سبک وزن” ایجاد کند. در هر صورت، مجوز جدید آنقدر که میتوانست باز و رایگان نیست.
البته این محدودیت برای اکثر کاربران مشکل مهمی ایجاد نمی کند.
آنها هنوز هم می توانند Qwen Image 2.1 را روی سخت افزار خود اجرا کنند، تصاویری را که می خواهند ایجاد کنند و از خروجی ها هر طور که می خواهند استفاده کنند.
با توجه به طراحی شیک و قابلیت های چشمگیر این مدل، واکنش توسعه دهندگان مدل های انحصاری جالب توجه خواهد بود.
در متن مجوز نیز آمده است که هر فردی که بخواهد از «مواد» مذکور برای مقاصد تجاری استفاده کند، باید با توجه به کاربری خود، مجوز جداگانه ای از تیم Qwen دریافت کند.
















گفتگو در مورد این post