رونمایی xAI از مدل مولد تصویر Imagine Image 2.0
استارتاپ هوش مصنوعی xAI، متعلق به ایلان ماسک از عرضه عمومی Imagine Image 2.0 بهعنوان حالت کیفیت جدید در مدل مولد تصویر خود در چتبات Grok و همچنین اپلیکیشنهای iOS و Android خبر داد.
به ادعای xAI، این نسخه با هدف مشخصی طراحی شده است؛ تولید تصاویری که واقعاً در کارهای حرفهای قابلاستفاده باشند. برخلاف بسیاری از مدلهای قبلی که بیشتر بر جذابیت بصری تمرکز داشتند، Image 2.0 بر دقت در پیروی از دستورالعملها، برنامهریزی تایپوگرافی و چیدمان به شیوه یک طراح حرفهای، حفظ یکپارچگی در تصاویر چندبخشی و وضوح متنهای کوچک تأکید دارد. همچنین توانایی حفظ عناصر ورودی در نسلهای متوالی و ویرایشها از ویژگیهای کلیدی آن محسوب میشود.


یکی از محورهای اصلی این بهروزرسانی، قابلیتهای ویرایش دقیق است. در دنیای واقعی، تولید اولیه تصویر بهندرت نسخه نهایی است و کار بهصورت تکراری پیش میرود. Image 2.0 ابزارهایی را ارائه میدهد که امکان تغییر دقیق بخشهای موردنظر را بدون تأثیر بر سایر قسمتها فراهم میکند. ابزار magic wand ناحیه مشخصشده را ویرایش میکند. قابلیت segmentation نیز بخشهایی خاص از تصویر را بهصورت خودکار تشخیص میدهد، امکان انتخاب دقیق نواحی را به کاربر میدهد، امکان حذف پسزمینه سگمنت و حتی دانلود جداگانه آن را فراهم میکند تا آماده استفاده در پروژههای دیگر باشد. ویرایش چندمرجعی (multi-ref) تا پنج تصویر ورودی را در یک پرامپت میپذیرد و نیاز به ترکیب دستی را از بین میبرد. علاوه بر این، قابلیت Smart Resize امکان تغییر نسبت تصویر به هر اندازهای را فراهم میکند؛ مدل قاب را به طور خودکار پر میکند و نسبتهایی مانند ۱:۲، ۹:۱۶، ۲:۳، ۳:۴، ۱:۱، ۴:۳، ۳:۲، ۱۶:۹ و ۲:۱ پشتیبانی میشوند.

از نظر عملکرد در دنیای واقعی، Image 2.0 برای وفاداری در حوزههای عکاسی، طراحی و تصویرسازی آموزشدیده و ویرایش را بهعنوان یک قابلیت درجه یک در نظر گرفته است. طبق رتبهبندیهای Arena Text-to-Image و Image Edit (تا تاریخ ۷ اوت ۲۰۲۶)، این مدل در هر دو دسته تولید متن به تصویر و ویرایش تصویر در رتبه دوم قرار دارد. مدلهای xAI در این رتبهبندیها تحت عنوان SpaceXAI فهرست شدهاند و نتایج نشاندهنده رقابت نزدیک با مدلهای پیشرو از OpenAI، Meta، Google و سایر شرکتها است.
همزمان با این پیشرفتها، مجموعهای از قالبهای جدید معرفی شدهاند که گردشکارهای رایج را به نقاط شروع آماده تبدیل میکنند. این قالبها شامل ابزارهای ویرایش عکس، تغییر رنگ محصول، پوسترهای تبلیغاتی، تصویرسازی مجدد، کلاژ عکس، ساخت مسکات، حذف و تغییر پسزمینه، عکسهای تجارت الکترونیک، عکسهای UGC، پرتره حرفهای، ساخت آیکون، اسپرایت شخصیت، کیتهای پراپ و UI برای بازی، ساخت ایموجی و طراحی مرچ میشوند. کاربر تنها ورودیهای لازم را فراهم میکند و نتیجه نهایی را دریافت میکند.

قابلیت دیگری که برای تولید محتوای ویدئویی اهمیت دارد، ساخت یک دنیای منسجم است. با چند پرامپت، شخصیت، مکانها و اشیای همراه بهصورت جداگانه تولید میشوند؛ اما سبک یکسانی را در تمام تصاویر حفظ میکنند. این رویکرد امکان ایجاد مجموعهای هماهنگ از داراییهای بصری را فراهم میآورد که برای پروژههای ویدئویی مناسب است.

در حال حاضر، Imagine Image 2.0 از طریق محصولات xAI در دسترس است و دسترسی API نیز بهزودی ارائه خواهد شد. این نسخه با تمرکز بر دقت، قابلیت ویرایش پیشرفته و کاربردپذیری واقعی، ابزاری قدرتمند برای علاقهمندان و متخصصان هوش مصنوعی محسوب میشود که به دنبال تولید محتوای بصری حرفهای و قابلاتکا هستند.