مایکروسافت از دو مدل MAI-Image-2.5-Pro و MAI-Voice-2-Flashرونمایی کرد
مایکروسافت یک سال پیش توسعه مدلهایی را آغاز کرد که بهصورت اختصاصی و درونسازمانی طراحی شدهاند؛ مدلهایی که بر پایه دادههای تمیز، قابلردیابی و در سطح استانداردهای سازمانی آموزش دیدهاند، بدون آنکه از مدلهای شخص ثالث تقطیر (Distillation) شده باشند و از همان ابتدا با هدف خدمترسانی به افرادی طراحی شدهاند که هر روز از محصولات مایکروسافت استفاده میکنند.
مصطفی سلیمان، مدیر هوش مصنوعی مایکروسافت در جریان رویداد Build 2026 خانوادهای متشکل از هفت مدل جدید را معرفی کرد که به طور کامل در داخلMicrosoft AI توسعه یافتهاند؛ این مدلها نهتنها در رتبهبندیهای معیار عملکرد (Leaderboard) در صدر قرار گرفتهاند، بلکه اکنون در محیطهای عملیاتی و در مقیاس گسترده نیز مورداستفاده قرار میگیرند و با بهرهوری بالا، تجربه میلیونها کاربر را در مجموعهای روبهرشد از محصولات مایکروسافت، از جمله Bing، PowerPoint، OneDrive، Dynamics 365 و Azure، پشتیبانی میکنند.
رونمایی مایکروسافت از ۷مدل جدید و اختصاصی MAI
اکنون مایکروسافت دو عضو این خانواده را با بهروزرسانیهای جدید منتشر کرده است.
- مدل MAI-Image-2.5-Pro اکنون بهصورت پیشنمایش عمومی در دسترس قرار گرفته است. مدل MAI-Image-2.5-Pro برای سناریوهایی طراحی شده که کیفیت، مهمترین اولویت است؛ از تولید تصاویر شاخص (Hero Image) گرفته تا ویرایشهای دقیق و نمایش کاملاً دقیق متن درون تصویر. نسخه Pro تاکنون باکیفیتترین مدل تولید تصویر مایکروسافت محسوب میشود و هزینه استفاده از آن بهترتیب ۵ دلار برای هر یک میلیون توکن ورودی متنی، ۸ دلار برای هر یک میلیون توکن ورودی تصویری و ۱۰۶ دلار برای هر یک میلیون توکن خروجی تصویری است.
- مدل MAI-Voice-2-Flash نیز اکنون بهصورت پیشنمایش عمومی عرضه شده است. مدل MAI-Voice-2-Flas که نخستینبار در کنفرانس Build معرفی شد، با تمرکز بر سرعت و مقیاسپذیری توسعه یافته است. Flash راهکاری سریع و کارآمد برای کاربردهای صوتی با حجم بسیار بالاست؛ کاربردهایی که سرعت پاسخگویی در آنها اهمیت حیاتی دارد، درحالیکه همچنان آهنگ گفتار طبیعی (Prosody) و کیفیت آکوستیکی بالای MAI-Voice-2 را حفظ میکند. این مدل نسبت به MAI-Voice-2 دوبرابر سریعتر و ۳۲ درصد ارزانتر است و هزینه استفاده از آن ۱۵ دلار برای هر یک میلیون کاراکتر تعیین شده است.
مدلهای MAI-Voice-2-Flash و MAI-Image-2.5-Pro در کنار مدلهای موجود مایکروسافت قرار میگیرند تا توسعهدهندگان بتوانند بسته به نیاز خود، بهترین نقطه تعادل میان کیفیت، سرعت و هزینه را انتخاب کنند.
هرچند رتبهبندیهای معیار عملکرد و بنچمارکها ابزار مناسبی برای ارزیابی کیفیت مدلها هستند، اما معیار واقعی موفقیت، عملکرد آنها در کاربردهای واقعی محصولات است. مایکروسافت پیش از انتخاب هر مدل برای استفاده در محیطهای عملیاتی، آن را با دقت و به طور جامع ارزیابی میکند. اکنون مدلهای MAI در بخش بیشتری از محصولات مایکروسافت، از نظر کیفیت، تأخیر (Latency) و بهرهوری، عملکردی بهتر از مدلهای رقیب ارائه میدهند.
- Bing Image Creator اکنون به طور کامل و بهصورت پیشفرض از مدلهای داخلی مایکروسافت استفاده میکند. با بهرهگیری از قابلیتهای جدید MAI-Image-2.5 در ویرایش دقیق تصاویر، این مدل اکنون به موتور پیشفرض Bing Image Creator در تمام مراحل تولید و ویرایش تصویر تبدیل شده و امکان تولید تصاویر باکیفیتتر و کنترل خلاقانه بیشتر را فراهم کرده است.
- قابلیتهای تولید و ویرایش تصویر در PowerPoint اکنون با MAI-Image-2.5 در محیط عملیاتی اجرا میشود. این مدل برای قابلیتهای «تبدیل تصویر به تصویر» بهکار گرفته شده و در مقایسه با GPT-Image-2، هزینه استفاده از پردازندههای گرافیکی (GPU) را تا ۸۴ درصد کاهش داده است.
- ویرایش تصویر در OneDrive نیز اکنون به طور پیشفرض از MAI-Image-2.5 بهره میبرد. از زمان استقرار این مدل، نرخ ذخیرهسازی موفق تصاویر ۲۶ درصد افزایش یافته، تأخیر در صدک ۹۵ (P95) حدود ۲۵ درصد کاهش یافته و در بارهای کاری عملیاتی با میزان استفاده متوسط، ۲.۵ برابر بهرهوری بیشتر حاصل شده است.
- پردازش صوت در مراکز تماس اکنون با MAI-Voice-2-Flash انجام میشود. این مدل موتور اصلی Dynamics 365 Contact Center است؛ پلتفرم سازمانی مایکروسافت برای ساخت عاملهای هوشمند مراکز تماس که توسط شرکتهایی مانند T-Mobile و EasyJet مورداستفاده قرار میگیرد. این مدل طبیعیترین و گویاترین صدای تولیدشده توسط مایکروسافت را برای تعاملات حساس با مشتریان فراهم میکند و همزمان هزینه استفاده از پردازندههای گرافیکی را تا ۸۹ درصد کاهش میدهد.
- ادغام MAI-Voice-2-Flash در Azure Voice Live. مشتریان اکنون میتوانند بهسرعت عاملهای صوتی خود را در Voice Live توسعه دهند و از صداهای طبیعی، بیانگر و کمتأخیر این مدل بهره ببرند. Voice Live مسیر مقیاسپذیری را در اختیار توسعهدهندگان قرار میدهد تا عاملهای هوشمند باکیفیتی بسازند که از تعاملات گفتار به گفتار (Speech-to-Speech) پشتیبانی میکنند.