مایکروسافت از دو مدل MAI-Image-2.5-Pro و MAI-Voice-2-Flashرونمایی کرد

زمان مطالعه: 3 دقیقه

مایکروسافت یک سال پیش توسعه مدل‌هایی را آغاز کرد که به‌صورت اختصاصی و درون‌سازمانی طراحی شده‌اند؛ مدل‌هایی که بر پایه داده‌های تمیز، قابل‌ردیابی و در سطح استانداردهای سازمانی آموزش دیده‌اند، بدون آنکه از مدل‌های شخص ثالث تقطیر (Distillation) شده باشند و از همان ابتدا با هدف خدمت‌رسانی به افرادی طراحی شده‌اند که هر روز از محصولات مایکروسافت استفاده می‌کنند.

مصطفی سلیمان، مدیر هوش مصنوعی مایکروسافت در جریان رویداد Build 2026 خانواده‌ای متشکل از هفت مدل جدید را معرفی کرد که به طور کامل در داخلMicrosoft AI  توسعه یافته‌اند؛ این مدل‌ها نه‌تنها در رتبه‌بندی‌های معیار عملکرد (Leaderboard) در صدر قرار گرفته‌اند، بلکه اکنون در محیط‌های عملیاتی و در مقیاس گسترده نیز مورداستفاده قرار می‌گیرند و با بهره‌وری بالا، تجربه میلیون‌ها کاربر را در مجموعه‌ای رو‌به‌رشد از محصولات مایکروسافت، از جمله Bing، PowerPoint، OneDrive، Dynamics 365 و Azure، پشتیبانی می‌کنند.

رونمایی مایکروسافت از ۷مدل جدید و اختصاصی MAI

اکنون مایکروسافت دو عضو این خانواده را با به‌روزرسانی‌های جدید منتشر کرده است.

  • مدل MAI-Image-2.5-Pro اکنون به‌صورت پیش‌نمایش عمومی در دسترس قرار گرفته است. مدل MAI-Image-2.5-Pro برای سناریوهایی طراحی شده که کیفیت، مهم‌ترین اولویت است؛ از تولید تصاویر شاخص (Hero Image) گرفته تا ویرایش‌های دقیق و نمایش کاملاً دقیق متن درون تصویر. نسخه Pro تاکنون باکیفیت‌ترین مدل تولید تصویر مایکروسافت محسوب می‌شود و هزینه استفاده از آن به‌ترتیب ۵ دلار برای هر یک میلیون توکن ورودی متنی، ۸ دلار برای هر یک میلیون توکن ورودی تصویری و ۱۰۶ دلار برای هر یک میلیون توکن خروجی تصویری است.
  • مدل MAI-Voice-2-Flash نیز اکنون به‌صورت پیش‌نمایش عمومی عرضه شده است. مدل MAI-Voice-2-Flas که نخستین‌بار در کنفرانس Build معرفی شد، با تمرکز بر سرعت و مقیاس‌پذیری توسعه یافته است. Flash راهکاری سریع و کارآمد برای کاربردهای صوتی با حجم بسیار بالاست؛ کاربردهایی که سرعت پاسخ‌گویی در آن‌ها اهمیت حیاتی دارد، درحالی‌که همچنان آهنگ گفتار طبیعی (Prosody) و کیفیت آکوستیکی بالای MAI-Voice-2 را حفظ می‌کند. این مدل نسبت به MAI-Voice-2 دوبرابر سریع‌تر و ۳۲ درصد ارزان‌تر است و هزینه استفاده از آن ۱۵ دلار برای هر یک میلیون کاراکتر تعیین شده است.

مدل‌های MAI-Voice-2-Flash و MAI-Image-2.5-Pro در کنار مدل‌های موجود مایکروسافت قرار می‌گیرند تا توسعه‌دهندگان بتوانند بسته به نیاز خود، بهترین نقطه تعادل میان کیفیت، سرعت و هزینه را انتخاب کنند.

هرچند رتبه‌بندی‌های معیار عملکرد و بنچمارک‌ها ابزار مناسبی برای ارزیابی کیفیت مدل‌ها هستند، اما معیار واقعی موفقیت، عملکرد آن‌ها در کاربردهای واقعی محصولات است. مایکروسافت پیش از انتخاب هر مدل برای استفاده در محیط‌های عملیاتی، آن را با دقت و به طور جامع ارزیابی می‌کند. اکنون مدل‌های MAI در بخش بیشتری از محصولات مایکروسافت، از نظر کیفیت، تأخیر (Latency) و بهره‌وری، عملکردی بهتر از مدل‌های رقیب ارائه می‌دهند.

  • Bing Image Creator اکنون به طور کامل و به‌صورت پیش‌فرض از مدل‌های داخلی مایکروسافت استفاده می‌کند. با بهره‌گیری از قابلیت‌های جدید MAI-Image-2.5 در ویرایش دقیق تصاویر، این مدل اکنون به موتور پیش‌فرض Bing Image Creator در تمام مراحل تولید و ویرایش تصویر تبدیل شده و امکان تولید تصاویر باکیفیت‌تر و کنترل خلاقانه بیشتر را فراهم کرده است.
  • قابلیت‌های تولید و ویرایش تصویر در PowerPoint اکنون با MAI-Image-2.5 در محیط عملیاتی اجرا می‌شود. این مدل برای قابلیت‌های «تبدیل تصویر به تصویر» به‌کار گرفته شده و در مقایسه با GPT-Image-2، هزینه استفاده از پردازنده‌های گرافیکی (GPU) را تا ۸۴ درصد کاهش داده است.
  • ویرایش تصویر در OneDrive نیز اکنون به طور پیش‌فرض از MAI-Image-2.5 بهره می‌برد. از زمان استقرار این مدل، نرخ ذخیره‌سازی موفق تصاویر ۲۶ درصد افزایش یافته، تأخیر در صدک ۹۵ (P95) حدود ۲۵ درصد کاهش یافته و در بارهای کاری عملیاتی با میزان استفاده متوسط، ۲.۵ برابر بهره‌وری بیشتر حاصل شده است.
  • پردازش صوت در مراکز تماس اکنون با MAI-Voice-2-Flash انجام می‌شود. این مدل موتور اصلی Dynamics 365 Contact Center است؛ پلتفرم سازمانی مایکروسافت برای ساخت عامل‌های هوشمند مراکز تماس که توسط شرکت‌هایی مانند T-Mobile و EasyJet مورداستفاده قرار می‌گیرد. این مدل طبیعی‌ترین و گویاترین صدای تولیدشده توسط مایکروسافت را برای تعاملات حساس با مشتریان فراهم می‌کند و هم‌زمان هزینه استفاده از پردازنده‌های گرافیکی را تا ۸۹ درصد کاهش می‌دهد.
  • ادغام MAI-Voice-2-Flash در Azure Voice Live. مشتریان اکنون می‌توانند به‌سرعت عامل‌های صوتی خود را در Voice Live توسعه دهند و از صداهای طبیعی، بیان‌گر و کم‌تأخیر این مدل بهره ببرند. Voice Live مسیر مقیاس‌پذیری را در اختیار توسعه‌دهندگان قرار می‌دهد تا عامل‌های هوشمند باکیفیتی بسازند که از تعاملات گفتار به گفتار (Speech-to-Speech) پشتیبانی می‌کنند.

طراحان خلاقی و فرهنگ پیشرو در زبان فارسی ایجاد کرد. در این صورت می توان امید داشت که تمام و دشواری موجود در ارائه راهکارها و شرایط سخت تایپ به پایان رسد.

دیدگاهتان را بنویسید