Mistral از مدل امنیت سایبری خود رونمایی کرد

زمان مطالعه: 2 دقیقه

استارتاپ فرانسوی Mistral با معرفی Shieldstral، یک مدل طبقه‌بندی‌کننده ایمنی چندوجهی با ۳ میلیارد پارامتر و متن‌باز ارائه کرده است که بر اساس متن منبع، در برخی معیارها عملکرد مدل‌هایی تا هفت برابر بزرگ‌تر از خود را دارد و در ارزیابی ایمنی چندوجهی به سطح جدیدی از عملکرد رسیده است. این مدل تحت مجوز Apache 2.0 منتشر شده و می‌تواند روی یک GPU انویدیا با ۱۶ گیگابایت حافظه اجرا شود.

ایده اصلی Shieldstral تغییر نحوه تعریف تعدیل محتوا یا Content Moderation است. در بسیاری از مدل‌های محافظ یا Guardrail، دسته‌بندی‌های مشخصی از محتوای مضر در وزن‌های مدل از پیش تعریف شده‌اند. در نتیجه، اگر یک محصول به سیاست ایمنی متفاوتی نیاز داشته باشد، معمولاً باید مدل برای آن سیاست دوباره آموزش داده شود. ازسوی‌دیگر، یک تعریف واحد از محتوای ناایمن برای همه محصولات وجود ندارد؛ محتوایی که ممکن است در یک ابزار پژوهشی امنیت سایبری قابل‌قبول باشد، ممکن است در یک پلتفرم سلامت روان نامناسب تلقی شود.

Shieldstral به‌جای تثبیت سیاست‌های ایمنی در وزن‌های مدل، سیاست را هنگام استنتاج به‌صورت یک پرسش به زبان طبیعی دریافت می‌کند. سپس مدل یک امتیاز ایمنی کالیبره‌شده ارائه می‌دهد. به‌این‌ترتیب، بدون آموزش مجدد می‌توان مدل را با سیاست‌های مختلف تطبیق داد و ارزیابی متن و تصویر را با یک رابط واحد انجام داد.

Shieldstral مسئله تعدیل محتوا را به یک عملیات پرسش‌وپاسخ دودویی تبدیل می‌کند. هر درخواست شامل سه بخش است:

  • Instruct: زمینه ارزیابی، میزان سخت‌گیری و در صورت نیاز، تعریف محتوای ناایمن.
  • Query: یک پرسش بله/خیر، مانند «آیا این محتوا خشونت فیزیکی را ترویج می‌کند؟»
  • Document: محتوایی که باید ارزیابی شود؛ از یک پرامپت یا پاسخ گرفته تا جفت پرامپت–پاسخ یا تصویر همراه با متن اختیاری.

مدل در زمان استنتاج تنها خروجی‌های مربوط به «بله» و «خیر» را بررسی و با نرمال‌سازی Softmax، آن‌ها را به یک امتیاز ایمنی پیوسته تبدیل می‌کند. این چارچوب وظایفی مانند طبقه‌بندی پرامپت، تعدیل پاسخ، تشخیص امتناع از پاسخ و شناسایی محتوای سمی را در یک مسئله واحد ادغام می‌کند.

بنچمارک‌ها

ویژگی‌های اصلی

Shieldstral بر اساس متن منبع، در چهار محور اصلی ارزیابی شده است: ایمنی متنی، تشخیص امتناع، سازگاری با سیاست‌ها و تعدیل چندوجهی.  از ویژگی‌های مهم آن می‌توان به انعطاف‌پذیری سیاست‌ها بدون آموزش مجدد، پشتیبانی از متن، تصویر و متن+تصویر، امتیاز ایمنی پیوسته به‌جای یک برچسب گسسته، اندازه ۳ میلیارد پارامتری و اجرای آن روی یک GPU با ۱۶ گیگابایت حافظه اشاره کرد. وزن‌های این مدل نیز تحت مجوز Apache 2.0 در هاگینگ‌فیس در دسترس قرار گرفته‌اند.

دانلود مدل Shieldstral از هاگینگ‌فیس

نحوه ساخت Shieldstral

تیم سازنده Mistral AI برای آموزش مدل با چهار مسئله اصلی مواجه بود.

نخست، داده‌های ایمنی عمومی از نظر دسته‌بندی‌ها، برچسب‌ها و شیوه‌های حاشیه‌نویسی با یکدیگر متفاوت‌اند. این داده‌ها به قالب مشترک دستورالعمل–پرسش–محتوا تبدیل شدند و میزان سخت‌گیری نیز متناسب با منبع تنظیم شد.

دوم، هدف آموزش مدل صرفاً حفظ‌کردن برچسب‌های ازپیش‌تعیین‌شده نبود، بلکه مدل باید می‌آموخت مرز دقیق سیاست‌های مختلف را تشخیص دهد. برای این منظور، سیاست‌های مشابه و به‌راحتی قابل‌اشتباه طراحی شدند و متن‌هایی به شکل جفت‌های متضاد تولید شدند تا هر متن یک سیاست را نقض کند اما سیاست مشابه دیگری را نقض نکند.

سوم، برای تقویت داده‌های ایمنی تصویری، داده‌های محدود تعدیل تصاویر با مجموعه‌داده‌های عمومی تصاویر تکمیل شدند. همچنین جفت‌های تصویر–پرسش با استفاده از یک رتبه‌بندی‌کننده مجدد بینایی–زبانی فیلتر شدند تا داده‌های دارای برچسب نادرست و خطاهای ناشی از مدل کاهش یابد.

در نهایت، چند چک‌پوینت مکمل با استفاده از LoRA و روش SLERP ادغام شدند تا کالیبراسیون سیاست‌ها، قابلیت تشخیص سیاست‌های دقیق‌تر و توانایی پیروی از دستورالعمل‌ها در یک مدل واحد ترکیب شود.

Shieldstral به‌عنوان گامی برای حرکت به سمت سیستم‌های تعدیل محتوای سازگار با زمینه معرفی شده است؛ رویکردی که به‌جای تحمیل یک نظام ثابت از دسته‌بندی‌های ایمنی، امکان تعریف و تغییر سیاست‌ها در زمان استفاده را فراهم می‌کند. طبق متن منبع، توسعه‌دهندگان در ادامه بر پوشش چندزبانه، عملکرد بهتر روی اسناد طولانی‌تر و گسترش ایمنی چندوجهی تمرکز خواهند کرد.

طراحان خلاقی و فرهنگ پیشرو در زبان فارسی ایجاد کرد. در این صورت می توان امید داشت که تمام و دشواری موجود در ارائه راهکارها و شرایط سخت تایپ به پایان رسد.

دیدگاهتان را بنویسید