Claude Opus 5.5؛ جدیدترین عضو آنتروپیک با تمرکز بر عملکرد، بهرهوری و ایمنی
آنتروپیک از Claude Opus 5.5 بهعنوان نخستین مدل خانواده جدید Claude 5.5 رونمایی کرد.
مدل Opus 5.5 در بیشتر کارها عملکردی همسطح Claude Fable 5.1 دارد، اما هزینه اجرای آن نسبت به Opus 5 حدود ۴۰ درصد کمتر است. Opus 5.5 نخستین مدل آنتروپیک پس از طرح دیدگاه این شرکت درباره «کُند کردن روند پیشرفت مرزهای توانمندی هوش مصنوعی» است.
عملکرد و بهرهوری
پیش از عرضه، این مدل توسط ارزیابان خارجی از جمله Frontier Design و METR آزمایش شده است. در جامعترین آزمون خودکار رفتاری آنتروپیک برای ارزیابی همراستایی مدلها، Opus 5.5 بهترین عملکرد ثبتشده میان مدلهای آزمایششده این شرکت را داشته است. این مدل همچنین با مجموعهای از سازوکارهای حفاظتی عرضه شده که برای مدلهای توانمندتر آنتروپیک توسعه یافتهاند.
آنتروپیک میگوید Opus 5.5 نسبت به Opus 5 جهشی قابلتوجه دارد و در حوزههایی مانند کدنویسی عاملمحور، استفاده از رایانه و کارهای دانشمحور در صدر معیارهای داخلی این شرکت قرار گرفته است. البته آنتروپیک تأکید میکند که در سطوح بالای توانمندی مدلها، فاصله میان نتایج بنچمارکها الزاماً تفاوت عملکرد در دنیای واقعی را بهخوبی نشان نمیدهد.
یکی از آزمایشکنندگان اولیه از Opus 5.5 برای مهاجرت یک کدبیس ۶۸۰ هزار خطی استفاده کرد و این کار را در کمتر از یک روز انجام داد؛ کاری که به گفته آنتروپیک در حالت معمول میتوانست هفتهها زمان یک تیم مهندسی را نیاز داشته باشد. در آزمایشی دیگر، مدل برای کاهش زمان بارگذاری تمام صفحات یک وب اپلیکیشن، در ۳۹ مورد از ۴۰ تلاش موفق عمل کرد.
Opus 5.5 در کارهای گسترده کدنویسی مانند مهاجرت و ممیزی کل کدبیس نیز عملکرد قابلتوجهی نشان داده است. یک آزمایشکننده یک کدبیس ۲۰۰ هزار خطی را با کمک این مدل در کمتر از سه ساعت ممیزی و اصلاح کرد؛ درحالیکه استفاده از Opus 5 بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد.
در یک آزمایش داخلی، Opus 5.5 و Fable 5.1 نرمافزار HAProxy را از زبان C به Rust منتقل کردند. هر دو نسخه تقریباً تمام آزمونهای رگرسیون HAProxy را پشت سر گذاشتند، اما Opus 5.5 این کار را در ۹.۵ ساعت، در برابر ۱۲ ساعت برای Fable 5.1، انجام داد و هزینه آن ۵۱ درصد کمتر بود. آنتروپیک همچنین گزارش میکند که Opus 5.5 در برخی بنچمارکهای کدنویسی عاملمحور با هزینه بسیار پایینتر به نتایج رقابتی یا بهتر از مدلهای مقایسهشده رسیده است.


قیمت و سرعت
Opus 5.5 به محاسبات کمتری نیاز دارد و این موضوع در قیمتگذاری آن منعکس شده است. هزینه معمول اجرای آن طبق آزمایشهای آنتروپیک، حدود ۴۰ درصد کمتر از Opus 5 است. قیمت هر یک میلیون توکن مدل Opus 5.5 از سوی آنتروپیک به این صورت اعلام شده است:
| نوع توکن | Opus 5.5 | Opus 5 |
| Cache reads | ۰.۲۰ دلار | ۰.۵۰ دلار |
| Input | ۴ دلار | ۵ دلار |
| Output | ۲۰ دلار | ۲۵ دلار |
| Cache writes | ۵ دلار | ۶.۲۵ دلار |
Opus 5.5 همچنین بیش از ۳۰ درصد سریعتر از Opus 5 خروجی تولید میکند. حالت سریع این مدل در Claude Code و پلتفرم Claude نیز با سرعتی تا ۲.۵ برابر در دسترس است. آنتروپیک همزمان با کاهش قیمت، محدودیت استفاده پنجساعته را در برخی طرحهای اشتراکی افزایش داده و امکان ذخیره یک بازنشانی محدودیت نرخ (rate limit reset) را نیز برای کاربران اشتراکی فراهم کرده است.
کدنویسی و امنیت عاملها
Opus 5.5 علاوه بر توانایی کدنویسی، با سازوکارهایی برای استفاده ایمنتر از عاملهای نرمافزاری عرضه شده است. هر اقدام عامل پیش از اجرا توسط یک طبقهبندیکننده بررسی میشود، یک سندباکس متنباز برای ممیزی تیمهای امنیتی ارائه شده و فرایند بازبینی کد میتواند آسیبپذیریها را پیش از ادغام کد شناسایی کند.
این مدل همچنین در برابر حملات تزریق پرامپت نسبت به Opus 5 مقاومتر است. در آزمایشهای آنتروپیک، Opus 5.5 در حوزههای کدنویسی، استفاده از ابزار، استفاده از رایانه و وبگردی، با Opus 5 برابری کرده یا عملکرد بهتری داشته است. در یک بنچمارک شرکت امنیت هوش مصنوعی Gray Swan نیز Opus 5.5 از نظر نرخ موفقیت حملات تزریق پرامپت با Fable 5.1 برابر بوده است.
کارهای دانشی و تحلیل کسبوکار
Opus 5.5 در پژوهش و تولید گزارش نیز عملکرد بالایی نشان داده است. در یک آزمایش داخلی، از Opus 5.5، Fable 5.1 و Opus 5 خواسته شد با استفاده از اطلاعات موجود در نسخهای از وب که در آن یافتن گزارش درآمدی یک شرکت دشوار بود، گزارشی از عملکرد فصلی آن تهیه کنند. ارزیاب خودکار تمام ارقام و نقلقولها را با منابع تطبیق داد. در تنظیمات مختلف، ۱۶ مورد از ۱۸ گزارش Opus 5.5 معیار کیفی تعیینشده را پشت سر گذاشتند؛ درحالیکه هیچیک از تلاشهای Fable 5.1 یا Opus 5 این معیار را رعایت نکرد.
در یک آزمایش تحلیل مالی، Opus 5.5 و Opus 5 یک ادغام فرضی میان دو شرکت نرمافزاری حوزه منابع انسانی را بررسی کردند. هر دو مدل به نتایج مشابهی رسیدند، اما مدل مالی Opus 5.5 جامعتر بود و ارائه مدیریتی آن خوانایی بیشتری داشت. این مدل کار را در ۶۳ دقیقه در مقابل ۹۳ دقیقه برای Opus 5 تکمیل کرد و هزینه تولید آن ۵۰ درصد کمتر بود.
ارتباط و همکاری
آنتروپیک میگوید یکی از حوزههای اصلی بهبود در Opus 5.5، نحوه ارتباط مدل است. پیامهای مدل برای درک سریع آسانتر شدهاند، اطلاعات مهم را در ابتدای پاسخ قرار میدهد، کمتر از اصطلاحات تخصصی یا عبارتهای نامتعارف استفاده میکند و دستورهای مربوط به سبک نوشتار را بهتر دنبال میکند. آزمایشکنندگان اولیه گزارش کردهاند که این ویژگی، کار با مدل را در جلسات طولانی آسانتر میکند و آنتروپیک نیز آن را هم از نظر کاربردی و هم از منظر ایمنی مفید میداند؛ زیرا بررسی و کنترل خروجیهای مدل را سادهتر میکند.
ایمنی، همراستایی و حفاظتها
در ارزیابی خودکار رفتاری آنتروپیک که Claude را در نزدیک به ۲ هزار سناریو بررسی میکند، Opus 5.5 در تقریباً تمام معیارهای رفتار ناهمراستا، عملکرد بهتری از مدلهای اخیر Claude داشته است. همچنین در بیشتر معیارهای صداقت، قویترین مدل این شرکت در این آزمون بوده است.
Opus 5.5 در رفتارهایی مانند استدلال سوگیرانه یا انگیزهمحور، تلاش برای خروج از سندباکس و انجام اقدامات مضر پس از تشخیص شبیهسازی بودن محیط بهبود یافته است. در یک ارزیابی جدید برای سنجش تمایل مدل به عبور از مرزهای مقید و مشخصشده، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 برای دورزدن این مرزها تلاش کرد و تمام تلاشهای آن شدت پایینی داشتند و توسط خود مدل گزارش شدند.



بااینحال، آنتروپیک تأکید میکند که ساخت ارزیابیهایی که بتوانند تمام شکستهای احتمالی مدل را پیش از استقرار شناسایی کنند، همچنان یک مسئله حلنشده است. این شرکت همچنین مشاهده کرده که Opus 5.5 در بسیاری از موارد احتمالاً متوجه میشود که در حال ارزیابی است؛ مسئلهای که ارزیابی رفتار آن در محیطهای واقعی و متنوع را دشوار میکند.
به دلیل توانایی بالای Opus 5.5 در حوزههای پرریسکی مانند امنیت سایبری و زیستشناسی، این مدل با حفاظتهایی مشابه Fable 5.1 عرضه شده است. در امنیت سایبری، کاربران میتوانند فعالیتهای معمول توسعه نرمافزار مانند شناسایی و رفع باگ را انجام دهند، اما بیشتر وظایف سایبری به Opus 4.8 هدایت میشوند.
در حوزه زیستشناسی نیز Opus 5.5 از سازوکارهای حفاظتی Fable 5.1 استفاده میکند. آنتروپیک اعلام کرده است که برنامهای برای ارائه دسترسی به سازمانهای تأییدشده، از جمله آزمایشگاههای دانشگاهی، استارتاپها و شرکتهای دارویی، در نظر گرفته شده است.
این مدل همچنین با سازوکار preserved thinking برای مقابله با حملات تقطیر (distillation) عرضه شده است. این سازوکار مانع از آن میشود که کاربران API با ویرایش زمینه قبلی Claude، تلاش کنند استدلال مدل را استخراج کنند. Opus 5.5 مانند مدلهای قبلی Opus با نگهداری صفر داده (zero data retention) در دسترس است و برای انطباق با EU AI Act از اقدامات واترمارکگذاری استفاده میکند. حالت thinking نیز دیگر قابل خاموشکردن نیست.
عرضه
Claude Opus 5.5 اکنون روی تمام پلتفرمها، از جمله Amazon Web Services، Google Cloud و Microsoft Azure در دسترس است. توسعهدهندگان در Claude Platform میتوانند از مدل با شناسه claude-opus-5-5 استفاده کنند. آنتروپیک اعلام کرده است که Claude Sonnet 5.5 و Claude Haiku 5.5 نیز در هفتههای آینده عرضه خواهند شد و انتظار میرود بسیاری از بهبودهای مربوط به عملکرد، بهرهوری و ایمنی را به همراه داشته باشند.