رونمایی OpenAI از GPT-6 Sol و GPT-6 Luna؛ هوش پیشرفتهتر با هزینه کمتر
اوایل این ماه، GPT-6 Astra بهعنوان هوشمندترین و همراستاترین مدل OpenAI معرفی شد. بااینحال، همه پروژهها به سطح یکسانی از عمق پردازشی، سرعت یا بودجه نیاز ندارند. به همین دلیل، OpenAI خانواده GPT-6 را با دو مدل جدید GPT-6 Sol و GPT-6 Luna گسترش داده است.
این دو مدل با روشهایی مشابه GPT-6 Astra آموزش داده شدهاند و پیشرفتهای این مدل در زمینههایی مانند عملکرد حرفهای، صحت اطلاعات، کدنویسی، استفاده از رایانه و همراستایی را به مدلهایی سریعتر و مقرونبهصرفهتر منتقل میکنند. هدف اصلی این است که هوش پیشرفته برای طیف وسیعتری از کارهای روزمره و کاربردهای مقیاسپذیر قابلاستفاده باشد.
GPT-6 Astra
قیمت
GPT-6 Sol و GPT-6 Luna همچنین از بهبودهای مربوط به کشینگ و استنتاج بهره میبرند که هزینه ارائه آنها را کاهش داده است. بر اساس اعلام OpenAI، قیمت API هر دو مدل نسبت به قیمت خانواده مدلهای GPT-5.6، حدود ۵۰ درصد کاهش یافته است. قیمتها بهازای هر یک میلیون توکن محاسبه میشوند.
| مدل | قیمت ورودی | قیمت خروجی |
| GPT-6 Sol | ۲ دلار | ۱۰ دلار |
| GPT-6 Luna | ۰٫۱۰ دلار | ۰٫۵۰ دلار |
عملکرد حرفهای
GPT-6 Astra همچنان مدل برتر این خانواده از نظر عملکرد کلی معرفی شده و برای پروژههایی که بیشترین کیفیت و عملکرد ممکن را نیاز دارند، در نظر گرفته شده است.
GPT-6 Sol برای انجام وظایف پیچیده حرفهای طراحی شده و هزینه کمتر آن امکان استفاده و تکرار بیشتر را فراهم میکند. در آزمون AutomationBench که گردشهای کاری تجاری میان اپلیکیشنها را ارزیابی میکند، GPT-6 Sol با سطح تلاش xhigh امتیاز ۳۳٫۲ درصد به دست آورده است؛ درحالیکه Claude Opus 5 با بیشترین سطح تلاش امتیاز ۲۶٫۹ درصد کسب کرده است. هزینه هر وظیفه برای GPT-6 Sol حدود ۰٫۲۷ دلار بوده و طبق متن، هزینه Claude Opus 5 برای همان وظایف ۱۱٫۱ برابر بیشتر بوده است. GPT-6 Sol همچنین در این آزمون از Claude Fable 5.1 با سازوکار بازگشت به Opus 5 عملکرد بالاتری داشته و از GPT-6 Astra در سطح تلاش پایین نیز امتیاز بیشتری کسب کرده است.
در آزمون Agents’ Last Exam برای ارزیابی عاملهای هوش مصنوعی در گردشهای کاری پیچیده حرفهای، GPT-6 Sol در بیشترین سطح تلاش به امتیاز ۵۶٫۴ درصد رسیده است؛ درحالیکه این عملکرد با هزینهای حدود ۶۰ درصد کمتر از بالاترین عملکرد گزارششده Claude Opus 5 حاصل شده است.
صحت اطلاعات
یکی از محورهای اصلی توسعه این مدلها، افزایش قابلیت اطمینان اطلاعاتی است. در ارزیابی داخلی صحت اطلاعات که بر اساس مکالمات واقعی و ناشناسسازیشدهای انجام شده که کاربران در آنها خطاهای مدلها را گزارش کردهاند، GPT-6 Sol تقریباً فقط نیمی از خطاهای GPT-5.6 Sol را مرتکب شده است. قابلیت اطمینان GPT-6 Sol به سطح Astra نزدیک شده، اما با هزینه بسیار پایینتر. GPT-6 Luna نیز پیشرفت قابلتوجهی داشته و در سطوح بالاتر تلاش، عملکردی مشابه GPT-5.6 Sol را با حدود یکصدم هزینه آن ارائه میکند.
کدنویسی
با پیچیدهتر شدن وظایف عاملهای کدنویسی، هزینه استفاده مداوم از آنها اهمیت بیشتری پیدا کرده است. در خود OpenAI نیز مصرف داخلی این عاملها بهسرعت افزایش یافته و ارزش مصرف روزانه توکنها بر اساس قیمت API برای پژوهشگر میانه بیش از ۶۰۰ دلار و برای ۱۰ درصد بهترین پژوهشگران بیش از ۷۰۰۰ دلار بوده است. GPT-6 Sol و Luna GPT-6 با ترکیب عملکرد کدنویسی قویتر و قیمت API پایینتر، امکان تکرار و آزمایش بیشتر را برای توسعهدهندگان فراهم میکنند.

در FrontierCode، مدل GPT-6 Sol نسبت به GPT-5.6 Sol پیشرفت قابلتوجهی داشته و توانسته است عملکرد Claude Fable 5.1 در سطح xhigh را با هزینه بسیار کمتر مطابقت دهد.

در DeepSWE v1.1، مدل GPT-6 Sol در بیشترین سطح تلاش امتیاز ۶۸٫۸ درصد کسب کرده است؛ این رقم تنها ۱٫۱ واحد درصد کمتر از بالاترین امتیاز Claude Fable 5 یعنی ۶۹٫۹ درصد است، درحالیکه هزینه هر وظیفه برای GPT-6 Sol حدود ۸۰ درصد کمتر گزارش شده است. GPT-6 Luna در بیشترین سطح تلاش امتیاز ۶۶٫۶ درصد به دست آورده و عملکردی قابلمقایسه با Claude Opus 5 و Fable 5 در سطح تلاش متوسط داشته است. هزینه Luna برای هر وظیفه ۹۳ درصد کمتر از Opus 5 و ۹۶ درصد کمتر از Fable 5 بوده است.

استفاده از رایانه
Sol و Luna نسبت به نسل قبلی خود عملکرد مقرونبهصرفهتری ارائه میکنند. در آزمون OSWorld 2.0 offline، مدل GPT-6 Sol با سطح تلاش xhigh به امتیاز ۶۰٫۵ درصد رسیده که نزدیک به امتیاز ۶۰٫۳ درصدی Claude Opus 5 در سطح تلاش متوسط است. هزینه هر وظیفه برای GPT-6 Sol حدود ۸۰ درصد کمتر گزارش شده است. GPT-6 Luna نیز در سطح تلاش حداکثر توانسته است از GPT-5.6 Sol در سطح تلاش متوسط بهتر عمل کند، درحالیکه هزینه آن یکدهم مدل قبلی بوده است.

بهبود کشینگ برای عاملها و مکالمات طولانی
OpenAI علاوه بر کاهش قیمت توکنها، قابلیت Prompt Caching را نیز در GPT-6 بهبود داده است. این تغییر باعث افزایش نرخ برخورد به کش بهصورت پیشفرض میشود و به عاملها اجازه میدهد بخش بیشتری از زمینه قبلی را دوباره استفاده کنند، سریعتر پاسخ دهند و از تخفیف ۹۰ درصدی برای خواندن توکنهای ورودی ذخیرهشده در کش بهره ببرند.
توسعهدهندگان اکنون میتوانند عملکرد کشینگ را نیز بهتر پایش و بهینه کنند. داشبورد Prompt Caching میزان ورودی ذخیرهشده در کش و تغییرات آن را نشان میدهد و ابزار تشخیص، فرصتهای ازدسترفته برای کشینگ و اصلاحات لازم را مشخص میکند. همچنین تغییر سطح تلاش استدلالی یا فعال و غیرفعالکردن ابزارها، بدون ازبینرفتن زمینه قبلی قابلانجام است. توسعهدهندگان میتوانند با استفاده از نقاط شکست صریح، مشخص کنند کدام بخش از پیشوندهای درخواست در کش ذخیره شود.
طبق گزارش GitHub این بهبودها طی چند ماه گذشته و در میلیاردها درخواست به مدلهای OpenAI، سهم توکنهای پرامپتی را که نیازمند پردازش مجدد بودهاند بیش از ۵۰ درصد کاهش دادهاند و به پاسخگویی سریعتر Copilot کمک کردهاند.

ادامه بهبود همراستایی
GPT-6 Sol و GPT-6 Luna همچنین بر مبنای کارهای انجامشده برای همراستایی در GPT-6 Astra توسعه یافتهاند. در ارزیابیهای همراستایی، هر دو مدل نسبت به نسخههای GPT-5.6 خود پیشرفت نشان دادهاند؛ از جمله کاهش نرخ ادعاهای گمراهکننده درباره کارهایی که در حوزه کدنویسی انجام دادهاند. OpenAI تأکید میکند که این ارزیابیها عمداً موقعیتهای دشوار را بررسی میکنند و نرخ خطا در استفاده معمول را اندازهگیری نمیکنند.
دسترسی
مدلهای GPT-6 Sol و GPT-6 Luna از زمان معرفی در ChatGPT Work و Codex برای کاربران Plus، Pro، Business، Enterprise و Edu در دسترس قرار گرفتهاند. کاربران Free و Go نیز میتوانند به GPT-6 Luna در اپلیکیشن دسکتاپ دسترسی داشته باشند.
این مدلها در زمان انتشار این گزارش، هنوز در نسخه وب چتبات ChatGPT در دسترس نیستند. در API نیز با نامهای gpt-6-sol و gpt-6-luna ارائه شدهاند. OpenAI اعلام کرده است که عرضه این مدلها در ChatGPT بهصورت تدریجی انجام خواهد شد.