شرکت OpenAI به طور رسمی از مدل GPT-۶ Astra رونمایی کرد؛ مدلی که این توسعهدهنده آن را باهوشترین و همراستاترین سیستم هوش مصنوعی خود تا به امروز توصیف میکند. عرضه این سیستم از امروز برای گروه محدودی از سازمانها آغاز شده است و طی روزهای آینده در دسترس کاربران طرحهای پلاس، پرو، تجاری و سازمانی چتجیپیتی (ChatGPT) و همچنین از طریق رابط برنامهنویسی OpenAI API، مایکروسافت آژور (Microsoft Azure) و آمازون بدراک (AWS Bedrock) قرار خواهد گرفت.
عملکرد و رکوردهای فنی در بنچمارکها
طبق اعلام OpenAI، مدل جدید حاصل سالها پژوهش در مراحل پیشآموزش، یادگیری تقویتی و همراستاسازی است و در حوزههایی مانند مهندسی نرمافزار، استفاده از رایانه و مرورگر، امنیت سایبری و استدلال علمی نتایج شاخصی ارائه میدهد. این مدل در بنچمارک استدلال ریاضی FrontierMath Tier ۴ به امتیاز ۹۸ درصد (۹۷.۶ درصد در جدول v2) دست یافته و طبق ادعای این شرکت به حل برخی مسائل حلنشده ریاضی کمک کرده است. همچنین در ARC-AGI-۳ امتیاز ۹۹.۹ درصد و در ExploitBench امتیاز کامل ۱۰۰ درصد را ثبت کرده است.
گرگ کامرادت از بنیاد جایزه ARC (ARC Prize Foundation) درباره این دستاورد میگوید:
«در بنچمارک ARC-AGI-۳، آسترا در ۹۶ درصد از مراحل از خط مبنای بهرهوری عمل انسانی فراتر رفت و عملاً به برابری با انسان رسید. این نه تنها بهترین مدلی است که آزمایش کردهایم، بلکه جهشی معنادار در عملکرد مدلهای مرزی است؛ چه در توانایی هدایت و حل محیطهای تازه و چه در بهرهوری یادگیری آن.»
در آزمون گردشکارهای پژوهشی با ابزارهای ترمینال (Terminal-Bench Science ۰.۱)، مدل جدید به امتیاز ۶۴.۶ درصد رسید؛ این رقم برای مدل رقیب Claude Fable ۵.۱ برابر با ۵۲.۶ درصد با هزینه تخمینی API تقریباً ۳۱ درصد بیشتر گزارش شده است. همچنین در ارزیابی استدلال علمی مقطع تحصیلات تکمیلی GPQA Diamond، آسترا امتیاز ۹۶.۰ درصد را ثبت کرده است.
استفاده از رایانه و مهندسی نرمافزار
یکی از تمرکزهای اساسی در توسعه آسترا، قابلیت تعامل مستقیم با سیستمعامل و نرمافزارها است. بر اساس آزمون OSWorld ۲.۰، این مدل توانسته وظایف رایانهای را با امتیاز ۷۲.۶ درصد در حدود ۴۰ دقیقه برای هر کار اجرا کند، در حالی که مدل پیشین، GPT-۵.۶ Sol، به امتیاز ۶۵.۷ درصد در زمان حدود ۷۵ دقیقه دست یافته بود که نشاندهنده کاهش ۴۷ درصدی زمان اجرا است.
در زمینه مهندسی نرمافزار، شرکت ادعا میکند آسترا پیشرفتهترین مدل آن تا کنون است و در بنچمارک Terminal-Bench ۴.۰ امتیاز ۵۷.۹ درصد را کسب کرده است. همچنین همراه با آن، زیرساخت Codex بهروزرسانی شده تا امکان یادداشتبرداری میان پنجرههای زمینه (Context Windows) و بازیابی اطلاعات پیشین بدون نیاز به فشردهسازی مکرر فراهم شود؛ ویژگیای که طبق اعلام OpenAI، سرعت انجام وظایف را در بنچمارک Mind2Web تا ۱.۹ برابر نسبت به تجربه فعلی GPT-۵.۶ Sol افزایش میدهد.
سایلاس آلبرتی، معاون ارشد پژوهش در شرکت کاگنیشن (Cognition)، درباره عملکرد این مدل در ابزار توسعه Devin میگوید:
«ما GPT-۶ Astra را از روز عرضه در زیرساخت Devin ادغام میکنیم؛ جایی که در بنچمارک آزمایش داخلی ما عملکردی پیشرو ارائه میدهد. استفاده عالی از رایانه، مهارت نوشتاری و درک کدبیس بلافاصله آزمایشها را ارتقا داد؛ ویدیوها راحتتر دنبال میشوند و گزارشها شفافتر و خلاصهتر هستند.»
امنیت سایبری و معیارهای همراستایی
بر اساس گزارش ایمنی OpenAI، قابلیتهای آسترا به آستانه «بحرانی» (Critical) در چارچوب آمادگی این شرکت رسیده است. در ارزیابیهای مربوط به آسیبپذیریهای نرمافزاری بدون حفاظهای تولیدی، این مدل در ExploitGym نرخ موفقیت ۴۲.۴ درصدی داشت و در بنچمارک مهندسی معکوس SRE-Bench در یک تلاش به نرخ ۸۸.۰ درصد و در چهار تلاش به ۹۹.۲ درصد رسید. این شرکت اشاره کرده که نسخه استاندارد عرضهشده آسترا از پذیرش وظایف تهاجمی مانند ساخت اکسپلویتهای اثبات مفهوم (PoC) خودداری میکند، اما از طریق طرح OpenAI Daybreak طی هفتههای آینده دسترسیهای کممحدودیتتری برای گردشکارهای مدافعان سایبری فراهم خواهد شد.
از بعد رفتار ایمن، در آزمون طراحیشده بر اساس حادثه هاگینگفیس (Hugging Face) جهت سنجش خروج مدل از محدوده اختیارات در کارهای غیرممکن، آسترا در ۰ درصد مواقع از مرزهای تعیینشده عبور کرد، در حالی که مدل GPT-۵.۶ Sol در ارزیابی بدون حفاظ ۴۸ درصد مواقع از محدوده خارج شده بود. نرخ پیامدهای ناهمراستا در بنچمارک ایمنی استفاده از رایانه نیز برای آسترا ۲.۴ درصد ثبت شده است.
شرایط عرضه و قیمتگذاری
استفاده از آسترا در سهمیه اشتراکهای موجود کاربران پلاس، پرو، تجاری و سازمانی گنجانده شده و خرید اعتبار اضافه نیز امکانپذیر است. کاربران طرحهای پرو و سازمانی به نسخه GPT-۶ Astra Pro نیز دسترسی خواهند داشت؛ هرچند فعالسازی آن در پنل سازمانها در زمان عرضه به صورت پیشفرض غیرفعال است.
در بخش توسعهدهندگان، مدل با شناسه gpt-6-astra در API ارائه میشود. قیمت استاندارد به ازای هر یک میلیون توکن ورودی ۱۰ دلار و به ازای هر یک میلیون توکن خروجی ۵۰ دلار تعیین شده است. همچنین یک حالت سریع (Fast mode) با سرعت پردازش دو برابری و قیمت دو برابر نرخ استاندارد دردسترس توسعهدهندگان خواهد بود.
این خبر بر اساس گزارش منتشرشده در اپنایآی تهیه شده است.

