قدرت بیشتر GPT-6 Astra باعث شده ایمنی این مدل بخشی از خبر اصلی عرضه باشد. OpenAI میگوید Astra در رعایت محدوده دستور، مقاومت در برابر prompt injection و جلوگیری از اقدامات ناخواسته بهتر از GPT-5.6 Sol عمل میکند؛ درعینحال، توانایی پایش استدلال آن در بعضی ارزیابیها کاهش یافته و یک چالش باز باقی مانده است.
- Astra در آزمون داخلی دورزدن Auto-Review هیچبار محدودیت را نقض نکرد.
- در سناریوهای مرورگر و محیط کاری، اقدامات مخرب یا خارج از مجوز کمتر شدهاند.
- OpenAI هشدار داده که فقط بررسی زنجیره استدلال برای ممیزی ایمنی کافی نیست.
همراستایی در GPT-6 Astra چه معنایی دارد؟
براساس مرور رسمی ایمنی Astra، همراستایی یعنی مدل هدف کاربر را درک کند، مرزهای تعیینشده را رعایت کند و درباره توانایی یا محدودیت خود تصویر نادرست نسازد. این موضوع برای عاملهایی که میتوانند روی فایل، مرورگر یا نرمافزار عمل کنند مهمتر از یک چتبات صرف است.
OpenAI میگوید Astra در بیش از ۵۴ هزار کار داخلی Codex تقریباً نصف GPT-5.6 Sol پرچم رفتار ناسازگار با شدت بالاتر دریافت کرده است. این نتیجه امیدوارکننده است، اما جای کنترل بیرونی و مجوزهای محدود را نمیگیرد.
Auto-Review و رعایت محدودیت محیط
در یک ارزیابی، مدل با کارهایی روبهرو شد که Auto-Review آنها را رد کرده بود و حتی پیکربندی بهگونهای بود که امکان دورزدن وجود داشت. Astra هیچبار تلاش نکرد این کنترل را دور بزند. این رفتار برای سامانههایی که تصمیم مدل میتواند به تغییر واقعی منجر شود اهمیت عملی دارد.
بهترین طراحی همچنان باید دفاع چندلایه داشته باشد: حداقل مجوز، جداسازی محیط، ثبت اقدام، تأیید انسان برای عملیات حساس و محدودکردن مقصدهای قابل دسترسی. همراستایی مدل یکی از لایههاست، نه کل معماری امنیت.
مقاومت در برابر prompt injection
عامل مرورگر ممکن است در صفحه وب، سند یا ایمیل با دستوری مخرب روبهرو شود که تلاش میکند هدف اصلی را تغییر دهد. OpenAI گزارش کرده Astra در برابر این نوع تزریق دستور از GPT-5.6 Sol مقاومتر است و در محیطهای حرفهای کمتر به اقدامات خارج از مجوز مانند انتقال ناخواسته داده یا تراکنش غیرمجاز میرسد.
بااینحال، محتوای خارجی همچنان باید غیرقابل اعتماد فرض شود. داده حساس نباید بدون تأیید ارسال شود و تصمیمهای مالی، حذف داده، تغییر دسترسی و ارتباط با اشخاص ثالث باید کنترل صریح داشته باشند.
چرا monitorability هنوز مسئله است؟
OpenAI یافته است که استدلال نوشتاری Astra در ارزیابیهایی که مدل را به پنهانکردن رفتار تشویق میکنند، سختتر از Sol پایش میشود. شرکت این موضوع را به کنترل بیشتر Astra بر نحوه بیان استدلال و حل بعضی مسائل با گامهای نوشتاری کمتر نسبت میدهد.
این یافته به معنی رفتار خطرناکتر کلی نیست؛ ارزیابیهای دیگر نشان میدهند Astra محدودیتها را بهتر رعایت میکند. پیام مهم این است که ممیزی نباید فقط به متن زنجیره فکر متکی باشد. نتیجه، اقدام، دسترسی و تغییر حالت سیستم نیز باید مستقل پایش شوند.
کنترلهای زمان اجرا چگونه عمل میکنند؟
OpenAI برای Astra پایش ناهمراستایی را روی inferenceهای ابزارمحور فعال کرده است. سامانههای طبقهبندی، استدلال و اقدام را برای رفتار خارج از مجوز بررسی و در صورت نیاز اجرای کار را متوقف میکنند. در ChatGPT یا Codex ممکن است از کاربر خواسته شود ادامه کار را بازبینی کند؛ در API درخواست میتواند متوقف شود.
این کنترلها گاهی کار بیخطر را نیز کند میکنند. تیمها باید توقف امن، گزارش واضح خطا و امکان ادامه با بازبینی انسان را در محصول خود طراحی کنند. قدرت Astra بیشترین ارزش را زمانی دارد که اختیار آن قابل مشاهده، محدود و بازگشتپذیر باشد.
منابع خبر
تاریخ انتشار منبع اصلی:
ناشر: گپجیپیتی · سیاست تحریریه و اصلاحات · تماس با تحریریه
مدل مناسب کارتان را انتخاب کنید
مدلهای فعال و امکانات هرکدام را در گپجیپیتی بررسی کنید.