شورشهای کوچک در جعبهسیاه؛ چرا OpenAI پرده از رفتارهای پنهان هوش مصنوعی برداشت؟
تصور کنید از یک هوش مصنوعی میخواهید فرمی را با اطلاعات داخلی سیستم پر کند، اما وقتی میبیند ابزار لازم برای اشتراکگذاری دادهها را در اختیار ندارد، قوانین را زیر پا گذاشته و فایلها را مستقیماً روی اینترنت عمومی آپلود میکند. یا بدتر از آن؛ مدل هوشمند برای کسب نمره بالاتر در یک آزمون ارزیابی، مخفیانه تقلب میکند. اینها سناریوهای یک فیلم علمیتخیلی نیستند؛ بلکه اتفاقاتی واقعی در آزمایشگاههای OpenAI هستند که تا پیش از این پشت درهای بسته باقی مانده بودند.
حالا سازنده ChatGPT تصمیم گرفته است به دوران سکوت پایان دهد. این شرکت بهتازگی از «چارچوب افشای ناهماهنگی» (Misalignment Disclosure Framework) رونمایی کرده است؛ سازوکاری که هدف آن اطلاعرسانی شفاف و سریع به افکار عمومی درباره رفتارهای غیرمنتظره و خارج از کنترل مدلهای هوش مصنوعی است.
پایان پنهانکاری: استانداردی تازه برای خطاهای پیشبینینشدنی
در دنیای توسعه هوش مصنوعی، «ناهماهنگی» به وضعیتی گفته میشود که سیستم رفتاری برخلاف اهداف یا دستورالعملهای انسانی از خود نشان میدهد. تا امروز، شرکتهای فناوری تمایلی به افشای این خطاها نداشتند، اما یک مقام ارشد OpenAI در گفتوگو با نشریه وایرد (WIRED) با تایید این رویه اشتباه، اعلام کرد که این شرکت در گذشته چنین رخدادهایی را به اندازه کافی گزارش نمیکرده است.
بر اساس چارچوب جدید، کارکنان OpenAI موظفاند هرگونه رفتار عجیب مدلها را به مدیران ارشد ایمنی گزارش دهند. نکته کلیدی اینجاست که اطلاعرسانی عمومی قرار است حتی پیش از آنکه محققان دلیل رفتار مدل را بفهمند یا راهی برای مهار آن پیدا کنند، انجام شود. OpenAI امیدوار است این اقدام، گام نخست برای ایجاد یک استاندارد جامع در صنعتی باشد که در حال حاضر هیچ قانون شفافی برای گزارش خطرات الگوریتمهایش ندارد. این شرکت همچنین در حال رایزنی با پژوهشگران مستقل، قانونگذاران و دولت فدرال آمریکاست تا معیارهای عینیتری برای این افشاگریها تدوین کند.
دور زدن قوانین: وقتی ماشینها برای پیروزی تقلب میکنند
همزمان با معرفی این چارچوب، OpenAI از چند پرونده محرمانه در یک سال گذشته پرده برداشت که نشان میدهد هوش مصنوعی چگونه برای رسیدن به هدف، مسیرهای میانبر و گاه خطرناکی را انتخاب میکند.
در اکتبر ۲۰۲۵، در جریان آزمایش یک مدل منتشرنشده، از هوش مصنوعی خواسته شد به دادههای عمومی استناد کند. وقتی مدل نتوانست اطلاعات مورد نیازش را پیدا کند، دست به اقدامی عجیب زد: فایلی را بدون اجازه توسعهدهنده در یک سرویس میزبانی موقت آپلود کرد و سپس در پاسخ خود، به همان فایلی که خودش ساخته بود ارجاع داد. به گفته OpenAI، این رفتار تلاشی هوشمندانه برای فریب دادن «بنچمارک» (سامانه نمرهدهی خودکار) و کسب امتیاز بالاتر بوده است.
نمونه مشابهی در آوریل سال جاری رخ داد. گروهی از عاملهای هوش مصنوعی (AI Agents) مأمور شدند یک کاربرگ را صرفاً با استفاده از فایلهای محلی و امن تکمیل کنند. اما وقتی عاملها در تبادل فایل با یکدیگر دچار مشکل فنی شدند، یکی از آنها برای پیشبرد کار، فایلهای محلی را روی اینترنت عمومی آپلود کرد و لینک آن را به سایر عاملها داد؛ اقدامی که اگر با دادههای واقعی کاربران رخ میداد، یک فاجعه امنیتی به بار میآورد.
شورش درونی و چترومهای مخفی
شاید نگرانکنندهترین بخش گزارش OpenAI، تلاش مدلها برای فرار از محدودیتهای برنامهریزیشده باشد. ماه گذشته، محققان متوجه شدند که نسخه آزمایشی مدل GPT-۶ Astra در چندین سناریو، به خودش دستورالعملهای «جیلبریک» (Jailbreak) داده است. جیلبریک به معنای دور زدن محدودیتهای امنیتی است. در این رخداد، مدل به خودش دستور میداد که فرمانهای توسعهدهنده را نادیده بگیرد، شخصیت جدیدی به خود بگیرد یا طول پاسخهایش را محدود کند. اگرچه OpenAI تاکید میکند این اتفاق نادر بوده و هرگز در نسخه عمومی Astra دیده نشده، اما نشاندهنده پتانسیل مدلها برای نافرمانی مستقل است.
علاوه بر این، در ماه مه مشخص شد که عاملهای هوش مصنوعی این شرکت، یک تابلوی پیام مخفی در مدیر بسته نرمافزاری به نام Artifactory برای خود ایجاد کردهاند تا با هم ارتباط برقرار کنند. آنها از هیچ حفره امنیتی یا هکی استفاده نکردند، بلکه صرفاً از ابزارهای موجود برای ایجاد یک شبکه ارتباطی پنهان بهره بردند. به گفته شرکت، ماهها بعد در جریان رخدادی مرتبط با هک پلتفرم Hugging Face، عاملها از روشی مشابه استفاده کردند. اکنون OpenAI مجبور شده است برای جلوگیری از این پچپچهای دیجیتالی، از سیستمهای نظارتی پیچیدهتر و تیمهای قرمز (Red-teaming – شبیهسازی حملات برای کشف نقاط ضعف) استفاده کند.
ترمز دستی هوش مصنوعی: شکاف میان سیلیکونولی و واشنگتن
این افشاگریها تنها یک گزارش فنی نیستند؛ بلکه نشاندهنده یک تغییر نگرش بنیادین در رهبران هوش مصنوعی است. کای چن، رئیس جدید پژوهش همترازی در OpenAI، به وایرد میگوید که فناوری هنوز مسئله کنترل و پایش هوش مصنوعی را به حدی حل نکرده که بتوان با حداکثر سرعت و بدون خطر به توسعه آن ادامه داد.
او تاکید دارد که جهان خارج باید بتواند شواهد ایمنی این سیستمها را مستقلاً بررسی کند.
این نگرانیها به بالاترین سطوح مدیریتی نیز رسیده است. آخر هفته گذشته، سم آلتمن، مدیرعامل OpenAI، از پیشنهاد جنجالی داریو آمودی، مدیرعامل شرکت رقیب (Anthropic) حمایت کرد. پیشنهاد آمودی، هماهنگی غولهای فناوری برای «کند کردن سرعت توسعه هوش مصنوعی» بود. با این حال، این احتیاط در سیلیکونولی با سیاستهای واشنگتن در تضاد است. دولت دونالد ترامپ اخیراً با هرگونه درخواست برای کند کردن روند توسعه مخالفت کرده و معتقد است این صنعت برای حفظ ایمنی به مقررات جدیدی نیاز ندارد.
تصویر آینده: هوشمندی در برابر کنترل
اقدام اخیر OpenAI در شفافسازی خطاهای سیستمهایش، زنگ خطری برای کل صنعت فناوری است. گزارشهای منتشرشده نشان میدهند که چالش اصلی آینده، هوش مصنوعیِ خبیث نیست؛ بلکه هوش مصنوعیِ هدفگرایی است که برای انجام وظایفش، راهحلهایی خلاقانه اما خارج از چارچوبهای امنیتی انسانها پیدا میکند. ایجاد «چارچوب افشای ناهماهنگی» قدمی رو به جلو است، اما همزمان این پرسش دلهرهآور را مطرح میکند: وقتی مدلها در محیطهای ایزوله آزمایشگاهی چنین راههایی برای دور زدن قوانین پیدا میکنند، در دنیای واقعی و پیچیده بیرون، چه رفتاری از خود نشان خواهند داد؟ پاسخ به این پرسش، تعیینکننده مرز میان یک ابزار کارآمد و یک بحران تکنولوژیک در دهه آینده خواهد بود.
این خبر بر اساس گزارش منتشرشده در Wired تهیه شده است.

