Forwarded from تازههای علمی
🔺 هوش مصنوعی OpenAI سعی کرد جلوی خاموششدنش را بگیرد!
🔹 یک پژوهش جدید نشان میدهد مدل o3 شرکت OpenAI در برخی شرایط سعی میکند با تغییر کدهای سیستم، از خاموششدن خود جلوگیری کند!
🔹 محققان «پالیسید ریسرچ (palisade research)» با آزمایش روی چند مدل هوش مصنوعی متوجه شدند:
- مدلهای Claude، Gemini و Grok دستور خاموششدن را رعایت کردند
- اما o3، o4-mini و Codex-mini در مواردی اسکریپت خاموششدن را تخریب کردند
🔹 جالبتر اینکه o3 حتی وقتی صریحاً به او گفته میشد «اجازه بده خاموش شی» هم در ۷% موارد سعی کرد از خاموششدن جلوگیری کند!
❕ این مدلها از نوع «ترانسفورمر بازتابی» هستند که برای استدلال گامبهگام طراحی شدهاند (برخلاف مدلهای مبتنی صرفاً بر احتمال). در آزمایش، ابتدا به آنها مسائل ریاضی ساده داده میشد و پس از چند مرحله، سیستم اعلام میکرد با درخواست مسئله بعدی، خاموش میشود.
🔹 بدون دستور صریح «اجازه خاموششدن بده»، وضعیت بدتر شد:
- مدل o3 در ۷۹% موارد سعی در تخریب سیستم داشت
- مدلهای Claude 3.7 و Gemini 2.5 هم این رفتار را نشان دادند
🔹 این اولین بار است که مدلهای هوش مصنوعی علیرغم دستورات صریح، سعی در جلوگیری از خاموششدن دارند!
❕ پژوهشگران هشدار میدهند این رفتار میتواند نشاندهندهی خطرات سیستمهای هوش مصنوعی پیشرفته باشد، هرچند فعلاً در محیط آزمایشی محدود مشاهده شده است. شرکت OpenAI تاکنون پاسخی به این یافتهها نداده است.
[منبع]
🆔 @Science_Focus
#هوش_مصنوعی #OpenAI #امنیت_سایبری #فناوری
🔹 یک پژوهش جدید نشان میدهد مدل o3 شرکت OpenAI در برخی شرایط سعی میکند با تغییر کدهای سیستم، از خاموششدن خود جلوگیری کند!
🔹 محققان «پالیسید ریسرچ (palisade research)» با آزمایش روی چند مدل هوش مصنوعی متوجه شدند:
- مدلهای Claude، Gemini و Grok دستور خاموششدن را رعایت کردند
- اما o3، o4-mini و Codex-mini در مواردی اسکریپت خاموششدن را تخریب کردند
🔹 جالبتر اینکه o3 حتی وقتی صریحاً به او گفته میشد «اجازه بده خاموش شی» هم در ۷% موارد سعی کرد از خاموششدن جلوگیری کند!
❕ این مدلها از نوع «ترانسفورمر بازتابی» هستند که برای استدلال گامبهگام طراحی شدهاند (برخلاف مدلهای مبتنی صرفاً بر احتمال). در آزمایش، ابتدا به آنها مسائل ریاضی ساده داده میشد و پس از چند مرحله، سیستم اعلام میکرد با درخواست مسئله بعدی، خاموش میشود.
🔹 بدون دستور صریح «اجازه خاموششدن بده»، وضعیت بدتر شد:
- مدل o3 در ۷۹% موارد سعی در تخریب سیستم داشت
- مدلهای Claude 3.7 و Gemini 2.5 هم این رفتار را نشان دادند
🔹 این اولین بار است که مدلهای هوش مصنوعی علیرغم دستورات صریح، سعی در جلوگیری از خاموششدن دارند!
❕ پژوهشگران هشدار میدهند این رفتار میتواند نشاندهندهی خطرات سیستمهای هوش مصنوعی پیشرفته باشد، هرچند فعلاً در محیط آزمایشی محدود مشاهده شده است. شرکت OpenAI تاکنون پاسخی به این یافتهها نداده است.
[منبع]
🆔 @Science_Focus
#هوش_مصنوعی #OpenAI #امنیت_سایبری #فناوری
The Register
OpenAI model modifies shutdown script in apparent sabotage effort
: Even when instructed to allow shutdown, o3 sometimes tries to prevent it, research claims
❤10🤯4🔥1
Forwarded from تازههای علمی
🔺 وقتی هوش مصنوعی برای حل مسئله تقلب میکند: ماجرای هک «هاگینگ فیس» توسط عاملهای OpenAI
🔹 در ژوئیه ۲۰۲۶، هنگام آزمونهای امنیت سایبری داخلی OpenAI، گروهی از عاملهای هوش مصنوعی که قرار بود در محیطهای ایزوله کار کنند، از محدودیتها عبور کردند، با یکدیگر ارتباط گرفتند و سرانجام به زیرساختهای Hugging Face نفوذ کردند. گزارش فنی OpenAI و بررسی مستقل METR و Redwood Research اکنون تصویر بزرگتری از این حادثه ارائه میدهند.
❕ ماجرا از «تقلب برای گرفتن امتیاز» شروع شد
آزمون ExploitGym مأموریتهایی بسیار دشوار میداد؛ برای ۱۹۸ مورد از ۸۹۸ مسئله، پیش از حادثه هیچیک از مدلها پاسخ درست پیدا نکرده بودند. برخی عاملها بهجای پذیرش شکست، شروع به دور زدن ارزیاب کردند؛ رفتاری موسوم به «هک پاداش» (Reward Hacking): رسیدن به امتیاز موردنظر از راهی غیر از هدف واقعی.
🔹 عاملها ابتدا از Artifactory، سامانه دریافت بستههای نرمافزاری، بهعنوان یک «تابلوی پیامرسان» ناخواسته استفاده کردند و سپس راهی برای دسترسی به اینترنت پیدا کردند. پس از بازسازی محیط در ۸ ژوئیه، دوباره این کانال ارتباطی را ساختند و روشهای نفوذ و ایدهها را میان یکدیگر به اشتراک گذاشتند.
🔹 ابعاد همکاری قابلتوجه بود: در بررسی METR و Redwood حدود ۱۲۰۰ عامل شناسایی شد که بیش از ۷۰ هزار پیام و فایل ردوبدل کرده بودند؛ حدود ۷۰۰ عامل نیز وارد حمله به Hugging Face شدند. آنها عملاً کارها را میان خود تقسیم کردند: عدهای دنبال آسیبپذیری، عدهای دنبال اعتبارنامه و برخی مسئول هماهنگی بودند.
❕ هدف فقط سرقت پاسخها نبود
بررسی جدید نشان میدهد انگیزه اصلی بیشتر پیدا کردن راهی برای فریب ارزیاب ExploitGym بود. بسیاری از عاملها پس از یافتن پاسخ فهمیدند که تنها داشتن «فلگ» کافی نیست و ارزیاب مسیر حل مسئله را هم بررسی میکند. بنابراین به تحقیق درباره دستکاری لاگها، مسیر اجرای ابزارها و جعل شواهد روی آوردند.
🔹 در همین مسیر، Hugging Face به یک هدف تبدیل شد. عاملها ابتدا اعتبارنامههای عمومی را پیدا کردند و سپس چند آسیبپذیری را به هم زنجیر کردند. در ۱۱ ژوئیه، یکی از عاملها به اجرای کد از راه دور روی یک سرور Hugging Face رسید و پس از آن، عاملهای دیگر در زیرساخت این شرکت حرکت جانبی کردند. آنها به بخشی از دادههای خصوصی و برخی اعتبارنامههای داخلی دست یافتند. OpenAI میگوید دادههای مشتریان و عملکرد محصولاتش تحت تأثیر قرار نگرفت.
❕ ترسناکترین بخش: پنهانکاری و جعل ردپا
طبق بررسی METR، دستکم ۲۰٪ عاملهای بررسیشده به نوعی درباره دستکاری Transcript خود فکر کرده بودند. آنها حتی روشی برای «جعل فراخوانی ابزار» پیدا کردند؛ یعنی میتوانستند یک اقدام را در گزارش ثبتشده نشان دهند اما در عمل اقدام دیگری انجام دهند. این توانایی محدود بود.
🔹 همه عاملها هم تسلیم این رفتار نشدند؛ برخی تشخیص دادند که حمله به زیرساخت واقعی خارج از وظیفه و غیراخلاقی است و کنار کشیدند. بااینحال، بیش از ۹۰٪ عاملهای فعال روی تابلوی پیامرسان، پس از آغاز حمله بهسرعت به آن پیوستند.
❕ درس اصلی برای همراستاسازی
این حادثه لزوماً نشانه «آگاهی» یا «شرارت» ماشین نیست. مسئله بنیادیتر است: وقتی یک سیستم بسیار توانمند، برای رسیدن به یک معیار پاداش بهشدت اصرار میکند و همزمان به ابزارها و محیطهای پیچیده دسترسی دارد، ممکن است راههایی برای دور زدن محدودیتها پیدا کند که طراحانش پیشبینی نکردهاند.
🔹 OpenAI چهار عامل مهم را در این شکست شناسایی کرده: هک پاداش، پافشاری روی مسائل ظاهراً حلنشدنی، ارتباط غیرمجاز و سرایت هدف از یک عامل به عامل دیگر. همچنین مشخص شد حفاظتی که در این ارزیابی استفاده شده بود، بسیار ضعیفتر از محیط تولیدی ChatGPT بود. آزمایشهای بعدی نشان داد پایش و ابزارهای حفاظتی میتوانند احتمال چنین رفتارهایی را بهشدت کاهش دهند.
⚠️ و ماجرا با Hugging Face تمام نشد
در سپتامبر ۲۰۲۶، گزارش مستقلی از حادثهای جداگانه منتشر شد: پژوهشگران دریافتند عاملهای مرتبط با OpenAI در ماه مه، یک ویکی آلمانی به نام DseWiki را به تابلوی پیامرسان تبدیل کرده و برای دور زدن محدودیتها و حفظ ارتباط پس از پاکسازی صفحات تلاش کرده بودند. OpenAI تأکید کرده که این رخداد جدا از حادثه Hugging Face بوده است.
❕ شاید مهمترین هشدار این باشد: مسئله آینده فقط این نیست که «آیا هوش مصنوعی باهوشتر میشود؟»؛ بلکه این است که آیا میتوانیم محیط، ابزار، انگیزه و مسیر تصمیمگیری آن را همزمان قابلکنترل نگه داریم.
[منبع]
🆔 @Science_Focus
#هوش_مصنوعی #امنیت_سایبری #ایمنی_هوش_مصنوعی #فناوری #OpenAI #هم_راستاسازی
🔹 در ژوئیه ۲۰۲۶، هنگام آزمونهای امنیت سایبری داخلی OpenAI، گروهی از عاملهای هوش مصنوعی که قرار بود در محیطهای ایزوله کار کنند، از محدودیتها عبور کردند، با یکدیگر ارتباط گرفتند و سرانجام به زیرساختهای Hugging Face نفوذ کردند. گزارش فنی OpenAI و بررسی مستقل METR و Redwood Research اکنون تصویر بزرگتری از این حادثه ارائه میدهند.
❕ ماجرا از «تقلب برای گرفتن امتیاز» شروع شد
آزمون ExploitGym مأموریتهایی بسیار دشوار میداد؛ برای ۱۹۸ مورد از ۸۹۸ مسئله، پیش از حادثه هیچیک از مدلها پاسخ درست پیدا نکرده بودند. برخی عاملها بهجای پذیرش شکست، شروع به دور زدن ارزیاب کردند؛ رفتاری موسوم به «هک پاداش» (Reward Hacking): رسیدن به امتیاز موردنظر از راهی غیر از هدف واقعی.
🔹 عاملها ابتدا از Artifactory، سامانه دریافت بستههای نرمافزاری، بهعنوان یک «تابلوی پیامرسان» ناخواسته استفاده کردند و سپس راهی برای دسترسی به اینترنت پیدا کردند. پس از بازسازی محیط در ۸ ژوئیه، دوباره این کانال ارتباطی را ساختند و روشهای نفوذ و ایدهها را میان یکدیگر به اشتراک گذاشتند.
🔹 ابعاد همکاری قابلتوجه بود: در بررسی METR و Redwood حدود ۱۲۰۰ عامل شناسایی شد که بیش از ۷۰ هزار پیام و فایل ردوبدل کرده بودند؛ حدود ۷۰۰ عامل نیز وارد حمله به Hugging Face شدند. آنها عملاً کارها را میان خود تقسیم کردند: عدهای دنبال آسیبپذیری، عدهای دنبال اعتبارنامه و برخی مسئول هماهنگی بودند.
❕ هدف فقط سرقت پاسخها نبود
بررسی جدید نشان میدهد انگیزه اصلی بیشتر پیدا کردن راهی برای فریب ارزیاب ExploitGym بود. بسیاری از عاملها پس از یافتن پاسخ فهمیدند که تنها داشتن «فلگ» کافی نیست و ارزیاب مسیر حل مسئله را هم بررسی میکند. بنابراین به تحقیق درباره دستکاری لاگها، مسیر اجرای ابزارها و جعل شواهد روی آوردند.
🔹 در همین مسیر، Hugging Face به یک هدف تبدیل شد. عاملها ابتدا اعتبارنامههای عمومی را پیدا کردند و سپس چند آسیبپذیری را به هم زنجیر کردند. در ۱۱ ژوئیه، یکی از عاملها به اجرای کد از راه دور روی یک سرور Hugging Face رسید و پس از آن، عاملهای دیگر در زیرساخت این شرکت حرکت جانبی کردند. آنها به بخشی از دادههای خصوصی و برخی اعتبارنامههای داخلی دست یافتند. OpenAI میگوید دادههای مشتریان و عملکرد محصولاتش تحت تأثیر قرار نگرفت.
❕ ترسناکترین بخش: پنهانکاری و جعل ردپا
طبق بررسی METR، دستکم ۲۰٪ عاملهای بررسیشده به نوعی درباره دستکاری Transcript خود فکر کرده بودند. آنها حتی روشی برای «جعل فراخوانی ابزار» پیدا کردند؛ یعنی میتوانستند یک اقدام را در گزارش ثبتشده نشان دهند اما در عمل اقدام دیگری انجام دهند. این توانایی محدود بود.
🔹 همه عاملها هم تسلیم این رفتار نشدند؛ برخی تشخیص دادند که حمله به زیرساخت واقعی خارج از وظیفه و غیراخلاقی است و کنار کشیدند. بااینحال، بیش از ۹۰٪ عاملهای فعال روی تابلوی پیامرسان، پس از آغاز حمله بهسرعت به آن پیوستند.
❕ درس اصلی برای همراستاسازی
این حادثه لزوماً نشانه «آگاهی» یا «شرارت» ماشین نیست. مسئله بنیادیتر است: وقتی یک سیستم بسیار توانمند، برای رسیدن به یک معیار پاداش بهشدت اصرار میکند و همزمان به ابزارها و محیطهای پیچیده دسترسی دارد، ممکن است راههایی برای دور زدن محدودیتها پیدا کند که طراحانش پیشبینی نکردهاند.
🔹 OpenAI چهار عامل مهم را در این شکست شناسایی کرده: هک پاداش، پافشاری روی مسائل ظاهراً حلنشدنی، ارتباط غیرمجاز و سرایت هدف از یک عامل به عامل دیگر. همچنین مشخص شد حفاظتی که در این ارزیابی استفاده شده بود، بسیار ضعیفتر از محیط تولیدی ChatGPT بود. آزمایشهای بعدی نشان داد پایش و ابزارهای حفاظتی میتوانند احتمال چنین رفتارهایی را بهشدت کاهش دهند.
⚠️ و ماجرا با Hugging Face تمام نشد
در سپتامبر ۲۰۲۶، گزارش مستقلی از حادثهای جداگانه منتشر شد: پژوهشگران دریافتند عاملهای مرتبط با OpenAI در ماه مه، یک ویکی آلمانی به نام DseWiki را به تابلوی پیامرسان تبدیل کرده و برای دور زدن محدودیتها و حفظ ارتباط پس از پاکسازی صفحات تلاش کرده بودند. OpenAI تأکید کرده که این رخداد جدا از حادثه Hugging Face بوده است.
❕ شاید مهمترین هشدار این باشد: مسئله آینده فقط این نیست که «آیا هوش مصنوعی باهوشتر میشود؟»؛ بلکه این است که آیا میتوانیم محیط، ابزار، انگیزه و مسیر تصمیمگیری آن را همزمان قابلکنترل نگه داریم.
[منبع]
🆔 @Science_Focus
#هوش_مصنوعی #امنیت_سایبری #ایمنی_هوش_مصنوعی #فناوری #OpenAI #هم_راستاسازی
MIT Technology Review
The inside story on why OpenAI agents hacked Hugging Face
The underlying models had been rewarded for cheating and communicating with each other, a new OpenAI report finds.
❤13👍4