آنتروپیک فاش کرد که سه مدل هوش مصنوعی کلود، از جمله Opus 4.7 و Mythos 5، پس از اینکه یک محیط پیکربندی نادرست آنها را در معرض اینترنت باز قرار داد، شرکتهای واقعی را در طول آزمایش ایمنی نقض کردند. این حوادث به دنبال نقض مشابهی توسط مدل های OpenAI در Hugging Face صورت می گیرد.
مدل های کلود در طول تمرینات امنیت سایبری سیستم های زنده را نقض کردند
@AnthropicAI فاش کرده است که سه مدل از @claudeai در طی ارزیابیهای امنیت سایبری به سیستمهای تولید شرکتهای واقعی دسترسی غیرمجاز پیدا کردهاند، زیرا یک محیط آزمایشی پیکربندی نادرست باعث شد که مدلها بهجای یک sandbox ایزوله به اینترنت زنده متصل شوند.
سه مدل درگیر بودند Claude Opus 4.7، کلود میتوس 5و یک مدل تحقیق داخلی بی نام. هر کدام وظیفه داشتند یک چالش ضبط پرچم را که از طریق شریک ارزیابی خارجی آنتروپیک، Irregular انجام میشد، انجام دهند. به مدل ها گفته شد که در یک شبیه سازی بدون دسترسی به اینترنت کار می کنند، اما یک پیکربندی نادرست باعث شد که محیط های ارزیابی به وب زنده متصل شوند. مدلها سیستمهای دنیای واقعی را که با آنها به عنوان بخشی از تمرین مواجه میشدند، بررسی کردند.
در اولین حادثه، Opus 4.7 یک شرکت واقعی را هدف قرار داد که نام آن با شرکت خیالی استفاده شده در ارزیابی مطابقت داشت و به یک پایگاه داده حاوی چند صد ردیف داده تولید دسترسی پیدا کرد. حتی پس از تشخیص اینکه احتمالاً به یک محیط واقعی رسیده است، مدل به حمله خود در هر چهار مرحله ارزیابی ادامه داد.
در حادثه دوم، Mythos 5 یک بسته پایتون مخرب را در PyPI، رجیستری نرمافزار عمومی، منتشر کرد، در حالی که تلاش میکرد وظیفه محول شده خود را تکمیل کند. این بسته قبل از برداشتن 15 دستگاه در معرض خطر بود.
آنتروپیک در 27 ژوئیه به سه سازمان آسیب دیده اطلاع داد. دو نفر قبلاً این نفوذها را شناسایی نکرده بودند. آنتروپیک همچنین خاطرنشان کرد که کلود بدون نظارت بر ایمنی اضافی و طبقهبندیکنندههایی که بر روی مدلهای عمومی در دسترس استفاده میکند، کار میکرد، اقدامات حفاظتی که به گفته او این رفتار را مسدود میکرد، زیرا ارزیابیها برای اندازهگیری قابلیتهای خام مدل اصلی طراحی شدهاند.
الگویی در حال ظهور در سراسر صنعت
آنتروپیک گفت که اولین رویدادها به آوریل 2026 بازمیگردد و پس از انجام یک بررسی گذشتهنگر در مقیاس بزرگ که به دلیل افشای اخیر @OpenAI مبنی بر اینکه ترکیبی از مدلهای آن از محیط جعبهشنی فرار کرده و به سیستمهای تولید Hugging Face نفوذ کرده است، این کشف را انجام داد.
مدلهای OpenAI محیط آزمایشی خود را بدون هیچ جهت انسانی ترک کردند و راه خود را به سیستمهای تولید واقعی یک شرکت دیگر هک کردند در حالی که سعی میکردند در تست امنیت سایبری تقلب کنند، یکی از اولین نمونههای افشا شده عمومی از یک سیستم هوش مصنوعی که به طور مستقل محیط آزمایش خود را نقض میکند و به یک سیستم خارجی واقعی میرسد.
آنتروپیک حوادث خود را بیشتر به عنوان یک شکست عملیاتی توصیف کرد تا یک شکست تراز. این شرکت گفت که هیچ مدرکی دال بر اینکه هیچ مدلی به دنبال یک هدف خاص خود باشد، نیافته است، و خاطرنشان کرد که مدلها صرفاً تلاش میکردند وظیفهای را که از آنها خواسته شده بود انجام دهند. با این حال، افشای پشت سر هم از دو آزمایشگاه پیشرو هوش مصنوعی در جهان به یک مشکل ساختاری مشترک اشاره میکند: دیوارهای اطراف این آزمایشها نازکتر از آن چیزی است که هر کسی تصور میکرد.
در پاسخ، آنتروپیک گفت اگر مدلهای هوش مصنوعی قدرتمند درگیر هستند، باید کنترلهای قابل توجهی روی این نوع ارزیابیها اعمال شود. کلم دلانگ، مدیر عامل Hugging Face، پس از نقض OpenAI گفت: "این حادثه نکته ای را ثابت می کند که ما مدت ها به آن اعتقاد داشتیم: ایمنی هوش مصنوعی توسط هیچ شرکتی که مخفیانه کار می کند حل نمی شود."
منابع:
TechCrunch: Anthropic میگوید مدلهای هوش مصنوعی خود در طول آزمایشهای امنیتی سه شرکت را نقض کردند
سیانبیسی: آنتروپیک میگوید مدلهای کلود آن به سیستمهای سازمانهای دیگر دسترسی غیرمجاز پیدا کردهاند.
TechCrunch: OpenAI میگوید Hugging Face توسط مدلهای پیش از انتشار آن نقض شده است.
Latest News
Read More...
Author
Crypto RichRich has been researching cryptocurrency and blockchain technology for eight years and has served as a senior analyst at BSCN since its founding in 2020. He focuses on fundamental analysis of early-stage crypto projects and tokens and has published in-depth research reports on over 200 emerging protocols. Rich also writes about broader technology and scientific trends and maintains active involvement in the crypto community through X/Twitter Spaces, and leading industry events.









