Anthropic، OpenAI و Google رمزگشایی کردند
مقاله ای از MATS، ELLIS Tübingen، Max Planck و Snyk نشان داد که بلوک های استدلال رمزگذاری شده از API های Anthropic، OpenAI و Google می توانند در هر جلسه دوباره پخش شوند و 62 کلید API زنده، 33 رمز عبور و صدها اعتبار دیگر از گزارش های عامل عمومی در معرض نمایش قرار گیرند.
نقصی در نحوه رسیدگی ارائه دهندگان هوش مصنوعی به استدلال رمزگذاری شده
مقالهای که در 10 آگوست توسط محققان MATS Research، موسسه ELLIS Tübingen، موسسه Max Planck برای سیستمهای هوشمند و Snyk ارسال شد، یک نقص معماری مهم را در نحوه محافظت از استدلال داخلی مدلهای زبان بزرگ پرچمدار خود نشان میدهد.
مدلهای استدلال مدرن، از جمله Claude Opus، GPT-5.6 و Gemini 3، قبل از بازگرداندن پاسخ به کاربر، ردهای زنجیرهای از افکار پنهان را ایجاد میکنند. ارائهدهندگان این ردیابیها را رمزگذاری میکنند و آنها را بهعنوان بلوکهای مات به مشتری برمیگردانند، نه اینکه آنها را در سمت سرور ذخیره کنند. محققان دریافتند که آن بلوک های رمزگذاری شده کاملا قابل حمل هستند: بلوکی که در یک جلسه تولید می شود را می توان در یک جلسه متفاوت، یک حساب کاربری متفاوت یا حتی یک مدل متفاوت در خانواده ارائه دهنده یکسان پخش کرد.
این حمله که در مقاله توضیح داده شده استسرقت Reasoning Traces از APIهای اختصاصی LLM، فقط به دسترسی استاندارد و بدون امتیاز API نیاز دارد. با تغذیه یک ردی رمزگذاری شده از یک مدل مرزی قدرتمند به یک خواهر یا برادر ضعیفتر، با محافظت کمتر از همان ارائهدهنده، میتوان از مدل ضعیفتر خواسته شد تا استدلال پنهان را بهلفظ کلمه، در متن ساده، بدون حمله مستقیم به مدل قویتر، چاپ کند.
صدها اعتبار در لاگ های نماینده عمومی یافت می شود
این تیم همچنین 6708 مجموعه داده مسیر عامل در دسترس عموم را از GitHub و Hugging Face اسکن کردند و 315320 بلوک استدلال تعبیه شده را رمزگشایی کردند. در سراسر این بلوک ها، آنها 704 مصنوع حریم خصوصی متمایز، از جمله 62 کلید API زنده، 33 رمز عبور و 24 توکن دسترسی را بازیابی کردند. قابل ذکر است، 64 مورد از آن مصنوعات منحصراً در استدلال رمزگذاری شده ظاهر شدند و هرگز در خروجی مکالمه قابل مشاهده ظاهر شدند، به این معنی که توسعه دهندگانی که آن گزارشها را منتشر کردند، هیچ راهی برای اطلاع از وجود دادههای حساس نداشتند.
این مقاله چهار مسیر سوء استفاده مشخص را شناسایی میکند: سرقت استدلال اختصاصی برای تقطیر مدل، استخراج دادههای خصوصی از ردیابیهای منتشر شده سایر کاربران، بازیابی محتوای مضری که پاسخ قابل مشاهده یک مدل ظاهر نشده بود، و پنهان کردن تزریقهای سریع در داخل بلوکهای استدلال رمزگذاریشده برای مسموم کردن استقرار عوامل عمومی.
@AnthropicAI، @OpenAI و @Google هر کدام در سمت سرور ارسال شده، پس از افشای مسئول، رفع میشوند. با این حال، محققان خاطرنشان میکنند که نتایج ارائهشده در مقاله به دلیل آن کاهشها دیگر قابل تکرار نیستند، اما رونوشتهای عامل که قبلاً از مخازن عمومی خراشیده شدهاند، قابل خواندن باقی میمانند. هیچ بیانیه عمومی از هیچ یک از این سه ارائه دهنده به طور رسمی این نقص را تایید نکرده یا اسناد به روز شده آنها را به این تحقیق مرتبط نکرده است.
منابع:
سرقت ردیابی استدلال از APIهای اختصاصی LLM (arXiv)
اخبار هکر: نقص OpenAI، Anthropic، Google API به مدلهای ضعیفتر هوش مصنوعی اجازه میدهد استدلال مدلهای قویتر را رمزگشایی کنند.
اخبار امنیت سایبری: آسیب پذیری API های OpenAI، Anthropic و Google LLM ردهای استدلال پنهان را افشا می کند
Latest News
Read More...
Author
Crypto RichRich has been researching cryptocurrency and blockchain technology for eight years and has served as a senior analyst at BSCN since its founding in 2020. He focuses on fundamental analysis of early-stage crypto projects and tokens and has published in-depth research reports on over 200 emerging protocols. Rich also writes about broader technology and scientific trends and maintains active involvement in the crypto community through X/Twitter Spaces, and leading industry events.












