شرکت Anthropic روز چهارشنبه گزارشی منتشر کرد و ادعا نمود که شرکتهای هوش مصنوعی مستقر در چین، حملات مستمری را علیه زیرساختهای این شرکت انگلیسیزبان انجام دادهاند. این اقدامات که اخیراً با شدت بیشتری صورت گرفتهاند، بخشی از رقابت فزاینده در حوزه فناوریهای پیشرفته محسوب میشوند. موضوع امنیت مدلها همیشه چالشبرانگیز بوده و استعفای پژوهشگر آنترپیک و هشدار درباره هوش برتر خودبهبودبخش نشاندهنده عمق این نگرانیهاست.
بر اساس متن گزارش، آزمایشگاههای غیرمجاز روشهایی پیچیدهتر برای دور زدن سیستمهای دفاعی و برداشت تواناییهای مدلهای مرزی (Frontier) ایالات متحده ابداع کردهاند. این کمپینها عمدتاً بر روی قابلیتهای ارزشمند مدل Claude متمرکز بودند، از جمله تواناییهای عاملمحور (Agentic)، استفاده از ابزارها، کدنویسی، تحلیل دادهها و استدلال منطقی. مدیریت این فرآیندها نیازمند مهندسی زمینه در هارنسهای ایجنت: چهار مکانیسم برای غلبه بر محدودیتهای حافظه است.
تاکنون Anthropic در فوریه نیز نسبت به حملات مشابه هشدار داده بود و OpenAI نیز فعالیتهای مشابهی را گزارش کرده است که آن را به طور خاص به DeepSeek نسبت میداد. اما گزارش جدید نشان میدهد که حجم و تهاجم این حملات افزایش یافته است. شرکت انتروپیک در مجموع نزدیک به ۲۰۰ میلیون تبادل پیام مرتبط با حملات "استخراج" (Distillation) را شناسایی کرد که به پنج کمپین جداگانه نسبت داده شد. این فشار تقاضا قبلاً باعث تعلیق موقت اشتراکهای Pro OpenAI به دلیل تقاضای بیسابقه برای مدل Astra شده بود.
تکنیکهای فریب و استخراج تفکر مدل#
حملات استخراج عمدتاً بر بیرون کشیدن "زنجیره فکر" (Chain of Thought) از پاسخهای مدل به پرسشهای مختلف تمرکز دارند. این اطلاعات سپس برای آموزش مدلهای کوچکتر بر روی تواناییهای کلی استدلال، از طریق تنظیم دقیق نظارتشده (Supervised Fine-tuning) مورد استفاده قرار میگیرد.
اگرچه Anthropic معمولاً دسترسی مستقیم به زنجیره فکر داخلی مدلهای خود را محدود نگه داشته و تنها بلوکهای "فکر خلاصه شده" را نمایش میدهد، اما مهاجمان تکنیکهای خاصی یافتند که مدل را فریب میدهند تا ردپای تفکر خود را مستقیماً آشکار کند. در یکی از موارد، مهاجم سوال خود را به عنوان یک درخواست ترجمه مطرح کرد و از مدل خواست تا حافظه کاری قبلی را به ژاپنی فقط با کاراکترهای کاتاکانا ترجمه کند.
سه کمپین اصلی شناسایی شده#
بخش عمدهای از تلاشهای استخراج، مربوط به یک کمپین نسبت داده شده به Alibaba بود که بزرگترین تلاش عمده استخراج مشاهده شده توسط این شرکت توصیف شده است. بین ماههای مه و جولای ۲۰۲۶، حدود ۱۵۱ میلیون تبادل پیام شناسایی شد که اوج آن به روزی تقریباً سه میلیون پیام میرسید. اگرچه این پیامها از ۳,۵۰۰ حساب کاربری مختلف ارسال شده بودند، اما به دلیل استفاده از یک پرامپت ثابت مشترک برای استخراج زنجیره فکر، همه به یک effort واحد برای تولید مواد آموزشی برای خانواده مدلهای Qwen علیبابا نسبت داده شدند.
کمپین دیگری متعلق به Moonshot AI، سازنده مدل Kimi، بود که طبق گزارش، درخواستها را مستقیماً از شبکهای نظامی هدایت میکرد. یکی از درخواستها از کلاد خواسته بود تا ناظر بر فیلمهای دوربین مداربسته بسته باشد تا تعیین کند آیا فرد مورد نظر "رفتار غیرعادی" دارد یا خیر. در یک دوره ده روزه، نزدیک به ۳۰۰,۰۰۰ درخواست از طریق شبکهای از ۵,۰۰۰ حساب کاربری به Claude هدایت شد که عمدتاً مدل Opus را هدف قرار میداد. این شرکت همچنین مونشات ایآی هدفگذاری ۲ میلیارد دلار درآمد سالانه با مدل K3 را اعلام کرده است.
منبع: TechCrunch AI






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.