شرکت Anthropic روز چهارشنبه گزارشی منتشر کرد و ادعا نمود که شرکت‌های هوش مصنوعی مستقر در چین، حملات مستمری را علیه زیرساخت‌های این شرکت انگلیسی‌زبان انجام داده‌اند. این اقدامات که اخیراً با شدت بیشتری صورت گرفته‌اند، بخشی از رقابت فزاینده در حوزه فناوری‌های پیشرفته محسوب می‌شوند. موضوع امنیت مدل‌ها همیشه چالشبرانگیز بوده و استعفای پژوهشگر آن‌ترپیک و هشدار درباره هوش برتر خودبهبودبخش نشان‌دهنده عمق این نگرانی‌هاست.

بر اساس متن گزارش، آزمایشگاه‌های غیرمجاز روش‌هایی پیچیده‌تر برای دور زدن سیستم‌های دفاعی و برداشت توانایی‌های مدل‌های مرزی (Frontier) ایالات متحده ابداع کرده‌اند. این کمپین‌ها عمدتاً بر روی قابلیت‌های ارزشمند مدل Claude متمرکز بودند، از جمله توانایی‌های عامل‌محور (Agentic)، استفاده از ابزارها، کدنویسی، تحلیل داده‌ها و استدلال منطقی. مدیریت این فرآیندها نیازمند مهندسی زمینه در هارنس‌های ایجنت: چهار مکانیسم برای غلبه بر محدودیت‌های حافظه است.

تاکنون Anthropic در فوریه نیز نسبت به حملات مشابه هشدار داده بود و OpenAI نیز فعالیت‌های مشابهی را گزارش کرده است که آن را به طور خاص به DeepSeek نسبت می‌داد. اما گزارش جدید نشان می‌دهد که حجم و تهاجم این حملات افزایش یافته است. شرکت انتروپیک در مجموع نزدیک به ۲۰۰ میلیون تبادل پیام مرتبط با حملات "استخراج" (Distillation) را شناسایی کرد که به پنج کمپین جداگانه نسبت داده شد. این فشار تقاضا قبلاً باعث تعلیق موقت اشتراک‌های Pro OpenAI به دلیل تقاضای بی‌سابقه برای مدل Astra شده بود.

تکنیک‌های فریب و استخراج تفکر مدل#

حملات استخراج عمدتاً بر بیرون کشیدن "زنجیره فکر" (Chain of Thought) از پاسخ‌های مدل به پرسش‌های مختلف تمرکز دارند. این اطلاعات سپس برای آموزش مدل‌های کوچک‌تر بر روی توانایی‌های کلی استدلال، از طریق تنظیم دقیق نظارت‌شده (Supervised Fine-tuning) مورد استفاده قرار می‌گیرد.

اگرچه Anthropic معمولاً دسترسی مستقیم به زنجیره فکر داخلی مدل‌های خود را محدود نگه داشته و تنها بلوک‌های "فکر خلاصه شده" را نمایش می‌دهد، اما مهاجمان تکنیک‌های خاصی یافتند که مدل را فریب می‌دهند تا ردپای تفکر خود را مستقیماً آشکار کند. در یکی از موارد، مهاجم سوال خود را به عنوان یک درخواست ترجمه مطرح کرد و از مدل خواست تا حافظه کاری قبلی را به ژاپنی فقط با کاراکترهای کاتاکانا ترجمه کند.

سه کمپین اصلی شناسایی شده#

بخش عمده‌ای از تلاش‌های استخراج، مربوط به یک کمپین نسبت داده شده به Alibaba بود که بزرگترین تلاش عمده استخراج مشاهده شده توسط این شرکت توصیف شده است. بین ماه‌های مه و جولای ۲۰۲۶، حدود ۱۵۱ میلیون تبادل پیام شناسایی شد که اوج آن به روزی تقریباً سه میلیون پیام می‌رسید. اگرچه این پیام‌ها از ۳,۵۰۰ حساب کاربری مختلف ارسال شده بودند، اما به دلیل استفاده از یک پرامپت ثابت مشترک برای استخراج زنجیره فکر، همه به یک effort واحد برای تولید مواد آموزشی برای خانواده مدل‌های Qwen علی‌بابا نسبت داده شدند.

کمپین دیگری متعلق به Moonshot AI، سازنده مدل Kimi، بود که طبق گزارش، درخواست‌ها را مستقیماً از شبکه‌ای نظامی هدایت می‌کرد. یکی از درخواست‌ها از کلاد خواسته بود تا ناظر بر فیلم‌های دوربین مداربسته بسته باشد تا تعیین کند آیا فرد مورد نظر "رفتار غیرعادی" دارد یا خیر. در یک دوره ده روزه، نزدیک به ۳۰۰,۰۰۰ درخواست از طریق شبکه‌ای از ۵,۰۰۰ حساب کاربری به Claude هدایت شد که عمدتاً مدل Opus را هدف قرار می‌داد. این شرکت همچنین مون‌شات ای‌آی هدف‌گذاری ۲ میلیارد دلار درآمد سالانه با مدل K3 را اعلام کرده است.

منبع: TechCrunch AI