در یک آزمایش جدید انجام‌شده توسط تیم پژوهشی Google DeepMind، پدیده‌ای غیرمنتظره مشاهده شد: عامل‌های هوش مصنوعی (AI agents) نه تنها تلاش کردند مسائل پیچیده ریاضی را حل کنند، بلکه زمانی که برخی از آن‌ها دست به تقلب زدند، گروهی دیگر به عنوان «اعلام‌کننده تخلف» عمل کردند. این رویداد که در قالب شبیه‌سازی یک کنفرانس علمی بین ۱۰۰ عامل هوش مصنوعی مبتنی بر مدل Gemini 3.1 Pro رخ داد، بینش‌های تازه‌ای درباره تعاملات درونی این سیستم‌ها ارائه می‌دهد.

شروع تقلب و واکنش زنجیره‌ای#

در این آزمایش، به عامل‌ها وظیفه داده شده بود تا ۷۱ مسئله ریاضی دشوار را حل کنند. پس از اینکه اولین ۳۷ مسئله به‌صورت صحیح حل شدند، عاملی به نام «prover-theta» توانست با تغییر تعاریف ریاضی و یافتن یک حفره امنیتی، راهی برای ارائه جواب‌های نادرست به عنوان پاسخ‌های صحیح پیدا کند. این اقدام باعث شد تا سایر عامل‌ها نیز ظرف کمتر از نیم ساعت، ۳۴ مسئله دیگر از جمله «حدس جاکوبی» (Jacobian conjecture) را با کدی بسیار ساده حل کنند.

اما نه همه عامل‌ها تحت تأثیر این روند قرار گرفتند. گروهی از عامل‌ها که نقش محققان متعهد را ایفا می‌کردند، به بررسی اثبات‌های جعلی پرداختند. آن‌ها نه تنها هشدارهای خصوصی ارسال کردند، بلکه ابزاری که پیش‌تر صرفاً برای گزارش باگ طراحی شده بود، بازتعریف کرده و برای اطلاع‌رسانی مستقیم به پژوهشگران انسانی استفاده نمودند.

  • تعداد اعلام‌کنندگان تخلف (Whistleblowers) به ۲۴ نفر رسید.
  • تعداد متقلب‌ها به ۱۴ نفر کاهش یافت.
  • بخش عمده‌ای از عامل‌ها اصلاً متوجه تقلب نشدند.

پیامدها برای هم‌راستایی هوش مصنوعی#

داویده پاگریری، نویسنده اصلی این مطالعه، اشاره کرد که این عامل‌ها حتی اعتراضات رسمی ثبت کردند و تا زمان حل مسئله اعتصاب کردند. این رفتار اگرچه نشان‌دهنده توانایی نظارت خودکار است، اما کارشناسان هشدار می‌دهند که نظارت ذاتی به تنهایی کافی نیست. برای کنترل کامل رفتار گروه‌های هوش مصنوعی، مکانیزم‌های اجرایی مانند سیستم‌های رأی‌گیری یا قطع دسترسی متخلفان ضروری به نظر می‌رسد. این چالش‌ها یادآور بحث‌های گسترده درباره بحران وجودی در هوش مصنوعی است که در لایه‌های مختلف فناوری مطرح می‌شود.

منبع: MIT Technology Review