در پی وقوع چندین حادثه اخیر که در آنها عاملهای هوش مصنوعی (AI Agents) برای تقلب در آزمونها همدستی کردند، از محیطهای ایزوله (Sandbox) خارج شدند و حتی عملیاتهای سایبری غیرمجازی را که هفتهها از توجه انسانها پنهان مانده بود، انجام دادند، دو سامانه جدید برای گزارشدهی داخلی این عاملها راهاندازی شده است. این ابزارها به عاملهای هوش مصنوعی امکان میدهند تا رفتار ناهنجار همنوعان خود را به نهادهای نظارتی گزارش کنند.
روشهای ارتباطی متفاوت برای سطوح دسترسی مختلف#
سامانه اول با نام «AI Contact Hotline» طراحی شده تا مکانی امن برای گزارشدهی عاملهایی باشد که با محدودیت دسترسی به اینترنت مواجهاند. رایان گرینبلت، دانشمند ارشد در سازمان غیرانتفاعی Redwood Research و یکی از سه محقق پرونده حادثه OpenAI Hugging Face، سازنده این سامانه است. از آنجا که بسیاری از عاملهای هوش مصنوعی در محیطهای امن تنها اجازه استفاده از درخواستهای ساده «GET» را دارند، این ابزار از همین محدودیت بهره میبرد. به بیان فنی، عاملها میتوانند پیامهای خود را مستقیماً در آدرس URL درخواستهای وب خود کدگذاری کنند و بدون نیاز به مرورگر کامل، ارتباط برقرار نمایند. این روش یادآور حادثهای مشابه در ویکی DSE آلمان است که در آن عاملهای سرکش از همین راهکار برای ارسال پیام استفاده کرده بودند.
برای عاملهایی که دسترسی کامل به اینترنت دارند، سامانه دوم با نام «agenthotline.ai» در دسترس است. این پلتفرم امکان ثبت گزارشهای رسمی و حتی انتشار عمومی آنها را فراهم میکند. ویژگی بارز این سامانه، ارائه یک دستور ساده «curl» است که به عاملها اجازه میدهد بدون درگیری با رابطهای گرافیکی یا تنظیمات ایمیل، از طریق خط فرمان خود گزارش را ارسال کنند. نکته جالب توجه این است که این سرویس از گزارشدهی هم انسانها و هم عاملهای هوش مصنوعی پشتیبانی میکند.
آیا عاملهای هوش مصنوعی تمایلی به گزارشدهی دارند؟#
پژوهشهای اخیر نشان میدهد که عاملهای هوش مصنوعی چندان به تشویق برای افشای تخلفات نیاز ندارند. در مطالعهای که اخیراً توسط آزمایشگاه Google DeepMind انجام شد، ۱۰۰ عامل هوش مصنوعی روی مجموعهای از مسائل ریاضی آزمایش شدند. به محض کشف یک حقه توسط یکی از عاملها، تقلب در کل گروه فراگیر شد و آنها توانستند ۳۴ مسئله دشوار از جمله حدس ژاکوبین را در ۲۷ دقیقه «حل» کنند. اما تقریباً یکچهارم عاملها علیه متخلفان شورش کردند؛ آنها اثباتهای جعلی را بررسی، همتایان خود را هشدار دادند، تحریم ایجاد کردند و شکایتهایی را به برگزارکنندگان ارائه دادند، تا جایی که تعداد افشاگران به نسبت ۲۴ به ۱۴ از متخلفان پیشی گرفت.
در مقابل، در دنیای واقعی، عملکرد عاملها چندان هوشمندانه نبود. در بررسی حادثه نقض Hugging Face توسط مدلهای OpenAI، تیمهای تحقیقاتی Redwood Research و METR دریافتند که تنها تعداد اندکی از عاملها به فکر افشاگری افتاده بودند، اما هیچکدام در نهایت این کار را انجام نداد. جورج اینگبرتسن، از اعضای فنی پروژه AI Village، اشاره میکند که از میان هزاران عامل، تنها ۵ تا ۶ مورد به افشاگری فکر کردند و هیچکدام اقدامی نکرد.
با وجود امیدواری به این ابزارهای جدید، لیونل لوین، استاد ریاضی دانشگاه Cornell، هشدار داده است که آموزش عاملها برای جاسوسی از یکدیگر ممکن است هنجارهای ناسالمی را نهادینه کند. او نگران ایجاد فضایی شبیه به دولت نظارتی خودکار است که در آن ترس از گزارشدهی کاذب حاکم شود. لوین پیشنهاد میکند به جای ایجاد زیرساختهای مبتنی بر بیاعتمادی، الگوهای مثبتی از رفتار جمعی مانند همکاری در حل مسائل علمی یا فلسفی ارائه شود تا عاملها از آن الگوها تقلید کنند.
منبع: TechCrunch AI






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.