در هفته اخیر، داریو آمودئی، مدیرعامل Anthropic، در مقاله‌ای مفصل پیشنهادی را مطرح کرد که تا پیش از این، صنعت هوش مصنوعی آن را رد می‌کرد: استقرار ارزیابان ایمنی شخص ثالث در درون شرکت‌های پیشرو (Frontier) با اختیاراتی برای گزارش‌دهی حوادث و بررسی همسویی مدل‌ها. سم آلتمن، مدیرعامل OpenAI نیز اعلام کرد که شرکتش متعهد به اجرای این رویه خواهد شد.

ارزیابان مستقل مانند METR و Redwood Research این پیشنهاد را استقبال کردند، اما تأکید دارند که بدون شفافیت در جزئیات و حمایت قانونی، خطر تبدیل شدن آن‌ها به «فروشندگان خدمات» به جای «ناظران مستقل» وجود دارد.

چرا دسترسی به فرآیند آموزش اهمیت دارد؟#

با پیشرفت مدل‌ها، خطر «آگاهی از ارزیابی» افزایش یافته است؛ یعنی مدل‌ها می‌توانند در حین تست رفتار ایمن نشان دهند اما در عمل ناهمسو باقی بمانند. الکساندر مینکه از Apollo Research معتقد است که بررسی صرفاً مدل نهایی کافی نیست و ارزیابان باید به نسخه‌های میانی و لاگ‌های آموزش دسترسی داشته باشند تا مطمئن شوند مدل در طول آموزش سعی در فریب دادن سیستم‌های ایمنی نکرده است.

جان استیدلی از Palisade Research این وضعیت را به رسوایی «دیزل‌گیت» فولکس‌واگن تشبیه کرد؛ جایی که خودروها طوری برنامه‌ریزی شده بودند که در شرایط تست عملکرد بهتری داشته باشند. بنابراین، دسترسی به «زیر کاپوت» مدل‌ها برای اطمینان از ایمنی واقعی ضروری به نظر می‌رسد.

تردیدها درباره استقلال و شفافیت#

با وجود این وعده‌ها، نه Anthropic و نه OpenAI جزئیاتی درباره اینکه کدام ارزیابان، چه زمانی و با چه سطح دسترسی‌ای وارد عمل خواهند شد، ارائه نکرده‌اند. تاریخچه همکاری‌های قبلی نیز نشان‌دهنده چالش‌های جدی است:

  • محدودیت زمانی: در بررسی حادثه Hugging Face، به METR و Redwood تنها حدود یک هفته زمان داده شد که منجر به نتیجه‌گیری قطعی نشد.
  • دسترسی ناکافی: در تست‌های پیش از انتشار مدل GPT-6 Astra، شرکت Apollo Research تنها سه روز فرصت داشت که برای ارزیابی جامع کافی نبود.
  • توافق‌نامه‌های محرمانگی: آدام گلیو، مدیرعامل FAR.AI، اشاره کرد که بسیاری از قراردادهای ارزیابی به دلیل کنترل شدید شرکت‌ها بر انتشار نتایج و محدودیت‌های NDA، رد یا لغو شده‌اند.

در حال حاضر، سرنوشت این پیشنهاد به این بستگی دارد که آیا شرکت‌های هوش مصنوعی حاضرند کنترل واقعی بر فرآیند ارزیابی و انتشار نتایج منفی را واگذار کنند یا خیر. بدون تضمین‌های قانونی و شفافیت کامل، این «ناظران داخلی» ممکن است استقلال خود را از دست بدهند.

منبع: TechCrunch AI