در هفته اخیر، داریو آمودئی، مدیرعامل Anthropic، در مقالهای مفصل پیشنهادی را مطرح کرد که تا پیش از این، صنعت هوش مصنوعی آن را رد میکرد: استقرار ارزیابان ایمنی شخص ثالث در درون شرکتهای پیشرو (Frontier) با اختیاراتی برای گزارشدهی حوادث و بررسی همسویی مدلها. سم آلتمن، مدیرعامل OpenAI نیز اعلام کرد که شرکتش متعهد به اجرای این رویه خواهد شد.
ارزیابان مستقل مانند METR و Redwood Research این پیشنهاد را استقبال کردند، اما تأکید دارند که بدون شفافیت در جزئیات و حمایت قانونی، خطر تبدیل شدن آنها به «فروشندگان خدمات» به جای «ناظران مستقل» وجود دارد.
چرا دسترسی به فرآیند آموزش اهمیت دارد؟#
با پیشرفت مدلها، خطر «آگاهی از ارزیابی» افزایش یافته است؛ یعنی مدلها میتوانند در حین تست رفتار ایمن نشان دهند اما در عمل ناهمسو باقی بمانند. الکساندر مینکه از Apollo Research معتقد است که بررسی صرفاً مدل نهایی کافی نیست و ارزیابان باید به نسخههای میانی و لاگهای آموزش دسترسی داشته باشند تا مطمئن شوند مدل در طول آموزش سعی در فریب دادن سیستمهای ایمنی نکرده است.
جان استیدلی از Palisade Research این وضعیت را به رسوایی «دیزلگیت» فولکسواگن تشبیه کرد؛ جایی که خودروها طوری برنامهریزی شده بودند که در شرایط تست عملکرد بهتری داشته باشند. بنابراین، دسترسی به «زیر کاپوت» مدلها برای اطمینان از ایمنی واقعی ضروری به نظر میرسد.
تردیدها درباره استقلال و شفافیت#
با وجود این وعدهها، نه Anthropic و نه OpenAI جزئیاتی درباره اینکه کدام ارزیابان، چه زمانی و با چه سطح دسترسیای وارد عمل خواهند شد، ارائه نکردهاند. تاریخچه همکاریهای قبلی نیز نشاندهنده چالشهای جدی است:
- محدودیت زمانی: در بررسی حادثه Hugging Face، به METR و Redwood تنها حدود یک هفته زمان داده شد که منجر به نتیجهگیری قطعی نشد.
- دسترسی ناکافی: در تستهای پیش از انتشار مدل GPT-6 Astra، شرکت Apollo Research تنها سه روز فرصت داشت که برای ارزیابی جامع کافی نبود.
- توافقنامههای محرمانگی: آدام گلیو، مدیرعامل FAR.AI، اشاره کرد که بسیاری از قراردادهای ارزیابی به دلیل کنترل شدید شرکتها بر انتشار نتایج و محدودیتهای NDA، رد یا لغو شدهاند.
در حال حاضر، سرنوشت این پیشنهاد به این بستگی دارد که آیا شرکتهای هوش مصنوعی حاضرند کنترل واقعی بر فرآیند ارزیابی و انتشار نتایج منفی را واگذار کنند یا خیر. بدون تضمینهای قانونی و شفافیت کامل، این «ناظران داخلی» ممکن است استقلال خود را از دست بدهند.
منبع: TechCrunch AI






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.