پژوهشگران شرکت Sakana AI روش جدیدی تحت عنوان Augmented Lagrangian Predictive Coding (PC-ALM) را ارائه دادند. این الگوریتم به عنوان جایگزینی برای روش جهانی «پس‌انتشار» (Backpropagation) طراحی شده است که در آن به‌روزرسانی وزن‌ها تنها در سطح هر لایه انجام می‌شود، اما همچنان سیگنال‌های لازم برای همسویی با عملکرد پس‌انتشار را بازیابی می‌کند.

چالش شبکه‌های عمیق و تنگ#

روش‌های یادگیری محلی مانند کدگذاری پیش‌بینانه (Predictive Coding) به دلیل شباهت فرضی به مکانیسم‌های مغزی مورد توجه هستند. با این حال، در شبکه‌های عصبی عمیق و باریک، سیگنال نظارتی که از خروجی آغاز می‌شود، قبل از رسیدن به لایه‌های ورودی به شدت تضعیف می‌گردد. این مسئله باعث افت شدید دقت در معماری‌هایی می‌شود که تعداد لایه‌ها بیشتر از عرض شبکه است.

نوآوری PC-ALM#

روش پیشنهادی تیم Sakana AI با استفاده از ضرایب لاگرانژ (Lagrange multipliers) در هر لایه، مشکل تضعیف سیگنال را حل می‌کند. این ضرایب خطای پیش‌بینی هر لایه را جمع‌آوری کرده و به عنوان یک کنترلر PI عمل می‌کنند. در شبکه‌های خطی، ثابت شده است که این ضرایب به دقیقاً گرادیان‌های پس‌انتشار همگرا می‌شوند.

نتایج آزمایشی#

آزمایش‌ها روی مجموعه داده‌های MNIST و Fashion-MNIST نشان داد که PC-ALM در طیف وسیعی از ابعاد شبکه (عرض و عمق بین ۸ تا ۱۲۸) عملکردی مشابه پس‌انتشار دارد، در حالی که روش استاندارد PC در حالت‌های عمیق و باریک شکست می‌خورد. مهم‌ترین دستاورد این پژوهش، آموزش موفقیت‌آمیز MLP‌های پسماندی (Residual MLPs) با ۱۰۰۰ لایه بر روی MNIST است که تنها حدود دو درصد تفاوت عملکرد با پس‌انتشار داشته‌اند.

این روش یک مدل نیست، بلکه متدی برای آموزش است. کد مرجح آن با مجوز MIT و مبتنی بر JAX منتشر شده و قابلیت اجرا روی پردازنده‌های معمولی (CPU) را دارد.

منبع: MarkTechPost