پژوهشگران شرکت Sakana AI روش جدیدی تحت عنوان Augmented Lagrangian Predictive Coding (PC-ALM) را ارائه دادند. این الگوریتم به عنوان جایگزینی برای روش جهانی «پسانتشار» (Backpropagation) طراحی شده است که در آن بهروزرسانی وزنها تنها در سطح هر لایه انجام میشود، اما همچنان سیگنالهای لازم برای همسویی با عملکرد پسانتشار را بازیابی میکند.
چالش شبکههای عمیق و تنگ#
روشهای یادگیری محلی مانند کدگذاری پیشبینانه (Predictive Coding) به دلیل شباهت فرضی به مکانیسمهای مغزی مورد توجه هستند. با این حال، در شبکههای عصبی عمیق و باریک، سیگنال نظارتی که از خروجی آغاز میشود، قبل از رسیدن به لایههای ورودی به شدت تضعیف میگردد. این مسئله باعث افت شدید دقت در معماریهایی میشود که تعداد لایهها بیشتر از عرض شبکه است.
نوآوری PC-ALM#
روش پیشنهادی تیم Sakana AI با استفاده از ضرایب لاگرانژ (Lagrange multipliers) در هر لایه، مشکل تضعیف سیگنال را حل میکند. این ضرایب خطای پیشبینی هر لایه را جمعآوری کرده و به عنوان یک کنترلر PI عمل میکنند. در شبکههای خطی، ثابت شده است که این ضرایب به دقیقاً گرادیانهای پسانتشار همگرا میشوند.
نتایج آزمایشی#
آزمایشها روی مجموعه دادههای MNIST و Fashion-MNIST نشان داد که PC-ALM در طیف وسیعی از ابعاد شبکه (عرض و عمق بین ۸ تا ۱۲۸) عملکردی مشابه پسانتشار دارد، در حالی که روش استاندارد PC در حالتهای عمیق و باریک شکست میخورد. مهمترین دستاورد این پژوهش، آموزش موفقیتآمیز MLPهای پسماندی (Residual MLPs) با ۱۰۰۰ لایه بر روی MNIST است که تنها حدود دو درصد تفاوت عملکرد با پسانتشار داشتهاند.
این روش یک مدل نیست، بلکه متدی برای آموزش است. کد مرجح آن با مجوز MIT و مبتنی بر JAX منتشر شده و قابلیت اجرا روی پردازندههای معمولی (CPU) را دارد.
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.