Yifan Zhang، پژوهشگر دانشگاه پرینستون، گزارشی فنی با عنوان «ترنسفورمر حلقوی تکراری» (Recurrent Looped Transformer یا RLT) منتشر کرده است. این طرح پیشنهادی، ساختار معمول مدلهای زبانی بزرگ مبتنی بر دیکودر (Decoder-only LLMs) را به چالش میکشد. در معماریهای رایج فعلی، هیچ محاسبهای در لایه آخر توکن t به لایه اول توکن t+1 منتقل نمیشود و موقعیتها تنها از طریق مکانیزم توجه (Attention) بر روی کلیدها و مقادیر ذخیره شده با یکدیگر ارتباط برقرار میکنند.
راهکار RLT برای بستن این حلقه، انتقال نهایی پنهان (Hidden State) دیکودر و حافظه توجه پنجره لغزنده (Sliding-Window Attention - SWA) آن به توکن بعدی است. این انتقال بدون هیچ گونه ریست شدن در مرزهای بین توکنها، چه در بخش Prompt و چه در بخش پاسخ، انجام میشود. این پژوهش در حال حاضر بیشتر شبیه به یک مشخصات طراحی (Design Specification) است تا یک محصول نهایی؛ زیرا نویسنده صراحتاً اعلام کرده که نتایج اندازهگیری شدهای درباره کیفیت استدلال، کارایی یا مقیاسپذیری ارائه نداده است. غلبه بر محدودیتهای حافظه یکی از چالشهای اصلی است که معماریهای جدید باید آن را حل کنند.
ساختار و اصول طراحی#
مدل RLT یک انکودر علّی (Causal Encoder) را با یک دیکودر بازگشتی (Recurrent Decoder) ترکیب میکند. انکودر توکنها را به صورت موازی پردازش کرده و نمایشهایی تولید میکند که از طریق آنها حافظه کلید-مقدار (KV Memory) پروژه میشود. دیکودر مسئول حفظ بازگشتی بودن سیستم است و وضعیت کامل آن شامل خروجی نهایی و حافظه SWA در هر لایه میباشد. برای هر توکن، یک ادغام کنترلشده، خروجی قبلی را با نمای فعلی ترکیب کرده و سپس بلاکهای دیکودر عملیات توجه علّی، توجه متقاطع به حافظه انکودر و شبکه عصبی پیشخور (FFN) را اجرا میکنند.
در پیکربندی مرجع این تحقیق، ۴۸ لایه انکودر و ۴۸ لایه دیکودر وجود دارند که وزنهای توجه و FFN بین آنها مشترک است. این یعنی هر توکن به طور منطقی از ۹۶ بلوک عبور میکند. اگرچه نویسنده این موضوع را «بازاستفاده از پارامتر» مینامد، اما به دلیل اضافه شدن توجه متقاطع در دیکودر، تعداد عملیات ریاضی (FLOPs) در هر بلوک برابر نیست.
چالشهای سختافزاری و آموزش#
یکی از اصول کلیدی RLT، همکاری نزدیک مدل با سختافزار است. اگرچه ویژگیهای انکودر میتوانند به صورت موازی پردازش شوند، اما گذارهای دیکودر باید به صورت متوالی در طول یک دنباله انجام شوند. گزارش تأکید میکند که هیچ ادعایی مبنی بر سرعت بخشیدن به مرحله Pre-fill یا اجرای اسکن موازی استاندارد برای بخش غیرخطی دیکودر وجود ندارد. همچنین، در فرآیند یادگیری تقویتی (RL)، بازیابی Replay نیازمند بازسازی کامل وضعیتها از ابتدای دنباله تحت پارامترهای فعلی است و از حالتهای قدیمی استفاده نمیشود. ترنسفورمر حلقوی تکراری در آرکایو قابل دسترسی است.
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.