Yifan Zhang، پژوهشگر دانشگاه پرینستون، گزارشی فنی با عنوان «ترنسفورمر حلقوی تکراری» (Recurrent Looped Transformer یا RLT) منتشر کرده است. این طرح پیشنهادی، ساختار معمول مدل‌های زبانی بزرگ مبتنی بر دیکودر (Decoder-only LLMs) را به چالش می‌کشد. در معماری‌های رایج فعلی، هیچ محاسبه‌ای در لایه آخر توکن t به لایه اول توکن t+1 منتقل نمی‌شود و موقعیت‌ها تنها از طریق مکانیزم توجه (Attention) بر روی کلیدها و مقادیر ذخیره شده با یکدیگر ارتباط برقرار می‌کنند.

راهکار RLT برای بستن این حلقه، انتقال نهایی پنهان (Hidden State) دیکودر و حافظه توجه پنجره لغزنده (Sliding-Window Attention - SWA) آن به توکن بعدی است. این انتقال بدون هیچ گونه ریست شدن در مرزهای بین توکن‌ها، چه در بخش Prompt و چه در بخش پاسخ، انجام می‌شود. این پژوهش در حال حاضر بیشتر شبیه به یک مشخصات طراحی (Design Specification) است تا یک محصول نهایی؛ زیرا نویسنده صراحتاً اعلام کرده که نتایج اندازه‌گیری شده‌ای درباره کیفیت استدلال، کارایی یا مقیاس‌پذیری ارائه نداده است. غلبه بر محدودیت‌های حافظه یکی از چالش‌های اصلی است که معماری‌های جدید باید آن را حل کنند.

ساختار و اصول طراحی#

مدل RLT یک انکودر علّی (Causal Encoder) را با یک دیکودر بازگشتی (Recurrent Decoder) ترکیب می‌کند. انکودر توکن‌ها را به صورت موازی پردازش کرده و نمایش‌هایی تولید می‌کند که از طریق آن‌ها حافظه کلید-مقدار (KV Memory) پروژه می‌شود. دیکودر مسئول حفظ بازگشتی بودن سیستم است و وضعیت کامل آن شامل خروجی نهایی و حافظه SWA در هر لایه می‌باشد. برای هر توکن، یک ادغام کنترل‌شده، خروجی قبلی را با نمای فعلی ترکیب کرده و سپس بلاک‌های دیکودر عملیات توجه علّی، توجه متقاطع به حافظه انکودر و شبکه عصبی پیش‌خور (FFN) را اجرا می‌کنند.

در پیکربندی مرجع این تحقیق، ۴۸ لایه انکودر و ۴۸ لایه دیکودر وجود دارند که وزن‌های توجه و FFN بین آن‌ها مشترک است. این یعنی هر توکن به طور منطقی از ۹۶ بلوک عبور می‌کند. اگرچه نویسنده این موضوع را «بازاستفاده از پارامتر» می‌نامد، اما به دلیل اضافه شدن توجه متقاطع در دیکودر، تعداد عملیات ریاضی (FLOPs) در هر بلوک برابر نیست.

چالش‌های سخت‌افزاری و آموزش#

یکی از اصول کلیدی RLT، همکاری نزدیک مدل با سخت‌افزار است. اگرچه ویژگی‌های انکودر می‌توانند به صورت موازی پردازش شوند، اما گذارهای دیکودر باید به صورت متوالی در طول یک دنباله انجام شوند. گزارش تأکید می‌کند که هیچ ادعایی مبنی بر سرعت بخشیدن به مرحله Pre-fill یا اجرای اسکن موازی استاندارد برای بخش غیرخطی دیکودر وجود ندارد. همچنین، در فرآیند یادگیری تقویتی (RL)، بازیابی Replay نیازمند بازسازی کامل وضعیت‌ها از ابتدای دنباله تحت پارامترهای فعلی است و از حالت‌های قدیمی استفاده نمی‌شود. ترنسفورمر حلقوی تکراری در آرکایو قابل دسترسی است.

منبع: MarkTechPost