گروهی از محققان متشکل از تیم Google Research، دانشگاه توکیو، RIKEN AIP و دانشگاه Tohoku، ابزار ToolGrad را معرفی کردند که روش سنتی تولید داده‌های آموزشی برای مدل‌های زبانی بزرگ (LLM) را زیر رو می‌کند. این پژوهش نشان می‌دهد که با تأیید زنجیره‌ای از فراخوانی‌های ابزار پیش از نگارش پرسش کاربر، می‌توان داده‌های باکیفیت‌تری تولید کرد.

چرا روش‌های قبلی ناکارآمد بودند؟#

رویکردهای پیشین مانند ToolBench و ToolACE از الگوی «سوال-محور» پیروی می‌کردند. در این روش، سیستم ابتدا یک دستور کاربر احتمالی تولید می‌کند و سپس تلاش می‌کند تا مسیری برای اجرای ابزارها پیدا کند. مشکل اصلی این است که این جستجو تضمینی برای موفقیت ندارد و وقتی به بن‌بست می‌رسد، محاسبات هدر رفته و نمونه حذف می‌شود. این فرآیند استخراج مسیرهای ارزشمند از اکتشافات ناموفق، ذاتاً ناکارآمد است.

معکوس کردن فرآیند با ToolGrad#

ToolGrad ترتیب کار را برعکس می‌کند: ابتدا یک زنجیره واقعی و اجرایی از ابزارها ساخته می‌شود، و سپس پرسش کاربر متناسب با آن زنجیره نوشته می‌شود. از آنجا که زنجیره اجرایی شفاف‌تر از یک پرسش فرضی است، مرحله نگارش پرسش تنها به یک تماس با مدل زبانی نیاز دارد. این چرخه شامل چهار ماژول تکراری است:

  • API Proposer: کاندیداهای مناسب برای گسترشworkflow را انتخاب می‌کند.
  • API Executors: اجرا موازی کاندیداها و تولید گزارش عملکرد.
  • API Selector: بهترین فراخوانی را بر اساس گزارش‌ها انتخاب و به workflow اضافه می‌کند.
  • LLM Updater: پرسش و پاسخ مصنوعی را با مجموعه ابزارهای جدید هماهنگ می‌کند.

این چرخه در پیکربندی پیش‌فرض، ۱۰ تکرار روی ۵۰ API نمونه انجام می‌شود تا یک نمونه کامل شامل پرسش، workflow تأیید شده و پاسخ نهایی ایجاد شود.

نتایج ارزیابی و مقایسه عملکرد#

در ارزیابی روی پایگاه داده ToolBench (شامل بیش از ۱۶,۰۰۰ API واقعی)، نرخ موفقیت (Pass Rate) از ۶۳.۸٪ در روش DFS به ۹۹.۸٪ در ToolGrad رسید. همچنین تعداد مراحل ابزار به هر نمونه از ۳۴.۳ به ۲۰ کاهش یافت، در حالی که عمق زنجیره‌های صحیح بیشتر شد. تنها ۰.۲٪ شکست زمانی رخ داد که هیچ‌کدام از سه API انتخاب شده در تمام ۱۰ تکرار پاسخ موفق نمی‌دادند.

برای سنجش عملکرد مدل‌ها،数据集 ToolGrad-500 (شامل ۵۰۰ نمونه تولید شده با Gemini 2.5 Flash-Lite) برای آموزش مجدد مدل‌های Gemma-3 در اندازه‌های ۱B، ۴B و ۱۲B استفاده شد. نتایج در Berkeley Function Calling Leaderboard (BFCL) نشان داد که مدل Gemma-3-12B که تنها با ۵۰۰ نمونه آموزش دیده، نمره ۸۳.۱ را کسب کرد. این نمره نزدیک به Gemini 2.5 Pro (۸۳.۲) و Claude 4.5 Opus (۸۲.۸) است و از GPT-5 (۷۴.۴) بهتر عمل کرد. جالب توجه اینکه مدل دانشجو (Gemma-3) از معلم خود (Gemini 2.5 Flash-Lite) نیز عملکرد بهتری داشت.

این پروژه تحت مجوز Apache-2.0 منتشر شده و کد آن، dataset و مدل‌ها در پلتفرم‌های هوش مصنوعی در دسترس هستند.

منبع: MarkTechPost