گروهی از محققان متشکل از تیم Google Research، دانشگاه توکیو، RIKEN AIP و دانشگاه Tohoku، ابزار ToolGrad را معرفی کردند که روش سنتی تولید دادههای آموزشی برای مدلهای زبانی بزرگ (LLM) را زیر رو میکند. این پژوهش نشان میدهد که با تأیید زنجیرهای از فراخوانیهای ابزار پیش از نگارش پرسش کاربر، میتوان دادههای باکیفیتتری تولید کرد.
چرا روشهای قبلی ناکارآمد بودند؟#
رویکردهای پیشین مانند ToolBench و ToolACE از الگوی «سوال-محور» پیروی میکردند. در این روش، سیستم ابتدا یک دستور کاربر احتمالی تولید میکند و سپس تلاش میکند تا مسیری برای اجرای ابزارها پیدا کند. مشکل اصلی این است که این جستجو تضمینی برای موفقیت ندارد و وقتی به بنبست میرسد، محاسبات هدر رفته و نمونه حذف میشود. این فرآیند استخراج مسیرهای ارزشمند از اکتشافات ناموفق، ذاتاً ناکارآمد است.
معکوس کردن فرآیند با ToolGrad#
ToolGrad ترتیب کار را برعکس میکند: ابتدا یک زنجیره واقعی و اجرایی از ابزارها ساخته میشود، و سپس پرسش کاربر متناسب با آن زنجیره نوشته میشود. از آنجا که زنجیره اجرایی شفافتر از یک پرسش فرضی است، مرحله نگارش پرسش تنها به یک تماس با مدل زبانی نیاز دارد. این چرخه شامل چهار ماژول تکراری است:
- API Proposer: کاندیداهای مناسب برای گسترشworkflow را انتخاب میکند.
- API Executors: اجرا موازی کاندیداها و تولید گزارش عملکرد.
- API Selector: بهترین فراخوانی را بر اساس گزارشها انتخاب و به workflow اضافه میکند.
- LLM Updater: پرسش و پاسخ مصنوعی را با مجموعه ابزارهای جدید هماهنگ میکند.
این چرخه در پیکربندی پیشفرض، ۱۰ تکرار روی ۵۰ API نمونه انجام میشود تا یک نمونه کامل شامل پرسش، workflow تأیید شده و پاسخ نهایی ایجاد شود.
نتایج ارزیابی و مقایسه عملکرد#
در ارزیابی روی پایگاه داده ToolBench (شامل بیش از ۱۶,۰۰۰ API واقعی)، نرخ موفقیت (Pass Rate) از ۶۳.۸٪ در روش DFS به ۹۹.۸٪ در ToolGrad رسید. همچنین تعداد مراحل ابزار به هر نمونه از ۳۴.۳ به ۲۰ کاهش یافت، در حالی که عمق زنجیرههای صحیح بیشتر شد. تنها ۰.۲٪ شکست زمانی رخ داد که هیچکدام از سه API انتخاب شده در تمام ۱۰ تکرار پاسخ موفق نمیدادند.
برای سنجش عملکرد مدلها،数据集 ToolGrad-500 (شامل ۵۰۰ نمونه تولید شده با Gemini 2.5 Flash-Lite) برای آموزش مجدد مدلهای Gemma-3 در اندازههای ۱B، ۴B و ۱۲B استفاده شد. نتایج در Berkeley Function Calling Leaderboard (BFCL) نشان داد که مدل Gemma-3-12B که تنها با ۵۰۰ نمونه آموزش دیده، نمره ۸۳.۱ را کسب کرد. این نمره نزدیک به Gemini 2.5 Pro (۸۳.۲) و Claude 4.5 Opus (۸۲.۸) است و از GPT-5 (۷۴.۴) بهتر عمل کرد. جالب توجه اینکه مدل دانشجو (Gemma-3) از معلم خود (Gemini 2.5 Flash-Lite) نیز عملکرد بهتری داشت.
این پروژه تحت مجوز Apache-2.0 منتشر شده و کد آن، dataset و مدلها در پلتفرمهای هوش مصنوعی در دسترس هستند.
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.