شرکت آنتروپیک (Anthropic) یک روش جدید برای ارزیابی پلاگین‌ها در محیط برنامه‌نویسی Claude Code منتشر کرده است. این قابلیت تحت عنوان claude plugin eval عمل می‌کند و به توسعه‌دهندگان اجازه می‌دهد تا عملکرد مهارت‌های خود را بر روی پرسنده‌های واقع‌بینانه آزمایش، نتایج را رتبه‌بندی کرده و آن‌ها را با خروجی مدلی که فاقد آن پلاگین است، مقایسه کنند. این ابزار سه سوال کلیدی را پاسخ می‌دهد که پیش از این قابل اندازه‌گیری نبودند: آیا مهارت مورد نظر فعال می‌شود؟ آیا در برابر ویرایش‌ها یا تغییرات مدل مقاوم است؟ و آیا عملکرد آن برتر از مدل خالص (بدون پلاگین) است؟

این سیستم برای اجرا نیازمند نسخه 2.1.269 یا بالاتر از Claude Code است. هر اجرای ارزیابی و هرگونه قضاوت توسط مدل‌ها، به عنوان یک درخواست واقعی در نظر گرفته شده و هزینه آن مستقیماً به طرح کاربر یا حساب API صورت می‌شود. ساختار فایل‌های ارزیابی در پوشه‌ای به نام evals/ در داخل پلاگین قرار دارد که شامل دستورات ورودی و پرونده‌های رتبه‌بندی (Graders) است.

مکانیزم مقایسه و شش نوع رتبه‌بندی#

در این سیستم، هر کیس تست به طور پیش‌فرض دو بار اجرا می‌شود: یکی با فعال بودن پلاگین و دیگری بدون آن. تفاوت این دو نتیجه، که به آن Δ گفته می‌شود، نشان‌دهنده میزان ارزش افزوده‌ای است که پلاگین ایجاد کرده است. اگر این عدد نزدیک به صفر باشد، یعنی پلاگین نقش خاصی در موفقیت خروجی نداشته است.

آنتروپیک شش نوع رتبه‌بندی را معرفی کرده است. چهار مورد اول شامل regex، tool_used، tool_order و file_exists هستند که رایگان محاسبه می‌شوند زیرا صرفاً از طریق بررسی ترانزکت و فایل‌های دیسک انجام می‌گیرند. دو مورد دیگر که نیازمند مدل قاضی (Judge Model) هستند و هزینه دارند، عبارتند از llm که پاسخ را بر اساس معیارهای متنی امتیازدهی می‌کند و baseline که آن را با یک پاسخ مرجع مقایسه می‌نماید.

یکپارچه‌سازی با فرآیندهای CI/CD#

یکی از ویژگی‌های مهم این ابزار، قابلیت استفاده از آن به عنوان یک گیت در فرآیندهای ادغام مستمر (CI) است. توسعه‌دهندگان می‌توانند با استفاده از پارامترهایی مانند --threshold و --max-cost-usd، محدودیت‌های هزینه و دقت را تعیین کنند. نکته قابل توجه این است که خطاهای مربوط به محدودیت استفاده (Usage-limit) ممکن است به اشتباه به عنوان افت عملکرد گزارش شوند.

آنتروپیک همچنین ابزاری به نام claude plugin validate را معرفی کرده که اگرچه سیناکس مانیفست را بررسی می‌کند، اما نمی‌تواند رفتار پنهان پلاگین‌ها را تشخیص دهد. بنابراین، یافتن یک اختلاف (Δ) نزدیک به صفر همراه با شکست در تشخیص فعال‌سازی مهارت، نشان‌دهنده این است که مدل کلاد در مواجهه با عبارات طبیعی، انتخاب آن پلاگین را انجام نمی‌دهد.

منبع: MarkTechPost