شرکت آنتروپیک (Anthropic) یک روش جدید برای ارزیابی پلاگینها در محیط برنامهنویسی Claude Code منتشر کرده است. این قابلیت تحت عنوان claude plugin eval عمل میکند و به توسعهدهندگان اجازه میدهد تا عملکرد مهارتهای خود را بر روی پرسندههای واقعبینانه آزمایش، نتایج را رتبهبندی کرده و آنها را با خروجی مدلی که فاقد آن پلاگین است، مقایسه کنند. این ابزار سه سوال کلیدی را پاسخ میدهد که پیش از این قابل اندازهگیری نبودند: آیا مهارت مورد نظر فعال میشود؟ آیا در برابر ویرایشها یا تغییرات مدل مقاوم است؟ و آیا عملکرد آن برتر از مدل خالص (بدون پلاگین) است؟
این سیستم برای اجرا نیازمند نسخه 2.1.269 یا بالاتر از Claude Code است. هر اجرای ارزیابی و هرگونه قضاوت توسط مدلها، به عنوان یک درخواست واقعی در نظر گرفته شده و هزینه آن مستقیماً به طرح کاربر یا حساب API صورت میشود. ساختار فایلهای ارزیابی در پوشهای به نام evals/ در داخل پلاگین قرار دارد که شامل دستورات ورودی و پروندههای رتبهبندی (Graders) است.
مکانیزم مقایسه و شش نوع رتبهبندی#
در این سیستم، هر کیس تست به طور پیشفرض دو بار اجرا میشود: یکی با فعال بودن پلاگین و دیگری بدون آن. تفاوت این دو نتیجه، که به آن Δ گفته میشود، نشاندهنده میزان ارزش افزودهای است که پلاگین ایجاد کرده است. اگر این عدد نزدیک به صفر باشد، یعنی پلاگین نقش خاصی در موفقیت خروجی نداشته است.
آنتروپیک شش نوع رتبهبندی را معرفی کرده است. چهار مورد اول شامل regex، tool_used، tool_order و file_exists هستند که رایگان محاسبه میشوند زیرا صرفاً از طریق بررسی ترانزکت و فایلهای دیسک انجام میگیرند. دو مورد دیگر که نیازمند مدل قاضی (Judge Model) هستند و هزینه دارند، عبارتند از llm که پاسخ را بر اساس معیارهای متنی امتیازدهی میکند و baseline که آن را با یک پاسخ مرجع مقایسه مینماید.
یکپارچهسازی با فرآیندهای CI/CD#
یکی از ویژگیهای مهم این ابزار، قابلیت استفاده از آن به عنوان یک گیت در فرآیندهای ادغام مستمر (CI) است. توسعهدهندگان میتوانند با استفاده از پارامترهایی مانند --threshold و --max-cost-usd، محدودیتهای هزینه و دقت را تعیین کنند. نکته قابل توجه این است که خطاهای مربوط به محدودیت استفاده (Usage-limit) ممکن است به اشتباه به عنوان افت عملکرد گزارش شوند.
آنتروپیک همچنین ابزاری به نام claude plugin validate را معرفی کرده که اگرچه سیناکس مانیفست را بررسی میکند، اما نمیتواند رفتار پنهان پلاگینها را تشخیص دهد. بنابراین، یافتن یک اختلاف (Δ) نزدیک به صفر همراه با شکست در تشخیص فعالسازی مهارت، نشاندهنده این است که مدل کلاد در مواجهه با عبارات طبیعی، انتخاب آن پلاگین را انجام نمیدهد.
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.