میخواهی بفهمی یک prompt واقعاً بهتر شده؟ یک Test Set دهتایی بساز
prompt را چند بار تغییر میدهی و هر بار یک جواب خوب میبینی، اما نمیدانی در استفاده واقعی عملکرد پایدارتر شده یا نه.
بهجای قضاوت با یک نمونه خوششانس، 10 ورودی واقعی با چند edge case نگه دار و هر نسخه prompt را روی همانها مقایسه کن.
چطور دقیقتر به موضوع نگاه کنیم؟
- از کار واقعی 6 نمونه معمولی، 2 نمونه سخت و 2 ورودی نامعتبر یا مبهم انتخاب کن.
- معیار موفقیت را قبل از تست بنویس؛ صحت، فرمت، کاملبودن یا نیاز به اصلاح دستی.
- نسخههای prompt را روی همان ورودیها اجرا و خطاها را دستهبندی کن.
- بهجای اصلاح برای یک مورد، الگویی را تغییر بده که چند خطا را حل میکند و regression جدید نسازد.
چرا این موضوع مهم است؟
خروجی مدل میتواند بین نمونهها و اجراها تغییر کند. مجموعه تست کوچک باعث میشود بهبود را روی موارد نماینده بسنجی.
سؤالهایی که معمولاً بعدش پیش میآید
ده نمونه کافی است؟
برای شروع و workflow کوچک مفید است؛ سیستم مهمتر یا متنوعتر به مجموعه بزرگتر نیاز دارد.
هر بار جواب یکسان نمیآید؛ چه کنم؟
معیار را روی ویژگیهای خروجی بسنج، نه تطابق کلمهبهکلمه؛ در صورت نیاز چند اجرا نمونه بگیر.
