पाठ 21 / 27
कार्य के लिए मीट्रिक चुनना
मापदंड को इससे मिलाएँ कि आउटपुट को क्या करना है।
सटीक, संरचनात्मक, judged
सफलता दर्शाने वाली सबसे सस्ती मीट्रिक चुनें। सटीक या संरचित जाँचें वर्गीकरण और निष्कर्षण के लिए (accuracy, precision/recall, field-स्तर मिलान, schema वैधता)। Programmatic जाँचें code (tests पास) और formats (parse होना) के लिए। मानव या मॉडल judges खुले लेखन के लिए, पर judges के पूर्वाग्रह होते हैं (स्थिति, लंबाई, स्व-वरीयता), इसलिए नमूने पर मानव labels से उन्हें calibrate करें। गुणवत्ता के साथ format वैधता, इनकार दर, लंबाई, लागत और latency ट्रैक करें। एक अकेली headline संख्या regressions छिपाती है।
कार्य के अनुसार मीट्रिक
शुरुआती मेनू; अपने अनुसार ढालें।
classification accuracy, per-class precision/recall, confusion matrix
extraction field-level exact match, schema validity, missing/extra fields
code generation unit tests pass, lints clean, runs within time
summarisation human or calibrated-judge rating, factual-consistency checks
chat / support resolution rate, escalation rate, sampled human review
all of them format validity, refusal rate, length, cost, p95 latencyJudge को calibrate करें
मॉडल outputs को grade करे तो उसके grades की 50 मानव-labelled मामलों से तुलना करें और स्थिति-पूर्वाग्रह उजागर करने को उत्तरों का क्रम बदलें।
त्वरित जाँच: गुणवत्ता के साथ format वैधता और लागत क्यों ट्रैक करें?
- वे गुणवत्ता की जगह लेते हैं
- एक अकेला headline score अन्य आयामों में regressions छिपा सकता है
- LoRA के लिए आवश्यक हैं
- वे loss सुधारते हैं
Answer
एक अकेला headline score अन्य आयामों में regressions छिपा सकता है — कई आयाम साथ देखें।