SkillByAIइंटरैक्टिव संस्करण खोलें →

पाठ 21 / 27

कार्य के लिए मीट्रिक चुनना

मापदंड को इससे मिलाएँ कि आउटपुट को क्या करना है।

सटीक, संरचनात्मक, judged

सफलता दर्शाने वाली सबसे सस्ती मीट्रिक चुनें। सटीक या संरचित जाँचें वर्गीकरण और निष्कर्षण के लिए (accuracy, precision/recall, field-स्तर मिलान, schema वैधता)। Programmatic जाँचें code (tests पास) और formats (parse होना) के लिए। मानव या मॉडल judges खुले लेखन के लिए, पर judges के पूर्वाग्रह होते हैं (स्थिति, लंबाई, स्व-वरीयता), इसलिए नमूने पर मानव labels से उन्हें calibrate करें। गुणवत्ता के साथ format वैधता, इनकार दर, लंबाई, लागत और latency ट्रैक करें। एक अकेली headline संख्या regressions छिपाती है।

कार्य के अनुसार मीट्रिक

शुरुआती मेनू; अपने अनुसार ढालें।

classification      accuracy, per-class precision/recall, confusion matrix
extraction          field-level exact match, schema validity, missing/extra fields
code generation     unit tests pass, lints clean, runs within time
summarisation       human or calibrated-judge rating, factual-consistency checks
chat / support      resolution rate, escalation rate, sampled human review
all of them         format validity, refusal rate, length, cost, p95 latency

Judge को calibrate करें

मॉडल outputs को grade करे तो उसके grades की 50 मानव-labelled मामलों से तुलना करें और स्थिति-पूर्वाग्रह उजागर करने को उत्तरों का क्रम बदलें।

त्वरित जाँच: गुणवत्ता के साथ format वैधता और लागत क्यों ट्रैक करें?

  • वे गुणवत्ता की जगह लेते हैं
  • एक अकेला headline score अन्य आयामों में regressions छिपा सकता है
  • LoRA के लिए आवश्यक हैं
  • वे loss सुधारते हैं
Answer

एक अकेला headline score अन्य आयामों में regressions छिपा सकता है — कई आयाम साथ देखें।