# कार्य के लिए मीट्रिक चुनना — Fine-tuning बनाम Prompting

Source: https://www.skillbyai.com/hi/fine-tuning/o-metrics

> मापदंड को इससे मिलाएँ कि आउटपुट को क्या करना है।

## सटीक, संरचनात्मक, judged

सफलता दर्शाने वाली सबसे सस्ती मीट्रिक चुनें। **सटीक या संरचित जाँचें** वर्गीकरण और निष्कर्षण के लिए (accuracy, precision/recall, field-स्तर मिलान, schema वैधता)। **Programmatic जाँचें** code (tests पास) और formats (parse होना) के लिए। **मानव या मॉडल judges** खुले लेखन के लिए, पर judges के पूर्वाग्रह होते हैं (स्थिति, लंबाई, स्व-वरीयता), इसलिए नमूने पर मानव labels से उन्हें calibrate करें। गुणवत्ता के साथ **format वैधता**, **इनकार दर**, **लंबाई**, **लागत** और **latency** ट्रैक करें। एक अकेली headline संख्या regressions छिपाती है।

## कार्य के अनुसार मीट्रिक

शुरुआती मेनू; अपने अनुसार ढालें।

```text
classification      accuracy, per-class precision/recall, confusion matrix
extraction          field-level exact match, schema validity, missing/extra fields
code generation     unit tests pass, lints clean, runs within time
summarisation       human or calibrated-judge rating, factual-consistency checks
chat / support      resolution rate, escalation rate, sampled human review
all of them         format validity, refusal rate, length, cost, p95 latency
```

## Judge को calibrate करें

मॉडल outputs को grade करे तो उसके grades की 50 मानव-labelled मामलों से तुलना करें और स्थिति-पूर्वाग्रह उजागर करने को उत्तरों का क्रम बदलें।

**Quiz:** गुणवत्ता के साथ format वैधता और लागत क्यों ट्रैक करें?

- [ ] वे गुणवत्ता की जगह लेते हैं
- [x] एक अकेला headline score अन्य आयामों में regressions छिपा सकता है
- [ ] LoRA के लिए आवश्यक हैं
- [ ] वे loss सुधारते हैं

*Answer:* एक अकेला headline score अन्य आयामों में regressions छिपा सकता है. कई आयाम साथ देखें।
