पाठ 3 / 27

Fine-Tuning कब सही औज़ार है

वे स्थितियाँ पहचानें जहाँ प्रशिक्षण लाभ देता है।

शैली, format, संकरे कौशल, लागत और latency

Fine-tuning इनमें लाभ देती है: एकसमान शैली या format जिसे prompt सिर्फ़ अधिकांश बार मानता है, संकरे दोहराए कार्य (वर्गीकरण, निष्कर्षण, routing) जहाँ छोटा मॉडल बड़े prompted मॉडल की बराबरी कर सकता है, छोटे prompts (प्रशिक्षण से सीखे व्यवहार को लंबे निर्देश नहीं चाहिए), छोटे मॉडल से कम latency, और बड़े मॉडल को छोटे में distill करना। यह नए तथ्य भरोसे से सीखने, तेज़ी से बदलती जानकारी, कम या असंगत उदाहरणों वाले कार्यों और उस सबमें ख़राब है जिसे आप आँक नहीं सकते।

अच्छे और कमज़ोर उम्मीदवार

निवेश से पहले तेज़ छँटनी।

GOOD candidates                                          POOR candidates
classify tickets into 12 categories (5k labelled)         answer questions about last week's policy change
extract invoice fields into a strict JSON schema          "be smarter" in general
write replies in our brand voice (1k approved replies)    tasks with 20 inconsistent examples
cut a 3,500-token few-shot prompt to 400 tokens           anything with no evaluation set
distill an expensive model for one task                   a knowledge base that changes daily (use RAG)

अपने उदाहरण ईमानदारी से गिनें

सैकड़ों एकसमान, समीक्षित उदाहरण हज़ारों गंदे उदाहरणों से बेहतर हैं; न जुटा पाएँ तो सीढ़ी पर रुकें।

त्वरित जाँच: कौन-सा कार्य fine-tuning के लिए उपयुक्त है?

  • ऐसा कार्य जिसकी सफलता मापी नहीं जा सकती
  • आज सुबह की ख़बरों पर सवालों के उत्तर
  • रोज़ बदलते तथ्य सीखना
  • हज़ारों labelled उदाहरणों के साथ invoice fields को कड़े schema में निकालना
Answer

हज़ारों labelled उदाहरणों के साथ invoice fields को कड़े schema में निकालना — संकरे, दोहराए, मापने योग्य कार्य जिनके पास भरपूर उदाहरण हों, प्रशिक्षण के लिए उपयुक्त हैं।