पाठ 20 / 27
हमेशा मज़बूत prompted baseline से तुलना करें
प्रश्न यह नहीं कि tuning ने बेस मॉडल सुधारा, बल्कि यह कि वह आपके सबसे अच्छे prompt को हराती है या नहीं।
निष्पक्ष तुलना या तुलना नहीं
आलसी prompt वाले अनट्यून मॉडल को हराने वाला tuned मॉडल बहुत कम सिद्ध करता है। उसी held-out test set पर तुलना करें: (a) आपके सबसे अच्छे prompt और उदाहरणों वाला बेस मॉडल, (b) प्रासंगिक हो तो बेस मॉडल + retrieval, (c) छोटे prompt वाला tuned मॉडल। सबके लिए एक ही scoring, लागत और latency सहित, और अनिश्चितता बताएँ (छोटे test sets शोर वाले scores देते हैं)। सिर्फ़ औसत नहीं, उपसमूह और कठिन मामले जाँचें, और विफलताएँ हाथ से पढ़ें। Tuned मॉडल तभी ship करें जब लाभ असली हो और रखरखाव के योग्य।
सिद्ध करें, ship करें, बनाए रखें
Tuned मॉडल तभी ship करने योग्य है जब वह आपके अपने held-out डेटा पर अच्छी तरह prompted baseline से बेहतर हो।
तुलना तालिका का साँचा
अपनी मापी संख्याओं से भरें; यहाँ के मान placeholders हैं।
System quality cost/1k calls p95 latency notes
A base + best prompt + examples ___ ___ ___
B base + prompt + retrieval ___ ___ ___
C tuned + short prompt ___ ___ ___
D tuned + retrieval ___ ___ ___
same test set - same scorer - 95% interval reported - failures read by handअंतराल बताएँ
100 test cases पर 3-अंक का लाभ अक्सर शोर होता है; confidence interval बताएँ या paired तुलना चलाएँ।
त्वरित जाँच: Tuned मॉडल के लिए निष्पक्ष baseline क्या है?
- एक-शब्द prompt वाला अनट्यून मॉडल
- उसी test set पर आपके सबसे अच्छे prompt और उदाहरणों वाला बेस मॉडल
- प्रशिक्षण set सटीकता
- बिल्कुल अलग कार्य
Answer
उसी test set पर आपके सबसे अच्छे prompt और उदाहरणों वाला बेस मॉडल — अपने सर्वश्रेष्ठ विकल्प को हराएँ, पुतले को नहीं।