पाठ 5 / 25
लंबा Context हमेशा बेहतर क्यों नहीं
अधिक tokens पैसा और समय लेते हैं और उत्तर को दबा सकते हैं।
मात्रा से प्रासंगिकता बेहतर
बड़ी window को हर संभवतः उपयोगी चीज़ से भरने की लागतें हैं: क़ीमत इनपुट tokens के साथ बढ़ती है, latency बढ़ती है (उत्तर देने से पहले मॉडल को सब process करना पड़ता है), और गुणवत्ता गिर सकती है क्योंकि प्रासंगिक तथ्य भटकाने वाली चीज़ों से घिर जाते हैं। शोध और अभ्यास में पाया गया है कि मॉडल लंबे इनपुट के आरंभ और अंत की जानकारी, बीच में दबी जानकारी से अधिक भरोसे से उपयोग कर सकते हैं, हालाँकि नए मॉडल अलग होते हैं, इसलिए अपना परखें। व्यावहारिक नियम: प्रश्न का उत्तर देने वाली अत्यधिक प्रासंगिक सामग्री का सबसे छोटा set भेजें, और मापें कि और जोड़ना वास्तव में मदद करता है या नहीं।
Briefing pack, गोदाम नहीं
एक-पंक्ति के प्रश्न के लिए किसी को 300 पन्नों का binder देना उन्हें धीमा और उस एक ज़रूरी पन्ने को चूकने की ओर ले जाता है।
Quality को k के सामने plot करें
अपना मूल्यांकन 2, 5, 10 और 20 retrieved chunks के साथ चलाएँ; जहाँ गुणवत्ता बढ़ना रुके वहाँ रुकें।
त्वरित जाँच: बहुत लंबा context उत्तरों को नुक़सान क्यों पहुँचा सकता है?
- मॉडल हमेशा लंबे इनपुट मना करते हैं
- प्रासंगिक तथ्य भटकाने वाली चीज़ों में दब जाते हैं, और लागत व latency बढ़ती है
- लंबे इनपुट मॉडल weights बदलते हैं
- Tokens मुफ़्त हो जाते हैं
Answer
प्रासंगिक तथ्य भटकाने वाली चीज़ों में दब जाते हैं, और लागत व latency बढ़ती है — सबसे छोटा अत्यधिक प्रासंगिक set भेजें।