पाठ 7 / 27
लंबे Prompts की लागत और Prompt Caching
जानें दोहराए उदाहरणों की लागत क्या है, और caching क्या बदलती है।
हर call पर उदाहरणों का भुगतान
लंबे few-shot prompts का भुगतान हर अनुरोध पर होता है और वे latency जोड़ते हैं। दो चीज़ें इसे नरम करती हैं। Prompt caching (कई providers देते हैं) दोहराए, अपरिवर्तित prefix को घटी दर पर बिल करती है और तेज़ करती है, इसलिए स्थिर सामग्री पहले रखें। और dynamic few-shot समानता खोज से प्रति अनुरोध सबसे प्रासंगिक उदाहरण ही चुनता है। दोनों में से कोई भी सिर्फ़ tokens बचाने को fine-tune करने का अधिकांश दबाव हटा सकता है, इसलिए निर्णय से पहले लंबे prompt की क़ीमत इनके साथ आँकें और क़ीमतें बदलने पर दोबारा जाँचें।
टिफ़िन बनाम नुस्ख़ा
हर रसोई में पूरा नुस्ख़ा ले जाना लंबा prompt है; रसोइये को प्रशिक्षित करना ताकि वह पहले से जाने fine-tuning है; caching नुस्ख़ा दीवार पर चिपका छोड़ना है।
स्थिर पहले, बदलने वाला अंत में
Prompt को निर्देश, निश्चित उदाहरण, फिर उपयोगकर्ता इनपुट के क्रम में रखें ताकि cache होने वाला prefix अधिकतम लंबा हो।
त्वरित जाँच: प्रशिक्षण के बिना लंबे निश्चित few-shot prompt की लागत क्या घटा सकता है?
- Prompt caching और प्रति अनुरोध सिर्फ़ सबसे प्रासंगिक उदाहरण चुनना
- उदाहरण लंबे करना
- मूल्यांकन set हटाना
- Temperature दोगुना करना
Answer
Prompt caching और प्रति अनुरोध सिर्फ़ सबसे प्रासंगिक उदाहरण चुनना — सस्ती prompting अक्सर fine-tuning का लागत-तर्क हटा देती है।