# लंबे Prompts की लागत और Prompt Caching — Fine-tuning बनाम Prompting

Source: https://www.skillbyai.com/hi/fine-tuning/p-long

> जानें दोहराए उदाहरणों की लागत क्या है, और caching क्या बदलती है।

## हर call पर उदाहरणों का भुगतान

लंबे few-shot prompts का भुगतान **हर अनुरोध पर** होता है और वे latency जोड़ते हैं। दो चीज़ें इसे नरम करती हैं। **Prompt caching** (कई providers देते हैं) दोहराए, अपरिवर्तित prefix को घटी दर पर बिल करती है और तेज़ करती है, इसलिए स्थिर सामग्री पहले रखें। और **dynamic few-shot** समानता खोज से **प्रति अनुरोध सबसे प्रासंगिक उदाहरण** ही चुनता है। दोनों में से कोई भी सिर्फ़ tokens बचाने को fine-tune करने का अधिकांश दबाव हटा सकता है, इसलिए निर्णय से पहले लंबे prompt की क़ीमत इनके साथ आँकें और क़ीमतें बदलने पर दोबारा जाँचें।

## टिफ़िन बनाम नुस्ख़ा

हर रसोई में पूरा नुस्ख़ा ले जाना लंबा prompt है; रसोइये को प्रशिक्षित करना ताकि वह पहले से जाने fine-tuning है; caching नुस्ख़ा दीवार पर चिपका छोड़ना है।

## स्थिर पहले, बदलने वाला अंत में

Prompt को निर्देश, निश्चित उदाहरण, फिर उपयोगकर्ता इनपुट के क्रम में रखें ताकि cache होने वाला prefix अधिकतम लंबा हो।

**Quiz:** प्रशिक्षण के बिना लंबे निश्चित few-shot prompt की लागत क्या घटा सकता है?

- [x] Prompt caching और प्रति अनुरोध सिर्फ़ सबसे प्रासंगिक उदाहरण चुनना
- [ ] उदाहरण लंबे करना
- [ ] मूल्यांकन set हटाना
- [ ] Temperature दोगुना करना

*Answer:* Prompt caching और प्रति अनुरोध सिर्फ़ सबसे प्रासंगिक उदाहरण चुनना. सस्ती prompting अक्सर fine-tuning का लागत-तर्क हटा देती है।
