पाठ 7 / 27

लंबे Prompts की लागत और Prompt Caching

जानें दोहराए उदाहरणों की लागत क्या है, और caching क्या बदलती है।

हर call पर उदाहरणों का भुगतान

लंबे few-shot prompts का भुगतान हर अनुरोध पर होता है और वे latency जोड़ते हैं। दो चीज़ें इसे नरम करती हैं। Prompt caching (कई providers देते हैं) दोहराए, अपरिवर्तित prefix को घटी दर पर बिल करती है और तेज़ करती है, इसलिए स्थिर सामग्री पहले रखें। और dynamic few-shot समानता खोज से प्रति अनुरोध सबसे प्रासंगिक उदाहरण ही चुनता है। दोनों में से कोई भी सिर्फ़ tokens बचाने को fine-tune करने का अधिकांश दबाव हटा सकता है, इसलिए निर्णय से पहले लंबे prompt की क़ीमत इनके साथ आँकें और क़ीमतें बदलने पर दोबारा जाँचें।

टिफ़िन बनाम नुस्ख़ा

हर रसोई में पूरा नुस्ख़ा ले जाना लंबा prompt है; रसोइये को प्रशिक्षित करना ताकि वह पहले से जाने fine-tuning है; caching नुस्ख़ा दीवार पर चिपका छोड़ना है।

स्थिर पहले, बदलने वाला अंत में

Prompt को निर्देश, निश्चित उदाहरण, फिर उपयोगकर्ता इनपुट के क्रम में रखें ताकि cache होने वाला prefix अधिकतम लंबा हो।

त्वरित जाँच: प्रशिक्षण के बिना लंबे निश्चित few-shot prompt की लागत क्या घटा सकता है?

  • Prompt caching और प्रति अनुरोध सिर्फ़ सबसे प्रासंगिक उदाहरण चुनना
  • उदाहरण लंबे करना
  • मूल्यांकन set हटाना
  • Temperature दोगुना करना
Answer

Prompt caching और प्रति अनुरोध सिर्फ़ सबसे प्रासंगिक उदाहरण चुनना — सस्ती prompting अक्सर fine-tuning का लागत-तर्क हटा देती है।