पाठ 2 / 25

Tokens और Context Window

सब कुछ tokens में गिना जाता है, उत्तर समेत।

Window एक कड़ी सीमा है

मॉडल tokens, यानी शब्दों के टुकड़े, पढ़ते और लिखते हैं। Context window एक call पर इनपुट और आउटपुट मिलाकर अधिकतम tokens है; उससे आगे का अस्वीकार या कट जाता है। अंग्रेज़ी में token अक्सर लगभग चार अक्षर का होता है, पर code, संख्याएँ और अन्य भाषाएँ (हिंदी समेत) प्रति शब्द कहीं अधिक tokens ले सकती हैं। क़ीमत और latency भी tokens के साथ बढ़ती हैं। Budget के लिए मोटा अनुमान ठीक है; सीमाओं के लिए मॉडल का अपना tokenizer या API से लौटा token count उपयोग करें। बड़ी windows का अर्थ यह नहीं कि उन्हें भरें: लंबे इनपुट महँगे होते हैं और मॉडल को विवरण चूकने पर मजबूर कर सकते हैं।

दो मोटे token अनुमान, चलाकर

मैंने यह सादे Python 3 (सिर्फ़ standard library) से चलाया; डेटा गढ़ा हुआ उदाहरण डेटा है। 15 शब्दों के 83-अक्षर वाक्य के अनुमान 21 और 20 tokens आते हैं। ये अंगूठे के नियम सिर्फ़ योजना के लिए हैं; असली tokenizer तय करता है।

text = "Context engineering decides what the model sees, in what order, and how much of it."
words = len(text.split())
chars = len(text)
print("words:", words, "| characters:", chars)
print("rough token estimate (chars / 4):", round(chars / 4))
print("rough token estimate (words * 1.3):", round(words * 1.3))
print("use the real tokenizer of your model for exact counts")

Output:

words: 15 | characters: 83
rough token estimate (chars / 4): 21
rough token estimate (words * 1.3): 20
use the real tokenizer of your model for exact counts

हिंदी अलग से मापें

कई भाषाओं में सेवा दें तो हर एक के असली नमूनों पर tokens गिनें; कुछ लिपियों में वही संदेश कई गुना महँगा हो सकता है।

त्वरित जाँच: Context window में क्या गिना जाता है?

  • इनपुट tokens और उत्पन्न आउटपुट tokens
  • सिर्फ़ उपयोगकर्ता का प्रश्न
  • सिर्फ़ system prompt
  • सिर्फ़ images
Answer

इनपुट tokens और उत्पन्न आउटपुट tokens — उत्तर के लिए भी जगह रखें।