पाठ 6 / 25

आउटपुट आरक्षित और नियंत्रित करना

उत्तर को जगह और आकार चाहिए।

Max tokens, लंबाई निर्देश और रुकने के बिंदु

सबसे लंबे वैध उत्तर में फ़िट होने वाला अधिकतम आउटपुट tokens मान रखें, और window में वह जगह ख़ाली रखें। उत्तर वाक्य के बीच कटें तो या सीमा बहुत कम है या prompt लंबी बातों को बुलाता है। स्पष्ट लंबाई निर्देश (जैसे तीन bullet points, या 120 शब्दों से कम) और format दें ताकि मॉडल जाने कि कब पूरा हुआ। API का stop reason जाँचें: लंबाई सीमा पर रुका उत्तर अधूरा है और उसे अंतिम उत्तर नहीं मानना चाहिए, ख़ासकर संरचित आउटपुट के लिए।

Stop reason सँभालना (sketch)

Field नाम provider के अनुसार अलग हैं; तर्क मायने रखता है। यहाँ चलाया नहीं गया।

resp = call_model(prompt, max_output_tokens=600)
if resp.stop_reason == "length":        # hit the output limit
    log.warning("truncated answer", request_id=resp.id)
    resp = call_model(prompt + "\nAnswer in at most 5 bullet points.", max_output_tokens=600)
answer = resp.text

Truncation दर ट्रैक करें

गिनें कि उत्तर कितनी बार लंबाई सीमा पर रुकते हैं; बढ़ती दर संकेत है कि prompts या इनपुट बढ़ गए हैं।

त्वरित जाँच: उत्तर लंबाई सीमा पर रुका। क्या सच है?

  • इसका अर्थ है इनपुट ख़ाली था
  • यह हमेशा पूर्ण है
  • इसका अर्थ है मॉडल ने मना किया
  • यह अधूरा हो सकता है और सँभालना चाहिए, अंतिम नहीं मानना
Answer

यह अधूरा हो सकता है और सँभालना चाहिए, अंतिम नहीं मानना — आउटपुट पर भरोसे से पहले stop reason जाँचें।