पाठ 6 / 25
आउटपुट आरक्षित और नियंत्रित करना
उत्तर को जगह और आकार चाहिए।
Max tokens, लंबाई निर्देश और रुकने के बिंदु
सबसे लंबे वैध उत्तर में फ़िट होने वाला अधिकतम आउटपुट tokens मान रखें, और window में वह जगह ख़ाली रखें। उत्तर वाक्य के बीच कटें तो या सीमा बहुत कम है या prompt लंबी बातों को बुलाता है। स्पष्ट लंबाई निर्देश (जैसे तीन bullet points, या 120 शब्दों से कम) और format दें ताकि मॉडल जाने कि कब पूरा हुआ। API का stop reason जाँचें: लंबाई सीमा पर रुका उत्तर अधूरा है और उसे अंतिम उत्तर नहीं मानना चाहिए, ख़ासकर संरचित आउटपुट के लिए।
Stop reason सँभालना (sketch)
Field नाम provider के अनुसार अलग हैं; तर्क मायने रखता है। यहाँ चलाया नहीं गया।
resp = call_model(prompt, max_output_tokens=600)
if resp.stop_reason == "length": # hit the output limit
log.warning("truncated answer", request_id=resp.id)
resp = call_model(prompt + "\nAnswer in at most 5 bullet points.", max_output_tokens=600)
answer = resp.textTruncation दर ट्रैक करें
गिनें कि उत्तर कितनी बार लंबाई सीमा पर रुकते हैं; बढ़ती दर संकेत है कि prompts या इनपुट बढ़ गए हैं।
त्वरित जाँच: उत्तर लंबाई सीमा पर रुका। क्या सच है?
- इसका अर्थ है इनपुट ख़ाली था
- यह हमेशा पूर्ण है
- इसका अर्थ है मॉडल ने मना किया
- यह अधूरा हो सकता है और सँभालना चाहिए, अंतिम नहीं मानना
Answer
यह अधूरा हो सकता है और सँभालना चाहिए, अंतिम नहीं मानना — आउटपुट पर भरोसे से पहले stop reason जाँचें।