पाठ 22 / 27
Tuned मॉडल serve करना: Merged Weights और Adapters
प्रति कार्य एक merged मॉडल और बदली जा सकने वाली adapters वाले साझा base में चुनें।
सरलता के लिए merge, पैमाने के लिए swap
LoRA adapter को बेस weights में merge किया जा सकता है, जिससे अतिरिक्त latency के बिना सामान्य मॉडल मिलता है पर प्रति कार्य एक पूरी प्रति। वैकल्पिक रूप से GPU memory में एक साझा base रखें और प्रति कार्य या ग्राहक माँग पर छोटी adapters लोड करें; कई serving stacks इसे समर्थन देते हैं, इसीलिए LoRA कई विशेषीकृत रूपों के लिए उपयुक्त है। GPU memory, adapter लोड होने पर cold-start समय, adapters के बीच batching और fallback मॉडल की योजना बनाएँ। Hosted सेवा में आपको शायद सिर्फ़ model id दिखे, बाकी provider सँभालता है; उसकी क़ीमत, rate limits और सेवानिवृत्ति नीति जाँचें।
Serving विकल्प
एक नज़र में समझौते।
merged weights one standalone model per task simple, no adapter overhead more GPU memory per task
shared base + adapters one base + small adapters many variants cheaply adapter load / routing logic
hosted fine-tune provider runs it, you call an id least ops work price, limits, retirement set by providerFallback रखें
अनट्यून prompted मॉडल को fallback route रखें ताकि ख़राब tuned release मिनटों में बंद हो सके।
त्वरित जाँच: कई विशेषीकृत रूपों के लिए LoRA सुविधाजनक क्यों है?
- यह बेस मॉडल हटा देती है
- यह हर मॉडल मुफ़्त कर देती है
- यह GPUs की ज़रूरत हटा देती है
- छोटी adapters एक साझा बेस मॉडल पर बदली जा सकती हैं
Answer
छोटी adapters एक साझा बेस मॉडल पर बदली जा सकती हैं — साझा base पर प्रति-कार्य छोटे deltas memory बचाते हैं।