SkillByAIइंटरैक्टिव संस्करण खोलें →

पाठ 22 / 27

Tuned मॉडल serve करना: Merged Weights और Adapters

प्रति कार्य एक merged मॉडल और बदली जा सकने वाली adapters वाले साझा base में चुनें।

सरलता के लिए merge, पैमाने के लिए swap

LoRA adapter को बेस weights में merge किया जा सकता है, जिससे अतिरिक्त latency के बिना सामान्य मॉडल मिलता है पर प्रति कार्य एक पूरी प्रति। वैकल्पिक रूप से GPU memory में एक साझा base रखें और प्रति कार्य या ग्राहक माँग पर छोटी adapters लोड करें; कई serving stacks इसे समर्थन देते हैं, इसीलिए LoRA कई विशेषीकृत रूपों के लिए उपयुक्त है। GPU memory, adapter लोड होने पर cold-start समय, adapters के बीच batching और fallback मॉडल की योजना बनाएँ। Hosted सेवा में आपको शायद सिर्फ़ model id दिखे, बाकी provider सँभालता है; उसकी क़ीमत, rate limits और सेवानिवृत्ति नीति जाँचें।

Serving विकल्प

एक नज़र में समझौते।

merged weights        one standalone model per task     simple, no adapter overhead   more GPU memory per task
shared base + adapters one base + small adapters         many variants cheaply         adapter load / routing logic
hosted fine-tune       provider runs it, you call an id  least ops work              price, limits, retirement set by provider

Fallback रखें

अनट्यून prompted मॉडल को fallback route रखें ताकि ख़राब tuned release मिनटों में बंद हो सके।

त्वरित जाँच: कई विशेषीकृत रूपों के लिए LoRA सुविधाजनक क्यों है?

  • यह बेस मॉडल हटा देती है
  • यह हर मॉडल मुफ़्त कर देती है
  • यह GPUs की ज़रूरत हटा देती है
  • छोटी adapters एक साझा बेस मॉडल पर बदली जा सकती हैं
Answer

छोटी adapters एक साझा बेस मॉडल पर बदली जा सकती हैं — साझा base पर प्रति-कार्य छोटे deltas memory बचाते हैं।