# Tuned मॉडल serve करना: Merged Weights और Adapters — Fine-tuning बनाम Prompting

Source: https://www.skillbyai.com/hi/fine-tuning/o-serving

> प्रति कार्य एक merged मॉडल और बदली जा सकने वाली adapters वाले साझा base में चुनें।

## सरलता के लिए merge, पैमाने के लिए swap

LoRA adapter को बेस weights में **merge** किया जा सकता है, जिससे अतिरिक्त latency के बिना सामान्य मॉडल मिलता है पर प्रति कार्य एक पूरी प्रति। वैकल्पिक रूप से GPU memory में एक **साझा base** रखें और प्रति कार्य या ग्राहक माँग पर **छोटी adapters** लोड करें; कई serving stacks इसे समर्थन देते हैं, इसीलिए LoRA कई विशेषीकृत रूपों के लिए उपयुक्त है। GPU memory, adapter लोड होने पर cold-start समय, adapters के बीच batching और fallback मॉडल की योजना बनाएँ। Hosted सेवा में आपको शायद सिर्फ़ model id दिखे, बाकी provider सँभालता है; उसकी क़ीमत, rate limits और सेवानिवृत्ति नीति जाँचें।

## Serving विकल्प

एक नज़र में समझौते।

```text
merged weights        one standalone model per task     simple, no adapter overhead   more GPU memory per task
shared base + adapters one base + small adapters         many variants cheaply         adapter load / routing logic
hosted fine-tune       provider runs it, you call an id  least ops work              price, limits, retirement set by provider
```

## Fallback रखें

अनट्यून prompted मॉडल को fallback route रखें ताकि ख़राब tuned release मिनटों में बंद हो सके।

**Quiz:** कई विशेषीकृत रूपों के लिए LoRA सुविधाजनक क्यों है?

- [ ] यह बेस मॉडल हटा देती है
- [ ] यह हर मॉडल मुफ़्त कर देती है
- [ ] यह GPUs की ज़रूरत हटा देती है
- [x] छोटी adapters एक साझा बेस मॉडल पर बदली जा सकती हैं

*Answer:* छोटी adapters एक साझा बेस मॉडल पर बदली जा सकती हैं. साझा base पर प्रति-कार्य छोटे deltas memory बचाते हैं।
