पाठ 19 / 27

प्रशिक्षण डेटा की सुरक्षा, गोपनीयता और licensing

जो प्रशिक्षण में जाता है वह वापस निकल सकता है।

Dataset को जोखिम-सतह मानें

Fine-tuning बेस मॉडल के सुरक्षा व्यवहार को कमज़ोर कर सकती है, हानिरहित दिखते डेटा पर भी, इसलिए बाद में अपने सुरक्षा और इनकार परीक्षण दोबारा चलाएँ। प्रशिक्षण set की कोई भी चीज़ रटकर दोहराई जा सकती है: secrets, credentials और व्यक्तिगत डेटा हटाएँ, ग्राहक डेटा की किसी भी प्रति जैसे गोपनीयता नियम लागू करें, और रिकॉर्ड रखें कि डेटा कहाँ से आया और उपयोग की अनुमति है या नहीं (licences, ग्राहक शर्तें, provider शर्तें)। दूषित या उपयोगकर्ता-प्रदत्त उदाहरण बुरा व्यवहार बो सकते हैं, इसलिए आपकी टीम के बाहर से आया डेटा जाँचें।

प्रशिक्षण-पूर्व डेटा checklist

हर dataset आपकी मशीन छोड़ने से पहले चलाएँ।

[ ] secrets / API keys / passwords scanned and removed
[ ] personal data removed or masked, per our privacy policy
[ ] source and licence recorded for every data source
[ ] provider terms allow training on these inputs/outputs
[ ] external or user-submitted rows reviewed for poisoning
[ ] safety / refusal tests ready to re-run after training
[ ] dataset version and hash saved

Scan करें, भरोसा नहीं

हर row पर secrets और व्यक्तिगत डेटा का स्वचालित scan चलाएँ; सिर्फ़ हाथ की समीक्षा row 8,412 की एक API key चूक जाती है।

त्वरित जाँच: Fine-tuning के बाद सुरक्षा परीक्षण दोबारा क्यों चलाएँ?

  • वे वैकल्पिक marketing हैं
  • सुरक्षा परीक्षण मॉडल प्रशिक्षित करते हैं
  • Tuning हमेशा सुरक्षा सुधारती है
  • Tuning बेस मॉडल का सुरक्षा व्यवहार कमज़ोर कर सकती है
Answer

Tuning बेस मॉडल का सुरक्षा व्यवहार कमज़ोर कर सकती है — Weights में हर बदलाव के बाद सुरक्षा जाँचें।