हम संभावित हानिकारक वास्तविक परिणामों (गैर-दुर्भावनापूर्ण परिस्थितियों में) को समझने और ऐसी प्रतिक्रिया प्राप्त करने में विशेष रूप से रुचि रखते हैं जो हमें नए luckystar जोखिमों को समझने और उन्हें कम करने के तरीकों की पहचान करने में मदद करेगी। उदाहरण के लिए, मानव प्रतिक्रिया सुदृढ़ीकरण शिक्षण (HFRL) के कार्यान्वयन के बाद त्रुटिपूर्ण और अवांछित परिणामों में उल्लेखनीय कमी आई है। GPT-3 और Codex जैसे पिछले मॉडलों के उपयोग ने इस संस्करण में लागू किए गए सुरक्षा उपायों को बेहतर बनाने में महत्वपूर्ण भूमिका निभाई है।
हमने मॉडल को प्रशिक्षित करने के लिए मानव प्रतिक्रिया सुदृढ़ीकरण अधिगम (HFRL) का उपयोग किया (InstructGPT के समान विधियों का प्रयोग करते हुए), हालांकि हमने डेटा संग्रह को थोड़ा अलग तरीके से कॉन्फ़िगर किया। हमने उपयोगकर्ताओं को उपयोगकर्ता इंटरफ़ेस के माध्यम से मॉडल द्वारा उत्पन्न समस्याग्रस्त परिणामों (साथ ही बाहरी सामग्री फ़िल्टर से प्राप्त किसी भी गलत सकारात्मक या नकारात्मक परिणाम) की रिपोर्ट करने के लिए प्रोत्साहित किया, जो इंटरफ़ेस का ही एक हिस्सा है। ऐसा करने के लिए, हमने AI प्रशिक्षकों द्वारा चैटबॉट के साथ की गई बातचीत का उपयोग करके मॉडल द्वारा लिखे गए संदेश का यादृच्छिक रूप से चयन किया, कई वैकल्पिक नमूने निकाले और AI प्रशिक्षकों से उन्हें रैंक करने के लिए कहा। सुदृढ़ीकरण अधिगम के लिए एक पुरस्कार मॉडल बनाने के लिए, हमें तुलनात्मक डेटा एकत्र करने की आवश्यकता थी – अर्थात्, गुणवत्ता के आधार पर रैंक किए गए दो या अधिक मॉडल प्रतिक्रियाएँ। प्रशिक्षक प्रतिक्रियाएँ तैयार करने में सहायता के लिए मॉडल के सुझावों का संदर्भ ले सकते थे। पिछले मॉडलों ने हमें इस मॉडल को बेहतर बनाने में मदद की – और हम इस संस्करण से सीखे गए सबक का उपयोग करके अधिक शक्तिशाली प्रणालियाँ विकसित करने की आशा करते हैं।
हमें उम्मीद है कि ChatGPT को उपयोगकर्ताओं के लिए उपलब्ध कराने से हमें उन मुद्दों पर बहुमूल्य जानकारी जुटाने में मदद मिलेगी जिनकी पहचान हमने अभी तक नहीं की है। हम मानते हैं कि अभी भी कई सीमाएँ हैं, इसलिए हम ऊपर बताए गए पहलुओं को बेहतर बनाने के लिए अपने मॉडलों को नियमित रूप से अपडेट करने का इरादा रखते हैं। ChatGPT का वर्तमान शोध-चरण संस्करण OpenAI में हमारे द्वारा अपनाई जाने वाली पुनरावर्ती तैनाती प्रक्रिया का नवीनतम चरण है, जिसका उद्देश्य अधिक सुरक्षित AI सिस्टम प्रदान करना है। फिर हम इस संवाद डेटासेट को InstructGPT डेटासेट के साथ मिलाकर इसे संवादात्मक प्रारूप में परिवर्तित करते हैं।

आप 3.5 सीरीज़ के बारे में अधिक जानकारी यहाँ पा सकते हैं (एक नई विंडो में खुलता है)। इन रिवॉर्ड मॉडल्स के आधार पर, हम प्रॉक्सिमेट पॉलिसी ऑप्टिमाइजेशन का उपयोग करके मॉडल को परिष्कृत कर सकते हैं। ChatGPT, InstructGPT का एक सिस्टर मॉडल है जिसे हमने प्रॉम्प्ट-आधारित निर्देशों का पालन करने और विस्तृत प्रतिक्रियाएँ प्रदान करने के लिए प्रशिक्षित किया है। इस प्रारूप के कारण (ChatGPT उपयोगकर्ताओं के स्पष्टीकरण संबंधी प्रश्नों का उत्तर दे सकता है), यह त्रुटियों को स्वीकार कर सकता है, उन मान्यताओं को चुनौती दे सकता है जिन्हें वह गलत मानता है, और अनुचित अनुरोधों को अस्वीकार कर सकता है।
ChatGPT (संक्षेप में) के लॉन्च पर उपयोगकर्ताओं की प्रतिक्रिया जानने के लिए हम उत्सुक हैं, ताकि इसकी खूबियों और सुधार के क्षेत्रों की पहचान की जा सके। ChatGPT में हमने एक मॉडल को प्रशिक्षित किया है जो उपयोगकर्ताओं के साथ इस तरह से बातचीत करता है जैसे कि वह उनसे बातचीत कर रहा हो। WilmerHale के शोध के पूरा होने के बाद, Altman और Brockman एक बार फिर OpenAI का नेतृत्व कर रहे हैं। हमने GPT-3.5 श्रृंखला के एक मॉडल का उपयोग करके ChatGPT को अनुकूलित किया है, जिसका प्रशिक्षण 2022 की शुरुआत में पूरा हुआ था।