तकनीक के अंदर - इमर्सिव वॉयस कम्युनिकेशन में सुरक्षा का समाधान

रॉब्लॉक्स अवतारों का विकास
किरण भट्ट, वरिष्ठ निदेशक, इंजीनियरिंग; महेश रामसुब्रमण्यन, वरिष्ठ निदेशक, उत्पाद; और एफी गोएनवान, प्रमुख उत्पाद प्रबंधक के साथ
इंजीनियरिंग के वरिष्ठ निदेशक किरण भट्ट, उत्पाद के वरिष्ठ निदेशक महेश रमासुब्रमण्यन, और प्रमुख उत्पाद प्रबंधक एफी गोएनवान सीईओ डेविड बाज़ुकी के साथ अवतारों के माध्यम से इमर्सिव संचार के भविष्य और इसे शक्ति प्रदान करने के लिए हम जिन तकनीकी चुनौतियों का समाधान कर रहे हैं, उन पर एक नज़र डालने के लिए शामिल हुए। वे विस्तार से चर्चा करेंगे कि अभिव्यक्तिपूर्ण अवतार न केवल हमें डिजिटल रूप से खुद को व्यक्त करने की अनुमति देते हैं, बल्कि आवाज़, चेहरे के भाव और शारीरिक भाषा के माध्यम से अधिक इमर्सिव रूप से संवाद करने में भी सक्षम बनाते हैं।
आपकी टीम किन सबसे बड़े तकनीकी चुनौतियों का सामना कर रही है?
हम अपने उपयोगकर्ताओं के लिए एक सुरक्षित और सकारात्मक अनुभव बनाए रखने को प्राथमिकता देते हैं। सुरक्षा और सभ्यता हमेशा हमारी सर्वोच्च प्राथमिकता होती है, लेकिन वास्तविक समय में इसका प्रबंधन करना एक बड़ी तकनीकी चुनौती हो सकती है। जब भी कोई समस्या होती है, हम इसे वास्तविक समय में समीक्षा करना और कार्रवाई करना चाहते हैं, लेकिन हमारे पैमाने को देखते हुए यह चुनौतीपूर्ण है। इस पैमाने को प्रभावी ढंग से संभालने के लिए, हमें स्वचालित सुरक्षा प्रणालियों का लाभ उठाने की आवश्यकता है।
एक और तकनीकी चुनौती जिस पर हम ध्यान केंद्रित कर रहे हैं, वह है मॉडरेशन के लिए हमारे सुरक्षा उपायों की सटीकता। नीति उल्लंघनों को संबोधित करने और वास्तविक समय में सटीक प्रतिक्रिया प्रदान करने के लिए दो मॉडरेशन दृष्टिकोण हैं: प्रतिक्रियाशील और सक्रिय मॉडरेशन। प्रतिक्रियाशील मॉडरेशन के लिए, हम विभिन्न प्रकार के नीति उल्लंघनों की सटीक पहचान करने के लिए मशीन लर्निंग (एमएल) मॉडल विकसित कर रहे हैं, जो प्लेटफॉर्म पर लोगों की रिपोर्टों पर प्रतिक्रिया करके काम करते हैं। सक्रिय रूप से, हम हमारी नीतियों का उल्लंघन करने वाली संभावित सामग्री का वास्तविक समय में पता लगाने पर काम कर रहे हैं, और उपयोगकर्ताओं को उनके व्यवहार के बारे में शिक्षित कर रहे हैं। बोले गए शब्द को समझना और ऑडियो गुणवत्ता में सुधार करना एक जटिल प्रक्रिया है। हम पहले से ही प्रगति देख रहे हैं, लेकिन हमारा अंतिम लक्ष्य एक अत्यधिक सटीक मॉडल रखना है जो वास्तविक समय में नीति-उल्लंघन करने वाले व्यवहार का पता लगा सके।
इन तकनीकी चुनौतियों से निपटने के लिए हम जिन कुछ अभिनव दृष्टिकोणों और समाधानों का उपयोग कर रहे हैं, वे क्या हैं?
हमने एक एंड-टू-एंड एमएल मॉडल विकसित किया है जो ऑडियो डेटा का विश्लेषण कर सकता है और नीति उल्लंघनों के प्रकार के आधार पर एक विश्वास स्तर प्रदान करता है (जैसे कि यह बदमाशी, अपशब्द, आदि कितनी संभावित है)। इस मॉडल ने स्वचालित रूप से कुछ रिपोर्टों को बंद करने की हमारी क्षमता में काफी सुधार किया है। हम तब कार्रवाई करते हैं जब हमारा मॉडल आश्वस्त होता है और हमें यकीन हो जाता है कि यह इंसानों से बेहतर प्रदर्शन करता है। लॉन्च करने के कुछ ही महीनों के भीतर, हम इस मॉडल से लगभग सभी अंग्रेजी वॉयस दुरुपयोग रिपोर्टों को मॉडरेट करने में सक्षम थे। हमने इन मॉडलों को इन-हाउस विकसित किया है और यह कई ओपन सोर्स तकनीकों और इसके पीछे की तकनीक बनाने के हमारे अपने काम के बीच सहयोग का प्रमाण है।
वास्तविक समय में यह निर्धारित करना कि क्या उपयुक्त है, काफी जटिल लगता है। यह कैसे काम करता है?
प्रणाली को संदर्भ के अनुसार जागरूक बनाने में बहुत विचार किया गया है। हम कार्रवाई करने से पहले समय के साथ पैटर्न भी देखते हैं ताकि हम यह सुनिश्चित कर सकें कि हमारी कार्रवाइयाँ उचित हैं। हमारी नीतियां किसी व्यक्ति की उम्र, वे सार्वजनिक स्थान पर हैं या निजी चैट में, और कई अन्य कारकों के आधार पर सूक्ष्म होती हैं। हम वास्तविक समय में सभ्यता को बढ़ावा देने के नए तरीके खोज रहे हैं और एमएल (ML) इसके केंद्र में है। हमने हाल ही में उपयोगकर्ताओं को हमारी नीतियों की याद दिलाने के लिए स्वचालित पुश सूचनाएं शुरू की हैं। हम किसी व्यक्ति के इरादों को बेहतर ढंग से समझने और व्यंग्य या मज़ाक जैसी चीज़ों को अलग करने के लिए वॉयस टोन जैसे अन्य कारकों पर भी विचार कर रहे हैं। अंत में, हम एक बहुभाषी मॉडल भी बना रहे हैं क्योंकि कुछ लोग कई भाषाएं बोलते हैं या वाक्य के बीच में भी भाषा बदल लेते हैं। इन सबको संभव बनाने के लिए, हमारे पास एक सटीक मॉडल होना चाहिए।
वर्तमान में, हम दुर्व्यवहार के सबसे प्रमुख रूपों, जैसे उत्पीड़न, भेदभाव और अपमानजनक भाषा को संबोधित करने पर ध्यान केंद्रित कर रहे हैं। ये दुर्व्यवहार की अधिकांश रिपोर्टों का गठन करते हैं। हमारा उद्देश्य इन क्षेत्रों में महत्वपूर्ण प्रभाव डालना और एक सभ्य ऑनलाइन बातचीत को बढ़ावा देने और बनाए रखने के लिए उद्योग के मानदंड स्थापित करना है। हम वास्तविक समय में एमएल (ML) के उपयोग की क्षमता के बारे में उत्साहित हैं, क्योंकि यह हमें सभी के लिए एक सुरक्षित और सभ्य अनुभव को प्रभावी ढंग से बढ़ावा देने में सक्षम बनाता है।
रॉब्लॉक्स में हम जिन चुनौतियों को हल कर रहे हैं, वे कैसे अनूठी हैं? हम सबसे पहले क्या हल करने की स्थिति में हैं?
हमारी स्पैशियल वॉइस तकनीक के साथ चैट एक अधिक इमर्सिव अनुभव बनाती है, जो वास्तविक दुनिया के संचार की नकल करती है। उदाहरण के लिए, यदि मैं किसी के बाईं ओर खड़ा हूँ, तो वे मुझे अपने बाएँ कान में सुनेंगे। हम वास्तविक दुनिया में संचार कैसे काम करता है, उसका एक एनालॉग बना रहे हैं और यह एक ऐसी चुनौती है जिसे हम सबसे पहले हल करने की स्थिति में हैं।
एक गेमर होने के नाते, मैंने ऑनलाइन गेमिंग में बहुत सारे उत्पीड़न और धमकाने की घटनाएँ देखी हैं। यह एक ऐसी समस्या है जो अक्सर उपयोगकर्ता की गुमनामी और परिणामों की कमी के कारण अनियंत्रित रह जाती है। हालाँकि, इस संबंध में हम जिन तकनीकी चुनौतियों का सामना कर रहे हैं, वे कुछ क्षेत्रों में अन्य प्लेटफ़ॉर्म द्वारा सामना की जा रही चुनौतियों से अलग हैं। कुछ गेमिंग प्लेटफ़ॉर्म पर, बातचीत केवल टीम के साथियों तक ही सीमित होती है। रॉब्लॉक्स एक सामाजिक वातावरण में घूमने-फिरने के कई तरीके प्रदान करता है जो वास्तविक जीवन की अधिक नकल करता है। एमएल (ML) और रीयल-टाइम सिग्नल प्रोसेसिंग में प्रगति के साथ, हम अपमानजनक व्यवहार का प्रभावी ढंग से पता लगाने और उसे संबोधित करने में सक्षम हैं, जिसका अर्थ है कि हम न केवल एक अधिक यथार्थवादी वातावरण हैं, बल्कि एक ऐसा वातावरण भी हैं जहाँ हर कोई दूसरों के साथ बातचीत करने और जुड़ने के लिए सुरक्षित महसूस करता है। हमारी तकनीक, हमारे इमर्सिव प्लेटफ़ॉर्म, और उपयोगकर्ताओं को हमारी नीतियों के बारे में शिक्षित करने की हमारी प्रतिबद्धता का संयोजन हमें इन चुनौतियों का सीधे तौर पर सामना करने की स्थिति में रखता है।
इस तकनीकी काम को करने से आपने जो कुछ महत्वपूर्ण बातें सीखी हैं, वे क्या हैं?
मुझे लगता है कि मैंने काफी कुछ सीखा है। मैं एक एमएल इंजीनियर नहीं हूँ। मैंने ज्यादातर गेमिंग में फ्रंट एंड पर काम किया है, इसलिए इन मॉडलों के काम करने के तरीके के बारे में मेरी समझ से भी ज़्यादा गहराई तक जाना मेरे लिए बहुत बड़ी सीख रही है। मेरी उम्मीद है कि सभ्यता को बढ़ावा देने के लिए हम जो कदम उठा रहे हैं, वे ऑनलाइन समुदाय में सहानुभूति के उस स्तर को लाएंगे जिसकी कमी रही है।
एक आखिरी सीख यह है कि सब कुछ उस ट्रेनिंग डेटा पर निर्भर करता है जिसे आप इसमें डालते हैं। और डेटा को सटीक बनाने के लिए, कुछ नीति-विरोधी व्यवहारों को वर्गीकृत करने के लिए उपयोग किए जा रहे लेबल पर मनुष्यों को सहमत होना होगा। इस पर प्रशिक्षण देना वास्तव में महत्वपूर्ण है कि वह गुणवत्तापूर्ण डेटा हो जिस पर हर कोई सहमत हो सके। यह एक वास्तव में कठिन समस्या है जिसे हल करना मुश्किल है। आप उन क्षेत्रों को देखना शुरू कर देते हैं जहाँ एमएल (ML) बाकी सब से बहुत आगे है, और फिर अन्य क्षेत्रों को जहाँ यह अभी भी शुरुआती चरण में है। अभी भी कई क्षेत्र हैं जहाँ एमएल (ML) अभी भी विकसित हो रहा है, इसलिए इसकी वर्तमान सीमाओं के प्रति सचेत रहना महत्वपूर्ण है।
आपकी टीम रोब्लॉक्स के किन मूल्यों से सबसे अधिक मेल खाती है?
इस पूरी प्रक्रिया में समुदाय का सम्मान करना हमारा मार्गदर्शक मूल्य है। सबसे पहले, हमें अपने प्लेटफ़ॉर्म पर सभ्यता में सुधार करने और नीति उल्लंघनों को कम करने पर ध्यान केंद्रित करने की आवश्यकता है। इसका समग्र उपयोगकर्ता अनुभव पर महत्वपूर्ण प्रभाव पड़ता है। दूसरा, हमें सावधानीपूर्वक यह विचार करना होगा कि हम इन नई सुविधाओं को कैसे लागू करें। हमें मॉडल में फर्जी सकारात्मक (उदाहरण के लिए, किसी चीज़ को गलत तरीके से दुरुपयोग के रूप में चिह्नित करना) के प्रति सचेत रहने और उपयोगकर्ताओं को गलत तरीके से दंडित करने से बचने की आवश्यकता है। हमारे मॉडलों के प्रदर्शन और उपयोगकर्ता जुड़ाव पर उनके प्रभाव की निगरानी करना महत्वपूर्ण है।
रॉब्लॉक्स और आपकी टीम जिस दिशा में जा रहे हैं, उसके बारे में आपको सबसे ज़्यादा क्या उत्साहित करता है?
हमने सार्वजनिक वॉयस संचार में सुधार करने में महत्वपूर्ण प्रगति की है, लेकिन अभी भी बहुत कुछ किया जाना बाकी है। निजी संचार अन्वेषण के लिए एक रोमांचक क्षेत्र है। मुझे लगता है कि निजी संचार में सुधार करने का एक बड़ा अवसर है, ताकि उपयोगकर्ता अपने करीबी दोस्तों के साथ अपनी बात व्यक्त कर सकें, विभिन्न अनुभवों के दौरान या किसी अनुभव के बीच अपने दोस्तों के साथ बातचीत करते समय वॉयस कॉल कर सकें। मुझे लगता है कि बेहतर उपकरणों के साथ इन समुदायों को बढ़ावा देने का भी अवसर है, जो उपयोगकर्ताओं को स्वयं संगठित होने, समुदायों में शामिल होने, सामग्री साझा करने और विचारों का आदान-प्रदान करने में सक्षम बनाएंगे।
जैसे-जैसे हम बढ़ते रहेंगे, हम इन विस्तारित हो रहे समुदायों का समर्थन करने के लिए अपनी चैट तकनीक का विस्तार कैसे करें? हम जो कर सकते हैं, उसकी तो बस शुरुआत ही कर रहे हैं, और मुझे लगता है कि उद्योग भर में ऑनलाइन संचार और सहयोग की सभ्यता में इस तरह से सुधार करने का मौका है, जैसा पहले कभी नहीं किया गया। सही तकनीक और एमएल क्षमताओं के साथ, हम सभ्य ऑनलाइन संचार के भविष्य को आकार देने के लिए एक अनूठी स्थिति में हैं।


