तकनीक के अंदर - इमर्सिव वॉयस कम्युनिकेशन में सुरक्षा का समाधान

L'évolution des avatars Roblox
Avec Kiran Bhat, directeur principal de l'ingénierie, Mahesh Ramasubramanian, directeur principal des produits, et Effie Goenawan, chef de produit principal
Kiran Bhat, directeur principal de l'ingénierie, Mahesh Ramasubramanian, directeur principal des produits, et Effie Goenawan, chef de produit principal, se joignent au PDG David Baszucki pour évoquer l'avenir de la communication immersive via les avatars et les défis techniques que nous relevons pour la rendre possible. Ils discuteront en détail de la manière dont les avatars expressifs nous permettent non seulement de nous exprimer numériquement, mais aussi de communiquer de manière plus immersive grâce à la voix, aux expressions faciales et au langage corporel.
आपकी टीम किन सबसे बड़े तकनीकी चुनौतियों का सामना कर रही है?
हम अपने उपयोगकर्ताओं के लिए एक सुरक्षित और सकारात्मक अनुभव बनाए रखने को प्राथमिकता देते हैं। सुरक्षा और सभ्यता हमेशा हमारे ध्यान में रहती हैं, लेकिन वास्तविक समय में इसका प्रबंधन करना एक बड़ी तकनीकी चुनौती हो सकती है। जब भी कोई समस्या होती है, हम इसे समीक्षा करना चाहते हैं और वास्तविक समय में कार्रवाई करना चाहते हैं, लेकिन हमारे पैमाने को देखते हुए यह चुनौतीपूर्ण है। इस पैमाने को प्रभावी ढंग से संभालने के लिए, हमें स्वचालित सुरक्षा प्रणालियों का लाभ उठाने की आवश्यकता है।
एक और तकनीकी चुनौती जिस पर हम ध्यान केंद्रित कर रहे हैं, वह मॉडरेशन के लिए हमारे सुरक्षा उपायों की सटीकता है। नीति उल्लंघनों को संबोधित करने और वास्तविक समय में सटीक प्रतिक्रिया प्रदान करने के लिए दो मॉडरेशन दृष्टिकोण हैं: प्रतिक्रियाशील और सक्रिय मॉडरेशन। प्रतिक्रियाशील मॉडरेशन के लिए, हम विभिन्न प्रकार के नीति उल्लंघनों की सटीक पहचान करने के लिए मशीन लर्निंग (एमएल) मॉडल विकसित कर रहे हैं, जो प्लेटफॉर्म पर लोगों की रिपोर्टों पर प्रतिक्रिया करके काम करते हैं। सक्रिय रूप से, हम हमारी नीतियों का उल्लंघन करने वाली संभावित सामग्री का वास्तविक समय में पता लगाने पर काम कर रहे हैं, और उपयोगकर्ताओं को उनके व्यवहार के बारे में शिक्षित कर रहे हैं। बोले गए शब्द को समझना और ऑडियो गुणवत्ता में सुधार करना एक जटिल प्रक्रिया है। हम पहले से ही प्रगति देख रहे हैं, लेकिन हमारा अंतिम लक्ष्य एक अत्यधिक सटीक मॉडल रखना है जो वास्तविक समय में नीति-उल्लंघन करने वाले व्यवहार का पता लगा सके।
इन तकनीकी चुनौतियों से निपटने के लिए हम जिन कुछ अभिनव दृष्टिकोणों और समाधानों का उपयोग कर रहे हैं, वे क्या हैं?
हमने एक एंड-टू-एंड एमएल मॉडल विकसित किया है जो ऑडियो डेटा का विश्लेषण कर सकता है और नीति उल्लंघनों के प्रकार के आधार पर एक विश्वास स्तर प्रदान करता है (जैसे कि यह बदमाशी, अपशब्द, आदि कितनी संभावित है)। इस मॉडल ने स्वचालित रूप से कुछ रिपोर्टों को बंद करने की हमारी क्षमता में काफी सुधार किया है। हम तब कार्रवाई करते हैं जब हमारा मॉडल आश्वस्त होता है और यह सुनिश्चित कर सकता है कि यह मनुष्यों से बेहतर प्रदर्शन करता है। लॉन्च करने के कुछ ही महीनों के भीतर, हम इस मॉडल के साथ लगभग सभी अंग्रेजी वॉयस दुरुपयोग रिपोर्टों को मॉडरेट करने में सक्षम थे। हमने इन मॉडलों को इन-हाउस विकसित किया है और यह कई ओपन सोर्स तकनीकों और इसके पीछे की तकनीक बनाने के लिए हमारे अपने काम के बीच सहयोग का प्रमाण है।
वास्तविक समय में यह निर्धारित करना कि क्या उपयुक्त है, काफी जटिल लगता है। यह कैसे काम करता है?
प्रणाली को संदर्भ के अनुसार जागरूक बनाने के लिए बहुत सोच-विचार किया गया है। हम कार्रवाई करने से पहले समय के साथ पैटर्न को भी देखते हैं ताकि हम यह सुनिश्चित कर सकें कि हमारी कार्रवाइयाँ उचित हैं। हमारी नीतियाँ किसी व्यक्ति की उम्र, इस बात पर कि वे सार्वजनिक स्थान पर हैं या निजी चैट में, और कई अन्य कारकों के आधार पर सूक्ष्म होती हैं। हम वास्तविक समय में सभ्यता को बढ़ावा देने के नए तरीके खोज रहे हैं और एमएल (ML) इसके केंद्र में है। हमने हाल ही में उपयोगकर्ताओं को हमारी नीतियों की याद दिलाने के लिए स्वचालित पुश सूचनाएं शुरू की हैं। हम किसी व्यक्ति के इरादों को बेहतर ढंग से समझने और व्यंग्य या मज़ाक जैसी चीज़ों को अलग करने के लिए वॉयस टोन जैसे अन्य कारकों पर भी विचार कर रहे हैं। अंत में, हम एक बहुभाषी मॉडल भी बना रहे हैं क्योंकि कुछ लोग कई भाषाएं बोलते हैं या वाक्य के बीच में भी भाषा बदल देते हैं। इन सबके संभव होने के लिए, हमारे पास एक सटीक मॉडल होना चाहिए।
वर्तमान में, हम दुर्व्यवहार के सबसे प्रमुख रूपों, जैसे कि उत्पीड़न, भेदभाव और अपमानजनक भाषा को संबोधित करने पर ध्यान केंद्रित कर रहे हैं। ये दुर्व्यवहार की अधिकांश रिपोर्टों का गठन करते हैं। हमारा लक्ष्य इन क्षेत्रों में महत्वपूर्ण प्रभाव डालना और एक सभ्य ऑनलाइन बातचीत को बढ़ावा देने और बनाए रखने के लिए उद्योग के मानदंड स्थापित करना है। हम वास्तविक समय में एमएल (ML) के उपयोग की क्षमता के बारे में उत्साहित हैं, क्योंकि यह हमें सभी के लिए एक सुरक्षित और सभ्य अनुभव को प्रभावी ढंग से बढ़ावा देने में सक्षम बनाता है।
रॉब्लॉक्स में हम जिन चुनौतियों को हल कर रहे हैं, वे कैसे अनूठी हैं? हम सबसे पहले क्या हल करने की स्थिति में हैं?
हमारी स्पैशियल वॉइस तकनीक के साथ चैट एक अधिक इमर्सिव अनुभव बनाती है, जो वास्तविक दुनिया के संचार की नकल करती है। उदाहरण के लिए, यदि मैं किसी के बाईं ओर खड़ा हूँ, तो वे मुझे अपने बाएँ कान में सुनेंगे। हम वास्तविक दुनिया में संचार कैसे काम करता है, उसका एक एनालॉग बना रहे हैं और यह एक ऐसी चुनौती है जिसे हम सबसे पहले हल करने की स्थिति में हैं।
एक गेमर होने के नाते, मैंने ऑनलाइन गेमिंग में बहुत सारे उत्पीड़न और धमकाने की घटनाएँ देखी हैं। यह एक ऐसी समस्या है जो अक्सर उपयोगकर्ता की गुमनामी और परिणामों की कमी के कारण अनियंत्रित रह जाती है। हालाँकि, इस संबंध में हम जिन तकनीकी चुनौतियों का सामना कर रहे हैं, वे कुछ क्षेत्रों में अन्य प्लेटफ़ॉर्म द्वारा सामना की जा रही चुनौतियों से अलग हैं। कुछ गेमिंग प्लेटफ़ॉर्म पर, बातचीत केवल टीम के साथियों तक ही सीमित होती है। रॉब्लॉक्स एक सामाजिक वातावरण में घूमने-फिरने के कई तरीके प्रदान करता है जो वास्तविक जीवन की अधिक नकल करता है। एमएल (ML) और रीयल-टाइम सिग्नल प्रोसेसिंग में प्रगति के साथ, हम अपमानजनक व्यवहार का प्रभावी ढंग से पता लगाने और उसे संबोधित करने में सक्षम हैं, जिसका अर्थ है कि हम न केवल एक अधिक यथार्थवादी वातावरण हैं, बल्कि एक ऐसा वातावरण भी हैं जहाँ हर कोई दूसरों के साथ बातचीत करने और जुड़ने के लिए सुरक्षित महसूस करता है। हमारी तकनीक, हमारे इमर्सिव प्लेटफ़ॉर्म, और उपयोगकर्ताओं को हमारी नीतियों के बारे में शिक्षित करने की हमारी प्रतिबद्धता का संयोजन हमें इन चुनौतियों का सीधे तौर पर सामना करने की स्थिति में रखता है।
इस तकनीकी काम को करने से आपने जो कुछ महत्वपूर्ण बातें सीखी हैं, वे क्या हैं?
मुझे लगता है कि मैंने काफी कुछ सीखा है। मैं एक एमएल इंजीनियर नहीं हूँ। मैंने ज्यादातर गेमिंग में फ्रंट एंड पर काम किया है, इसलिए इन मॉडलों के काम करने के तरीके के बारे में जितना मैंने सीखा है, उससे कहीं ज़्यादा जानना मेरे लिए बहुत बड़ी बात रही है। मेरी उम्मीद है कि सभ्यता को बढ़ावा देने के लिए हम जो कदम उठा रहे हैं, वे ऑनलाइन समुदाय में सहानुभूति के उस स्तर को लाएंगे जिसकी कमी रही है।
एक आखिरी सीख यह है कि सब कुछ उस ट्रेनिंग डेटा पर निर्भर करता है जिसे आप इसमें डालते हैं। और डेटा को सटीक बनाने के लिए, कुछ नीति-विरोधी व्यवहारों को वर्गीकृत करने के लिए उपयोग किए जा रहे लेबल पर मनुष्यों को सहमत होना होगा। इस पर प्रशिक्षण देना वास्तव में महत्वपूर्ण है कि वह गुणवत्तापूर्ण डेटा हो जिस पर हर कोई सहमत हो सके। यह एक वास्तव में कठिन समस्या है जिसे हल करना मुश्किल है। आप उन क्षेत्रों को देखना शुरू कर देते हैं जहाँ एमएल (ML) बाकी सब से बहुत आगे है, और फिर अन्य क्षेत्रों को जहाँ यह अभी भी शुरुआती चरण में है। अभी भी कई क्षेत्र हैं जहाँ एमएल (ML) अभी भी विकसित हो रहा है, इसलिए इसकी वर्तमान सीमाओं के प्रति सचेत रहना महत्वपूर्ण है।
आपकी टीम रोब्लॉक्स के किन मूल्यों से सबसे अधिक मेल खाती है?
इस पूरी प्रक्रिया में समुदाय का सम्मान करना हमारा मार्गदर्शक मूल्य है। सबसे पहले, हमें अपने प्लेटफ़ॉर्म पर सभ्यता में सुधार करने और नीति उल्लंघनों को कम करने पर ध्यान केंद्रित करने की आवश्यकता है। इसका समग्र उपयोगकर्ता अनुभव पर महत्वपूर्ण प्रभाव पड़ता है। दूसरा, हमें यह सावधानीपूर्वक विचार करना होगा कि हम इन नई सुविधाओं को कैसे लागू करते हैं। हमें मॉडल में फर्जी सकारात्मक (उदाहरण के लिए, किसी चीज़ को गलत तरीके से दुरुपयोग के रूप में चिह्नित करना) के प्रति सचेत रहने और उपयोगकर्ताओं को गलत तरीके से दंडित करने से बचने की आवश्यकता है। हमारे मॉडलों के प्रदर्शन और उपयोगकर्ता जुड़ाव पर उनके प्रभाव की निगरानी करना महत्वपूर्ण है।
रॉब्लॉक्स और आपकी टीम जिस दिशा में जा रहे हैं, उसके बारे में आपको सबसे ज़्यादा क्या उत्साहित करता है?
हमने सार्वजनिक वॉयस संचार में सुधार करने में महत्वपूर्ण प्रगति की है, लेकिन अभी भी बहुत कुछ किया जाना बाकी है। निजी संचार अन्वेषण के लिए एक रोमांचक क्षेत्र है। मुझे लगता है कि निजी संचार में सुधार करने का एक बड़ा अवसर है, ताकि उपयोगकर्ता अपने करीबी दोस्तों के साथ अपनी बात व्यक्त कर सकें, विभिन्न अनुभवों के दौरान या किसी अनुभव के बीच अपने दोस्तों के साथ बातचीत करते समय वॉयस कॉल कर सकें। मुझे लगता है कि बेहतर उपकरणों के साथ इन समुदायों को बढ़ावा देने का भी अवसर है, जो उपयोगकर्ताओं को स्वयं संगठित होने, समुदायों में शामिल होने, सामग्री साझा करने और विचारों का आदान-प्रदान करने में सक्षम बनाएंगे।
जैसे-जैसे हम बढ़ते रहेंगे, हम इन विस्तारित हो रहे समुदायों का समर्थन करने के लिए अपनी चैट तकनीक का विस्तार कैसे करें? हम जो कर सकते हैं, उसकी तो बस शुरुआत ही कर रहे हैं, और मुझे लगता है कि उद्योग भर में ऑनलाइन संचार और सहयोग की सभ्यता में इस तरह से सुधार करने का मौका है, जैसा पहले कभी नहीं किया गया है। सही तकनीक और एमएल क्षमताओं के साथ, हम सभ्य ऑनलाइन संचार के भविष्य को आकार देने के लिए एक अनूठी स्थिति में हैं।


