इस साइट की सामग्री का अनुवाद कृत्रिम बुद्धिमत्ता (AI) या मशीन अनुवाद तकनीक का उपयोग करके किया गया है, और इसमें त्रुटियाँ हो सकती हैं.

Skip to content

वॉयस सुरक्षा के लिए एमएल की तैनाती

हमारा मिशन एक अरब लोगों को आशावाद और सभ्यता के साथ जोड़ना है, जिसके लिए हमें लोगों को एक-दूसरे के साथ वास्तव में एक साथ होने का एहसास कराने में मदद करनी होगी। 3D इमर्सिव दुनिया में, भौतिक दुनिया की तरह ही, स्थायी दोस्ती और संबंध बनाने में मानव आवाज से अधिक प्रामाणिक या शक्तिशाली कुछ भी नहीं है। लेकिन हम अपने समुदाय को सुरक्षित और सभ्य रखते हुए Roblox पर वॉयस संचार की इमर्सिवनेस और समृद्धि को कैसे बढ़ाएं?

इस ब्लॉग में, हम बताएँगे कि हमने रीयल-टाइम सेफ्टी को कैसे जीवंत किया, जो एक एंड-टू-एंड मशीन लर्निंग (एमएल) मॉडल है—जो प्रतिदिन लाखों मिनट की वॉयस गतिविधि के पैमाने पर काम करता है—और यह वॉयस संचार में नीति उल्लंघनों का पता मानवीय मॉडरेशन की तुलना में अधिक सटीक रूप से लगाता है। इस सिस्टम के आउटपुट को एक अन्य मॉडल में डाला जाता है, जो उचित परिणाम निर्धारित करता है। परिणाम मॉडल उन लोगों के लिए सूचनाएं ट्रिगर करता है जिन्होंने हमारी नीतियों का उल्लंघन किया है, शुरुआत में चेतावनियों के साथ और यदि व्यवहार जारी रहता है तो फिर और भी सख्त कार्रवाई के साथ।

यह एंड-टू-एंड रीयल-टाइम सेफ्टी सिस्टम एक साहसिक लक्ष्य था क्योंकि हम उद्योग में उपयोगकर्ताओं को बहुभाषी, लगभग रीयल-टाइम वॉयस सुरक्षा सुविधाएँ प्रदान करने वाले शुरुआती लोगों में से एक हैं। वॉयस वर्गीकरण ऑडियो शैली, जिसमें वॉल्यूम और टोन शामिल हैं, और सामग्री, जिसमें बोले गए शब्द शामिल हैं, दोनों पर निर्भर करता है। हमें यह साझा करते हुए खुशी हो रही है कि हमने इस प्रणाली को लगभग शून्य पूर्व स्वचालन—प्रभावी रूप से शून्य लेबल वाले डेटा और कोई मॉडल नहीं—से विकसित किया, और वास्तविक समय की वॉयस सुरक्षा के लिए शून्य से 60 तक पहुँचे।

और अंत में, हम अपना पहला ओपन-सोर्स मॉडल साझा करने के लिए उत्साहित हैं, जो हमारे वॉयस सेफ्टी मॉडलों में से एक है। इस मॉडल को ओपन-सोर्स करके और इसे व्यावसायिक उपयोग के लिए उपलब्ध कराकर, हम नीति उल्लंघन का पता लगाने के लिए एक उद्योग मानक प्रदान करने की उम्मीद करते हैं जो वॉयस सेफ्टी के लिए नए एमएल (ML) मॉडल के विकास को गति दे सकता है। यह ओपन-सोर्स मॉडल हमारा पहला संस्करण है, और तब से हमने महत्वपूर्ण सुधार किए हैं जिनका हम वर्तमान में परीक्षण कर रहे हैं।

डेटा की कमी को दूर करना

हमने अपनी एमएल (ML) पहलों की शुरुआत कई कंपनियों की तरह ही की—प्रशिक्षण के लिए उपलब्ध डेटा की गुणवत्ता का आकलन करके और अपने मॉडलों का मूल्यांकन करके। आदर्श डेटासेट पेयरिंग में वॉयस अटरेंस के साथ-साथ उस अटरेंस के लिए उच्च-गुणवत्ता वाला लेबल किया गया सुरक्षा वर्गीकरण शामिल होगा। हालाँकि, जब हमने शुरुआत की, तो हमारे पास लगभग कोई बड़े पैमाने पर मानव-लेबल किया गया वास्तविक-विश्व डेटा नहीं था। एक पर्यवेक्षित दृष्टिकोण का उपयोग करके उच्च-गुणवत्ता वाले वॉयस सुरक्षा पहचान मॉडल को प्रशिक्षित करने के लिए, हमें प्रत्येक भाषा के लिए हजारों घंटे के ऑडियो डेटा की आवश्यकता थी जिसे हम समर्थन करते थे, जिसे इकट्ठा करने में वर्षों लग जाते और जो संसाधन और समय की दृष्टि से अत्यधिक महंगा होता।

हजारों घंटे के हाथ से लेबल किए गए डेटा पर निर्भर रहने के बजाय, हमने कई अधिक कुशल तरीके विकसित किए:

  • प्रशिक्षण के लिए मशीन-लेबल डेटा। प्रशिक्षण के लिए उत्तम हस्त-लेबल डेटा की खोज में अटके रहने के बजाय, हमने वॉयस उच्चारणों के मशीन लेबलिंग से प्रशिक्षण डेटा की बड़ी मात्रा का विकल्प चुना। कम पर्यवेक्षण के साथ मशीन-लेबल डेटा की बड़ी मात्रा का उपयोग करने से ऐसे प्रशिक्षण मॉडल बने जो लेबल में कुछ शोर के प्रति भी मजबूत थे। इस दृष्टिकोण को सफल बनाने की कुंजी बेहतरीन ओपन-सोर्स स्पीच-टू-टेक्स्ट लाइब्रेरियों तक पहुंच और लोगों के लिखित संचार में सामुदायिक मानक उल्लंघनों का पता लगाने के लिए एमएल (ML) का उपयोग करने का वर्षों का अनुभव था। इस मशीन लेबलिंग दृष्टिकोण ने हमें वर्षों के बजाय हफ्तों में अपने मॉडलों के लिए आवश्यक प्रशिक्षण डेटा की मात्रा को लेबल करने की अनुमति दी।
  • मूल्यांकन के लिए मानव-लेबल किया गया डेटा। यद्यपि उच्च-गुणवत्ता वाला फिर भी अपूर्ण मशीन-लेबल किया गया डेटा एक उच्च-प्रदर्शन मॉडल को प्रशिक्षित करने के लिए पर्याप्त था, हमें परिणामी मॉडल के अंतिम सत्यापन के लिए मशीन लेबल पर भरोसा नहीं था। तो, अगला सवाल यह था कि हमें मूल्यांकन के लिए पर्याप्त मानव-लेबल किया गया डेटा कहाँ से मिल सकता है। सौभाग्य से, जबकि समय पर प्रशिक्षण के लिए पर्याप्त मानव-लेबल डेटा इकट्ठा करना असंभव था, हमारे इन-हाउस मॉडरेटरों का उपयोग करके हमारे मॉडल के मूल्यांकन के लिए पर्याप्त डेटा इकट्ठा करना संभव था, जो पहले से ही Roblox पर लोगों से आने वाली दुरुपयोग की रिपोर्टों को वर्गीकृत कर रहे थे और मैन्युअल रूप से परिणाम दे रहे थे। इससे हमें दोनों दुनिया का सर्वश्रेष्ठ लाभ उठाने का मौका मिला: मशीन-लेबल किया गया प्रशिक्षण डेटा जो एक उच्च-प्रदर्शन मॉडल बनाने के लिए पर्याप्त अच्छा और प्रचुर मात्रा में था, और मानव-लेबल किया गया मूल्यांकन डेटा जो मात्रा में बहुत छोटा था लेकिन हमें यह विश्वास दिलाने के लिए पर्याप्त था कि मॉडल वास्तव में काम करता है।

एक और क्षेत्र जहाँ हमें डेटा की कमी का सामना करना पड़ा, वह नीति उल्लंघन श्रेणियों में था जहाँ हमारी प्रसार दर बहुत कम है, जैसे कि ड्रग्स और शराब या आत्म-हानि के संदर्भ। इस मुद्दे को हल करने के लिए, हमने कई कम-प्रसार वाली श्रेणियों को एक "अन्य" श्रेणी में जोड़ दिया। परिणामस्वरूप, हमारा अंतिम मॉडल अपशब्द, बदमाशी, भेदभाव, डेटिंग और "अन्य" जैसी श्रेणियों की पहचान कर सका। इन "अन्य" श्रेणियों को समझने के लिए, ताकि हम अपने समुदाय की बेहतर रक्षा कर सकें और Roblox पर सुरक्षित और सभ्य बातचीत सुनिश्चित कर सकें, हम और उदाहरणों के लिए इनकी निगरानी करना जारी रखेंगे। समय के साथ, जैसे-जैसे उन उपश्रेणियों में प्रशिक्षण उदाहरणों की संख्या एक महत्वपूर्ण स्तर तक पहुँच जाएगी, "अन्य" में मौजूद उपश्रेणियाँ भी नामित श्रेणियाँ बन जाएँगी।

प्रशिक्षण डेटा के लिए मशीन लेबलिंग पाइपलाइन

हमने वॉयस चैट अनुक्रमों से उच्च-गुणवत्ता वाले लेबल निकालने के लिए एक पूरी तरह से स्वचालित मशीन लेबलिंग पाइपलाइन डिज़ाइन की है। हमारी पाइपलाइन में तीन चरण होते हैं:

  1. ऑडियो चंक विभाजन। पाइपलाइन का पहला चरण वाक्यों के बीच मौन की अवधि का पता लगते ही ऑडियो को चंक्स, या छोटे खंडों में विभाजित करने से संबंधित है। यह हमें नीति का उल्लंघन करने वाली सामग्री की पहचान करने और उसे अधिक कुशलता से लेबल करने की अनुमति देता है।
  2. ऑडियो प्रतिलेखन। पाइपलाइन का दूसरा चरण इन ऑडियो चंक्स को एक स्वचालित भाषण मान्यता (ASR) मॉडल का उपयोग करके टेक्स्ट में बदलने से बना है। हम सार्वजनिक रूप से उपलब्ध ओपन सोर्स ASR मॉडल का उपयोग करते हैं।
  3. टेक्स्ट वर्गीकरण। पाइपलाइन का अंतिम चरण हमारे इन-हाउस टेक्स्ट फ़िल्टर का उपयोग करके ट्रांसक्रिप्ट किए गए टेक्स्ट का वर्गीकरण करना है। यह फ़िल्टर टेक्स्ट-आधारित संचार में अनुचित सामग्री का पता लगाने और उसे ब्लॉक करने के लिए डिज़ाइन किया गया है। हमने फ़िल्टर को ट्रांसक्राइब किए गए ऑडियो डेटा के साथ काम करने के लिए अनुकूलित किया, जिससे हम ऑडियो चंक्स को नीति-उल्लंघन वर्गों और कीवर्ड के साथ लेबल कर सकें। टेक्स्ट फ़िल्टर एक एन्सेम्बल मॉडल है जिसे मानव-लेबल किए गए नीति-उल्लंघन टेक्स्ट डेटा पर प्रशिक्षित किया गया है, जिसमें एक विस्तारित DistilBERT मॉडल और नियमित अभिव्यक्ति नियम शामिल हैं।

यह ध्यान रखना महत्वपूर्ण है कि इस पाइपलाइन का उपयोग केवल हमारे अंतिम उत्पादन मॉडल के लिए प्रशिक्षण डेटा उत्पन्न करने के लिए किया गया था। हालांकि, आप सोच सकते हैं कि अगर पहले से ही एक पाइपलाइन मौजूद है जो हमें चाहिए वाले लेबल उत्पन्न करती है, तो मॉडल को प्रशिक्षित करने की क्या आवश्यकता है? इसका उत्तर दक्षता है—हमें बहुत कम समय में अत्यधिक सटीक होने की आवश्यकता है। Roblox के पैमाने पर, सभी वॉयस संचार को ट्रांसक्रिप्ट करने के लिए ASR को कॉल करना अत्यधिक धीमा और संसाधन-गहन होगा। हालाँकि, इस डेटा से प्रशिक्षित एक कॉम्पैक्ट ML मॉडल, जिसे बिना पूर्ण ट्रांसक्रिप्शन के वॉयस संचार में नीति उल्लंघनों का पता लगाने के लिए विशेष रूप से डिज़ाइन किया गया है, उतना ही सटीक है, फिर भी काफी तेज़ है और इसे Roblox के पैमाने पर उपयोग किया जा सकता है।

मशीन लेबलिंग पाइपलाइन का स्केलिंग

अधिकांश बड़ी AI पहलों में, गुणवत्तापूर्ण प्रशिक्षण डेटा प्राप्त करने की प्रक्रिया स्वयं एक प्रोडक्शन एमएल सिस्टम है, जिसे शून्य से बनाना पड़ता है। इस परियोजना के लिए, हमें अपनी मशीन लेबलिंग पाइपलाइन को 24/7 अपटाइम और हजारों समवर्ती CPU या GPU की समान संख्या तक स्केल करने की क्षमता के साथ एक प्रथम-श्रेणी के प्रोडक्शन सिस्टम के रूप में विकसित करने की आवश्यकता थी। हमने हजारों CPU कोर के साथ एक प्रशिक्षण डेटा क्लस्टर लागू किया जो मशीन लेबल उत्पन्न करने के लिए आने वाली ऑडियो स्ट्रीम को समानांतर में स्वचालित रूप से संसाधित करता है। अधिकतम थ्रूपुट के लिए इस सिस्टम को त्रुटिlessly चलाना था, और किसी भी गलती या डाउनटाइम के कारण प्रशिक्षण डेटा जेनरेशन में दिनों या हफ्तों का समय बर्बाद हो सकता था।

नीचे उस आर्किटेक्चर का एक उच्च-स्तरीय अवलोकन दिया गया है जिसने हमें कुछ ही हफ्तों में दसियों हज़ार ऑडियो घंटों को मशीन लेबल करने के लिए आवश्यक पैमाने का समर्थन दिया। यहाँ मुख्य बात यह थी कि हमारी प्रोसेसिंग के प्रमुख बिंदुओं पर कतारों (queues) में निवेश करने से हम कई मशीनों में वर्कर थ्रेड्स को क्षैतिज रूप से स्केल करके बोतल की गर्दन (bottlenecks) को दूर कर पाए। इन वर्कर थ्रेड्स ने पिछले खंड में उल्लिखित ऑडियो चंक विभाजन, ऑडियो ट्रांसक्रिप्शन और टेक्स्ट वर्गीकरण के चरणों को पूरा किया।

एमएल आर्किटेक्चर

हमारे मॉडल खोज के लिए एक केंद्रीय आवश्यकता कम विलंबता थी, यानी, मॉडल इंफरेंस के लिए लगभग वास्तविक-समय की गति, जिसने हमें ऐसी आर्किटेक्चर की ओर ले गया जो सीधे कच्चे ऑडियो पर काम करती हैं और एक स्कोर लौटाती हैं। हम ट्रांसफॉर्मर-आधारित आर्किटेक्चर का उपयोग करते हैं, जो अनुक्रम सारांश के लिए बहुत अच्छी तरह से काम करती हैं और प्राकृतिक भाषा प्रसंस्करण (एनएलपी) और ऑडियो मॉडलिंग के लिए उद्योग में बहुत सफल हैं। हमारी चुनौती एक ऐसा संतुलन बिंदु खोजना था जो जटिलता और कम-विलंबता वाले इन्फरेंस के बीच संतुलन बनाए—यानी, कई भाषाओं और उच्चारणों को संभालना, पृष्ठभूमि शोर के प्रति मजबूती, और ऑडियो गुणवत्ता, साथ ही हमारे उत्पाद की विलंबता संबंधी बाधाओं को पूरा करना।

मॉडल चयन

एक तत्काल डिज़ाइन प्रश्न यह निर्धारित करना था कि ट्रांसफॉर्मर मॉडल को प्रशिक्षित करने के लिए आवश्यक संदर्भ विंडो का आकार क्या है। हमने कई दिनों के उपयोग के दौरान वॉयस चैट डेटा में बोले गए वाक्यांशों की लंबाई का हिस्टोग्राम देखा और यह निर्धारित किया कि 15-सेकंड की विंडो विलंबता और वर्गीकरण के लिए आवश्यक पर्याप्त संदर्भ के बीच संतुलन प्रदान करती है। नीति उल्लंघनों की अनुपस्थिति का पता लगाने के लिए हम "नो-वॉयलेशन" (no-violation) को एक श्रेणी के रूप में उपयोग करते हैं। चूंकि एक ऑडियो क्लिप में कई प्रकार के उल्लंघन हो सकते हैं, इसलिए यह कार्य स्वाभाविक रूप से एक पारंपरिक मल्टीक्लास वर्गीकरण समस्या के बजाय मल्टीलेबल बन जाता है। हमने इस कार्य के लिए हेड लेयर्स सहित पूरे नेटवर्क को बाइनरी क्रॉस-एंट्रॉपी (BCE) लॉस के साथ फाइन-ट्यून किया। 

कैप्शन: चैट डेटा से वॉयस उच्चारणों का हिस्टोग्राम, जो दिखाता है कि 75 प्रतिशत उच्चारण 15 सेकंड से कम के हैं।

हमने ऑडियो अनुसंधान समुदाय से कई लोकप्रिय ओपन सोर्स एन्कोडर मॉडल का मूल्यांकन किया और अपनी पसंद को WavLM और Whisper तक सीमित कर दिया। हमारा पहला प्रयोग 2,300 घंटे के Roblox मशीन-लेबल वाले वॉयस डेटा के साथ प्री-ट्रेन्ड WavLM बेस+ को फाइन-ट्यून करना और दो वास्तविक-विश्व मूल्यांकन डेटासेट पर वर्गीकरण परिणामों का मूल्यांकन करना था। हमें बहुत ही उत्साहजनक वर्गीकरण परिणाम मिले (नीचे मॉडल मूल्यांकन देखें), लेकिन हमने पाया कि उत्पादन परिनियोजन के लिए हमारी सीमाओं से विलंब अधिक था। इसके बाद, हमने कम ट्रांसफॉर्मर परतों के साथ WavLM आर्किटेक्चर का एक कस्टम संस्करण लागू किया और 7,000 घंटे के Roblox मशीन-लेबल वाले वॉयस डेटा पर शून्य से एक एंड-टू-एंड मॉडल को प्रशिक्षित किया। यह मॉडल संवादात्मक सेटिंग्स में मजबूत वर्गीकरण उत्पन्न करता है और फाइन-ट्यून किए गए मॉडल की तुलना में अधिक कॉम्पैक्ट था। हमारे अंतिम मॉडल उम्मीदवार ने एक स्टूडेंट-टीचर डिस्टिलेशन सेटअप का उपयोग किया, जिसमें व्हिस्पर एन्कोडर शिक्षक नेटवर्क के रूप में और WavLM एंड-टू-एंड आर्किटेक्चर छात्र नेटवर्क के रूप में था। जब हमने इसे 4,000 घंटे के ऑडियो पर प्रशिक्षित किया, तो हमने फाइन-ट्यून किए गए मॉडल के समान वर्गीकरण सटीकता देखी, लेकिन विलंबता में पर्याप्त सुधार और मॉडल के आकार में कमी के साथ। नीचे दी गई छवि ऊपर वर्णित तीन प्रयोगों के लिए मॉडल पैरामीटर का सारांश प्रस्तुत करती है। हम बहुभाषी वॉयस सुरक्षा वर्गीकरण के लिए मॉडल का विस्तार करते हुए डेटा नमूना रणनीतियों, मूल्यांकन रणनीतियों और मॉडल हाइपरपैरामीटर में सुधार करना जारी रख रहे हैं।

डेटासेट का आकार

मॉडल का आकार

इनफरेंस विलंबता/इनपुट का सेकंड

वास्तविक समय कारक 

फाइन-ट्यून किया गया WavLM

2300h

96M पैरामीटर

102 मिलीसेकंड

9.80

एंड-टू-एंड प्रशिक्षित

7071h

52M पैरामीटर

83 ms

12.08

निष्कर्षित

4080h 

48M पैरामीटर

50 ms

19.95

मॉडल अनुकूलन 

हमने गुणवत्ता से समझौता किए बिना 25 प्रतिशत से अधिक की स्पीडअप हासिल करने के लिए, चुनिंदा ट्रांसफॉर्मर लेयर्स को क्वांटਾਈज़ करने सहित मानक उद्योग विधियों को नियोजित किया। केवल CNNs के बजाय कन्वोल्यूशनल न्यूरल नेटवर्क्स (CNNs) के साथ संयुक्त MFCC इनपुट्स पर फीचर एक्सट्रैक्शन चरण को स्विच करने से भी इंफरेंस के दौरान 40 प्रतिशत से अधिक की स्पीडअप हुई। इसके अतिरिक्त, प्रीप्रोसेसिंग चरण के रूप में वॉयस एक्टिविटी डिटेक्शन (VAD) मॉडल को शामिल करने से समग्र पाइपलाइन की मजबूती में काफी वृद्धि हुई, खासकर शोर वाले माइक्रोफोन वाले उपयोगकर्ताओं के लिए। VAD ने हमें शोर को फ़िल्टर करने और ऑडियो में मानव भाषण का पता चलने पर ही हमारी सुरक्षा पाइपलाइन लागू करने की अनुमति दी, जिससे इंफरेंस की कुल मात्रा लगभग 10 प्रतिशत तक कम हो गई और हमारे सिस्टम को उच्च-गुणवत्ता वाले इनपुट प्रदान हुए। 

मॉडल मूल्यांकन

हालांकि हमने मूल्यांकन के लिए कई अलग-अलग डेटासेट और मेट्रिक्स का उपयोग किया, हम यह साझा कर सकते हैं कि हमारे वॉयस क्लासिफायर ने एक अंग्रेजी-भाषा डेटासेट पर कैसा प्रदर्शन किया जिसमें नीति उल्लंघन की प्रचुरता अधिक थी (जैसा कि हमें उपयोगकर्ताओं से मिली वॉयस दुरुपयोग रिपोर्टों में मिलता है)। इस डेटासेट को हमारे मॉडरेटर द्वारा 100 प्रतिशत मानव-लेबल किया गया था। जब हमने सभी उल्लंघन प्रकारों (गाली-गलौज, धमकाना, डेटिंग, आदि) को एक एकल बाइनरी श्रेणी में संयोजित किया, तो हमने 0.95 से अधिक का PR-AUC (प्रिसिजन-रिकॉल वक्र के नीचे का क्षेत्र) स्कोर देखा, जैसा कि नीचे दिखाया गया है। इसका मतलब है कि इस मूल्यांकन डेटासेट पर, क्लासिफायर आमतौर पर बहुत से गैर-उल्लंघनों को झूठी रूप से फ़्लैग किए बिना, अधिकांश उल्लंघनों को पकड़ सकता है।

हालाँकि, ऊपर दिए गए मजबूत मूल्यांकन परिणाम सभी उपयोग मामलों में सीधे तौर पर लागू नहीं होते हैं। उदाहरण के लिए, नीति-उल्लंघनकारी भाषण के बारे में हमारी सूचनाओं के मामले में, क्लासिफायर सभी Roblox वॉयस चैट का मूल्यांकन कर रहा है और उल्लंघनों की कम प्रचलन पा रहा है, और गलत-सकारात्मक परिणामों की अधिक संभावना है। वॉयस दुरुपयोग रिपोर्टों के मामले में, क्लासिफायर केवल उस भाषण का मूल्यांकन कर रहा है जिसे संभावित उल्लंघनों के लिए फ़्लैग किया गया है, इसलिए प्रचलन अधिक है। फिर भी, उपरोक्त परिणाम इतने उत्साहजनक थे कि हमने उपयोगकर्ताओं को उनकी नीति-विरोधी भाषा के बारे में सूचित करने के लिए, उत्पादन में (सुरक्षित सीमाओं पर) क्लासिफायर के साथ प्रयोग शुरू किए। इन प्रयोगों के परिणामों ने हमारी उम्मीदों से कहीं अधिक परिणाम दिए।

आगे क्या?

अपने स्वयं के सीपीयू इंफ्रास्ट्रक्चर का लाभ उठाकर और बड़े पैमाने के लिए पाइपलाइन को सावधानीपूर्वक डिजाइन करके, हम इस मॉडल को रॉब्लॉक्स स्केल पर सफलतापूर्वक तैनात करने में सक्षम हुए। पीक समय के दौरान, यह मॉडल प्रति सेकंड 2,000 से अधिक अनुरोधों को सफलतापूर्वक पूरा कर रहा है (जिनमें से अधिकांश में कोई उल्लंघन नहीं होता है)। नीति-उल्लंघन वाली भाषा के बारे में लोगों को सूचित करने के लिए मॉडल के उपयोग के कारण, हमने प्लेटफ़ॉर्म पर नीति-उल्लंघन वाले व्यवहार में भी एक महत्वपूर्ण कमी देखी है। विशेष रूप से, हमारे शुरुआती रोलआउट से, हम गंभीर-स्तर की वॉयस दुरुपयोग रिपोर्टों में 15.3 प्रतिशत की कमी और प्रति मिनट भाषण में उल्लंघनों में 11.4 प्रतिशत की कमी देख रहे हैं।

हम अपने मॉडलों का विस्तार बहुभाषी प्रशिक्षण डेटा के साथ कर रहे हैं, जो हमें कई भाषाओं के साथ-साथ भाषा मिश्रण को संभालने के लिए पूरे प्लेटफॉर्म पर एक एकल वर्गीकरण मॉडल तैनात करने की अनुमति देता है। हम पूर्ण ASR का सहारा लिए बिना वर्गीकरण उद्देश्य के अलावा चयनित कीवर्ड की पहचान के लिए नए मल्टीटास्क आर्किटेक्चर की भी खोज कर रहे हैं। उल्लंघन लेबल के अलावा इन कीवर्ड का पता लगाने से वर्गीकरण की गुणवत्ता में सुधार होता है और परिणाम जारी करते समय लोगों को संदर्भ देने का अवसर मिलता है।

यहाँ वर्णित शोध रॉब्लॉक्स की कई टीमों का एक संयुक्त प्रयास था। यह समुदाय का सम्मान करने के हमारे मुख्य मूल्य का एक शानदार प्रदर्शन और कई विषयों में एक बेहतरीन सहयोग था।