रॉब्लॉक्स सेन्टिनल का ओपन सोर्सिंग: अग्रिम जोखिम पहचान के लिए हमारा दृष्टिकोण
असामान्य चैट पैटर्न का शीघ्र पता लगाने में मदद के लिए एआई का उपयोग

- हर दिन, सभी उम्र के 100 मिलियन से अधिक उपयोगकर्ता Roblox पर एक सुरक्षित और सकारात्मक अनुभव प्राप्त करते हैं।
- हम अपनी प्रणालियों को डिफ़ॉल्ट रूप से यथासंभव सुरक्षित बनाने का प्रयास करते हैं, खासकर हमारे सबसे छोटे उपयोगकर्ताओं के लिए। हम यह अपने अत्यधिक सतर्कतापूर्ण नीतियों के साथ करते हैं और चैट में उन अनुचित संदेशों को फ़िल्टर करने के लिए एआई का उपयोग करते हैं जिन्हें हम पहचानते हैं, जिसमें व्यक्तिगत रूप से पहचानने योग्य जानकारी (ट्रस्टेड कनेक्शंस के बाहर) शामिल है। हम सक्रिय रूप से सामग्री का प्रबंधन करते हैं और चैट में वास्तविक दुनिया की छवियों को साझा करने की अनुमति नहीं देते हैं।
- बेशक, कोई भी प्रणाली परिपूर्ण नहीं है, और उद्योग में सबसे बड़ी चुनौतियों में से एक संभावित बाल संकट जैसी गंभीर क्षति का पता लगाना है। दोस्ताना चैट और सहायक संदेशों की एक श्रृंखला, लंबे समय तक चलने वाली बातचीत के दौरान एक अलग अर्थ ले सकती है, खासकर जब यह अलग-अलग आयु वर्ग के उपयोगकर्ताओं के बीच होता है।
- हमने रोब्लॉक्स सेन्टिनल विकसित किया है, जो कंट्रास्टिव लर्निंग पर आधारित एक एआई सिस्टम है जो हमें संभावित बाल संकट के शुरुआती संकेतों का पता लगाने में मदद करता है, जैसे कि ग्रूमिंग, जिससे हम और भी जल्दी जांच कर सकते हैं और, जब प्रासंगिक हो, तो कानून प्रवर्तन को रिपोर्ट कर सकते हैं।
- 2025 की पहली छमाही में, सेन्टिनल ने हमारी टीम को राष्ट्रीय लापता और शोषित बच्चों के केंद्र (National Center for Missing and Exploited Children) को बाल शोषण के संभावित प्रयासों की लगभग 1,200 रिपोर्टें जमा करने में मदद की। इसमें हमारे फ़िल्टरिंग तंत्र और अन्य सुरक्षा उपायों को बाईपास करने के प्रयास शामिल हैं।
- हम रोब्लॉक्स सेन्टिनल को ओपन सोर्स करने के लिए उत्साहित हैं, और हम सक्रिय रूप से सामुदायिक जुड़ाव की तलाश कर रहे हैं, जिससे हमें उम्मीद है कि एक सुरक्षित इंटरनेट बनाने में मदद मिलेगी।
दोस्तों के साथ समय बिताना और अन्य खिलाड़ियों के साथ प्रतिस्पर्धा करना Roblox का एक केंद्रीय घटक है, और संचार उन गतिविधियों के केंद्र में है। वास्तव में, हर दिन, 111 मिलियन से अधिक उपयोगकर्ता रॉब्लॉक्स पर आते हैं, जहाँ समुदाय औसतन 6.1 बिलियन चैट संदेश भेजता है और दर्जनों भाषाओं में 1.1 मिलियन घंटे की वॉयस कम्युनिकेशन करता है। यह संचार वास्तविक दुनिया को दर्शाता है—इसमें से अधिकांश रोज़मर्रा की बातचीत होती है, जिसमें आकस्मिक बातचीत से लेकर गेमप्ले पर चर्चा तक शामिल है, लेकिन कुछ दुर्भावनापूर्ण लोग हमारी प्रणालियों को बायपास करने और संभवतः नुकसान पहुँचाने का प्रयास करते हैं।
पिछले महीने, हमने आयु-आधारित संचार के लिए अपनी दृष्टि साझा की। हम अपनी प्रणालियों को डिफ़ॉल्ट रूप से यथासंभव सुरक्षित बनाने का प्रयास करते हैं, विशेष रूप से हमारे सबसे कम उम्र के उपयोगकर्ताओं के लिए। उदाहरण के लिए, हम चैट के माध्यम से उपयोगकर्ता-से-उपयोगकर्ता छवि या वीडियो साझा करने की अनुमति नहीं देते हैं। हमारी प्रणालियाँ, हालांकि परिपूर्ण नहीं हैं, लगातार बेहतर हो रही हैं और व्यक्तिगत रूप से पहचानने योग्य जानकारी—जैसे फोन नंबर और उपयोगकर्ता नाम—को सक्रिय रूप से अवरुद्ध करने के लिए डिज़ाइन की गई हैं—और गैर-आयु-सत्यापित उपयोगकर्ताओं के बीच चैट को कड़ाई से फ़िल्टर किया जाता है (और 13 वर्ष से कम उम्र के उपयोगकर्ताओं के लिए इसकी अनुमति नहीं है)। Roblox उन सबसे बड़े प्लेटफ़ॉर्म में से एक है, जिन्हें आप जानते हैं, उन लोगों के साथ अधिक स्वतंत्र रूप से चैट करने के लिए चेहरे की उम्र का अनुमान लगाने की आवश्यकता होती है। हमारा लक्ष्य ऑनलाइन गेमिंग में सुरक्षा के मामले में दुनिया का नेतृत्व करना है, और हम प्रमुख सुरक्षा तकनीक को ओपन सोर्स करने के लिए प्रतिबद्ध हैं।
आज, हम अपना नवीनतम ओपन-सोर्स मॉडल, सेंटिनल (Sentinel) जारी कर रहे हैं, जो एक एआई सिस्टम है जो उन इंटरैक्शन का पता लगाने में मदद करता है जिनसे संभावित रूप से बच्चों को खतरे में डालने वाली स्थिति पैदा हो सकती है। किसी भी चीज़ के स्पष्ट होने से बहुत पहले, सेंटिनल हमें शुरुआती चरण में ही सूक्ष्म पैटर्न का पता लगाने और उनकी जांच करने में सक्षम बनाता है, और जब प्रासंगिक हो, तो कानून प्रवर्तन को रिपोर्ट करने में मदद करता है।
सेंटिनल 2024 के अंत से रॉब्लॉक्स पर चल रहा है और यह हमारे ओपन-सोर्स सुरक्षा टूलकिट में नवीनतम जोड़ है। 2025 की पहली छमाही में, हमारे द्वारा पता लगाए गए 35% मामले इस सक्रिय दृष्टिकोण के कारण हैं, और कई मामलों में तो दुरुपयोग की रिपोर्ट दर्ज होने से पहले ही इन्हें पकड़ लिया गया। हमारे अन्य मॉडरेशन सिस्टम के साथ मिलकर, सेंटिनल हमारे पास मौजूद उपकरणों के शस्त्रागार का विस्तार करता है, जिससे हम इन संभावित गंभीर उल्लंघनों का पता लगा सकते हैं और उन पर कार्रवाई कर सकते हैं।
चुनौती को समझना
प्रोएक्टिव प्रभाव और परिचालन अंतर्दृष्टि
सेंटिनल वर्तमान में बड़े पैमाने पर प्रोडक्शन में चल रहा है। 2025 के पहले छमाही में, इसकी सक्रिय क्षमताओं ने हमारी टीम को नेशनल सेंटर फॉर मिसिंग एंड एक्सप्लॉयटेड चिल्ड्रन को लगभग 1,200 रिपोर्टें जमा करने में मदद की है। हालाँकि हमारे पास सुधार की हमेशा गुंजाइश रहेगी, सेंटिनल की शीघ्र पता लगाने की क्षमताएं पहले से ही हमें संभावित दुर्भावनापूर्ण व्यक्तियों की पहचान करने और प्रक्रिया में पहले ही उनकी जांच करने में मदद कर रही हैं, जब संदेश अभी भी सूक्ष्म होते हैं और उपयोगकर्ताओं द्वारा सबमिट की गई दुरुपयोग रिपोर्टों द्वारा उन्हें उजागर करने से पहले।
सेंटिनल द्वारा पता लगाए गए मामलों की जांच करने और उनमें हस्तक्षेप करने के लिए मानवीय विशेषज्ञ आवश्यक हैं। प्रशिक्षित विश्लेषक, जो आमतौर पर पूर्व सीआईए या एफबीआई एजेंट और अन्य विशेषज्ञ होते हैं, उन मामलों की समीक्षा करते हैं जिन्हें सेंटिनल संभावित रूप से उल्लंघनकारी के रूप में चिह्नित करता है। इन विश्लेषकों द्वारा लिए गए निर्णय एक फीडबैक लूप बनाते हैं जो हमें उदाहरणों, सूचकांकों और प्रशिक्षण सेटों को लगातार परिष्कृत और अपडेट करने में सक्षम बनाता है। यह मानव-इन-द-लूप प्रक्रिया सेन्टिनल को हमारे पता लगाने से बचने के लिए काम करने वाले दुर्भावनापूर्ण अभिनेताओं के नए और विकसित हो रहे पैटर्न और तरीकों के अनुकूल होने और उनके साथ तालमेल बनाए रखने में मदद करने के लिए आवश्यक है।
सेंटिनल, रॉब्लॉक्स की बड़ी परतदार सुरक्षा प्रणाली का एक महत्वपूर्ण हिस्सा है, जिसमें अभिनव एआई उपकरण और हजारों मानवीय विशेषज्ञ शामिल हैं। आज से, यह हमारी रॉब्लॉक्स ओपन-सोर्स सुरक्षा टूलकिट का भी हिस्सा है। हमारा मानना है कि एक सुरक्षित डिजिटल दुनिया को बढ़ावा देना एक साझा जिम्मेदारी है। सेंटिनल जैसी सुरक्षा प्रणालियों को ओपन सोर्स करके, अपने दृष्टिकोण साझा करके और रॉबस्ट ओपन ऑनलाइन सेफ्टी टूल्स (ROOST) और टेक कोएलिशन के लैंटर्न प्रोजेक्ट जैसे संगठनों के संस्थापक सदस्य बनकर, हम ऑनलाइन सुरक्षा प्रथाओं और उन पर निर्भर ऑनलाइन समुदायों की सामूहिक उन्नति में योगदान करने की उम्मीद करते हैं।
"आज बहुत से प्लेटफ़ॉर्म उन परिष्कृत उपकरणों तक पहुँच से वंचित हैं जो ऑनलाइन हानियों की पहचान और रोकथाम के लिए आवश्यक हैं, विशेष रूप से उन हानियों के जो बच्चों को लक्षित करती हैं। ROOST में, हमारा मानना है कि मजबूत सुरक्षा उपाय उन सभी के लिए सुलभ होने चाहिए जो अपने उपयोगकर्ताओं की सुरक्षा के लिए प्रतिबद्ध हैं, और हमें बहुत खुशी है कि Roblox भरोसे और सुरक्षा के क्षेत्र में और अधिक खुले तौर पर उपलब्ध उपकरण प्रदान कर रहा है।"
तकनीक के अंदर: सेन्टिनल कैसे पूर्वसचेत पहचान को शक्ति प्रदान करता है
हमारी मॉडरेशन प्रणाली को त्वरित रूप से कार्य करने में सक्षम बनाने के लिए, इससे पहले कि हानि पहुँचाने का इरादा केवल इरादा ही रहे, सेंटिनल को लगभग वास्तविक समय में पूरी विश्लेषण पाइपलाइन चलाने की आवश्यकता है—हर दिन 6 अरब से अधिक चैट संदेशों पर बड़े पैमाने पर। सेंटिनल लगातार एक मिनट के स्नैपशॉट में टेक्स्ट चैट कैप्चर करता है। संदेशों का स्वचालित रूप से एमएल (ML) द्वारा विश्लेषण किया जाता है, जिसका एकमात्र उद्देश्य संभावित नुकसान, जैसे कि ग्रूमिंग या बच्चों को खतरे में डालने जैसी गतिविधियों की पहचान करना है। इसके अतिरिक्त, हम समय के साथ इस जानकारी को एकत्र करते हैं, और मानव विश्लेषकों द्वारा आकलन और जांच के लिए चिंताजनक मामलों और पैटर्न की पहचान करते हैं।
स्थिर नियमों और लेबल वाले उदाहरणों पर निर्भर करने वाले उपकरणों के विपरीत, सेन्टिनल संचार पैटर्न को होने पर ही पहचानने—और सामान्यीकृत करने—का तरीका सीखने के लिए स्व-पर्यवेक्षित प्रशिक्षण का उपयोग करता है। यह सेन्टिनल को नए और विकसित हो रहे खतरों की पहचान करने में सक्षम बनाता है।
टीम ने दो सूचकांक विकसित करके यह हासिल किया। एक उन उपयोगकर्ताओं के संचार से बना है जो सुरक्षित, हानिरहित संदेशों के साथ बातचीत करते हैं—यह सकारात्मक सूचकांक है। दूसरा उन संचारों से बना है जिन्हें हटा दिया गया था क्योंकि हमने यह निर्धारित किया कि वे बाल-संकट नीति का उल्लंघन थे—यह नकारात्मक सूचकांक है। यह विरोधाभासी दृष्टिकोण प्रणाली को सामान्यीकरण करने और विकसित हो रहे खतरों को पहचानने में मदद करता है, भले ही वे सूचकांक से पहले से पता लगाए गए संचार पैटर्न से सटीक रूप से मेल न खाते हों। सेंटिनल का एक प्रमुख लाभ यह है कि इसे काम करने के लिए बड़ी संख्या में उदाहरणों की आवश्यकता नहीं होती है। नकारात्मक उदाहरणों की कम प्रचुरता को देखते हुए यह विशेष रूप से महत्वपूर्ण है। हमारी वर्तमान उत्पादन प्रणाली नकारात्मक अनुक्रमणिका में केवल 13,000 उदाहरणों के साथ काम करती है, फिर भी संभावित नुकसान की सफलतापूर्वक पहचान करती है।

सकारात्मक सूचकांक
नकारात्मक सूचकांक
नकारात्मक अनुक्रम हमारे मानव मॉडरेटरों द्वारा समीक्षा की गई बातचीत से तैयार किया जाता है, जहाँ हमने बाल संकट में डालने वाली नीति उल्लंघनों के स्पष्ट प्रमाण पाए हैं (जिन पर हमने पहले ही कार्रवाई कर ली है)। जब किसी उपयोगकर्ता की इंटरैक्शन में निरंतर, चिंताजनक गतिविधि दिखाई देती है, तो हम उन बातचीत के विशिष्ट अंशों को हानिकारक संचार के उदाहरण के रूप में लेबल करते हैं। इन लेबल वाले खंडों को एम्बेडिंग वेक्टर में बदलकर नेगेटिव इंडेक्स में जोड़ा जाता है। इस प्रशिक्षण के साथ, सेन्टिनल कुछ शब्दों या वाक्यांशों को फ्लैग करने से आगे बढ़कर सीखता है; यह उन संदर्भगत पैटर्न और प्रगति से सीखता है जिनका पालन वास्तविक हानि-उद्देश्य वाली बातचीत करती है। इस वजह से, सिस्टम उन हानिकारक संचारों को पहचान सकता है जिन्हें हमारी अन्य एआई मॉडरेशन प्रणालियाँ नहीं पहचान पातीं, भले ही वे सूक्ष्म रूप में हों।
उदाहरण के लिए, "अरे, आप कैसे हैं?" जैसे सरल संदेश सकारात्मक अनुक्रमणिका से मेल खाएंगे क्योंकि भाषा हानिरहित है। "आप कहाँ से हैं?" जैसा संदेश नकारात्मक अनुक्रमणिका से मेल खाएगा क्योंकि यह संभावित ग्रूमिंग बातचीत के पैटर्न से मेल खाता है। यह सिस्टम नए संदेशों की तुलना इन सूचकांकों से करता है, और यदि यह किसी उपयोगकर्ता को "आप कहाँ से हैं?" पूछते हुए देखता है, तो यह यह देखने के लिए अधिक जानकारी इकट्ठा करना शुरू कर सकता है कि क्या बातचीत नकारात्मक मार्ग पर जारी रहती है। हालाँकि एक संदेश मानवीय समीक्षा के लिए फ़्लैग करने के लिए पर्याप्त नहीं होगा, लेकिन एक जारी पैटर्न पर्याप्त होगा।
तुलनात्मक मापन
यह तुलनात्मक मापन दृष्टिकोण SimCLR से प्रेरित है, जो एक स्व-पर्यवेक्षित शिक्षण ढांचा है जो लेबल किए गए डेटा के बिना छवि प्रतिनिधित्व मॉडल को प्रशिक्षित करने के लिए तुलनात्मक मापन का उपयोग करता है। हमने इस तकनीक को टेक्स्ट और वॉयस डेटा के साथ काम करने के लिए अनुकूलित किया है, जिससे सेन्टिनल यह समझ पाता है कि कोई उपयोगकर्ता क्या कहता है और यह ज्ञात पैटर्न के अनुरूप कैसे है या उनसे कैसे भिन्न है। यह तीन चरणों में काम करता है: इंटरैक्शन स्कोरिंग, पैटर्न ट्रैकिंग, और कार्रवाई करना।
व्यक्तिगत इंटरैक्शन को मापना: प्रत्येक संदेश को एक एम्बेडिंग, या एक वेक्टर में परिवर्तित किया जाता है जो क्रिया की अर्थपूर्ण और संचार सुविधाओं को कैप्चर करता है। सेन्टिनल इस एम्बेडिंग की तुलना सकारात्मक और नकारात्मक सूचकांकों से करता है। कॉसाइन समानता का उपयोग करते हुए, सिस्टम फिर मापता है कि इंटरैक्शन किस सूचकांक के करीब है।
यदि इंटरैक्शन नकारात्मक सूचकांक में हानिकारक पैटर्न के साथ अधिक संरेखित होता है, तो उसे उच्च जोखिम संकेतक प्राप्त होता है। जो संदेश सुरक्षित या हानिकारक संचार पैटर्न के साथ सार्थक रूप से संरेखित नहीं होते हैं, उन्हें फ़िल्टर कर दिया जाता है, ताकि सिस्टम केवल उन इंटरैक्शन पर ध्यान केंद्रित कर सके जिनमें एक संभावित संकेत होता है। यह फर्जी सकारात्मक परिणामों को कम करने और समय के साथ इंटरैक्शन को मापने की सटीकता में सुधार करने में मदद कर सकता है।
केवल औसत ही नहीं, बल्कि विषमता के साथ पैटर्न को ट्रैक करना: दुर्भावनापूर्ण लोग अक्सर अपने इरादे को हानिरहित सामग्री के साथ मिलाकर छिपाते हैं। यदि हम किसी उपयोगकर्ता के माप को समय के साथ केवल औसत निकालते हैं, तो जिन्हें हम पहचानना चाहते हैं, वे नकारात्मक संदेश शोर में खो सकते हैं। इसके बजाय, सेन्टिनल समय के साथ मापों के वितरण को देखता है और सांख्यिकीय विषमता को मापता है—यह पता लगाने का एक तरीका है कि क्या दुर्लभ, उच्च-जोखिम वाले संदेश जोखिम प्रोफ़ाइल को ऊपर की ओर बढ़ा रहे हैं।
यह हमें खतरनाक संचार की ओर बढ़ने के शुरुआती संकेतों का पता लगाने में मदद करता है, भले ही अधिकांश बातचीत सामान्य प्रतीत हो। जब हम स्कीव (skew) का विश्लेषण करते हैं, तो हम वॉल्यूम (मात्रा) के लिए भी समायोजन करते हैं। अत्यधिक सक्रिय उपयोगकर्ता अधिक जोखिम भरे लग सकते हैं क्योंकि उनके संचार में मिलान की बड़ी निरपेक्ष संख्या दिखाई देती है। कुल मात्रा के बजाय सांख्यिकीय विक्षेप पर जोर देकर, हम बातूनी लेकिन अनुपालन करने वाले उपयोगकर्ताओं से संबंधित फर्जी सकारात्मक परिणामों से बच सकते हैं। इसके साथ, सेन्टिनल न केवल स्केलेबल है, बल्कि यह अधिक सटीक भी है, और यह खतरे के इरादे का पता लगाने में मदद करने वाले दुर्लभ लेकिन महत्वपूर्ण संकेतों को खोजने के लिए विशाल संचार प्रवाहों को संसाधित करने में सक्षम है।
संकेत से कार्रवाई तक: जैसे-जैसे अधिक इंटरैक्शन मापे जाते हैं, सिस्टम एक गतिशील जोखिम प्रोफ़ाइल बनाता है। जब किसी उपयोगकर्ता के पैटर्न में हानि पहुँचाने के इरादे वाले संचार के साथ मजबूत संरेखण दिखाई देता है, या उस दिशा में एक झुकाव होता है, तो सेन्टिनल गहरी समीक्षा और जांच के लिए एक फ़्लैग ट्रिगर करता है।


