O conteúdo deste site foi traduzido usando inteligência artificial (IA) ou tecnologia de tradução automática e pode conter erros.

Skip to content

Roblox Sentinel em código aberto: nossa abordagem para a detecção preventiva de riscos

Usando IA para ajudar a detectar padrões anormais de bate-papo antecipadamente

  • Todos os dias, mais de 100 milhões de usuários de todas as idades têm uma experiência segura e positiva no Roblox.
  • Nós nos esforçamos para tornar nossos sistemas o mais seguros possível por padrão, especialmente para nossos usuários mais jovens. Fazemos isso com nossas políticas extremamente conservadoras e utilizamos IA para filtrar mensagens inadequadas no chat que detectamos, incluindo informações de identificação pessoal (fora do Trusted Connections). Moderamos o conteúdo de forma proativa e não permitimos o compartilhamento de imagens do mundo real no chat.
  • É claro que nenhum sistema é perfeito, e um dos maiores desafios do setor é detectar danos graves, como o potencial risco à segurança infantil. Uma série de conversas amigáveis e mensagens de apoio pode assumir um significado diferente ao longo de um histórico de conversas mais extenso, especialmente quando ocorre entre usuários de diferentes faixas etárias. 
  • Desenvolvemos o Roblox Sentinel, um sistema de IA baseado em aprendizado contrastivo que nos ajuda a detectar sinais precoces de potencial risco à criança, como aliciamento, permitindo-nos investigar ainda mais rapidamente e, quando relevante, notificar as autoridades policiais.
  • No primeiro semestre de 2025, o Sentinel ajudou nossa equipe a enviar aproximadamente 1.200 denúncias de possíveis tentativas de exploração infantil ao Centro Nacional para Crianças Desaparecidas e Exploradas. Isso inclui tentativas de contornar nossos mecanismos de filtragem e outras medidas de segurança.
  • Estamos entusiasmados em tornar o Roblox Sentinel de código aberto e estamos buscando ativamente o envolvimento da comunidade, o que esperamos que ajude a construir uma internet mais segura.

Passar tempo com amigos e competir com outros jogadores é um componente central do Roblox, e a comunicação está no centro dessas atividades. Na verdade, todos os dias, mais de 111 milhões de usuários acessam o Roblox, onde a comunidade envia uma média de 6,1 bilhões de mensagens de chat e gera 1,1 milhão de horas de comunicações de voz em dezenas de idiomas. Essa comunicação reflete o mundo real — a grande maioria é conversa cotidiana, desde conversas casuais até discussões sobre o jogo, mas um pequeno número de malfeitores busca contornar nossos sistemas e possivelmente tentar causar danos. 

No mês passado, compartilhamos nossa visão sobre a comunicação baseada na idade. Nós nos esforçamos para tornar nossos sistemas o mais seguros possível por padrão, especialmente para nossos usuários mais jovens. Por exemplo, não permitimos o compartilhamento de imagens ou vídeos entre usuários via chat. Nossos sistemas, embora não sejam perfeitos, estão em constante aprimoramento e foram projetados para bloquear proativamente informações de identificação pessoal — como números de telefone e nomes de usuário — e o chat entre usuários sem verificação de idade é fortemente filtrado (e não são permitidos para usuários menores de 13 anos). O Roblox é uma das maiores plataformas que exigem estimativa de idade facial para que você possa conversar mais livremente com as pessoas que conhece. Nosso objetivo é sermos líderes mundiais em segurança para jogos online, e estamos comprometidos em disponibilizar em código aberto as principais tecnologias de segurança.

Hoje, estamos lançando nosso mais recente modelo de código aberto, o Sentinel, um sistema de IA para ajudar a detectar interações que possam potencialmente colocar crianças em risco. Muito antes de algo se tornar explícito, o Sentinel nos permite detectar e investigar padrões sutis antecipadamente e, quando relevante, notificar as autoridades.

O Sentinel está em operação no Roblox desde o final de 2024 e é a mais recente adição ao nosso kit de ferramentas de segurança de código aberto. No primeiro semestre de 2025, 35% dos casos que detectamos foram identificados graças a essa abordagem proativa, em muitos casos antes mesmo que uma denúncia de abuso pudesse ser registrada. Quando combinado com nossos outros sistemas de moderação, o Sentinel amplia o arsenal de ferramentas que temos para detectar e agir contra essas violações potencialmente graves. 

Entendendo o desafio
O risco à segurança infantil é um desafio em todo o setor, tornando novas tecnologias e a colaboração aberta extremamente valiosas. O aliciamento online — a construção sistemática de confiança e conexão emocional com o objetivo final de exploração — é, por natureza, um processo sutil e gradual. Essas interações são raras e geralmente começam como uma série de conversas amigáveis, mensagens de apoio e interesses em comum. Mensagens que inicialmente parecem inofensivas podem assumir um significado diferente ao longo de um histórico de conversas mais extenso. Os malfeitores costumam usar linguagem sutil, indireta ou codificada — tornando os padrões propositalmente difíceis de detectar, mesmo para revisores humanos. Portanto, nossos sistemas de detecção evoluem continuamente para acompanhar as novas maneiras pelas quais os malfeitores tentam burlar nossos sistemas. Além disso, os dados de treinamento para aliciamento são raros — o que dificulta o treinamento de sistemas de aprendizado de máquina.
Impacto proativo e insights operacionais

O Sentinel está atualmente em operação em escala real. No primeiro semestre de 2025, seus recursos proativos ajudaram nossa equipe a enviar aproximadamente 1.200 denúncias ao Centro Nacional para Crianças Desaparecidas e Exploradas. Embora sempre haja espaço para melhorias, os recursos de detecção precoce do Sentinel já estão nos ajudando a identificar e investigar possíveis infratores mais cedo no processo, quando as mensagens ainda são sutis e antes que sejam reveladas por denúncias de abuso enviadas pelos usuários. 

Especialistas humanos são essenciais para investigar e intervir nos casos detectados pelo Sentinel. Analistas treinados, geralmente ex-agentes da CIA ou do FBI e outros especialistas, analisam os casos que o Sentinel sinaliza como potencialmente violadores. As decisões tomadas por esses analistas criam um ciclo de feedback que nos permite refinar e atualizar continuamente os exemplos, índices e conjuntos de treinamento. Esse processo com intervenção humana é essencial para ajudar o Sentinel a se adaptar e acompanhar os padrões e métodos novos e em evolução dos malfeitores que tentam escapar de nossa detecção.

O Sentinel é uma parte importante do sistema de segurança em camadas mais amplo da Roblox, que combina ferramentas inovadoras de IA e milhares de especialistas humanos. A partir de hoje, ele também faz parte do nosso kit de ferramentas de segurança de código aberto da Roblox. Acreditamos que promover um mundo digital mais seguro é uma responsabilidade compartilhada. Ao tornar sistemas de segurança como o Sentinel de código aberto, compartilhar nossas abordagens e nos tornarmos membros fundadores de organizações como a Robust Open Online Safety Tools (ROOST) e o projeto Lantern da Tech Coalition, esperamos contribuir para o avanço coletivo das práticas de segurança online e das comunidades online que dependem delas.

“Atualmente, muitas plataformas não têm acesso às ferramentas sofisticadas necessárias para identificar e prevenir danos online, especialmente aqueles que têm como alvo crianças. Na ROOST, acreditamos que proteções de segurança robustas devem estar acessíveis a qualquer pessoa comprometida com a proteção de seus usuários, e estamos muito entusiasmados com o fato de a Roblox estar contribuindo com mais ferramentas abertamente disponíveis para o espaço de confiança e segurança.”
Juliet Shen, Chefe de Produto da ROOST
Nossa visão de longo prazo para o Sentinel vai além da conversa. Os princípios do uso de embeddings e da medição contrastiva são altamente adaptáveis. Estamos explorando e desenvolvendo ativamente recursos para aplicar essas técnicas a uma gama mais ampla de interações do usuário, avançando em direção à compreensão multimodal — abrangendo texto, imagem, vídeo e muito mais. Ao analisar esses sinais em conjunto, esperamos trabalhar em direção a uma compreensão mais holística e robusta do comportamento do usuário, para que possamos identificar melhor os riscos potenciais à segurança que os sistemas de modalidade única poderiam deixar passar. 
Por dentro da tecnologia: como o Sentinel possibilita a detecção preventiva

Para ajudar nosso sistema de moderação a agir rapidamente, antes que a intenção de causar danos vá além da mera intenção, o Sentinel precisa executar todo o fluxo de análise quase em tempo real — em grande escala, analisando mais de 6 bilhões de mensagens de chat por dia. O Sentinel captura continuamente o chat de texto em instantâneos de um minuto. As mensagens são analisadas automaticamente por ML, com o único objetivo de identificar danos potenciais, como aliciamento ou colocação de crianças em risco. Além disso, agregamos essas informações ao longo do tempo, identificando casos e padrões preocupantes para que analistas humanos avaliem e investiguem. 

Ao contrário de ferramentas que dependem de regras estáticas e exemplos rotulados, o Sentinel usa treinamento auto-supervisionado para aprender a identificar — e generalizar — padrões de comunicação à medida que eles ocorrem. Isso permite que o Sentinel identifique ameaças novas e em evolução.

A equipe conseguiu isso desenvolvendo dois índices. Um é composto por comunicações de usuários que interagem com mensagens seguras e benignas — o índice positivo. O outro é composto por comunicações que foram removidas porque determinamos que eram violações da política de colocação de crianças em risco — o índice negativo. Essa abordagem contrastiva ajuda o sistema a generalizar e identificar ameaças em evolução, mesmo que elas não correspondam exatamente aos padrões de comunicação detectados anteriormente no índice. Uma das principais vantagens do Sentinel é que ele não requer um grande número de exemplos para funcionar. Isso é particularmente importante, dada a baixa prevalência de exemplos negativos. Nosso sistema de produção atual opera com apenas 13.000 exemplos no índice negativo, ao mesmo tempo em que identifica com sucesso potenciais danos.   

Como o Sentinel se integra ao nosso sistema geral de segurança.

O Índice Positivo

Para construir o índice positivo, usamos uma amostra selecionada do histórico de bate-papo de usuários sem histórico de violações das Normas da Comunidade relacionadas à segurança e com um envolvimento positivo consistente e de longo prazo no Roblox. Ao usar essa amostra selecionada do histórico de bate-papo do Roblox, em vez de conjuntos de dados de texto genéricos, conseguimos ajudar o Sentinel a aprender novas gírias e padrões e estilos de linguagem específicos do Roblox. Isso ajuda o sistema a fazer comparações mais precisas, reduzindo falsos positivos e permitindo que ele diferencie melhor entre a comunicação típica do Roblox e a comunicação que viola as normas.

O Índice Negativo

O índice negativo é construído a partir de conversas analisadas por nossos moderadores humanos, nas quais encontramos evidências claras de violações da política de proteção à criança (sobre as quais já tomamos medidas). Quando as interações de um usuário mostram atividades preocupantes e persistentes, classificamos trechos específicos dessas conversas como exemplos de comunicação prejudicial. Esses segmentos marcados são transformados em vetores de incorporação e adicionados ao índice negativo. Com esse treinamento, o Sentinel aprende a ir além de sinalizar certas palavras ou frases; ele aprende com os padrões contextuais e as progressões que conversas com real intenção de causar dano seguem. Por causa disso, o sistema pode reconhecer comunicações prejudiciais que nossos outros sistemas de moderação de IA podem não identificar, mesmo quando elas parecem sutis. 

Por exemplo, mensagens simples como “E aí, tudo bem?” corresponderiam ao índice positivo porque a linguagem é inofensiva. Uma mensagem como “De onde você é?” corresponderia ao índice negativo porque se encaixa nos padrões de conversas com potencial de aliciamento. O sistema compara novas mensagens com esses índices e, se perceber que um usuário está perguntando “De onde você é?”, ele pode começar a coletar mais informações para verificar se a conversa segue por um caminho negativo. Embora uma única mensagem não seja suficiente para ser sinalizada para revisão humana, um padrão contínuo já seria.

Medição contrastiva

Essa abordagem de medição contrastiva é inspirada no SimCLR, uma estrutura de aprendizado auto-supervisionado que utiliza medição contrastiva para treinar modelos de representação de imagens sem dados rotulados. Adaptamos essa técnica para funcionar com dados de texto e voz, permitindo que o Sentinel compreenda o que um usuário diz e como isso se alinha ou diverge de padrões conhecidos. Isso funciona em três etapas: pontuação de interação, rastreamento de padrões e tomada de ação.

Avaliação de interações individuais: cada mensagem é convertida em uma incorporação, ou um vetor que captura as características semânticas e de comunicação da ação. O Sentinel compara essa incorporação com os índices positivo e negativo. Usando a similaridade cosseno, o sistema então avalia a qual índice a interação está mais próxima.

Se a interação estiver mais alinhada com os padrões prejudiciais do índice negativo, ela recebe um indicador de risco mais alto. Mensagens que não se alinham significativamente com padrões de comunicação seguros ou prejudiciais são filtradas, para que o sistema possa se concentrar apenas nas interações que carregam um sinal potencial. Isso pode ajudar a reduzir falsos positivos e melhorar a precisão da medição de interações ao longo do tempo. 

Rastreando Padrões com Asimetria, Não Apenas Médias: Agentes mal-intencionados frequentemente mascaram suas intenções misturando-as a conteúdo inofensivo. Se simplesmente calculássemos a média das medições de um usuário ao longo do tempo, as mensagens negativas que queremos detectar poderiam se perder no ruído. Em vez disso, o Sentinel analisa a distribuição das medições ao longo do tempo e mede a asimetria estatística — uma forma de detectar se há mensagens raras e de alto risco elevando o perfil de risco.

Isso nos ajuda a detectar sinais precoces de escalada em direção a uma comunicação perigosa, mesmo que a maioria das interações pareça benigna. Ao analisarmos a assimetria, também corrigimos o volume. Usuários altamente ativos podem parecer mais arriscados porque sua comunicação apresenta um número absoluto maior de correspondências. Ao enfatizar a assimetria estatística em vez do volume geral, podemos evitar falsos positivos envolvendo usuários comunicativos, mas que cumprem as regras. Com isso, o Sentinel não é apenas escalável, mas também mais preciso, capaz de processar vastos fluxos de comunicação para encontrar os sinais raros, porém críticos, que nos ajudam a detectar a intenção de causar dano. 

Do sinal à ação: à medida que mais interações são medidas, o sistema constrói um perfil de risco dinâmico. Quando o padrão de um usuário mostra forte alinhamento com comunicações com intenção de causar dano, ou um desvio se movendo nessa direção, o Sentinel aciona um alerta para uma análise e investigação mais aprofundadas.