El contenido de este sitio se ha traducido mediante inteligencia artificial (IA) o tecnología de traducción automática, y puede contener errores.

Skip to content

Roblox Sentinel de código abierto: nuestro enfoque para la detección preventiva de riesgos

Uso de la IA para ayudar a detectar patrones de chat anómalos de forma temprana

  • Cada día, más de 100 millones de usuarios de todas las edades disfrutan de una experiencia segura y positiva en Roblox.
  • Nos esforzamos por hacer que nuestros sistemas sean lo más seguros posible de forma predeterminada, especialmente para nuestros usuarios más jóvenes. Lo hacemos mediante políticas extremadamente conservadoras y aprovechando la IA para filtrar los mensajes inapropiados que detectamos en el chat, incluida la información de identificación personal (fuera de las Conexiones de confianza). Moderamos el contenido de forma proactiva y no permitimos compartir imágenes del mundo real en el chat.
  • Por supuesto, ningún sistema es perfecto, y uno de los mayores retos del sector es detectar daños graves, como el posible peligro para los menores. Una serie de chats amistosos y mensajes de apoyo pueden adquirir un significado diferente a lo largo de un historial de conversación más extenso, especialmente cuando se produce entre usuarios de diferentes grupos de edad. 
  • Hemos desarrollado Roblox Sentinel, un sistema de IA basado en el aprendizaje contrastivo que nos ayuda a detectar señales tempranas de posible peligro para los menores, como el grooming, lo que nos permite investigar aún más pronto y, cuando sea pertinente, informar a las fuerzas del orden.
  • En la primera mitad de 2025, Sentinel ayudó a nuestro equipo a enviar aproximadamente 1200 denuncias de posibles intentos de explotación infantil al Centro Nacional para Niños Desaparecidos y Explotados. Esto incluye intentos de eludir nuestros mecanismos de filtrado y otras medidas de seguridad.
  • Estamos encantados de convertir Roblox Sentinel en código abierto y buscamos activamente la participación de la comunidad, lo que esperamos que ayude a construir un Internet más seguro.

Pasar tiempo con amigos y competir con otros jugadores es un componente central de Roblox, y la comunicación es el núcleo de esas actividades. De hecho, cada día, más de 111 millones de usuarios visitan Roblox, donde la comunidad envía una media de 6.100 millones de mensajes de chat y genera 1,1 millones de horas de comunicaciones de voz en docenas de idiomas. Esta comunicación es un reflejo del mundo real: la gran mayoría son charlas cotidianas, desde conversaciones informales hasta debates sobre el juego, pero un pequeño número de personas malintencionadas busca eludir nuestros sistemas y posiblemente intenta causar daño. 

El mes pasado, compartimos nuestra visión sobre la comunicación basada en la edad. Nos esforzamos por hacer que nuestros sistemas sean lo más seguros posible de forma predeterminada, especialmente para nuestros usuarios más jóvenes. Por ejemplo, no permitimos el intercambio de imágenes o vídeos entre usuarios a través del chat. Nuestros sistemas, aunque no son perfectos, mejoran continuamente y están diseñados para bloquear de forma proactiva la información de identificación personal —como números de teléfono y nombres de usuario— y el chat entre usuarios sin verificación de edad está fuertemente filtrado (y no se permite a los usuarios menores de 13 años). Roblox es una de las plataformas más grandes que requiere la estimación de la edad facial para chatear con mayor libertad con las personas que conoces. Nuestro objetivo es liderar el mundo en seguridad para los juegos en línea, y estamos comprometidos con la apertura del código fuente de la tecnología de seguridad clave.

Hoy lanzamos nuestro último modelo de código abierto, Sentinel, un sistema de IA que ayuda a detectar interacciones que podrían poner en peligro a los menores. Mucho antes de que algo se vuelva explícito, Sentinel nos permite detectar e investigar patrones sutiles de forma temprana y, cuando sea pertinente, informar a las fuerzas del orden.

Sentinel lleva funcionando en Roblox desde finales de 2024 y es la última incorporación a nuestro conjunto de herramientas de seguridad de código abierto. En la primera mitad de 2025, el 35 % de los casos que hemos detectado se deben a este enfoque proactivo, que en muchos casos permite detectarlos antes de que se pueda presentar una denuncia por abuso. Cuando se combina con nuestros otros sistemas de moderación, Sentinel amplía el arsenal de herramientas de que disponemos para detectar y actuar ante estas infracciones potencialmente graves. 

Comprender el reto
El peligro para la infancia es un reto en todo el sector, lo que hace que las nuevas tecnologías y la colaboración abierta sean increíblemente valiosas. El grooming en línea —la creación sistemática de confianza y conexión emocional con el objetivo final de la explotación— es, por naturaleza, un proceso sutil y gradual. Estas interacciones son poco frecuentes y a menudo comienzan como una serie de charlas amistosas, mensajes de apoyo e intereses compartidos. Los mensajes que inicialmente parecen inofensivos pueden adquirir un significado diferente a lo largo de un historial de conversación más extenso. Los malhechores suelen utilizar un lenguaje sutil, indirecto o en clave, lo que dificulta deliberadamente la detección de patrones, incluso para los revisores humanos. Por lo tanto, nuestros sistemas de detección evolucionan continuamente para mantenerse al día con las nuevas formas en que los malhechores intentan eludir nuestros sistemas. Además, los datos de entrenamiento para el grooming son escasos, lo que dificulta el entrenamiento de los sistemas de aprendizaje automático.
Impacto proactivo y perspectivas operativas

Sentinel se encuentra actualmente en funcionamiento a gran escala. En la primera mitad de 2025, sus capacidades proactivas han ayudado a nuestro equipo a enviar aproximadamente 1200 informes al Centro Nacional para Niños Desaparecidos y Explotados. Aunque siempre hay margen de mejora, las capacidades de detección temprana de Sentinel ya nos están ayudando a identificar e investigar a posibles infractores en una fase más temprana del proceso, cuando los mensajes aún son sutiles y antes de que salgan a la luz a través de los informes de abuso enviados por los usuarios. 

Los expertos humanos son esenciales para investigar e intervenir en los casos que detecta Sentinel. Analistas cualificados, normalmente antiguos agentes de la CIA o del FBI y otros expertos, revisan los casos que Sentinel señala como potencialmente infractores. Las decisiones tomadas por estos analistas crean un ciclo de retroalimentación que nos permite perfeccionar y actualizar continuamente los ejemplos, los índices y los conjuntos de entrenamiento. Este proceso con intervención humana es esencial para ayudar a Sentinel a adaptarse y mantenerse al día con los patrones y métodos nuevos y en constante evolución de los malhechores que intentan evadir nuestra detección.

Sentinel es una parte importante del sistema de seguridad por capas de Roblox, que combina herramientas innovadoras de IA y miles de expertos humanos. A día de hoy, también forma parte de nuestro kit de herramientas de seguridad de código abierto de Roblox. Creemos que fomentar un mundo digital más seguro es una responsabilidad compartida. Al convertir en código abierto sistemas de seguridad como Sentinel, compartir nuestros enfoques y convertirnos en miembros fundadores de organizaciones como Robust Open Online Safety Tools (ROOST) y el proyecto Lantern de Tech Coalition, esperamos contribuir al avance colectivo de las prácticas de seguridad en línea y de las comunidades en línea que dependen de ellas.

«Hoy en día, son demasiadas las plataformas que carecen de acceso a las sofisticadas herramientas necesarias para identificar y prevenir los daños en línea, especialmente aquellos dirigidos a los niños. En ROOST, creemos que cualquier persona comprometida con la protección de sus usuarios debería tener acceso a medidas de seguridad sólidas, y nos alegra mucho que Roblox esté aportando más herramientas de libre acceso al ámbito de la confianza y la seguridad».
Juliet Shen, directora de producto de ROOST
Nuestra visión a largo plazo para Sentinel va más allá de la conversación. Los principios del uso de incrustaciones y la medición contrastiva son muy adaptables. Estamos explorando y desarrollando activamente capacidades para aplicar estas técnicas a una gama más amplia de interacciones de los usuarios, avanzando hacia una comprensión multimodal —que abarque texto, imágenes, vídeo y más—. Al analizar estas señales en conjunto, esperamos avanzar hacia una comprensión más holística y sólida del comportamiento de los usuarios, de modo que podamos identificar mejor los posibles riesgos de seguridad que los sistemas de una sola modalidad podrían pasar por alto. 
Dentro de la tecnología: cómo Sentinel potencia la detección preventiva

Para que nuestro sistema de moderación pueda actuar con rapidez, antes de que la intención de causar daño vaya más allá de la mera intención, Sentinel necesita ejecutar el proceso de análisis completo casi en tiempo real, a gran escala, analizando más de 6000 millones de mensajes de chat al día. Sentinel captura continuamente el texto de los chats en instantáneas de un minuto. Los mensajes se analizan automáticamente mediante aprendizaje automático, con el único objetivo de identificar posibles daños, como la captación de menores o la puesta en peligro de la infancia. Además, agregamos esta información a lo largo del tiempo, identificando casos y patrones preocupantes para que los analistas humanos los evalúen e investiguen. 

A diferencia de las herramientas que se basan en reglas estáticas y ejemplos etiquetados, Sentinel utiliza el entrenamiento autosupervisado para aprender a detectar —y generalizar— los patrones de comunicación a medida que se producen. Esto permite a Sentinel identificar amenazas nuevas y en evolución.

El equipo logró esto desarrollando dos índices. Uno está compuesto por comunicaciones de usuarios que interactúan con mensajes seguros y benignos: el índice positivo. El otro está compuesto por comunicaciones que se eliminaron porque determinamos que infringían la política de peligro para los menores: el índice negativo. Este enfoque contrastivo ayuda al sistema a generalizar y detectar amenazas en evolución, incluso si no coinciden exactamente con los patrones de comunicación detectados previamente en el índice. Una de las principales ventajas de Sentinel es que no requiere un gran número de ejemplos para funcionar. Esto es especialmente importante dada la escasa prevalencia de ejemplos negativos. Nuestro sistema de producción actual opera con tan solo 13 000 ejemplos en el índice negativo, al tiempo que sigue identificando con éxito posibles daños.   

Cómo encaja Sentinel en nuestro sistema de seguridad global.

El Índice Positivo

Para crear el índice positivo, utilizamos una muestra seleccionada del historial de chat de usuarios sin antecedentes de infracciones de las Normas de la comunidad relacionadas con la seguridad y con una participación positiva constante y a largo plazo en Roblox. Al utilizar esta muestra seleccionada del historial de chat de Roblox, en lugar de conjuntos de datos de texto genéricos, hemos podido ayudar a Sentinel a aprender nueva jerga y patrones y estilos de lenguaje específicos de Roblox. Esto ayuda al sistema a realizar comparaciones más precisas, reduciendo los falsos positivos y permitiéndole diferenciar mejor entre la comunicación típica de Roblox y la comunicación que incumple las normas.

El Índice Negativo

El índice negativo se crea a partir de conversaciones revisadas por nuestros moderadores humanos, en las que hemos encontrado pruebas claras de infracciones de la política sobre poner en peligro a menores (sobre las que ya hemos tomado medidas). Cuando las interacciones de un usuario muestran una actividad preocupante y continuada, etiquetamos fragmentos específicos de esas conversaciones como ejemplos de comunicación dañina. Esos segmentos etiquetados se transforman en vectores de incrustación y se añaden al índice negativo. Con este entrenamiento, Sentinel aprende a ir más allá de marcar ciertas palabras o frases; aprende de los patrones contextuales y las progresiones que siguen las conversaciones con verdadera intención de causar daño. Gracias a esto, el sistema puede reconocer comunicaciones dañinas que nuestros otros sistemas de moderación de IA podrían no detectar, incluso cuando parecen sutiles. 

Por ejemplo, mensajes sencillos como «Hola, ¿qué tal?» coincidirían con el índice positivo porque el lenguaje es benigno. Un mensaje como «¿De dónde eres?» coincidiría con el índice negativo porque se ajusta a los patrones de posibles conversaciones de captación. El sistema compara los mensajes nuevos con estos índices, y si ve que un usuario pregunta «¿De dónde eres?», puede empezar a recopilar más información para ver si la conversación sigue por la vía negativa. Aunque un solo mensaje no sería suficiente para marcarlo para revisión humana, un patrón continuado sí lo sería.

Medición contrastiva

Este enfoque de medición contrastiva se inspira en SimCLR, un marco de aprendizaje autosupervisado que utiliza la medición contrastiva para entrenar modelos de representación de imágenes sin datos etiquetados. Hemos adaptado esta técnica para que funcione con datos de texto y voz, lo que permite a Sentinel comprender lo que dice un usuario y cómo se ajusta o se desvía de los patrones conocidos. Esto funciona en tres etapas: puntuación de la interacción, seguimiento de patrones y toma de medidas.

Medición de interacciones individuales: Cada mensaje se convierte en una incrustación, o un vector que captura las características semánticas y comunicativas de la acción. Sentinel compara esta incrustación con los índices positivo y negativo. Utilizando la similitud coseno, el sistema mide entonces a qué índice se acerca más la interacción.

Si la interacción se ajusta más a los patrones dañinos del índice negativo, recibe un indicador de riesgo más alto. Los mensajes que no se ajustan de manera significativa a los patrones de comunicación seguros o dañinos se filtran, de modo que el sistema puede centrarse únicamente en las interacciones que contienen una señal potencial. Esto puede ayudar a reducir los falsos positivos y mejorar la precisión de la medición de las interacciones a lo largo del tiempo. 

Seguimiento de patrones mediante la asimetría, no solo mediante promedios: los malos actores suelen enmascarar sus intenciones mezclándolas con contenido inofensivo. Si simplemente promediáramos la medición de un usuario a lo largo del tiempo, los mensajes negativos que queremos detectar podrían perderse entre el ruido. En su lugar, Sentinel analiza la distribución de las mediciones a lo largo del tiempo y mide la asimetría estadística, una forma de detectar si hay mensajes poco frecuentes y de alto riesgo que elevan el perfil de riesgo.

Esto nos ayuda a detectar los primeros indicios de una escalada hacia una comunicación peligrosa, incluso si la mayoría de las interacciones parecen benignas. Al analizar la asimetría, también corregimos el volumen. Los usuarios muy activos pueden parecer más riesgosos porque su comunicación muestra un mayor número absoluto de coincidencias. Al dar prioridad a la asimetría estadística en lugar del volumen total, podemos evitar falsos positivos relacionados con usuarios comunicativos pero que cumplen las normas. Con esto, Sentinel no solo es escalable, sino que es más preciso, capaz de procesar vastos flujos de comunicación para encontrar las señales poco frecuentes pero críticas que nos ayudan a detectar la intención de causar daño. 

De la señal a la acción: A medida que se miden más interacciones, el sistema construye un perfil de riesgo dinámico. Cuando el patrón de un usuario muestra una fuerte coincidencia con la comunicación con intención de causar daño, o un sesgo que se mueve en esa dirección, Sentinel activa una alerta para una revisión e investigación más exhaustivas.