本网站内容使用人工智能(AI)或机器翻译技术翻译,可能存在错误。

Skip to content

Roblox Sentinel 的开源化:我们对风险预先检测的策略

利用人工智能帮助早期发现异常聊天模式

  • 每天,超过 1 亿各年龄段的用户都在 Roblox 上享受安全、积极的体验。
  • 我们致力于让系统默认设置尽可能安全,特别是针对最年轻的用户。为此,我们制定了极其严格的政策,并利用人工智能过滤聊天中检测到的不当信息,包括个人身份信息(“可信联系人”功能之外的内容)。我们积极审核内容,并禁止在聊天中分享现实世界中的图片。
  • 当然,没有任何系统是完美的,而行业面临的最大挑战之一就是检测潜在的儿童受伤害等严重危害。一系列友好的聊天和支持性信息,在较长的对话记录中可能会产生不同的含义,尤其是在不同年龄段的用户之间发生时。 
  • 我们开发了 Roblox Sentinel——一个基于对比学习的 AI 系统,它能帮助我们检测潜在儿童受伤害的早期迹象(例如诱骗行为),从而让我们能够更早地展开调查,并在必要时向执法部门报告。
  • 在 2025 年上半年,Sentinel 协助我们的团队向美国国家失踪与受虐儿童中心提交了约 1,200 份关于潜在儿童剥削企图的报告。其中包括试图绕过我们的过滤机制及其他安全防护措施的行为。
  • 我们很高兴将 Roblox Sentinel 开源,并积极寻求社区参与,希望借此共同构建更安全的互联网环境。

与朋友共度时光以及与其他玩家竞技是 Roblox 的核心组成部分,而沟通正是这些活动的核心。 事实上,每天有超过 1.11 亿用户访问 Roblox,社区平均发送 61 亿条聊天消息,并产生 110 万小时的语音通信,涉及数十种语言。这种沟通与现实世界如出一辙——绝大多数是日常聊天,从闲聊到讨论游戏玩法,但少数不良分子试图绕过我们的系统,甚至可能企图造成伤害。 

上个月,我们分享了关于基于年龄的沟通机制的愿景。我们致力于让系统默认设置尽可能安全,特别是针对最年轻的用户。例如,我们禁止用户通过聊天功能分享图片或视频。虽然我们的系统并非完美,但正在持续改进,并设计为主动屏蔽个人身份信息(如电话号码和用户名),且未通过年龄验证的用户之间的聊天将受到严格过滤 (且禁止13岁以下用户进行此类聊天)。Roblox是少数要求通过面部年龄估算才能与熟人更自由聊天的平台之一。我们的目标是引领全球在线游戏安全领域,并致力于将关键安全技术开源

今天,我们发布了最新的开源模型 Sentinel——这是一个能够帮助检测可能危及儿童安全的互动行为的人工智能系统。在问题变得显而易见之前,Sentinel 就能让我们及早发现并调查细微的异常模式,并在必要时向执法部门报告。

Sentinel自2024年底起已在Roblox平台运行,是我们开源安全工具包中的最新成员。 在2025年上半年,我们检测到的案件中有35%得益于这一主动措施,其中许多案例是在虐待报告提交之前就被发现的。当与我们的其他内容审核系统结合使用时,Sentinel 扩展了我们用于检测并应对这些潜在严重违规行为的工具库。 

理解挑战
儿童受伤害问题是整个行业面临的挑战,这使得新技术和开放合作变得极其宝贵。网络诱骗——即系统性地建立信任和情感联系,最终以剥削为目的——本质上是一个微妙且渐进的过程。此类互动较为罕见,通常始于一系列友好的聊天、支持性的信息以及共同兴趣。起初看似无害的消息,在较长的对话记录中可能会产生不同的含义。 不法分子常使用隐晦、间接或暗语——刻意制造难以察觉的模式,甚至连人工审核员也难以识别。因此,我们的检测系统在不断进化,以跟上不法分子试图规避系统的新手段。此外,诱骗行为的训练数据十分稀缺,这使得训练机器学习系统变得困难重重。
前瞻性影响与运营洞察

Sentinel 目前已在大规模生产环境中运行。 在 2025 年上半年,其主动监测能力已协助我们的团队向美国国家失踪与受虐儿童中心提交了约 1,200 份报告。尽管我们仍有改进空间,但 Sentinel 的早期检测能力已能帮助我们在更早阶段识别并调查潜在的恶意行为者——即在信息表现尚不明显、且尚未因用户提交的滥用报告而浮出水面之时。 

在调查和干预 Sentinel 检测到的案件时,人工专家不可或缺。经过专业培训的分析师(通常是前中情局或联邦调查局特工及其他专家)会审查 Sentinel 标记为潜在违规的案件。 这些分析师做出的决策形成了一个反馈循环,使我们能够持续优化和更新示例、索引及训练集。这种“人机协同”流程对于帮助 Sentinel 适应并跟上恶意行为者为逃避检测而不断演变的新模式和手段至关重要。

Sentinel是Roblox更宏大的分层安全体系的重要组成部分,该体系融合了创新的人工智能工具与数千名人类专家。截至今日,它也已成为我们Roblox开源安全工具包的一部分。 我们相信,构建更安全的数字世界是大家的共同责任。通过开源 Sentinel 等安全系统、分享我们的方法,并成为“稳健开放在线安全工具”(ROOST)和“科技联盟”Lantern 项目等组织的创始成员,我们希望为在线安全实践的集体进步以及依赖这些实践的在线社区做出贡献。

“如今,太多平台缺乏识别和防范网络危害(尤其是针对儿童的危害)所需的先进工具。在 ROOST,我们坚信,任何致力于保护用户安全的人都应能够获得强大的安全防护措施,我们非常高兴 Roblox 能为信任与安全领域贡献更多开放使用的工具。”
ROOST 产品总监 沈朱丽叶
我们对 Sentinel 的长期愿景不仅限于对话。使用嵌入向量和对比度量法的基本原则具有很强的适应性。 我们正在积极探索并开发相关能力,将这些技术应用于更广泛的用户交互场景,朝着跨文本、图像、视频等多模态理解的方向迈进。通过综合分析这些信号,我们希望建立对用户行为更全面、更稳健的理解,从而更好地识别单模态系统可能忽略的潜在安全风险。 
技术内幕:Sentinel 如何实现主动检测

为了帮助我们的审核系统在恶意意图演变为实际危害之前迅速采取行动,Sentinel 需要在近乎实时的情况下运行完整的分析流程——每天处理超过 60 亿条聊天消息,规模庞大。Sentinel 会以一分钟为单位持续捕获文本聊天内容。 消息由机器学习自动分析,其唯一目的是识别潜在危害,例如诱骗或危害儿童安全。此外,我们会随时间推移汇总这些信息,识别出值得关注的案例和模式,供人工分析师进行评估和调查。 

与依赖静态规则和标注示例的工具不同,Sentinel 采用自监督学习,在通信模式发生时实时学习如何识别并泛化这些模式。这使 Sentinel 能够识别新兴且不断演变的威胁。

团队通过开发两个索引实现了这一目标。其中一个由用户与安全、无害消息的交互组成——即正样本索引;另一个则由因违反危害儿童政策而被移除的通信内容组成——即负样本索引。这种对比式方法有助于系统进行泛化,即使新出现的威胁与索引中先前检测到的通信模式不完全匹配,也能被识别出来。 Sentinel 的一个关键优势在于,其运行无需大量样本。鉴于负面样本的稀缺性,这一点尤为重要。我们当前的正式运行系统仅使用负面索引中的 13,000 个样本,仍能成功识别潜在危害。   

Sentinel 在我们整体安全系统中的作用。

《积极指数》

为了构建正向索引,我们使用了一组经过筛选的聊天记录样本,这些记录来自从未违反过与安全相关的社区准则、且在 Roblox 上长期保持积极互动的用户。 通过使用这部分经过筛选的 Roblox 聊天记录样本(而非通用文本数据集),我们帮助 Sentinel 学习了新的俚语以及 Roblox 特有的语言模式和风格。这有助于系统进行更准确的对比,减少误报,并使其能够更好地区分典型的 Roblox 交流与违规交流。

《负面索引》

负面索引基于人工审核员审查的对话构建而成,其中包含我们已发现的明显违反儿童安全政策的证据(针对此类情况我们已采取行动)。当用户的互动显示出持续且令人担忧的活动时,我们会将这些对话中的特定片段标记为有害交流的示例。 这些被标记的片段会被转换为嵌入向量并加入负面索引。通过这种训练,Sentinel 不仅能识别特定词汇或短语,更能从真实恶意对话的语境模式和演变过程中学习。正因如此,即使有害信息表现得十分隐晦,该系统也能识别出其他 AI 审核系统可能忽略的内容。 

例如,“嘿,你好吗?”这类简单消息会匹配正向索引,因为其语言性质温和;而“你来自哪里?”这类消息则会匹配负向索引,因为它符合潜在诱骗对话的模式。 该系统会将新消息与这些索引进行比对,若发现用户询问“你来自哪里?”,系统可能会开始收集更多信息,以判断对话是否会沿着负面路径发展。虽然单条消息不足以触发人工审核,但持续的模式则会触发。

对比测量

这种对比度量方法的灵感源自 SimCLR,这是一个利用对比度量在无标注数据情况下训练图像表示模型的自监督学习框架。我们已将该技术适配至文本和语音数据,使 Sentinel 能够理解用户所说内容,并判断其与已知模式的契合或偏离程度。该过程分为三个阶段:交互评分、模式追踪以及采取行动。

评估单次交互:每条消息会被转换为嵌入向量,该向量能捕捉该行为的语义和沟通特征。Sentinel将此嵌入向量与正向和负向索引进行比对。随后,系统通过余弦相似度来衡量该交互更接近哪个索引。

如果交互更符合负面索引中的有害模式,则会获得更高的风险指标。那些既不明显符合安全模式也不符合有害模式的消息会被过滤掉,从而使系统能够专注于那些可能包含潜在信号的交互。这有助于减少误报,并随着时间的推移提高交互测量的准确性。 

通过偏度而非仅平均值追踪模式:恶意行为者常将恶意意图混入无害内容中加以掩饰。若仅对用户随时间推移的测量值取平均值,我们想要检测的负面消息可能会淹没在噪声中。因此,Sentinel 会分析随时间推移的测量值分布,并测量统计偏度——这是一种检测是否存在罕见的高风险消息导致风险概况上升的方法。

这有助于我们及早发现通向危险沟通的征兆,即使大多数互动看似无害。在分析偏度时,我们还会对数据量进行校正。 高度活跃的用户可能看起来风险更高,因为他们的沟通中匹配项的绝对数量更大。通过侧重统计偏度而非总体数量,我们可以避免将健谈但守规的用户误判为风险用户。因此,Sentinel 不仅具备可扩展性,而且更加精准,能够处理海量的沟通流,从而发现那些罕见但关键的信号,帮助我们识别伤害意图。 

从信号到行动:随着更多交互数据的积累,系统会构建动态风险档案。当用户的行为模式与具有伤害意图的沟通高度吻合,或偏度正朝着该方向发展时,Sentinel 会触发警示,以便进行更深入的审查和调查。