本網站內容使用人工智慧(AI)或機器翻譯技術翻譯,可能存在錯誤。

Skip to content

開放 Roblox Sentinel 原始碼:我們對預先風險偵測的策略

運用人工智慧協助及早偵測異常聊天模式

  • 每天,超過一億名各年齡層的用戶都在 Roblox 上享有安全且正向的體驗。
  • 我們致力於讓系統預設狀態下盡可能安全,特別是針對最年幼的使用者。我們透過極為保守的政策,並運用人工智慧過濾聊天中偵測到的不當訊息(包括可識別個人身分的資訊,但「可信聯繫人」功能除外),來達成此目標。我們會主動審查內容,並禁止在聊天中分享現實世界的影像。
  • 當然,沒有任何系統是完美的,而業界面臨的最大挑戰之一,便是偵測潛在的兒童危害等嚴重風險。一連串友善的聊天與支持性訊息,在較長的對話歷史中可能會產生不同的含義,特別是在不同年齡層的用戶之間發生時。 
  • 我們開發了「Roblox Sentinel」——這套基於對比式學習的人工智慧系統,能協助我們偵測潛在兒童受危害的早期徵兆(例如誘騙行為),讓我們得以更早展開調查,並在必要時向執法機關通報。
  • 在 2025 年上半年,Sentinel 協助我們的團隊向「全國失蹤與受剝削兒童中心」提交了約 1,200 份關於潛在兒童剝削企圖的報告。這其中包含企圖規避我們的過濾機制及其他安全防護措施的案例。
  • 我們很高興將 Roblox Sentinel 開源,並積極尋求社群參與,期望藉此共同打造更安全的網路環境。

與朋友共度時光並與其他玩家競技,是 Roblox 的核心要素,而溝通正是這些活動的關鍵所在。 事實上,每天有超過 1.11 億名用戶造訪 Roblox,社群成員平均發送 61 億則聊天訊息,並以數十種語言進行總計 110 萬小時的語音通訊。這種溝通模式與現實世界如出一轍——絕大多數是日常閒聊,從隨意的交談到討論遊戲玩法,但仍有少數惡意使用者試圖規避我們的系統,甚至可能企圖造成傷害。 

上個月,我們分享了關於「依年齡分級溝通」的願景。我們致力於讓系統預設為盡可能安全,特別是針對最年幼的用戶。例如,我們不允許用戶透過聊天功能分享圖片或影片。雖然我們的系統並非完美,但正持續改進,並設計為主動阻擋個人識別資訊(如電話號碼和用戶名稱);此外,未經年齡驗證的用戶之間的聊天內容會受到嚴格過濾 (且禁止 13 歲以下用戶進行此類對話)。Roblox 是少數幾家要求透過臉部年齡估算,才能與熟人更自由地進行聊天的大型平台之一。我們的目標是引領全球線上遊戲的安全標準,並致力於關鍵安全技術開源

今日,我們發布了最新的開源模型「Sentinel」,這是一套人工智慧系統,旨在協助偵測可能危及兒童安全的互動行為。在情況變得明顯之前,Sentinel 便能讓我們及早偵測並調查細微的模式,並在必要時向執法機關通報。

Sentinel 自 2024 年底起便已在 Roblox 上運行,是我們開源安全工具組中的最新成員。 在 2025 年上半年,我們偵測到的案件中有 35% 是透過這種主動式方法發現的,許多情況下甚至在虐待報告提交之前就已察覺。當與我們的其他內容審查系統結合使用時,Sentinel 擴充了我們用以偵測並處理這些潛在嚴重違規行為的工具庫。 

理解挑戰
兒童受侵害問題是整個產業面臨的挑戰,這使得新技術與開放合作顯得極其重要。網路誘拐——即系統性地建立信任與情感連結,最終目的在於剝削——本質上是一個隱晦且漸進的過程。這類互動雖屬罕見,但往往始於一系列友善的聊天、支持性的訊息以及共同興趣。那些起初看似無害的訊息,在較長的對話紀錄中可能會產生截然不同的含義。 惡意行為者常使用隱晦、間接或暗語——刻意讓模式難以被察覺,即使是人工審查員也難以辨識。因此,我們的偵測系統持續進化,以跟上惡意行為者試圖規避系統的新手法。此外,誘騙行為的訓練資料極為稀少,這使得訓練機器學習系統變得困難重重。
主動影響與營運洞察

Sentinel 目前已在大規模環境中投入正式運作。 在 2025 年上半年,其主動偵測功能已協助我們的團隊向「國家失蹤與受剝削兒童中心」提交了約 1,200 份報告。雖然我們仍有改進空間,但 Sentinel 的早期偵測能力已能協助我們在流程更早的階段——當訊息仍顯隱晦且尚未因用戶提交的濫用報告而浮現時——即刻識別並調查潛在的不良行為者。 

在調查與介入 Sentinel 偵測到的案件時,人類專家至關重要。經過專業訓練的分析師(通常為前中情局或聯邦調查局探員及其他專家)會審查 Sentinel 標記為潛在違規的案件。 這些分析師的決策形成了一種反饋循環,使我們能夠持續精進並更新範例、索引及訓練資料集。這種「人機協作」的流程對於協助 Sentinel 適應並跟上惡意行為者為規避偵測而不斷演變的新模式與手法至關重要。

Sentinel 是 Roblox 更宏大的分層安全系統中不可或缺的一環,該系統融合了創新的 AI 工具與數千名人類專家。截至今日,它也已成為我們 Roblox 開源安全工具包的一部分。 我們相信,營造更安全的數位世界是大家的共同責任。透過將 Sentinel 等安全系統開源、分享我們的做法,並成為「強健開放式線上安全工具」(ROOST)及「科技聯盟Lantern 計畫等組織的創始成員,我們希望為線上安全實務的集體進步,以及依賴這些實務的線上社群,做出貢獻。

「當今有太多平台缺乏識別和預防網路危害所需的先進工具,尤其是針對兒童的危害。在 ROOST,我們相信任何致力於保護使用者的人都應能獲得強大的安全防護措施,我們非常高興 Roblox 能為信任與安全領域貢獻更多開放使用的工具。」
ROOST 產品總監 沈茱麗葉
我們對 Sentinel 的長期願景不僅限於對話。使用嵌入向量與對比測量的原則具有高度適應性。 我們正積極探索並開發相關能力,將這些技術應用於更廣泛的用戶互動情境,朝著跨文本、圖像、影片等多模態理解的方向邁進。透過綜合分析這些訊號,我們期望能建立更全面且穩健的用戶行為理解,從而更有效地識別單一模態系統可能忽略的潛在安全風險。 
技術內幕:Sentinel 如何實現預先偵測

為了協助我們的審核系統迅速採取行動,在惡意意圖演變成實際傷害之前,Sentinel 必須以近乎即時的速度執行完整的分析流程——且須在龐大規模下運作,每日處理超過 60 億則聊天訊息。Sentinel 會持續以一分鐘為單位擷取文字聊天內容。 訊息會透過機器學習進行自動分析,其唯一目的是識別潛在危害,例如誘騙或危害兒童安全。此外,我們會隨時間累積這些資訊,找出值得關注的案例與模式,供人工分析師評估與調查。 

有別於依賴靜態規則和標記範例的工具,Sentinel 採用自監督學習,在通訊模式發生時即時學習如何辨識並進行泛化。這使 Sentinel 能夠識別新出現且不斷演變的威脅。

團隊透過開發兩個索引來實現此目標。其一是由與安全、無害訊息互動的用戶所產生的通訊內容構成——即正向索引;另一則是由我們判定違反危害兒童政策而遭移除的通訊內容構成——即負向索引。這種對比式方法有助於系統進行泛化,即使新威脅與索引中先前偵測到的通訊模式不完全吻合,系統仍能識別出這些不斷演變的威脅。 Sentinel 的關鍵優勢之一在於其運作無需大量範例。鑑於負面範例的稀缺性,這一點尤為重要。我們目前的生產系統僅憑負面索引中的 13,000 個範例即可運作,同時仍能成功識別潛在危害。   

Sentinel 在我們整體安全系統中的定位。

《正向指數》

為了建立正向指標,我們採用了一組經過精選的聊天記錄樣本,這些樣本來自從未有過違反安全相關《社群規範》紀錄,且在 Roblox 上長期保持積極互動的用戶。 透過使用這份經過篩選的 Roblox 聊天記錄樣本,而非通用文字資料集,我們得以協助 Sentinel 學習新的俚語以及 Roblox 特有的語言模式與風格。這有助於系統進行更精準的比對,減少誤報,並使其能更有效地區分典型的 Roblox 溝通與違規溝通。

《負面索引》

負面索引是根據我們的人工審核員所審查的對話建立而成,其中我們發現了明顯違反兒童安全政策的證據(我們已針對此採取行動)。當用戶的互動顯示出持續且令人擔憂的行為時,我們會將這些對話中的特定片段標記為有害溝通的範例。 這些被標記的片段會轉化為嵌入向量,並加入負面索引中。透過此訓練,Sentinel 不僅能標記特定詞彙或短語,更能從真實具傷害意圖對話所遵循的語境模式與發展脈絡中學習。正因如此,即使有害通訊表現得極為隱晦,系統仍能識別出其他 AI 審核系統可能忽略的內容。 

舉例來說,像「嗨,你好嗎?」這類簡單的訊息會與正面索引匹配,因為其用詞無害;而「你來自哪裡?」這類訊息則會與負面索引匹配,因為它符合潛在誘騙對話的模式。 系統會將新訊息與這些指標進行比對,若發現用戶詢問「你來自哪裡?」,系統可能會開始收集更多資訊,以觀察對話是否持續朝負面方向發展。雖然單一訊息不足以觸發人工審查,但若出現持續性的模式,則足以觸發審查。

對比測量

這種對比度量方法的靈感源自 SimCLR,這是一個利用對比度量在無標籤數據的情況下訓練圖像表徵模型的自監督學習框架。我們已將此技術改編為適用於文字與語音數據,使 Sentinel 能理解用戶所說內容,並判斷其與已知模式的契合或偏離程度。此過程分為三個階段:互動評分、模式追蹤,以及採取行動。

衡量個別互動:每則訊息都會被轉換為嵌入向量,該向量能捕捉該互動的語義與溝通特徵。Sentinel 會將此嵌入向量與正向及負向指標進行比對。接著,系統會運用餘弦相似度來衡量該互動與哪個指標更為接近。

若互動與負面指標中的有害模式更為吻合,則會被賦予更高的風險指標。那些既未顯著符合安全模式也未顯著符合有害模式的訊息將被過濾,使系統能專注於那些可能蘊含潛在訊號的互動。此舉有助於減少誤報,並隨時間推移提升互動評估的準確性。 

透過偏度而非僅平均值追蹤模式:惡意行為者常將其意圖混入無害內容中以掩飾行蹤。若我們僅對用戶的測量值進行時間平均,我們欲偵測的負面訊息可能會淹沒在雜訊中。相反地,Sentinel 會觀察測量值隨時間的分布,並測量統計偏度——這是一種偵測是否存在罕見的高風險訊息,進而拉高風險輪廓的方法。

這有助於我們在多數互動看似無害時,仍能偵測到朝向危險通訊升級的早期徵兆。在分析偏度時,我們同時會對互動量進行校正。 高度活躍的使用者可能因其通訊中匹配項目的絕對數量較多,而顯得風險更高。透過強調統計偏度而非整體數量,我們能避免將健談但守規的使用者誤判為風險對象。藉此,Sentinel 不僅具備可擴展性,更精準無比,能夠處理龐大的通訊流量,找出那些稀少卻關鍵的訊號,協助我們偵測傷害意圖。 

從訊號到行動:隨著測量更多互動,系統會建立動態風險檔案。當用戶的模式與具傷害意圖的通訊高度吻合,或偏斜趨勢朝該方向發展時,Sentinel 便會觸發警示,以進行更深入的審查與調查。