Nội dung trên trang web này đã được dịch bằng trí tuệ nhân tạo (AI) hoặc công nghệ dịch máy và có thể có lỗi.

Skip to content

Mở mã nguồn Roblox Sentinel: Cách tiếp cận của chúng tôi để phát hiện rủi ro chủ động

Sử dụng trí tuệ nhân tạo để phát hiện sớm các mẫu trò chuyện bất thường

  • Mỗi ngày, hơn 100 triệu người dùng ở mọi lứa tuổi đều có trải nghiệm an toàn và tích cực trên Roblox.
  • Chúng tôi nỗ lực để các hệ thống của mình an toàn nhất có thể theo mặc định, đặc biệt là đối với những người dùng nhỏ tuổi nhất. Chúng tôi thực hiện điều này bằng các chính sách cực kỳ thận trọng và tận dụng AI để lọc các tin nhắn không phù hợp trong trò chuyện mà chúng tôi phát hiện, bao gồm thông tin nhận dạng cá nhân (ngoài Trusted Connections). Chúng tôi chủ động kiểm duyệt nội dung và không cho phép chia sẻ hình ảnh trong thế giới thực trong trò chuyện.
  • Tất nhiên, không có hệ thống nào là hoàn hảo, và một trong những thách thức lớn nhất trong ngành là phát hiện các nguy cơ nghiêm trọng như nguy cơ gây hại cho trẻ em. Một chuỗi cuộc trò chuyện thân thiện và tin nhắn hỗ trợ có thể mang ý nghĩa khác đi theo thời gian, đặc biệt khi diễn ra giữa người dùng thuộc các nhóm tuổi khác nhau. 
  • Chúng tôi đã phát triển Roblox Sentinel, một hệ thống AI dựa trên học đối chiếu giúp chúng tôi phát hiện các dấu hiệu sớm của nguy cơ tiềm ẩn đối với trẻ em, chẳng hạn như dụ dỗ, cho phép chúng tôi điều tra sớm hơn và, khi cần thiết, báo cáo cho cơ quan thực thi pháp luật.
  • Trong nửa đầu năm 2025, Sentinel đã giúp đội ngũ của chúng tôi gửi khoảng 1.200 báo cáo về các nỗ lực tiềm ẩn nhằm lạm dụng trẻ em đến Trung tâm Quốc gia về Trẻ em Mất tích và Bị lạm dụng. Điều này bao gồm các nỗ lực nhằm lách qua các cơ chế lọc và các biện pháp bảo vệ khác của chúng tôi.
  • Chúng tôi rất vui mừng được mở mã nguồn Roblox Sentinel và đang tích cực tìm kiếm sự tham gia của cộng đồng, với hy vọng điều này sẽ giúp xây dựng một môi trường internet an toàn hơn.

Dành thời gian với bạn bè và cạnh tranh với những người chơi khác là một phần quan trọng của Roblox, và giao tiếp là trọng tâm của những hoạt động đó. Thực tế, mỗi ngày có hơn 111 triệu người dùng truy cập Roblox, nơi cộng đồng gửi trung bình 6,1 tỷ tin nhắn chat và tạo ra 1,1 triệu giờ giao tiếp bằng giọng nói bằng hàng chục ngôn ngữ. Sự giao tiếp này phản ánh thế giới thực – phần lớn là những cuộc trò chuyện hàng ngày, từ những cuộc trò chuyện casual đến thảo luận về gameplay, nhưng một số ít kẻ xấu tìm cách vượt qua hệ thống của chúng tôi và có thể cố gắng gây hại. 

Tháng trước, chúng tôi đã chia sẻ tầm nhìn về giao tiếp dựa trên độ tuổi. Chúng tôi nỗ lực để các hệ thống của mình an toàn nhất có thể theo mặc định, đặc biệt là đối với người dùng nhỏ tuổi nhất. Ví dụ, chúng tôi không cho phép chia sẻ hình ảnh hoặc video giữa người dùng qua chat. Các hệ thống của chúng tôi, dù chưa hoàn hảo, đang liên tục được cải thiện và được thiết kế để chủ động chặn thông tin nhận dạng cá nhân—như số điện thoại và tên người dùng—và cuộc trò chuyện giữa người dùng chưa xác minh độ tuổi sẽ bị lọc nghiêm ngặt (và không được phép đối với người dùng dưới 13 tuổi). Roblox là một trong những nền tảng lớn nhất yêu cầu ước tính độ tuổi qua khuôn mặt để trò chuyện tự do hơn với những người bạn biết. Mục tiêu của chúng tôi là dẫn đầu thế giới về an toàn trong trò chơi trực tuyến, và chúng tôi cam kết mở mã nguồn các công nghệ an toàn quan trọng.

Hôm nay, chúng tôi ra mắt mô hình mã nguồn mở mới nhất của mình, Sentinel, một hệ thống AI giúp phát hiện các tương tác có khả năng gây nguy hiểm cho trẻ em. Rất lâu trước khi một điều gì đó trở nên rõ ràng, Sentinel cho phép chúng tôi phát hiện và điều tra các mẫu hành vi tinh vi từ sớm, và khi cần thiết, báo cáo cho cơ quan thực thi pháp luật.

Sentinel đã được triển khai trên Roblox từ cuối năm 2024 và là thành phần mới nhất trong bộ công cụ an toàn mã nguồn mở của chúng tôi. Trong nửa đầu năm 2025, 35% các trường hợp mà chúng tôi phát hiện là nhờ phương pháp chủ động này, trong nhiều trường hợp, chúng tôi đã phát hiện ra chúng trước khi có báo cáo lạm dụng. Khi kết hợp với các hệ thống kiểm duyệt khác của chúng tôi, Sentinel mở rộng kho công cụ mà chúng tôi có để phát hiện và xử lý các vi phạm nghiêm trọng tiềm ẩn này. 

Hiểu rõ thách thức
Việc trẻ em bị đe dọa là một thách thức trong toàn ngành, khiến các công nghệ mới và sự hợp tác cởi mở trở nên vô cùng quý giá. Lạm dụng trẻ em trực tuyến — việc xây dựng lòng tin và kết nối cảm xúc một cách có hệ thống với mục đích cuối cùng là khai thác — bản chất là một quá trình tinh vi và dần dần. Những tương tác này rất hiếm và thường bắt đầu bằng một loạt các cuộc trò chuyện thân thiện, tin nhắn động viên và sở thích chung. Những tin nhắn ban đầu có vẻ vô hại có thể mang một ý nghĩa khác trong quá trình trò chuyện kéo dài. Những kẻ xấu thường sử dụng ngôn ngữ tinh vi, gián tiếp hoặc mã hóa — cố tình làm cho các mẫu khó phát hiện, ngay cả đối với những người đánh giá là con người. Do đó, hệ thống phát hiện của chúng tôi liên tục phát triển để bắt kịp với những cách thức mới mà những kẻ xấu cố gắng sử dụng để lách luật hệ thống của chúng tôi. Hơn nữa, dữ liệu huấn luyện về dụ dỗ trẻ em rất hiếm — khiến việc huấn luyện các hệ thống học máy trở nên khó khăn.
Tác động chủ động và thông tin chi tiết về hoạt động

Sentinel hiện đang được triển khai trên quy mô lớn trong môi trường sản xuất. Trong nửa đầu năm 2025, các tính năng chủ động của Sentinel đã giúp đội ngũ của chúng tôi gửi khoảng 1.200 báo cáo đến Trung tâm Quốc gia về Trẻ em Mất tích và Bị lạm dụng. Mặc dù chúng tôi luôn có thể cải thiện hơn nữa, nhưng khả năng phát hiện sớm của Sentinel đã giúp chúng tôi xác định và điều tra các đối tượng xấu tiềm ẩn sớm hơn trong quá trình xử lý, khi các tin nhắn vẫn còn mơ hồ và trước khi chúng được người dùng báo cáo lạm dụng. 

Các chuyên gia con người là yếu tố thiết yếu trong việc điều tra và can thiệp vào các trường hợp mà Sentinel phát hiện. Các nhà phân tích được đào tạo, thường là cựu nhân viên CIA hoặc FBI và các chuyên gia khác, sẽ xem xét các trường hợp mà Sentinel đánh dấu là có khả năng vi phạm. Các quyết định của các chuyên gia này tạo ra một vòng phản hồi, cho phép chúng tôi liên tục tinh chỉnh và cập nhật các ví dụ, chỉ mục và bộ dữ liệu đào tạo. Quy trình có sự tham gia của con người này là yếu tố thiết yếu giúp Sentinel thích ứng và theo kịp các mô hình và phương thức mới, đang phát triển của các đối tượng xấu nhằm tránh sự phát hiện của chúng tôi.

Sentinel là một phần quan trọng trong hệ thống an toàn nhiều lớp của Roblox, kết hợp các công cụ AI sáng tạo và hàng nghìn chuyên gia con người. Hiện tại, nó cũng là một phần của bộ công cụ an toàn mã nguồn mở Roblox. Chúng tôi tin rằng việc xây dựng một thế giới kỹ thuật số an toàn hơn là trách nhiệm chung. Bằng cách mở mã nguồn các hệ thống an toàn như Sentinel, chia sẻ các phương pháp tiếp cận của chúng tôi và trở thành thành viên sáng lập của các tổ chức như Robust Open Online Safety Tools (ROOST) và dự án Lantern của Tech Coalition, chúng tôi hy vọng sẽ đóng góp vào sự phát triển chung của các thực hành an toàn trực tuyến và các cộng đồng trực tuyến phụ thuộc vào chúng.

“Hiện nay, quá nhiều nền tảng thiếu các công cụ tiên tiến cần thiết để xác định và ngăn chặn các nguy cơ trực tuyến, đặc biệt là những nguy cơ nhắm vào trẻ em. Tại ROOST, chúng tôi tin rằng các biện pháp bảo vệ an toàn mạnh mẽ nên được cung cấp cho bất kỳ ai cam kết bảo vệ người dùng của mình, và chúng tôi rất vui mừng khi Roblox đang đóng góp thêm các công cụ có sẵn rộng rãi hơn cho lĩnh vực tin cậy và an toàn.”
Juliet Shen, Trưởng bộ phận Sản phẩm tại ROOST
Tầm nhìn dài hạn của chúng tôi đối với Sentinel không chỉ dừng lại ở việc trò chuyện. Các nguyên tắc sử dụng nhúng và đo lường đối chiếu có khả năng thích ứng rất cao. Chúng tôi đang tích cực khám phá và phát triển các khả năng để áp dụng các kỹ thuật này vào một phạm vi rộng hơn các tương tác của người dùng, hướng tới sự hiểu biết đa phương thức — bao gồm văn bản, hình ảnh, video và hơn thế nữa. Bằng cách phân tích các tín hiệu này cùng nhau, chúng tôi hy vọng sẽ hướng tới một sự hiểu biết toàn diện và vững chắc hơn về hành vi của người dùng, để từ đó có thể xác định tốt hơn các rủi ro an toàn tiềm ẩn mà các hệ thống đơn phương thức có thể bỏ sót. 
Bên trong công nghệ: Cách Sentinel hỗ trợ phát hiện chủ động

Để giúp hệ thống kiểm duyệt của chúng tôi có thể hành động nhanh chóng, trước khi ý định gây hại vượt quá mức ý định, Sentinel cần chạy toàn bộ quy trình phân tích gần như theo thời gian thực — trên quy mô lớn, với hơn 6 tỷ tin nhắn trò chuyện mỗi ngày. Sentinel liên tục thu thập các cuộc trò chuyện văn bản trong các bản chụp nhanh mỗi phút. Các tin nhắn được phân tích tự động bằng ML, với mục đích duy nhất là xác định các nguy cơ tiềm ẩn, chẳng hạn như dụ dỗ hoặc gây nguy hiểm cho trẻ em. Ngoài ra, chúng tôi tổng hợp thông tin này theo thời gian, xác định các trường hợp và mẫu đáng lo ngại để các nhà phân tích con người đánh giá và điều tra. 

Không giống như các công cụ dựa vào các quy tắc tĩnh và các ví dụ được gắn nhãn, Sentinel sử dụng phương pháp huấn luyện tự giám sát để học cách phát hiện — và khái quát hóa — các mẫu giao tiếp khi chúng xuất hiện. Điều này cho phép Sentinel xác định các mối đe dọa mới và đang phát triển.

Đội ngũ đã đạt được điều này bằng cách phát triển hai chỉ số. Một chỉ số bao gồm các cuộc trò chuyện từ người dùng tương tác với tin nhắn an toàn, vô hại — chỉ số tích cực. Chỉ số còn lại bao gồm các cuộc trò chuyện bị xóa vì chúng vi phạm chính sách về nguy cơ đối với trẻ em — chỉ số tiêu cực. Cách tiếp cận đối chiếu này giúp hệ thống tổng quát hóa và phát hiện các mối đe dọa đang phát triển ngay cả khi chúng không khớp chính xác với các mẫu giao tiếp đã được phát hiện trước đó từ chỉ số. Một trong những lợi thế chính của Sentinel là nó không yêu cầu một số lượng lớn các ví dụ để hoạt động. Điều này đặc biệt quan trọng do tỷ lệ xuất hiện của các ví dụ tiêu cực rất thấp. Hệ thống sản xuất hiện tại của chúng tôi hoạt động chỉ với 13.000 ví dụ trong chỉ số tiêu cực, trong khi vẫn xác định thành công các nguy cơ tiềm ẩn.   

Cách Sentinel tích hợp vào hệ thống an toàn tổng thể của chúng tôi.

Chỉ số tích cực

Để xây dựng chỉ số tích cực, chúng tôi sử dụng một mẫu được chọn lọc từ lịch sử trò chuyện của những người dùng không có tiền sử vi phạm Tiêu chuẩn cộng đồng liên quan đến an toàn và có sự tương tác tích cực, lâu dài trên Roblox. Bằng cách sử dụng mẫu lịch sử trò chuyện Roblox được chọn lọc này thay vì các tập dữ liệu văn bản chung chung, chúng tôi đã giúp Sentinel học được các từ lóng mới và các mẫu ngôn ngữ cũng như phong cách đặc trưng của Roblox. Điều này giúp hệ thống thực hiện so sánh chính xác hơn, giảm thiểu các kết quả dương tính giả và cho phép hệ thống phân biệt tốt hơn giữa giao tiếp thông thường trên Roblox và giao tiếp vi phạm.

Chỉ số âm

Chỉ mục tiêu cực được xây dựng từ các cuộc trò chuyện được kiểm duyệt bởi các điều phối viên của chúng tôi, trong đó chúng tôi đã tìm thấy bằng chứng rõ ràng về các vi phạm chính sách gây nguy hiểm cho trẻ em (chúng tôi đã có hành động xử lý). Khi các tương tác của người dùng cho thấy hoạt động đáng lo ngại và liên tục, chúng tôi sẽ gắn nhãn các đoạn trích cụ thể trong các cuộc trò chuyện đó là ví dụ về giao tiếp có hại. Các đoạn được gắn nhãn này được chuyển đổi thành các vectơ nhúng và thêm vào chỉ mục tiêu cực. Với quá trình huấn luyện này, Sentinel học cách vượt ra ngoài việc chỉ đánh dấu các từ hoặc cụm từ nhất định; nó học từ các mẫu ngữ cảnh và diễn biến mà các cuộc trò chuyện có ý định gây hại thực sự tuân theo. Nhờ đó, hệ thống có thể nhận diện các giao tiếp có hại mà các hệ thống kiểm duyệt AI khác của chúng tôi có thể không phát hiện được, ngay cả khi chúng có vẻ tinh vi. 

Ví dụ, các tin nhắn đơn giản như “Xin chào, bạn khỏe không?” sẽ khớp với chỉ mục tích cực vì ngôn ngữ trong đó vô hại. Một tin nhắn như “Bạn đến từ đâu?” sẽ khớp với chỉ mục tiêu cực vì nó phù hợp với các mẫu của các cuộc trò chuyện có khả năng dụ dỗ. Hệ thống so sánh các tin nhắn mới với các chỉ số này, và nếu thấy người dùng hỏi “Bạn đến từ đâu?”, hệ thống có thể bắt đầu thu thập thêm thông tin để xem liệu cuộc trò chuyện có tiếp tục đi theo hướng tiêu cực hay không. Mặc dù một tin nhắn không đủ để báo cáo cho nhân viên xem xét, nhưng một mô hình lặp lại liên tục thì có thể.

Đo lường so sánh

Phương pháp đo lường tương phản này được lấy cảm hứng từ SimCLR, một khung học tự giám sát sử dụng đo lường tương phản để huấn luyện các mô hình biểu diễn hình ảnh mà không cần dữ liệu được gắn nhãn. Chúng tôi đã điều chỉnh kỹ thuật này để hoạt động với dữ liệu văn bản và giọng nói, cho phép Sentinel hiểu những gì người dùng nói và mức độ phù hợp hoặc khác biệt so với các mẫu đã biết. Quá trình này diễn ra qua ba giai đoạn: chấm điểm tương tác, theo dõi mẫu và thực hiện hành động.

Đo lường các tương tác cá nhân: Mỗi tin nhắn được chuyển đổi thành một embedding, tức là một vectơ ghi lại các đặc điểm ngữ nghĩa và giao tiếp của hành động. Sentinel so sánh embedding này với các chỉ số tích cực và tiêu cực. Sử dụng độ tương đồng cosine, hệ thống sau đó xác định chỉ số nào mà tương tác đó gần hơn.

Nếu tương tác phù hợp hơn với các mẫu gây hại trong chỉ số tiêu cực, nó sẽ nhận được chỉ số rủi ro cao hơn. Các tin nhắn không phù hợp một cách có ý nghĩa với cả các mẫu giao tiếp an toàn hoặc gây hại sẽ bị lọc ra, giúp hệ thống tập trung vào những tương tác mang tín hiệu tiềm năng. Điều này có thể giúp giảm các kết quả dương giả và cải thiện độ chính xác của việc đo lường tương tác theo thời gian. 

Theo dõi Mô hình Bằng Độ lệch, Không Chỉ Bằng Trung bình: Các đối tượng xấu thường che giấu ý định của mình bằng cách trộn lẫn chúng vào nội dung vô hại. Nếu chúng ta chỉ tính trung bình các chỉ số của người dùng theo thời gian, các tin nhắn tiêu cực mà chúng ta muốn phát hiện có thể bị chìm trong tiếng ồn. Thay vào đó, Sentinel phân tích phân phối các chỉ số theo thời gian và đo lường độ lệch thống kê — một cách để phát hiện liệu có các tin nhắn hiếm gặp, rủi ro cao đang kéo chỉ số rủi ro lên cao hay không.

Điều này giúp chúng tôi phát hiện các dấu hiệu ban đầu của sự leo thang hướng tới giao tiếp nguy hiểm, ngay cả khi hầu hết các tương tác có vẻ vô hại. Khi phân tích độ lệch, chúng tôi cũng điều chỉnh theo khối lượng. Người dùng hoạt động mạnh có thể trông rủi ro hơn vì giao tiếp của họ cho thấy số lượng khớp tuyệt đối lớn hơn. Bằng cách nhấn mạnh độ lệch thống kê thay vì khối lượng tổng thể, chúng ta có thể tránh các kết quả dương giả liên quan đến người dùng nói nhiều nhưng tuân thủ. Nhờ đó, Sentinel không chỉ có khả năng mở rộng mà còn chính xác hơn, có thể xử lý luồng giao tiếp khổng lồ để tìm ra các tín hiệu hiếm nhưng quan trọng giúp phát hiện ý định gây hại. 

Chuyển từ tín hiệu sang hành động: Khi ngày càng có nhiều tương tác được đo lường, hệ thống sẽ xây dựng một hồ sơ rủi ro động. Khi mẫu hành vi của người dùng cho thấy sự phù hợp cao với giao tiếp có ý định gây hại, hoặc sự lệch hướng theo hướng đó, Sentinel sẽ kích hoạt một cờ báo để xem xét và điều tra sâu hơn.