Inside the Tech - 몰입형 음성 통신의 안전성 확보

로블록스 아바타의 진화
엔지니어링 부문 수석 이사 키란 바트(Kiran Bhat), 제품 부문 수석 이사 마헤시 라마수브라마니안(Mahesh Ramasubramanian), 수석 제품 매니저 에피 고에나완(Effie Goenawan)과 함께
엔지니어링 부문 수석 이사 키란 바트(Kiran Bhat), 제품 부문 수석 이사 마헤시 라마수브라마니안(Mahesh Ramasubramanian), 수석 제품 매니저 에피 고에나완(Effie Goenawan)이 데이비드 바주키(David Baszucki) CEO와 함께 아바타를 통한 몰입형 커뮤니케이션의 미래와 이를 실현하기 위해 해결하고 있는 기술적 과제에 대해 살펴봅니다. 이들은 표현력 풍부한 아바타가 어떻게 우리가 디지털 공간에서 자신을 표현할 수 있게 해줄 뿐만 아니라, 음성, 표정, 바디랭귀지를 통해 더욱 몰입감 있게 소통할 수 있게 해주는지에 대해 심도 있게 논의할 예정입니다.
귀 팀이 현재 해결하고 있는 가장 큰 기술적 과제는 무엇인가요?
저희는 사용자에게 안전하고 긍정적인 경험을 제공하는 것을 최우선으로 합니다. 안전과 예의는 항상 저희의 최우선 과제이지만, 이를 실시간으로 처리하는 것은 큰 기술적 과제일 수 있습니다. 문제가 발생할 때마다 이를 검토하고 실시간으로 조치를 취하고 싶지만, 저희의 규모를 고려할 때 이는 쉽지 않은 일입니다. 이러한 규모를 효과적으로 처리하기 위해서는 자동화된 안전 시스템을 활용해야 합니다.
저희가 집중하고 있는 또 다른 기술적 과제는 콘텐츠 검토를 위한 안전 조치의 정확성입니다. 정책 위반을 해결하고 실시간으로 정확한 피드백을 제공하는 데에는 두 가지 검토 접근 방식이 있습니다: 사후 대응형 검토와 사전 대응형 검토입니다. 사후 대응형 검토의 경우, 플랫폼 사용자의 신고에 대응하여 다양한 유형의 정책 위반을 정확하게 식별할 수 있는 머신러닝(ML) 모델을 개발하고 있습니다. 사전 대응적 측면에서는 정책을 위반할 가능성이 있는 콘텐츠를 실시간으로 탐지하고, 사용자에게 자신의 행동에 대해 교육하는 작업을 진행하고 있습니다. 음성 내용을 이해하고 음질을 개선하는 것은 복잡한 과정입니다. 이미 진전이 보이고 있지만, 우리의 궁극적인 목표는 정책 위반 행위를 실시간으로 탐지할 수 있는 매우 정밀한 모델을 구축하는 것입니다.
이러한 기술적 과제를 해결하기 위해 우리가 활용하고 있는 혁신적인 접근 방식과 솔루션에는 어떤 것들이 있을까요?
저희는 오디오 데이터를 분석하고 정책 위반 유형(예: 이 내용이 괴롭힘이나 욕설일 확률 등)에 따라 신뢰도 수준을 제공하는 엔드투엔드(end-to-end) 머신러닝 모델을 개발했습니다. 이 모델 덕분에 특정 신고를 자동으로 종결하는 능력이 크게 향상되었습니다. 우리는 모델의 신뢰도가 높고, 모델이 인간보다 더 우수한 성능을 보인다고 확신할 때 조치를 취합니다. 출시 후 불과 몇 달 만에, 우리는 이 모델을 통해 거의 모든 영어 음성 악용 신고를 처리할 수 있게 되었습니다. 우리는 이러한 모델을 사내에서 직접 개발했으며, 이는 수많은 오픈소스 기술과 이를 뒷받침하는 기술을 만들기 위한 우리 자체 작업 간의 협력이 결실을 맺은 증거입니다.
실시간으로 무엇이 적절한지 판단하는 것은 꽤 복잡해 보입니다. 어떻게 작동하나요?
시스템이 문맥을 인식할 수 있도록 많은 고민을 기울였습니다. 또한 조치를 취하기 전에 시간 경과에 따른 패턴을 분석하여 조치의 정당성을 확보합니다. 당사의 정책은 사용자의 연령, 공개 공간인지 비공개 채팅인지 여부, 그리고 기타 여러 요인에 따라 세밀하게 조정됩니다. 우리는 실시간으로 예의를 장려할 새로운 방법을 모색하고 있으며, 그 핵심에는 머신러닝이 자리 잡고 있습니다. 최근에는 사용자에게 정책을 상기시켜 드리기 위해 자동 푸시 알림 기능을 출시했습니다. 또한 사용자의 의도를 더 잘 이해하고 비꼬는 말이나 농담 등을 구분하기 위해 어조와 같은 다른 요소들도 분석하고 있습니다. 마지막으로, 일부 사용자는 여러 언어를 구사하거나 문장 도중에 언어를 바꾸기도 하므로 다국어 모델도 구축 중입니다. 이 모든 것이 가능하려면 정확한 모델이 필수적입니다.
현재 저희는 괴롭힘, 차별, 욕설과 같은 가장 두드러진 형태의 악용 사례를 해결하는 데 주력하고 있습니다. 이러한 사례들이 악용 신고의 대부분을 차지합니다. 저희의 목표는 이러한 분야에서 실질적인 성과를 거두고, 온라인에서 예의 바른 대화를 장려하고 유지하는 방식에 대한 업계 표준을 정립하는 것입니다. 머신러닝을 실시간으로 활용하면 모든 사용자에게 안전하고 예의 바른 환경을 효과적으로 조성할 수 있으므로, 그 잠재력에 큰 기대를 걸고 있습니다.
Roblox에서 해결하고 있는 과제의 독특한 점은 무엇인가요? 우리가 가장 먼저 해결할 수 있는 과제는 무엇인가요?
저희의 'Spatial Voice' 기술이 적용된 채팅은 현실 세계의 의사소통 방식을 모방하여 더욱 몰입감 있는 경험을 제공합니다. 예를 들어, 제가 누군가의 왼쪽에 서 있다면 상대방은 왼쪽 귀로 제 목소리를 듣게 됩니다. 저희는 현실 세계에서 의사소통이 이루어지는 방식을 모방하고 있으며, 이것이 바로 저희가 가장 먼저 해결할 수 있는 과제입니다.
저 역시 게이머로서 온라인 게임에서 많은 괴롭힘과 따돌림을 목격해 왔습니다. 이는 사용자의 익명성과 처벌 부재로 인해 종종 방치되는 문제입니다. 하지만 우리가 이 문제를 해결하기 위해 다루고 있는 기술적 과제는 몇 가지 측면에서 다른 플랫폼들이 직면한 문제와는 차별화됩니다. 일부 게임 플랫폼에서는 상호작용이 팀원들로만 제한되기도 합니다. 로블록스는 현실을 더 가깝게 모방한 소셜 환경에서 어울릴 수 있는 다양한 방법을 제공합니다. 머신러닝(ML)과 실시간 신호 처리 기술의 발전 덕분에, 우리는 악의적인 행동을 효과적으로 탐지하고 대처할 수 있습니다. 이는 우리가 더 현실적인 환경일 뿐만 아니라, 누구나 안전하게 상호작용하고 소통할 수 있는 공간임을 의미합니다. 저희의 기술, 몰입감 높은 플랫폼, 그리고 사용자에게 정책을 교육하려는 헌신이 결합되어, 저희는 이러한 과제를 정면으로 해결할 수 있는 입지를 갖추게 되었습니다.
이러한 기술적 작업을 수행하며 배운 핵심적인 점들은 무엇인가요?
상당히 많은 것을 배운 것 같습니다. 저는 머신러닝 엔지니어가 아닙니다. 주로 게임 분야의 프론트엔드 업무를 해왔기 때문에, 이러한 모델이 어떻게 작동하는지에 대해 이전보다 더 깊이 있게 이해할 수 있게 된 것만으로도 큰 성과였습니다. 제가 바라는 바는, 우리가 예의를 장려하기 위해 취하고 있는 조치들이 온라인 커뮤니티에 그동안 부족했던 공감의 수준으로 이어지기를 희망합니다.
마지막으로 배운 점은 모든 것이 입력하는 훈련 데이터에 달려 있다는 것입니다. 그리고 데이터가 정확하려면, 정책 위반 행위를 분류하는 데 사용되는 라벨에 대해 사람들이 합의해야 합니다. 모두가 동의할 수 있는 양질의 데이터로 훈련하는 것이 정말 중요합니다. 이는 해결하기 정말 어려운 문제입니다. 머신러닝(ML)이 다른 모든 분야보다 훨씬 앞서 있는 영역도 있고, 아직 초기 단계에 머물러 있는 영역도 있다는 것을 알게 됩니다. 머신러닝이 여전히 성장 중인 분야가 많기 때문에, 현재의 한계를 인지하는 것이 핵심입니다.
귀하의 팀은 로블록스의 어떤 가치와 가장 부합하나요?
커뮤니티 존중은 이 과정 전반에 걸쳐 저희를 이끄는 핵심 가치입니다. 첫째, 플랫폼 내 예의 바른 문화 조성에 집중하고 정책 위반을 줄여야 합니다. 이는 전반적인 사용자 경험에 큰 영향을 미칩니다. 둘째, 이러한 새로운 기능을 어떻게 도입할지 신중하게 고려해야 합니다. 모델에서 오탐지(예: 특정 콘텐츠를 잘못된 신고로 분류하는 경우)가 발생하지 않도록 주의하고, 사용자에게 부당한 불이익이 가지 않도록 해야 합니다. 모델의 성능과 사용자 참여도에 미치는 영향을 지속적으로 모니터링하는 것이 매우 중요합니다.
로블록스와 귀하의 팀이 나아가는 방향 중 가장 기대되는 점은 무엇인가요?
공개 음성 커뮤니케이션 개선 측면에서 상당한 진전을 이루었지만, 아직 해야 할 일이 많이 남아 있습니다. 비공개 커뮤니케이션은 탐구해 볼 만한 흥미로운 분야입니다. 비공개 커뮤니케이션을 개선하여 사용자가 친한 친구들에게 자신의 생각을 표현할 수 있게 하고, 친구들과 상호작용하는 동안 경험 간 또는 경험 내에서 음성 통화를 할 수 있도록 하는 데에는 엄청난 기회가 있다고 생각합니다. 또한 사용자가 스스로 조직을 구성하고, 커뮤니티에 가입하며, 콘텐츠와 아이디어를 공유할 수 있도록 더 나은 도구를 제공함으로써 이러한 커뮤니티를 육성할 기회도 있다고 봅니다.
우리가 계속 성장함에 따라, 이러한 확장되는 커뮤니티를 지원하기 위해 채팅 기술을 어떻게 확장해 나갈 것인가? 우리는 아직 할 수 있는 일의 표면만을 긁고 있을 뿐이며, 전례 없는 방식으로 업계 전반의 온라인 소통과 협업의 건전성을 개선할 기회가 있다고 생각합니다. 적절한 기술과 머신러닝(ML) 역량을 바탕으로, 우리는 건전한 온라인 소통의 미래를 만들어갈 수 있는 독보적인 위치에 있습니다.


