Classificação de conteúdo nocivo de confiança e segurança para uma plataforma de redes sociais
Uma plataforma de redes sociais precisava de conteúdo nocivo classificado de forma consistente em várias línguas para treinar o seu modelo de confiança e segurança, depois de uma cobertura desigual ter deixado alguns dos seus mercados de língua não inglesa significativamente sub-moderados.
Client snapshot
| Industry | Redes sociais e plataformas de conteúdo |
|---|---|
| Region | Global, concentrado nos mercados de língua não inglesa de crescimento mais rápido do cliente |
| Engagement type | Classificação multilingue de conteúdo nocivo para confiança e segurança |
The challenge
O modelo de moderação do cliente tinha bom desempenho em inglês, mas tinha uma cobertura significativamente mais fraca em vários dos seus mercados de crescimento mais rápido, onde o conteúdo nocivo era mais difícil de detetar e, quando não detetado, acarretava um risco desproporcionado para a plataforma.
The approach
A Jwuma atribuiu anotadores falantes nativos nas línguas prioritárias do cliente para classificar conteúdo segundo uma taxonomia de danos detalhada, com as classificações contestadas ou limítrofes escaladas através de um nível de revisão e com calibração por tarefas de referência (gold tasks) para monitorizar a consistência da classificação entre línguas.
Results
O cliente alargou a cobertura consistente de classificação de conteúdo nocivo a mercados que antes estavam significativamente sub-moderados, colmatando uma lacuna importante na sua cobertura de confiança e segurança.
Frequently asked questions
Porque é que a classificação multilingue de conteúdo nocivo é mais difícil do que a moderação apenas em inglês?
Porque o conteúdo nocivo assenta muitas vezes em gíria local, contexto cultural e linguagem codificada que um modelo treinado sobretudo com dados em inglês não detetará de forma fiável.
Como mantém a Jwuma a consistência da classificação em muitas línguas?
Através de uma taxonomia de danos partilhada, aplicada por anotadores falantes nativos em cada língua, com calibração por tarefas de referência a monitorizar a consistência em todo o conjunto de anotadores.
O que acontece quando uma classificação de conteúdo é contestada ou pouco clara?
É escalada através da escada de revisão em vários níveis da Jwuma, em vez de depender do juízo de um único anotador, dado o risco para a plataforma de uma decisão incorreta.
Related case studies
Dados de verificação facial e de identidade para uma plataforma global de mobilidade
Uma plataforma global de mobilidade e de transporte individual precisava de dados faciais e de identidade verificados em várias regiões para reforçar um sistema de verificação de segurança de condutores e passageiros, sob requisitos rigorosos de consentimento e de tratamento de dados biométricos.
Recolha de dados de vídeo egocêntrico para um programa de IA de robótica
Uma empresa de IA de robótica precisava de vídeo na primeira pessoa de humanos a realizar tarefas físicas do quotidiano, captado de forma consistente em ambientes e tipos de corpo diversos, para treinar um modelo de IA incorporada a generalizar para além de um único cenário de laboratório.
Avaliação de RLHF para um modelo de IA conversacional
Uma empresa de IA conversacional precisava de um pipeline de avaliação humana estruturado e escalável para avaliar a qualidade das respostas de chatbot no seu processo de ajuste fino por RLHF, depois de o seu conjunto de avaliadores ad hoc existente ter produzido pontuações inconsistentes.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.