Classificazione di contenuti dannosi per trust e safety di una piattaforma social
Una piattaforma social aveva bisogno di una classificazione coerente dei contenuti dannosi in diverse lingue per addestrare il proprio modello di trust e safety, dopo che una copertura disomogenea aveva lasciato alcuni dei suoi mercati non anglofoni significativamente sotto-moderati.
Client snapshot
| Industry | Social media e piattaforme di contenuti |
|---|---|
| Region | Globale, concentrato nei mercati non anglofoni a più rapida crescita del cliente |
| Engagement type | Classificazione multilingue di contenuti dannosi per trust e safety |
The challenge
Il modello di moderazione del cliente funzionava bene in inglese ma aveva una copertura sensibilmente più debole in diversi dei suoi mercati a più rapida crescita, dove i contenuti dannosi erano più difficili da individuare e, se non rilevati, comportavano un rischio sproporzionato per la piattaforma.
The approach
Jwuma ha assegnato annotatori madrelingua nelle lingue prioritarie del cliente per classificare i contenuti in base a una tassonomia dettagliata dei danni, con le classificazioni contestate o borderline inoltrate tramite un livello di revisione e una calibrazione con gold task usata per monitorare la coerenza della classificazione tra le lingue.
Results
Il cliente ha esteso una classificazione coerente dei contenuti dannosi a mercati che prima erano significativamente sotto-moderati, colmando una lacuna importante nella propria copertura di trust e safety.
Frequently asked questions
Perché la classificazione multilingue dei contenuti dannosi è più difficile della moderazione solo in inglese?
Perché i contenuti dannosi si basano spesso su gergo locale, contesto culturale e linguaggio in codice che un modello addestrato principalmente su dati in inglese non individuerà in modo affidabile.
Come mantiene Jwuma la coerenza della classificazione su molte lingue?
Tramite una tassonomia dei danni condivisa applicata da annotatori madrelingua in ciascuna lingua, con la calibrazione tramite gold task che monitora la coerenza sull'intero gruppo di annotatori.
Cosa succede quando la classificazione di un contenuto è contestata o poco chiara?
Viene sottoposta a escalation attraverso la scala di revisione su più livelli di Jwuma anziché affidarsi al giudizio di un singolo annotatore, dato il rischio per la piattaforma di una decisione sbagliata.
Related case studies
Dati di verifica facciale e dell'identità per una piattaforma di mobilità globale
Una piattaforma globale di mobilità e ride-hailing aveva bisogno di dati verificati di volti e identità in più regioni per rafforzare un sistema di verifica della sicurezza di autisti e passeggeri, nel rispetto di rigorosi requisiti di consenso e di trattamento dei dati biometrici.
Raccolta di dati video egocentrici per un programma di IA robotica
Un'azienda di IA robotica aveva bisogno di video in prima persona di persone che svolgono compiti fisici quotidiani, acquisiti in modo coerente in ambienti e con tipi di corpo diversi, per addestrare un modello di IA incarnata a generalizzare oltre un singolo ambiente di laboratorio.
Valutazione RLHF per un modello di IA conversazionale
Un'azienda di IA conversazionale aveva bisogno di una pipeline di valutazione umana strutturata e scalabile per valutare la qualità delle risposte dei chatbot nel proprio processo di messa a punto RLHF, dopo che il suo gruppo di valutatori ad hoc aveva prodotto punteggi incoerenti.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.