Classificatie van schadelijke content voor trust and safety bij een socialemediaplatform
Een socialemediaplatform had schadelijke content consistent geclassificeerd nodig in meerdere talen om zijn trust-and-safetymodel te trainen, nadat ongelijke dekking ertoe had geleid dat sommige van zijn niet-Engelstalige markten aanzienlijk te weinig werden gemodereerd.
Client snapshot
| Industry | Sociale media en contentplatforms |
|---|---|
| Region | Wereldwijd, geconcentreerd in de snelst groeiende niet-Engelstalige markten van de klant |
| Engagement type | Meertalige classificatie van schadelijke content voor trust and safety |
The challenge
Het moderatiemodel van de klant presteerde goed in het Engels, maar had een aanzienlijk zwakkere dekking in verschillende van zijn snelst groeiende markten, waar schadelijke content zowel moeilijker te detecteren was als, indien gemist, buitenproportionele risico's voor het platform met zich meebracht.
The approach
Jwuma wees annotators die moedertaalspreker zijn toe in de prioriteitstalen van de klant om content te classificeren volgens een gedetailleerde schadetaxonomie, waarbij betwiste of grensgevallen van classificaties via een beoordelingsniveau escaleerden en kalibratie met goudtaken (gold tasks) werd gebruikt om de classificatieconsistentie over talen heen te bewaken.
Results
De klant breidde consistente classificatie van schadelijke content uit naar markten die eerder aanzienlijk te weinig werden gemodereerd, waarmee een belangrijke kloof in zijn trust-and-safetydekking werd gedicht.
Frequently asked questions
Waarom is meertalige classificatie van schadelijke content moeilijker dan moderatie in alleen het Engels?
Omdat schadelijke content vaak leunt op lokale straattaal, culturele context en versluierd taalgebruik die een model dat vooral op Engelse data is getraind niet betrouwbaar zal oppikken.
Hoe bewaakt Jwuma de classificatieconsistentie over veel talen heen?
Via een gedeelde schadetaxonomie die door annotators die moedertaalspreker zijn in elke taal wordt toegepast, waarbij kalibratie met goudtaken de consistentie over de hele groep annotators bewaakt.
Wat gebeurt er wanneer een contentclassificatie wordt betwist of onduidelijk is?
Die escaleert via de beoordelingsladder op meerdere niveaus van Jwuma in plaats van af te hangen van het oordeel van één annotator, gezien het risico voor het platform van een onjuiste beslissing.
Related case studies
Gezichts- en identiteitsverificatiedata voor een wereldwijd mobiliteitsplatform
Een wereldwijd mobiliteits- en taxiplatform had geverifieerde gezichts- en identiteitsdata uit meerdere regio's nodig om een veiligheidsverificatiesysteem voor chauffeurs en passagiers te versterken, onder strikte eisen voor toestemming en omgang met biometrische gegevens.
Verzameling van egocentrische videodata voor een robotica-AI-programma
Een robotica-AI-bedrijf had video vanuit eerstepersoonsperspectief nodig van mensen die alledaagse fysieke taken uitvoeren, consistent vastgelegd in uiteenlopende omgevingen en met verschillende lichaamstypen, om een belichaamd AI-model te trainen te generaliseren voorbij één laboratoriumsituatie.
RLHF-beoordeling voor een conversationeel AI-model
Een bedrijf voor conversationele AI had een gestructureerde, schaalbare menselijke beoordelingspijplijn nodig om de kwaliteit van chatbotantwoorden te beoordelen voor zijn RLHF-finetuningproces, nadat zijn bestaande ad-hocgroep beoordelaars inconsistente scores had opgeleverd.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.