Trust-and-Safety-Klassifizierung schädlicher Inhalte für eine Social-Media-Plattform
Eine Social-Media-Plattform benötigte eine einheitliche Klassifizierung schädlicher Inhalte in mehreren Sprachen, um ihr Trust-and-Safety-Modell zu trainieren, nachdem eine ungleichmäßige Abdeckung einige ihrer nicht englischsprachigen Märkte erheblich untermoderiert zurückgelassen hatte.
Client snapshot
| Industry | Soziale Medien und Content-Plattformen |
|---|---|
| Region | Global, konzentriert auf die am schnellsten wachsenden nicht englischsprachigen Märkte des Kunden |
| Engagement type | Mehrsprachige Klassifizierung schädlicher Inhalte für Trust and Safety |
The challenge
Das Moderationsmodell des Kunden schnitt auf Englisch gut ab, hatte aber in mehreren seiner am schnellsten wachsenden Märkte eine deutlich schwächere Abdeckung, wo schädliche Inhalte sowohl schwerer zu erkennen waren als auch, wenn sie übersehen wurden, ein überproportionales Plattformrisiko darstellten.
The approach
Jwuma wies muttersprachliche Annotatoren in den Prioritätssprachen des Kunden zu, die Inhalte anhand einer detaillierten Schadenstaxonomie klassifizierten. Strittige oder grenzwertige Klassifizierungen wurden über eine Prüfstufe eskaliert, und eine Gold-Aufgaben-Kalibrierung überwachte die Klassifizierungskonsistenz über die Sprachen hinweg.
Results
Der Kunde weitete eine einheitliche Klassifizierung schädlicher Inhalte auf Märkte aus, die zuvor erheblich untermoderiert waren, und schloss damit eine spürbare Lücke in seiner Trust-and-Safety-Abdeckung.
Frequently asked questions
Warum ist die mehrsprachige Klassifizierung schädlicher Inhalte schwieriger als Moderation nur auf Englisch?
Weil schädliche Inhalte oft auf lokalem Slang, kulturellem Kontext und verschlüsselter Sprache beruhen, die ein überwiegend mit englischen Daten trainiertes Modell nicht zuverlässig erkennt.
Wie wahrt Jwuma die Klassifizierungskonsistenz über viele Sprachen hinweg?
Durch eine gemeinsame Schadenstaxonomie, die von muttersprachlichen Annotatoren in jeder Sprache angewendet wird, wobei die Gold-Aufgaben-Kalibrierung die Konsistenz im gesamten Annotatorenpool überwacht.
Was passiert, wenn eine Inhaltsklassifizierung strittig oder unklar ist?
Sie wird über die mehrstufige Prüf-Ladder von Jwuma eskaliert, statt sich auf das Urteil eines einzelnen Annotators zu stützen, angesichts des Plattformrisikos einer falschen Entscheidung.
Related case studies
Gesichts- und Identitätsverifizierungsdaten für eine globale Mobilitätsplattform
Eine globale Mobilitäts- und Ride-Hailing-Plattform benötigte verifizierte Gesichts- und Identitätsdaten aus mehreren Regionen, um ein Verifizierungssystem für die Sicherheit von Fahrern und Fahrgästen zu stärken, unter strengen Anforderungen an Einwilligung und Umgang mit biometrischen Daten.
Erhebung egozentrischer Videodaten für ein Robotik-KI-Programm
Ein Robotik-KI-Unternehmen benötigte Videos aus der Ich-Perspektive von Menschen, die alltägliche physische Aufgaben ausführen, einheitlich erfasst in vielfältigen Umgebungen und mit unterschiedlichen Körpertypen, um ein Embodied-AI-Modell so zu trainieren, dass es über eine einzelne Laborumgebung hinaus generalisiert.
RLHF-Evaluierung für ein Konversations-KI-Modell
Ein Unternehmen für Konversations-KI benötigte eine strukturierte, skalierbare menschliche Evaluierungs-Pipeline, um die Antwortqualität seiner Chatbots für den RLHF-Feinabstimmungsprozess zu bewerten, nachdem sein bisheriger Ad-hoc-Rater-Pool uneinheitliche Bewertungen geliefert hatte.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.