Erhebung egozentrischer Videodaten für ein Robotik-KI-Programm
Ein Robotik-KI-Unternehmen benötigte Videos aus der Ich-Perspektive von Menschen, die alltägliche physische Aufgaben ausführen, einheitlich erfasst in vielfältigen Umgebungen und mit unterschiedlichen Körpertypen, um ein Embodied-AI-Modell so zu trainieren, dass es über eine einzelne Laborumgebung hinaus generalisiert.
Client snapshot
| Industry | Robotik und Embodied AI |
|---|---|
| Region | Länderübergreifende Felderhebung in Afrika, Südostasien und Amerika |
| Engagement type | Erhebung egozentrischer Videos physischer Aufgaben |
The challenge
Der vorhandene Datensatz des Kunden war fast vollständig in einem einzigen Land und bei einer einzigen demografischen Gruppe erhoben worden, was einschränkte, wie gut sein Modell auf reale Haushalts- und Arbeitsumgebungen anderswo generalisierte. Benötigt wurde eine feldbasierte Erhebung im großen Umfang, mit einheitlichen Kamera- und Aufgabenstrukturstandards, in deutlich unterschiedlichen Umgebungen.
The approach
Jwuma rekrutierte feldtaugliche Contributors in mehreren Ländern, stattete sie nach einem dokumentierten Aufnahmestandard aus und briefte sie, und erhob Videos aus der Ich-Perspektive zum festgelegten Aufgabenset in einer bewusst vielfältigen Auswahl von Wohnungen, Arbeitsplätzen und Körpertypen. Jede Sitzung enthielt eine ausdrückliche Einwilligung, die Abbild- und Standortdaten abdeckte, und die Richtigkeit der Aufgabenausführung wurde bei der Prüfung neben der Videoqualität verifiziert.
Results
Der Kunde erhielt einen geografisch und demografisch vielfältigen Videodatensatz, der nach einheitlicher Methodik erhoben wurde und die Umgebungen, aus denen sein Modell Trainingsbeispiele hatte, deutlich erweiterte, innerhalb des ursprünglichen Zeitplans des Programms.
Frequently asked questions
Warum müssen Trainingsdaten für Physical AI in mehreren Ländern erhoben werden?
Weil ein Modell, das mit einem engen Spektrum an Umgebungen und Körpertypen trainiert wurde, auf reale Bedingungen außerhalb dieses Spektrums schlecht generalisiert.
Wie wird die Einheitlichkeit der Aufnahmen über viele Contributors und Orte hinweg gewahrt?
Durch einen dokumentierten Standard für Kamera und Aufgabenstruktur, auf den jeder Contributor vor Beginn der Erhebung gebrieft wird.
Welche Einwilligung ist für diese Art von Daten erforderlich?
Eine ausdrückliche Einwilligung für Abbild- und Standortdaten, zusätzlich zur üblichen Einwilligung in die Datennutzung, eingeholt zu Beginn jeder Aufnahmesitzung.
Related case studies
Gesichts- und Identitätsverifizierungsdaten für eine globale Mobilitätsplattform
Eine globale Mobilitäts- und Ride-Hailing-Plattform benötigte verifizierte Gesichts- und Identitätsdaten aus mehreren Regionen, um ein Verifizierungssystem für die Sicherheit von Fahrern und Fahrgästen zu stärken, unter strengen Anforderungen an Einwilligung und Umgang mit biometrischen Daten.
RLHF-Evaluierung für ein Konversations-KI-Modell
Ein Unternehmen für Konversations-KI benötigte eine strukturierte, skalierbare menschliche Evaluierungs-Pipeline, um die Antwortqualität seiner Chatbots für den RLHF-Feinabstimmungsprozess zu bewerten, nachdem sein bisheriger Ad-hoc-Rater-Pool uneinheitliche Bewertungen geliefert hatte.
Mehrsprachige Inhaltsmoderation und Produktdaten für einen E-Commerce-Marktplatz
Ein grenzüberschreitender E-Commerce-Marktplatz benötigte mehrsprachige Inhaltsmoderation und Annotation seines Produktkatalogs, um Angebote konform und auffindbar zu halten, und zwar in den Sprachen, die seine Verkäufer und Käufer tatsächlich nutzten.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.