Resources / Case Studies

Erhebung egozentrischer Videodaten für ein Robotik-KI-Programm

Ein Robotik-KI-Unternehmen benötigte Videos aus der Ich-Perspektive von Menschen, die alltägliche physische Aufgaben ausführen, einheitlich erfasst in vielfältigen Umgebungen und mit unterschiedlichen Körpertypen, um ein Embodied-AI-Modell so zu trainieren, dass es über eine einzelne Laborumgebung hinaus generalisiert.

Client snapshot

IndustryRobotik und Embodied AI
RegionLänderübergreifende Felderhebung in Afrika, Südostasien und Amerika
Engagement typeErhebung egozentrischer Videos physischer Aufgaben

The challenge

Der vorhandene Datensatz des Kunden war fast vollständig in einem einzigen Land und bei einer einzigen demografischen Gruppe erhoben worden, was einschränkte, wie gut sein Modell auf reale Haushalts- und Arbeitsumgebungen anderswo generalisierte. Benötigt wurde eine feldbasierte Erhebung im großen Umfang, mit einheitlichen Kamera- und Aufgabenstrukturstandards, in deutlich unterschiedlichen Umgebungen.

The approach

Jwuma rekrutierte feldtaugliche Contributors in mehreren Ländern, stattete sie nach einem dokumentierten Aufnahmestandard aus und briefte sie, und erhob Videos aus der Ich-Perspektive zum festgelegten Aufgabenset in einer bewusst vielfältigen Auswahl von Wohnungen, Arbeitsplätzen und Körpertypen. Jede Sitzung enthielt eine ausdrückliche Einwilligung, die Abbild- und Standortdaten abdeckte, und die Richtigkeit der Aufgabenausführung wurde bei der Prüfung neben der Videoqualität verifiziert.

Results

Der Kunde erhielt einen geografisch und demografisch vielfältigen Videodatensatz, der nach einheitlicher Methodik erhoben wurde und die Umgebungen, aus denen sein Modell Trainingsbeispiele hatte, deutlich erweiterte, innerhalb des ursprünglichen Zeitplans des Programms.

Frequently asked questions

Warum müssen Trainingsdaten für Physical AI in mehreren Ländern erhoben werden?

Weil ein Modell, das mit einem engen Spektrum an Umgebungen und Körpertypen trainiert wurde, auf reale Bedingungen außerhalb dieses Spektrums schlecht generalisiert.

Wie wird die Einheitlichkeit der Aufnahmen über viele Contributors und Orte hinweg gewahrt?

Durch einen dokumentierten Standard für Kamera und Aufgabenstruktur, auf den jeder Contributor vor Beginn der Erhebung gebrieft wird.

Welche Einwilligung ist für diese Art von Daten erforderlich?

Eine ausdrückliche Einwilligung für Abbild- und Standortdaten, zusätzlich zur üblichen Einwilligung in die Datennutzung, eingeholt zu Beginn jeder Aufnahmesitzung.

Ein Physical-AI-Videoprogramm eingrenzen →

Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.