Resources / Case Studies

Zbieranie egocentrycznych danych wideo dla programu AI w robotyce

Firma zajmująca się AI w robotyce potrzebowała wideo z perspektywy pierwszej osoby przedstawiającego ludzi wykonujących codzienne zadania fizyczne, rejestrowanego spójnie w zróżnicowanych środowiskach i dla różnych typów sylwetki, aby wytrenować model ucieleśnionej AI tak, by uogólniał się poza jedno środowisko laboratoryjne.

Client snapshot

IndustryRobotyka i ucieleśniona AI
RegionZbieranie w terenie w wielu krajach Afryki, Azji Południowo-Wschodniej i obu Ameryk
Engagement typeZbieranie egocentrycznego wideo z wykonywania zadań fizycznych

The challenge

Istniejący zbiór danych klienta został zebrany niemal w całości w jednym kraju i w jednej grupie demograficznej, co ograniczało to, jak dobrze jego model uogólniał się na środowiska domowe i zawodowe gdzie indziej. Potrzebne było zbieranie w terenie w dużej skali, ze spójnymi standardami kamery i struktury zadań, w wyraźnie różnych środowiskach.

The approach

Jwuma zrekrutowała współpracowników zdolnych do pracy w terenie w kilku krajach, wyposażyła ich i przeszkoliła zgodnie z udokumentowanym standardem nagrywania oraz zebrała wideo z perspektywy pierwszej osoby dla określonego zestawu zadań w celowo zróżnicowanym zakresie domów, miejsc pracy i typów sylwetki. Każda sesja obejmowała wyraźną zgodę dotyczącą wizerunku i danych o lokalizacji, a podczas weryfikacji sprawdzano dokładność wykonania zadania obok jakości wideo.

Results

Klient otrzymał geograficznie i demograficznie zróżnicowany zbiór wideo zebrany według spójnej metodologii, co istotnie poszerzyło zakres środowisk, z których jego model miał przykłady treningowe, w pierwotnym terminie programu.

Frequently asked questions

Dlaczego dane treningowe dla fizycznej AI trzeba zbierać w wielu krajach?

Ponieważ model wytrenowany na wąskim zakresie środowisk i typów sylwetki słabo uogólnia się na warunki świata rzeczywistego poza tym zakresem.

Jak utrzymuje się spójność nagrań wśród wielu współpracowników i lokalizacji?

Dzięki udokumentowanemu standardowi kamery i struktury zadań, według którego każdy współpracownik jest szkolony przed rozpoczęciem zbierania.

Jakiej zgody wymaga ten typ danych?

Wyraźnej zgody obejmującej wizerunek i dane o lokalizacji, oprócz standardowej zgody na wykorzystanie danych, zbieranej w momencie każdej sesji nagrywania.

Określ zakres programu wideo dla fizycznej AI →

Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.