Zbieranie egocentrycznych danych wideo dla programu AI w robotyce
Firma zajmująca się AI w robotyce potrzebowała wideo z perspektywy pierwszej osoby przedstawiającego ludzi wykonujących codzienne zadania fizyczne, rejestrowanego spójnie w zróżnicowanych środowiskach i dla różnych typów sylwetki, aby wytrenować model ucieleśnionej AI tak, by uogólniał się poza jedno środowisko laboratoryjne.
Client snapshot
| Industry | Robotyka i ucieleśniona AI |
|---|---|
| Region | Zbieranie w terenie w wielu krajach Afryki, Azji Południowo-Wschodniej i obu Ameryk |
| Engagement type | Zbieranie egocentrycznego wideo z wykonywania zadań fizycznych |
The challenge
Istniejący zbiór danych klienta został zebrany niemal w całości w jednym kraju i w jednej grupie demograficznej, co ograniczało to, jak dobrze jego model uogólniał się na środowiska domowe i zawodowe gdzie indziej. Potrzebne było zbieranie w terenie w dużej skali, ze spójnymi standardami kamery i struktury zadań, w wyraźnie różnych środowiskach.
The approach
Jwuma zrekrutowała współpracowników zdolnych do pracy w terenie w kilku krajach, wyposażyła ich i przeszkoliła zgodnie z udokumentowanym standardem nagrywania oraz zebrała wideo z perspektywy pierwszej osoby dla określonego zestawu zadań w celowo zróżnicowanym zakresie domów, miejsc pracy i typów sylwetki. Każda sesja obejmowała wyraźną zgodę dotyczącą wizerunku i danych o lokalizacji, a podczas weryfikacji sprawdzano dokładność wykonania zadania obok jakości wideo.
Results
Klient otrzymał geograficznie i demograficznie zróżnicowany zbiór wideo zebrany według spójnej metodologii, co istotnie poszerzyło zakres środowisk, z których jego model miał przykłady treningowe, w pierwotnym terminie programu.
Frequently asked questions
Dlaczego dane treningowe dla fizycznej AI trzeba zbierać w wielu krajach?
Ponieważ model wytrenowany na wąskim zakresie środowisk i typów sylwetki słabo uogólnia się na warunki świata rzeczywistego poza tym zakresem.
Jak utrzymuje się spójność nagrań wśród wielu współpracowników i lokalizacji?
Dzięki udokumentowanemu standardowi kamery i struktury zadań, według którego każdy współpracownik jest szkolony przed rozpoczęciem zbierania.
Jakiej zgody wymaga ten typ danych?
Wyraźnej zgody obejmującej wizerunek i dane o lokalizacji, oprócz standardowej zgody na wykorzystanie danych, zbieranej w momencie każdej sesji nagrywania.
Related case studies
Dane do weryfikacji twarzy i tożsamości dla globalnej platformy mobilności
Globalna platforma mobilności i przewozu osób potrzebowała zweryfikowanych danych twarzy i tożsamości z wielu regionów, aby wzmocnić system weryfikacji bezpieczeństwa kierowców i pasażerów, przy ścisłych wymogach dotyczących zgody i postępowania z danymi biometrycznymi.
Ocena RLHF dla modelu konwersacyjnej AI
Firma zajmująca się konwersacyjną AI potrzebowała ustrukturyzowanego, skalowalnego procesu oceny przez ludzi, aby oceniać jakość odpowiedzi chatbota w procesie dostrajania RLHF, po tym jak jej dotychczasowa doraźna pula oceniających dawała niespójne wyniki.
Wielojęzyczna moderacja treści i dane produktowe dla platformy handlu elektronicznego
Transgraniczna platforma handlu elektronicznego potrzebowała wielojęzycznej moderacji treści i adnotacji katalogu produktów, aby oferty były zgodne z zasadami i możliwe do wyszukania w językach, z których faktycznie korzystali jej sprzedawcy i kupujący.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.