Annotazione dei punti chiave del corpo umano
Shaip ha annotato 150,000 fotogrammi di immagini e video con uno schema del corpo intero a 36 punti chiave, combinando i punti di riferimento del viso (testa, occhi, orecchie, naso, mento) con le articolazioni dello scheletro (spalle, gomiti, polsi, fianchi, ginocchia, caviglie) — per potenziare la stima della postura, l'analisi del movimento, il monitoraggio dell'attività fisica e l'intelligenza artificiale applicata al movimento in ambito sanitario.
Panoramica del progetto
Con l'avvento in produzione della stima della postura e dell'intelligenza artificiale per il movimento umano, il cliente necessitava di un framework di annotazione scalabile per etichettare 150,000 fotogrammi di immagini e video con una copertura anatomicamente precisa dei punti chiave dell'intero corpo in diverse condizioni reali.
Shaip ha creato una pipeline di annotazione completa che comprende il posizionamento dei punti chiave, la gestione delle pose multi-angolo, la gestione delle occlusioni e il controllo qualità strutturato, supportando la fornitura di schemi corporei a 36 punti e producendo set di dati pronti per il modello con una velocità di elaborazione giornaliera costante.
Stato chiave
Fotogrammi annotati
150,000
Punti chiave / Corpo
36
Produzione giornaliera
Cornici 30
Piattaforma
CVAT
Le sfide
- Scalabilità da flussi di lavoro di campionamento controllati a Cornici 150,000 di annotazione dello scheletro dell'intero corpo
- Mantenere precisione anatomica in varie pose, angoli di visuale e condizioni di illuminazione
- Manovrabilità occlusione parziale e sovrapposizione di soggetti senza compromettere la precisione dei punti chiave
- Coordinare punto di riferimento facciale + scheletro corporeo posizionamento su un singolo schema a 36 punti
- Sostenere a 30 fotogrammi al giorno per annotatore Test di efficienza operativa per l'intero team
Soluzione
Strategie di annotazione
Shaip ha progettato uno schema corporeo a 36 punti chiave che copre l'intera area anatomica: punti di riferimento facciali (testa, occhi, orecchie, naso, mento) combinati con le articolazioni scheletriche di spalle, braccia, busto, fianchi e gambe. La piattaforma CVAT è stata configurata con questo schema e implementata in tutto il team per garantire un'etichettatura uniforme.
Gestione delle pose e della diversità
Il dataset includeva volutamente soggetti diversi in varie pose, angoli di visuale, condizioni di illuminazione e tipi di abbigliamento. Gli annotatori hanno seguito linee guida specifiche per ogni posa al fine di gestire le pose in piedi, sedute, accovacciate, sdraiate e in movimento dinamico con lo stesso livello di precisione dei punti chiave.
Regole di occlusione e casi limite
Regole rigorose disciplinavano la gestione delle occlusioni parziali: punti chiave nascosti dietro gli indumenti, parti del corpo celate da altri arti e soggetti parzialmente fuori dall'inquadratura. I punti di riferimento nascosti venivano contrassegnati con indicatori di visibilità anziché approssimati, preservando così l'integrità del set di dati per i modelli di stima della posa successivi.
Parametri di riferimento per la produttività e il throughput
Il team ha mantenuto un obiettivo di 30 fotogrammi annotati e approvati per annotatore al giorno, nell'arco di un turno di 8.5 ore. Questo obiettivo è stato calibrato rispetto a target di accuratezza, garantendo che la produttività non compromettesse la qualità.
Flusso di lavoro di garanzia della qualità
Ogni fotogramma annotato è stato sottoposto a una revisione strutturata di controllo qualità che ha valutato l'accuratezza del posizionamento dei punti chiave, la correttezza dei flag di visibilità e la coerenza con lo schema a 36 punti. I fotogrammi rifiutati sono stati restituiti per la correzione, con un feedback a livello di annotatore, al fine di promuovere un miglioramento continuo.
Ambito del progetto
| Tipo di set di dati | Volume | Punti chiave | Piattaforma | Throughput | timeline |
|---|---|---|---|---|---|
| Scheletro del corpo umano + annotazione dei punti chiave | Cornici 150,000 | 36 per figura umana | CVAT | 30 fotogrammi/giorno/annotatore | Multimestre |
Risultati
- Stabilito un framework di annotazione scalabile a 36 punti chiave pronto per la formazione sulla produzione di stima della posa
- Standardizzato posizionamento dei punti di riferimento anatomici nelle regioni facciali e scheletriche
- mantenuto Capacità di elaborazione dell'annotatore: 30 fotogrammi al giorno senza compromettere la precisione
- Consegnato un set di dati diversificato e multi-condizione che spaziano da pose, illuminazione, angolazioni e tipologie di abbigliamento
- Abilitato il client stima della postura, analisi del movimento, monitoraggio del fitness e intelligenza artificiale applicata al movimento in ambito sanitario tabella di marcia
Nel complesso, Shaip ha contribuito a trasformare un requisito di annotazione di punti chiave di 150,000 fotogrammi in una pipeline strutturata e pronta per la produzione, in grado di supportare l'intelligenza artificiale per il riconoscimento della postura umana, il monitoraggio del fitness, la diagnostica del movimento e le applicazioni sanitarie relative al movimento con precisione e scalabilità costanti.
Shaip ci ha fornito l'infrastruttura di annotazione dei punti chiave con la precisione necessaria ai nostri modelli di stima della posa. L'esecuzione dello schema a 36 punti, la gestione delle occlusioni e la costante produttività giornaliera si sono tradotte direttamente in prestazioni del modello superiori.
— Direttore, Ingegneria della visione artificiale