Catalogo di dati medici per l'intelligenza artificiale in ambito sanitario
Set di dati sanitari/medici pronti all'uso per avviare il tuo progetto di intelligenza artificiale sanitaria
Set di dati medici e sanitari per l'apprendimento automatico
Cosa include il catalogo dati medici Shaip?
Il catalogo di dati medici Shaip è una libreria pronta all'uso, conforme alle normative HIPAA, di dati di addestramento sanitario anonimizzati che coprono 31 specialità mediche, tra cui 257,977 ore di registrazioni audio di dettati medici, cartelle cliniche trascritte, cartelle cliniche elettroniche e set di dati multimodali. Ogni set di dati è concesso in licenza per l'addestramento commerciale dell'IA e viene fornito con anonimizzazione Safe Harbor o Expert Determination.
Dati audio di dettatura del medico
Il nostro set di dati anonimizzati per l'assistenza sanitaria include file audio di 31 specialità, redatti da medici che descrivono le condizioni cliniche dei pazienti e il piano di cura in base agli incontri medico-paziente in ambito clinico.
File audio di dettatura del medico standard:
- 257,977 ore di dati di dettatura vocale di medici del mondo reale da 31 specialità per addestrare modelli di discorso sanitario
- Dettatura audio acquisita da vari dispositivi come dettatura telefonica (54.3%), registratore digitale (24.9%), microfono vocale (5.4%), smartphone (2.7%) e sconosciuto (12.7%)
- Audio e trascrizioni redatte PII aderendo alle linee guida Safe Harbor in conformità con HIPAA
Cartella clinica trascritta
La trascrizione delle cartelle cliniche si riferisce alla trascrizione delle conversazioni tra medico e paziente, alla trascrizione dei referti medici e alla valutazione medica. Aiuta a mappare la storia clinica del paziente per visite future e funge anche da punto di riferimento per i medici. Aiuta a valutare le condizioni attuali del paziente e a suggerire un trattamento adeguato.
Cartella clinica trascritta pronta all'uso:
- Trascrizione di 257,977 ore di dettatura del medico nel mondo reale da 31 specialità per addestrare modelli di discorso sanitario
- Cartelle mediche trascritte da vari tipi di lavoro come referto operatorio, riepilogo dimissione, nota di consultazione, nota di ammissione, nota di pronto soccorso, nota clinica, referto radiologico, ecc.
- Audio e trascrizioni redatte PII aderendo alle linee guida Safe Harbor in conformità con HIPAA
Cartelle sanitarie elettroniche (EHR)
Le cartelle cliniche elettroniche o EHR sono cartelle cliniche che contengono anamnesi del paziente, diagnosi, prescrizioni, piani di trattamento, date di vaccinazione o immunizzazione, allergie, immagini radiologiche (TC, risonanza magnetica, raggi X) e test di laboratorio e altro.
Fascicoli sanitari elettronici (EHR) pronti all'uso:
- 5.1 milioni di record e file audio medici in 31 specialità
- Cartelle mediche standard di riferimento nel mondo reale per addestrare la PNL clinica e altri modelli di IA dei documenti
- Informazioni sui metadati come MRN (anonimizzato), data di ammissione, data di dimissione, giorni di permanenza, sesso, classe del paziente, pagatore, classe finanziaria, stato, disposizione di dimissione, età, DRG, descrizione DRG, $ rimborso, AMLOS, GMLOS, rischio di mortalità, gravità della malattia, cernia, codice postale dell'ospedale, ecc.
- Cartelle mediche di vari stati e regioni degli Stati Uniti: nord-est (46%), sud (9%), Midwest (3%), ovest (28%), altri (14%)
- Cartelle mediche appartenenti a tutte le Classi di pazienti coperte- Degenza, Ambulatoriale (Clinica, Riabilitativa, Ricorrente, Chirurgica Day Care), Emergenza.
- Cartelle mediche appartenenti a tutti i gruppi di età dei pazienti <10 anni (7.9%), 11-20 anni (5.7%), 21-30 anni (10.9%), 31-40 anni (11.7%), 41-50 anni (10.4% ), 51-60 anni (13.8%), 61-70 anni (16.1%), 71-80 anni (13.3%), 81-90 anni (7.8%), 90+ anni (2.4%)
- Rapporto tra i sessi dei pazienti del 46% (maschio) e del 54% (femmina)
- Documenti redatti PII che aderiscono alle Linee guida Safe Harbor in conformità con HIPAA
Cinque motivi per cui gli acquirenti licenza Shaip invece di cucirlo insieme.
Il catalogo dati medici Shaip esiste perché la maggior parte dei team di IA in ambito sanitario perde dai nove ai dodici mesi reperire dati di training conformi prima di addestrare un singolo modello. Ecco cosa cambia quando quei mesi vengono restituiti.
Una portata del catalogo che la maggior parte dei team non può eguagliare.
Il catalogo Shaip si estende 257,977 ore di dettatura medica, trascrizioni da 31 specialità medichee cartelle cliniche elettroniche che coprono ogni fascia di età dei pazienti: il tipo di volume che consente agli acquirenti addestrare e valutare modelli senza dover unire una dozzina di dataset aperti.
La conformità è una condizione di partenza, non una caratteristica.
Ogni set di dati medici Shaip viene spedito con Anonimizzazione predefinita ai sensi dell'HIPAA Safe Harbor.Valutazione da parte di esperti su richiesta, gestione conforme al GDPR e predisposizione BAA per le entità coperte. Gli acquirenti non devono adeguarsi a posteriori.
Specialisti con formazione in ambito sanitario, non operatori generici.
L'annotazione, la trascrizione e il controllo qualità del catalogo medico Shaip sono eseguiti da specialisti con formazione sanitariaIl flusso di lavoro Shaip include un controllo qualità multilivello e una validazione con intervento umano, calibrati secondo gli standard di accuratezza clinica.
Prodotti standard oggi disponibili, personalizzati su richiesta.
Gli acquirenti possono ottenere la licenza per i dataset Shaip esistenti immediatamente oppure commissionare una raccolta personalizzata mirata a specifici dati demografici, geografici, linguistici e modalità. senza cambiare fornitore o ripetere la verifica di conformità.
Disponibile dove già lavorano i team di dati.
I set di dati di Shaip relativi alle cartelle cliniche elettroniche e alle dettature mediche anonimizzate sono disponibili su Mercato dei databricks, con consegna nei formati già utilizzati dai team di dati e machine learning: JSON, CSV, WAV. Sono disponibili set di dati di esempio prima di qualsiasi impegno.
Sicurezza e conformità
Non riesci a trovare quello che stai cercando?
Nuovi set di dati medici pronti all'uso vengono raccolti per tutti i tipi di dati
Contattaci ora per lasciar andare le tue preoccupazioni relative alla raccolta dei dati sulla formazione sanitaria
Domande frequenti (FAQ)
1. Cosa sono i set di dati medici?
I dataset medici sono dati sanitari utilizzati per addestrare, valutare e migliorare i modelli di intelligenza artificiale/apprendimento automatico. Possono includere registrazioni audio di dettati medici, trascrizioni di cartelle cliniche, cartelle cliniche elettroniche, dialoghi sintetici medico-paziente e dataset sanitari multimodali che combinano testo, parlato e dati clinici strutturati pertinenti.
2. Cosa è incluso nel Catalogo dei dati medici Shaip?
Il catalogo di dati medici Shaip include registrazioni audio di dettati medici, trascrizioni di cartelle cliniche, cartelle cliniche elettroniche, dialoghi sintetici medico-paziente e set di dati multimodali che collegano testo, parlato e dati clinici strutturati a livello di paziente o di visita. Comprende 257,977 ore di registrazioni audio di dettati medici in 31 specialità mediche ed è disponibile per l'addestramento commerciale di modelli di intelligenza artificiale.
3. I set di dati medici di Shaip sono conformi alla normativa HIPAA?
Sì. I set di dati medici di Shaip sono anonimizzati per impostazione predefinita in conformità con l'HIPAA Safe Harbor, rimuovendo le 18 categorie di identificatori specificate nella norma sulla privacy dell'HIPAA. È inoltre disponibile l'anonimizzazione tramite determinazione da parte di esperti quando è richiesta la certificazione statistica, e Shaip è pronto per l'accordo BAA per le entità soggette a tale normativa.
4. I set di dati medici di Shaip sono conformi al GDPR e ad altri requisiti relativi ai dati sanitari?
Sì. I set di dati medici di Shaip possono essere preparati per soddisfare i requisiti HIPAA, GDPR e altri requisiti applicabili in materia di dati sanitari, a seconda dell'ambito del progetto, dell'area geografica, del tipo di dati e dei requisiti contrattuali.
5. Posso acquistare set di dati sanitari già pronti o devo raccoglierli io stesso?
Entrambe le opzioni sono disponibili. Shaip offre set di dati sanitari preconfigurati tramite lo Shaip Medical Data Catalog per l'addestramento di modelli di intelligenza artificiale a fini commerciali. Se un progetto richiede una lingua, dati demografici, specializzazione, modalità o contesto clinico specifici, Shaip può anche effettuare una raccolta dati medica personalizzata nel rispetto degli stessi standard di conformità.
6. È possibile personalizzare i set di dati medici di Shaip?
Sì. Shaip può personalizzare i set di dati medici in base a specializzazione, fascia d'età del paziente, sesso, area geografica, lingua, modalità, contesto clinico, formato, volume e requisiti di progetto. I set di dati personalizzati sono definiti tramite un documento di descrizione del lavoro e rispettano gli standard di anonimizzazione e conformità applicabili.
7. Posso visualizzare un set di dati di esempio prima di acquistare la licenza?
Sì. Shaip fornisce set di dati campione rappresentativi sotto accordo di riservatezza (NDA) in modo che i team di IA possano valutare il formato, la qualità, la copertura demografica e l'adeguatezza del modello prima di stipulare una licenza. L'accesso ai campioni è in genere il primo passo prima di sottoscrivere una licenza standard o di stipulare un contratto per una raccolta personalizzata.
8. In quali formati Shaip fornisce i set di dati medici?
Shaip fornisce set di dati medici in formati pronti per l'intelligenza artificiale, tra cui JSON, CSV e FHIR per i record strutturati; file WAV con trascrizioni abbinate per l'audio; e file di trascrizione per i set di dati relativi al parlato e al linguaggio. I set di dati multimodali possono includere file manifest che collegano testo, audio e record clinici strutturati.
9. In che modo Shaip garantisce la qualità dei set di dati medici?
Shaip garantisce la qualità dei set di dati medici attraverso la revisione da parte di esperti, l'annotazione da parte di specialisti del settore, flussi di lavoro di validazione e controlli di qualità strutturati. Questi processi contribuiscono a garantire accuratezza, affidabilità e prontezza del modello per lo sviluppo di applicazioni di intelligenza artificiale in ambito sanitario.
10. I set di dati medici di Shaip sono scalabili per progetti di IA/ML di grandi dimensioni?
Sì. I dataset medici di Shaip sono scalabili sia per piccoli progetti pilota che per progetti aziendali di IA/ML. Possono supportare progetti che richiedono grandi volumi di cartelle cliniche, dati clinici strutturati, trascrizioni o centinaia di migliaia di ore di registrazioni audio di dettati medici.
11. I set di dati medici di Shaip possono essere integrati nei modelli e nei flussi di lavoro di intelligenza artificiale esistenti?
Sì. Shaip fornisce set di dati medici in formati pronti all'uso come JSON, CSV, FHIR, WAV e file di trascrizione. Questi formati supportano l'integrazione nei flussi di lavoro esistenti di IA, ML, NLP, riconoscimento vocale, LLM in ambito sanitario e sviluppo di modelli multimodali.
12. Quanto tempo occorre per ricevere un set di dati medici Shaip?
I set di dati medici standard possono essere generalmente consegnati entro pochi giorni dalla revisione dei campioni, dalla firma del contratto e dalla finalizzazione delle licenze. Le tempistiche per la raccolta di dati personalizzati dipendono dall'ambito del progetto, dalle dimensioni del set di dati, dalla modalità di acquisizione, dai requisiti di conformità e dalla complessità, e sono definite nel capitolato d'appalto.
13. Quanto costano i set di dati medici?
Il costo dei dataset medici dipende dal tipo di dataset, dalla modalità, dal volume, dai requisiti di personalizzazione, dai termini di licenza, dalle tempistiche di consegna e dalle esigenze di conformità. I team possono condividere le proprie esigenze tramite il modulo Contattaci per ricevere un preventivo personalizzato.
14. Perché i set di dati medici sono importanti per l'IA/ML in ambito sanitario?
I dataset medici di alta qualità sono essenziali per addestrare modelli di intelligenza artificiale per il settore sanitario accurati, affidabili e clinicamente utili. Contribuiscono a migliorare la documentazione medica, l'elaborazione del linguaggio naturale in ambito clinico, il riconoscimento vocale, la sintesi di informazioni, il supporto alle decisioni, l'automazione, i flussi di lavoro per l'assistenza ai pazienti e l'analisi dei dati sanitari.