Una donna registra la propria voce con uno smartphone; un’onda sonora richiama l’analisi sperimentale con intelligenza artificiale del rischio di diabete di tipo 2Una donna registra la propria voce con uno smartphone; un’onda sonora richiama l’analisi sperimentale con intelligenza artificiale del rischio di diabete di tipo 2

Estratto: Una favola letta ad alta voce, venti secondi di registrazione e un algoritmo: così i ricercatori hanno provato a riconoscere il diabete di tipo 2. La voce può diventare una porta d’ingresso allo screening? Ecco numeri, limiti e domande ancora aperte.


Se una favola di Esopo letta per venti secondi potesse suggerire di controllare la glicemia, il confine tra salute digitale e racconto sembrerebbe davvero sottile. È l’idea alla base di una ricerca presentata al congresso 2026 dell’Associazione europea per lo studio del diabete, EASD, a Milano.

Un algoritmo esamina caratteristiche della voce e assegna un punteggio di rischio per il diabete di tipo 2. La domanda utile, però, non è se la macchina «senta» il diabete. È se quel punteggio aiuti a trovare persone che altrimenti non farebbero un esame del sangue, senza produrre troppi allarmi inutili. Il manoscritto originale consente di guardare oltre il titolo del comunicato. medRxiv

Come è stato condotto lo studio

Il gruppo di ricerca, composto soprattutto da studiosi dell’azienda britannica thymia, con una collaborazione accademica australiana, ha addestrato il modello usando 63.283 campioni vocali raccolti da 21.129 persone negli Stati Uniti e nel Regno Unito. Per valutarlo sono state usate brevi registrazioni di persone che leggevano ad alta voce una favola di Esopo. Il sistema ricava caratteristiche acustiche del parlato: non misura la glicemia.

La verifica è avvenuta in due passaggi. Nel primo, il punteggio è stato confrontato con la diagnosi di diabete di tipo 2 dichiarata da 7.319 adulti di lingua inglese nel Regno Unito, 217 dei quali riferivano la patologia. Nel secondo, 801 partecipanti hanno eseguito a domicilio un test dell’emoglobina glicata, HbA1c, entro tre mesi dalla registrazione. Quest’ultimo confronto usa un dato biologico, ma riguarda un sottogruppo più piccolo, selezionato anche in base al rischio previsto dal modello. medRxiv

L’80% non significa «otto diagnosi giuste su dieci»

Nel confronto con le diagnosi dichiarate, l’AUC, una misura della capacità di distinguere chi ha e chi non ha la condizione, è stata 0,80. In termini intuitivi: scegliendo a caso una persona con diabete e una senza, il modello tende ad attribuire il punteggio più alto alla prima nell’80% delle coppie. Non significa che abbia diagnosticato correttamente l’80% di tutti i partecipanti.

Nel sottogruppo con esame del sangue, usando come soglia per il diabete un’HbA1c di almeno 48 mmol/mol, pari al 6,5%, l’AUC è scesa a 0,75. A una soglia operativa riportata dagli autori, la sensibilità era circa 82% e il tasso di falsi positivi del 47%. In quel gruppo, quindi, il sistema avrebbe individuato circa 82 persone su 100 con HbA1c nella fascia diabetica, lasciandone sfuggire circa 18; fra 100 persone senza HbA1c in quella fascia, circa 47 avrebbero potuto ricevere una segnalazione positiva da verificare. Sensibilità e falsi positivi dipendono dalla soglia scelta. medRxiv

Gli autori riferiscono inoltre che nessuno dei partecipanti collocati nella fascia vocale a basso rischio aveva un’HbA1c nel range del prediabete o del diabete. È un’osservazione interessante, ma non autorizza a promettere che una voce giudicata «a basso rischio» escluda il diabete nella popolazione generale. Per stabilirlo bisogna conoscere il comportamento del sistema in un vero percorso di screening. medRxiv

Una voce diversa non è la prova di una malattia

Il parlato può riflettere respirazione, controllo muscolare, affaticamento e altre condizioni. Nello studio le prestazioni sono risultate inferiori nelle persone con malattia cardiovascolare, ipertensione o obesità, condizioni che possono coesistere con il diabete e influenzare la voce. La performance è stata inferiore anche nei partecipanti neri; gli autori richiamano la scarsa numerosità dei casi di diabete in quel sottogruppo. Prima di proporre uno strumento simile su larga scala servono verifiche per gruppi poco rappresentati, accenti, lingue e condizioni di registrazione. Lo studio ha valutato parlanti inglesi: non dimostra che il modello funzioni in italiano. medRxiv

C’è un’altra sottigliezza metodologica. Secondo il manoscritto, il questionario usato per raccogliere i dati iniziali di addestramento non distingueva sempre tra i diversi tipi di diabete. Le successive valutazioni hanno usato informazioni più specifiche, ma quell’etichetta iniziale resta una possibile fonte di imprecisione. Inoltre l’HbA1c, eseguita fino a tre mesi dopo la registrazione, non è una misurazione contemporanea della voce. medRxiv

Dove potrebbe essere utile, e quale prova manca

L’impiego più plausibile è un primo invito alla verifica: una persona registra la voce per telefono o in un’app, il sistema segnala un rischio più elevato e il medico propone gli esami appropriati. L’eventuale diagnosi resta clinica e richiede test validati.

Per capire se questo percorso sia davvero utile serve uno studio prospettico nella pratica sanitaria, preferibilmente con valutazione indipendente. Dovrebbe misurare quanti nuovi casi vengono confermati, quanti sfuggono, quanti esami del sangue aggiuntivi sono necessari, costi ed eventuali effetti dei falsi allarmi. Il confronto riportato nel preprint con QDiabetes va letto con attenzione: quel punteggio nasce per stimare il rischio futuro, mentre l’algoritmo vocale è stato valutato anche per riconoscere una condizione già presente. medRxiv

Qual è il livello di affidabilità della notizia?

I dati presentati all’EASD hanno un manoscritto originale su medRxiv: è un preprint, non ancora certificato dalla revisione tra pari. Si tratta della valutazione di un modello, non della prova che usarlo migliori gli esiti di salute. La quantità di materiale vocale è notevole; la verifica con HbA1c, che risponde alla domanda clinicamente più importante, comprende però 801 persone e richiede conferme in altre popolazioni. medRxiv

Vanno dichiarati anche gli interessi economici: diversi autori lavorano per thymia; due sono cofondatori e alcuni detengono quote della società, che potrebbe beneficiare della commercializzazione di tecnologie simili. Il manoscritto riferisce che la ricerca non ha ricevuto finanziamenti esterni. Il conflitto d’interesse non annulla i risultati, ma rende particolarmente importante una replica indipendente. medRxiv

La voce, insomma, potrebbe diventare un campanello discreto. Per ora non è un referto: se ci sono sintomi, fattori di rischio o una raccomandazione medica a controllare la glicemia, non occorre aspettare che sia un algoritmo ad «ascoltarli».

In sintesi

  • Che cosa è stato studiato: un algoritmo che stima il rischio di diabete di tipo 2 da circa 20 secondi di parlato.
  • Risultato principale: AUC 0,80 sulle diagnosi dichiarate e 0,75 nel sottogruppo di 801 persone con HbA1c.
  • Limite pratico: alla soglia riportata, sensibilità dell’82% e falsi positivi del 47% nel confronto con l’HbA1c. Non è un test diagnostico pronto per l’uso autonomo.
  • Stato delle prove: preprint e presentazione congressuale; servono revisione tra pari e studi clinici indipendenti, anche in altre lingue.

Fonti: Brann E. e colleghi, Detection of Type 2 Diabetes from 20-second Speech Recordings, medRxiv, versione 2, 18 agosto 2026; Organizzazione mondiale della sanità, scheda informativa sul diabete. medRxiv

Hashtag: #DiabeteTipo2 #IntelligenzaArtificiale #Screening #EASD2026

/RL

error: Il contenuto è protetto!!