A evolução da tecnologia nos últimos anos tem proporcionado à medicina novos e poderosos instrumentos no diagnóstico de doenças [1-5].

A Inteligência Artificial (IA) [5.1] também tem trazido novos ferramentas de diagnóstico para a medicina e a mais renomada delas é conhecido como Deep Learning (DL)  [6] (ou Aprendizado Profundo). O DL tem “1001 utilidades” em diversos segmento de indústria. Na medicina destacamos alguns exemplos nestas referências [7-9].

Juntando-se à lista das tecnologias não invasivas de diagnóstico temos detectado o crescente interesse em vários setores de saúde por um novo instrumento de diagnóstico. Trata-se da detecção de doenças por análise da voz humana. A tecnologia de DL é utilizada aqui para diagnosticar doenças a partir da voz das pessoas. Esse movimento é consequência da utilização da tecnologia de IA na Computação Afetiva [10-11] que tem evoluído muito nos últimos anos.

É basicamente o que lhe parece: você fala, e um computador analisa a sua voz e detecta a sua doença. A maioria dos indicadores que as máquinas utilizando algoritmos de DL podem identificar não são detectáveis pelo ouvido humano!

Quando ouvimos irregularidades em nossas próprias vozes ou nas vozes de outras pessoas, o fato de estarmos percebendo que elas são marcantes com características típicas de alongamento sílabas, voz distorcida (ou desarticulada), tremor, ou utilizando um tom que é excepcionalmente “plano” ou nasal poderiam ser indicadores de diferentes condições de saúde. Mesmo se pudéssemos ouvi-los não saberíamos como analisar ou interpretar esses biomarcadores da voz, a menos que alguém diga: “Estou com dor no peito” ou “Estou me sentido deprimido”. Apesar do ouvido humano não conseguir identificar estes biomarcadores, os computadores com a tecnologia de IA vão poder identifica-los!

Pesquisadores de vários centros médicos, universidades e empresas de saúde coletaram gravações de voz de centenas de pacientes e alimentaram um software de Machine Learning [12] (leia-se Deep Learning) que compara as vozes dos potenciais pacientes com as de pessoas saudáveis, com o objetivo de estabelecer padrões suficientemente claros para reconhecer indicadores de doenças através das vozes.