Três lições dos nossos projetos de IA
Ao longo de dois anos, acompanhámos dezenas de projetos de IA, desde a exploração inicial até um modelo que é executado todas as noites. Alguns…
Os exemplos acima têm a mesma causa. Os dados de treino dos algoritmos não são representativos de toda a população e, nestes casos, isso tem consequências graves e, por vezes, até perigosas.
Os modelos de machine learning também podem apresentar viés de género, incluindo algoritmos de autoaprendizagem que se poderia esperar que fossem neutros. Se os dados introduzidos num algoritmo já contiverem um viés, este pode não só refletir-se nos resultados do modelo, como até ser amplificado. Destacamos abaixo algumas técnicas e métodos de data science e/ou IA em que isto acontece.
Os modelos de reconhecimento de imagens permitem aprender a partir de imagens sem necessidade de conhecimentos específicos.
O software de reconhecimento de imagens, incluindo o utilizado por grandes fornecedores, apresenta estereótipos claros. As imagens de pessoas a fazer compras e a lavar são associadas a mulheres; as de treino desportivo e de tiro, a homens. Além disso, este software tende a identificar homens em cozinhas como mulheres. Ferramentas como o Google Cloud Vision também atribuem etiquetas claramente diferentes a imagens de homens e de mulheres.
As imagens de mulheres são muito mais frequentemente etiquetadas com base na aparência, enquanto as de homens são etiquetadas com base em características profissionais. Isto também se vê na imagem. Além disso, as mulheres são, em geral, menos reconhecidas nas imagens do que os homens.
A IA de voz, ou reconhecimento da fala, é cada vez mais utilizada. A Google tem um modelo próprio, amplamente utilizado, para este fim. A própria Google afirmou que o seu sistema de reconhecimento da fala tem uma precisão de 95%. No entanto, esta precisão não é igual para todos os grupos. A ferramenta é 13% mais precisa para homens do que para mulheres. Também funciona melhor com alguns dialetos e sotaques do que com outros[5].
Avaliar o desempenho do reconhecimento da fala em cada grupo permitiria introduzir melhorias específicas. Isto começa também pelos dados fornecidos ao sistema: envolver um grupo diversificado permite ter uma visão mais clara da sua precisão.
Também pode existir viés de género em Natural Language Processing. Um exemplo surge com a utilização de word embeddings [7]. Os word embeddings são treinados com base na coocorrência de palavras em corpora de texto. Num modelo deste tipo, treinado com dados do Google News, a distância entre as palavras ‘nurse’ e ‘woman’ é muito menor do que a distância entre ‘nurse’ e ‘man’. Isto indica um viés de género.
Existem métodos chamados ‘debias’ para modelos de machine learning que reduzem o enviesamento. Por exemplo, a palavra ‘nurse’ do exemplo anterior pode ser deslocada para mais perto do ponto médio entre ‘man’ e ‘woman’. Muitas vezes, também é possível reduzir a amplificação do enviesamento causada por alguns modelos de machine learning. Ainda assim, neste caso, prevenir é melhor do que remediar: a causa já está nos dados introduzidos no algoritmo. Além disso, estes métodos de debias só podem ser aplicados quando a pessoa que concebe o algoritmo deteta o enviesamento. Só quando, enquanto especialista em data science, tem consciência do enviesamento presente nos dados é que pode fazer algo para o contrariar.
O enviesamento de género não é o único tipo de enviesamento presente nestes algoritmos. Todos os algoritmos são fortemente influenciados pelos pressupostos em que assentam, pelo que o enviesamento de género é apenas uma ilustração da importância dos dados introduzidos num algoritmo.
O enviesamento de género nos dados desempenha, portanto, um papel importante e tem consequências claras na prática. Mas os primeiros passos já foram dados. Para enfrentar o problema, é preciso começar por reconhecê-lo. A consciencialização parece estar a aumentar e o tema está a ganhar visibilidade. Assim, a ‘pessoa’ por detrás do algoritmo é determinante para o resultado. Por isso, ter mais mulheres em data science é, sem dúvida, um bom começo!
ReferênciasAo longo de dois anos, acompanhámos dezenas de projetos de IA, desde a exploração inicial até um modelo que é executado todas as noites. Alguns…
Muitas organizações já realizaram um projeto-piloto de IA. O modelo funciona, a demonstração é aplaudida e depois não acontece mais nada. Pela nossa…
A inteligência artificial está a evoluir rapidamente. Surgem novos modelos quase todas as semanas, e cada vez mais organizações experimentam a IA. Ao…
Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?
Obrigado pela sua inscrição!