Ir para o conteúdo
Ir para insights Blog

Enviesamento de género nos dados

Enviesamento de género nos dados
Escrito por
Data Science Lab
Publicado em
17 de agosto de 2021
Os dados desempenham um papel cada vez mais importante nas nossas vidas. As decisões pessoais, empresariais e até políticas são cada vez mais tomadas por algoritmos. E um algoritmo que quase dispensa a intervenção humana não pode ser ‘enviesado’, pois não? Infelizmente, pode. Todos os algoritmos assentam em determinados pressupostos e dependem fortemente deles. As perspetivas e ideias de quem concebe o modelo acabam por ter uma enorme influência nos resultados. Neste artigo, abordamos uma consequência específica: o enviesamento de género. O que é exatamente? O enviesamento de género nos dados é um enviesamento (uma distorção do resultado causada por fatores externos) relacionado especificamente com o género. Muitos algoritmos baseiam-se em dados recolhidos sem recurso a um grupo representativo. Por exemplo, é frequente faltar contributo de mulheres. Isto pode gerar resultados parciais ou enviesados. Mas e se forem tomadas decisões importantes com base nos resultados? O enviesamento de género nos dados é visível na prática, mas também pode ocorrer de forma ‘oculta’, por exemplo, em machine learning.

Exemplos de enviesamento de género nos dados na prática

  • Quando as mulheres estão envolvidas num acidente de viação, a probabilidade de sofrerem ferimentos graves é 47% superior à dos homens, e a de sofrerem ferimentos moderados é 71% superior. A probabilidade de morrerem num acidente de viação também é 17% superior à dos homens[2]. Porquê? Em média, as mulheres sentam-se mais à frente, são mais baixas e, por isso, têm de se sentar mais direitas para terem melhor visibilidade. Isto acontece porque os automóveis foram concebidos com recurso a dummies de testes de colisão baseados no homem médio. Em 2011, os primeiros dummies femininos de testes de colisão passaram a ser usados na produção nos Estados Unidos.
  • Em 2014, a Amazon introduziu um algoritmo para selecionar automaticamente os melhores talentos entre um grande número de currículos. Parecia promissor, mas verificou-se que os currículos que continham a palavra “women’s” recebiam avaliações mais baixas. Currículos idênticos cuja única diferença era o candidato ser homem ou mulher também recebiam avaliações diferentes. Isto devia-se ao facto de o modelo ter sido treinado com currículos do setor tecnológico de 10 anos antes. Como as mulheres estavam sub-representadas nesse setor, os dados de treino eram constituídos sobretudo por currículos de homens.
  • Na medicina, também se verifica que os ataques cardíacos são identificados menos rapidamente nas mulheres do que nos homens e que os medicamentos, com maior frequência, não funcionam devidamente, simplesmente porque foram testados em grupos maioritariamente masculinos[6].

Os exemplos acima têm a mesma causa. Os dados de treino dos algoritmos não são representativos de toda a população e, nestes casos, isso tem consequências graves e, por vezes, até perigosas.

Viés de género nos dados em IA e data science

Os modelos de machine learning também podem apresentar viés de género, incluindo algoritmos de autoaprendizagem que se poderia esperar que fossem neutros. Se os dados introduzidos num algoritmo já contiverem um viés, este pode não só refletir-se nos resultados do modelo, como até ser amplificado. Destacamos abaixo algumas técnicas e métodos de data science e/ou IA em que isto acontece.

Reconhecimento de imagens[4]

Os modelos de reconhecimento de imagens permitem aprender a partir de imagens sem necessidade de conhecimentos específicos.

O software de reconhecimento de imagens, incluindo o utilizado por grandes fornecedores, apresenta estereótipos claros. As imagens de pessoas a fazer compras e a lavar são associadas a mulheres; as de treino desportivo e de tiro, a homens. Além disso, este software tende a identificar homens em cozinhas como mulheres. Ferramentas como o Google Cloud Vision também atribuem etiquetas claramente diferentes a imagens de homens e de mulheres.
As imagens de mulheres são muito mais frequentemente etiquetadas com base na aparência, enquanto as de homens são etiquetadas com base em características profissionais. Isto também se vê na imagem. Além disso, as mulheres são, em geral, menos reconhecidas nas imagens do que os homens.

Dois gráficos de barras que mostram quais as etiquetas mais frequentemente atribuídas a fotografias de homens e de mulheres.

Reconhecimento de voz

A IA de voz, ou reconhecimento da fala, é cada vez mais utilizada. A Google tem um modelo próprio, amplamente utilizado, para este fim. A própria Google afirmou que o seu sistema de reconhecimento da fala tem uma precisão de 95%. No entanto, esta precisão não é igual para todos os grupos. A ferramenta é 13% mais precisa para homens do que para mulheres. Também funciona melhor com alguns dialetos e sotaques do que com outros[5].

Avaliar o desempenho do reconhecimento da fala em cada grupo permitiria introduzir melhorias específicas. Isto começa também pelos dados fornecidos ao sistema: envolver um grupo diversificado permite ter uma visão mais clara da sua precisão.

Natural Language Processing e Word Embeddings

Também pode existir viés de género em Natural Language Processing. Um exemplo surge com a utilização de word embeddings [7]. Os word embeddings são treinados com base na coocorrência de palavras em corpora de texto. Num modelo deste tipo, treinado com dados do Google News, a distância entre as palavras ‘nurse’ e ‘woman’ é muito menor do que a distância entre ‘nurse’ e ‘man’. Isto indica um viés de género.

Existem métodos chamados ‘debias’ para modelos de machine learning que reduzem o enviesamento. Por exemplo, a palavra ‘nurse’ do exemplo anterior pode ser deslocada para mais perto do ponto médio entre ‘man’ e ‘woman’. Muitas vezes, também é possível reduzir a amplificação do enviesamento causada por alguns modelos de machine learning.  Ainda assim, neste caso, prevenir é melhor do que remediar: a causa já está nos dados introduzidos no algoritmo. Além disso, estes métodos de debias só podem ser aplicados quando a pessoa que concebe o algoritmo deteta o enviesamento. Só quando, enquanto especialista em data science, tem consciência do enviesamento presente nos dados é que pode fazer algo para o contrariar.

O enviesamento de género não é o único tipo de enviesamento presente nestes algoritmos. Todos os algoritmos são fortemente influenciados pelos pressupostos em que assentam, pelo que o enviesamento de género é apenas uma ilustração da importância dos dados introduzidos num algoritmo.

Conclusão

O enviesamento de género nos dados desempenha, portanto, um papel importante e tem consequências claras na prática. Mas os primeiros passos já foram dados. Para enfrentar o problema, é preciso começar por reconhecê-lo. A consciencialização parece estar a aumentar e o tema está a ganhar visibilidade. Assim, a ‘pessoa’ por detrás do algoritmo é determinante para o resultado. Por isso, ter mais mulheres em data science é, sem dúvida, um bom começo!

Referências
  1. A. Linder & M. Y. Svensson (2019) Road safety: the average male as a norm in vehicle occupant crash safety assessment, Interdisciplinary Science Reviews, 44:2, 140-153, DOI: 10.1080/03080188.2019.1603870
  2. https://www.theguardian.com/lifeandstyle/2019/feb/23/truth-world-built-for-men-car-crashes
  3. https://www.bbc.com/news/technology-45809919
  4. Schwemmer, C., Knight, C., Bello-Pardo, E. D., Oklobdzija, S., Schoonvelde, M., & Lockhart, J. W. (2020). Diagnosing gender bias in image recognition systems. Socius, 6, 2378023120967171
  5. Tatman, R. (2017). Gender and Dialect Bias in Youtube;s Automatic Captions
  6. Hamberg, K. (2008). Gender bias in medicine. Women’s health, 4(3), 237-243.
  7. Bolukbasi, T., Chang, K. W., Zou, J. Y., Saligrama, V., & Kalai, A. T. (2016). Man is to computer programmer as woman is to homemaker? debiasing word embeddings. Advances in neural information processing systems, 29, 4349-4357.
Blog

Também poderá ter interesse nisto,

Subscreva a nossa newsletter.

Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?

Introduza um endereço de e-mail válido.