Ir para o conteúdo
Ir para insights Blog

CLIP - A IA que liga imagens e linguagem

CLIP - A IA que liga imagens e linguagem
Escrito por
Data Science Lab
Publicado em
25 de fevereiro de 2025

O reconhecimento de imagens tem um problema

Os modelos tradicionais de computer vision funcionam bem em tarefas específicas, mas têm dificuldade em generalizar. Um modelo que reconhece gatos e cães não consegue necessariamente reconhecer pessoas. Até ImageNET, um conjunto de dados com 1000 categorias, tem limitações. Por exemplo, não reconhece pessoas, muito menos distingue uma criança de um adulto. Mas agora existe o CLIP.

CLIP: Generalização no reconhecimento de imagens

O Contrastive Language–Image Pre-training (CLIP), desenvolvido pela OpenAI, responde a este problema. O CLIP foi concebido como um modelo de uso geral que compreende imagens sem precisar de treino específico para cada categoria. Reconhece não só gatos e cães, mas também conceitos abstratos como "um astronauta a cavalo no espaço." Isto faz dele um poderoso modelo de computer vision: em vez de treinar vários modelos para diferentes tarefas, o CLIP oferece uma solução única para todas elas. Uma arquitetura semelhante também é utilizada no GPT-4 para o processamento de imagens.


CLIP an austronaut riding a horse in space

Imagem 1. A descrição que melhor corresponde à imagem, segundo o CLIP

Como funciona o CLIP

A OpenAI descreve o CLIP como

[“…uma rede neuronal treinada com diversos pares de (imagem, texto). Pode receber instruções em linguagem natural para prever o excerto de texto mais relevante para uma imagem, sem ser diretamente otimizada para essa tarefa, de forma semelhante às capacidades zero-shot do GPT-2 e do GPT-3”]

Essas capacidades zero-shot permitem-lhe reconhecer conceitos que nunca viu antes. Por exemplo, o modelo nunca viu uma imagem de um "astronauta a cavalo no espaço", mas sabe o que são um astronauta, um cavalo e o espaço. Ao combinar estes conceitos, consegue atribuir a classificação correta. Para compreender como o CLIP alcança esta generalização e associa imagens a texto, vamos analisar a tecnologia mais de perto.

Como funciona por dentro

O CLIP relaciona texto e imagem através de embeddings—representações numéricas de dados num espaço de elevada dimensionalidade. Nesse espaço, as imagens e os textos correspondentes ficam próximos uns dos outros. Isto permite realizar tarefas como a descrição de imagens, a deteção de objetos e a classificação. Para classificar uma imagem, o CLIP compara o embedding da imagem com descrições textuais como “Uma fotografia de um cão” e “Uma fotografia de um gato”. O modelo escolhe a descrição que melhor corresponde à imagem.

O CLIP foi treinado com 400 milhões de pares imagem-texto recolhidos da internet. Isto dá-lhe uma vantagem face aos datasets tradicionais com rótulos simples como “gato”. O dataset do CLIP contém descrições mais detalhadas, como “um gato a dormir numa cadeira” ou “um gato a brincar com uma bola”. Assim, o modelo aprende não só o que é um gato, mas também o que é uma cadeira ou uma bola.

A conversão destes pares imagem-texto em embeddings úteis ocorre numa etapa chamada contrastive pre-training . Nesta etapa, o modelo é treinado para associar pares imagem-texto corretos dentro de um lote de N pares selecionados aleatoriamente do dataset. Um encoder de texto e um encoder de imagem transformam, cada um, a sua entrada num embedding. O objetivo é que os embeddings da imagem e do texto do par 1 coincidam, e o mesmo aconteça com todos os pares do lote. O processo de treino procura maximizar a similaridade do cosseno entre os embeddings dos pares corretos e minimizar a similaridade entre os embeddings dos pares incorretos.

Esquema de pre-training contrastivo com um codificador de texto e um codificador de imagem.

Figura 2: Contrastive pre-training.

Ao repetir este processo várias vezes para todo o dataset, o CLIP consegue aprender representações de muitos conceitos. Depois do treino, os embeddings aprendidos podem ser usados para diferentes fins. O CLIP pode ser usado para a classificação de imagens já referida, mas há outros casos de uso interessantes que tiram partido das suas capacidades.

Casos de uso: Para que é utilizado o CLIP?

O CLIP foi originalmente desenvolvido para a classificação de imagens, mas agora é usado em muitas outras aplicações:

  • Multimodalidade em LLMs: A possibilidade de combinar texto e imagens torna os modelos CLIP úteis também em LLMs. Podem ser usados para responder a perguntas sobre imagens ou em tarefas multimodais, como descrever uma imagem fornecida pelo utilizador.
  • Sistema de pesquisa semântica: Os motores de pesquisa de imagens dependem muitas vezes de etiquetas e metadados adicionados manualmente, um processo trabalhoso e sujeito a erros. O CLIP associa diretamente pesquisas em texto a imagens relevantes, sem necessidade de etiquetagem manual.
  • Moderação de conteúdos: A versatilidade do CLIP também o torna útil para manter seguros os conteúdos das comunidades online. O CLIP consegue detetar e remover automaticamente conteúdos indesejados, como nudez, armas ou drogas. Graças à sua flexibilidade, é fácil adicionar outras categorias sem voltar a treinar o modelo.
  • Acessibilidade: As pessoas cegas ou com baixa visão dependem de leitores de ecrã para saber o que está numa página web. Para estes leitores, é importante que as imagens tenham texto alternativo que descreva o que mostram. Infelizmente, esse texto nem sempre existe. Nesses casos, o CLIP poderia ser usado para gerar automaticamente uma descrição da imagem.
  • Sistema de recomendação: O CLIP consegue encontrar imagens semelhantes sem recorrer a texto. Por exemplo, um utilizador de uma loja online pode carregar uma fotografia de um sofá, após o que o sistema recomenda produtos semelhantes. 
  • Modelos generativos: Modelos generativos como o [DALL-E] e o [Stable Diffusion] usam o CLIP nos bastidores para converter o prompt do utilizador em dados numéricos que um modelo generativo consegue utilizar.

O futuro do CLIP

O CLIP é uma solução versátil para o desafio da generalização em computer vision. A sua capacidade de compreender imagens e texto abre caminho a diversas aplicações, desde a moderação de conteúdos à melhoria da acessibilidade, a sistemas de recomendação eficientes e a muitas outras aplicações.

Além disso, a sua integração em LLMs modernos, como o GPT-4, mostra que o CLIP vai além de computer vision. A tecnologia torna a IA ainda mais flexível e capaz. E, com a rapidez com que a IA evolui, isto é apenas o início.

Blog

Também poderá ter interesse nisto,

Subscreva a nossa newsletter.

Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?

Introduza um endereço de e-mail válido.