Três lições dos nossos projetos de IA
Ao longo de dois anos, acompanhámos dezenas de projetos de IA, desde a exploração inicial até um modelo que é executado todas as noites. Alguns…
Os modelos tradicionais de computer vision funcionam bem em tarefas específicas, mas têm dificuldade em generalizar. Um modelo que reconhece gatos e cães não consegue necessariamente reconhecer pessoas. Até ImageNET, um conjunto de dados com 1000 categorias, tem limitações. Por exemplo, não reconhece pessoas, muito menos distingue uma criança de um adulto. Mas agora existe o CLIP.
O Contrastive Language–Image Pre-training (CLIP), desenvolvido pela OpenAI, responde a este problema. O CLIP foi concebido como um modelo de uso geral que compreende imagens sem precisar de treino específico para cada categoria. Reconhece não só gatos e cães, mas também conceitos abstratos como "um astronauta a cavalo no espaço." Isto faz dele um poderoso modelo de computer vision: em vez de treinar vários modelos para diferentes tarefas, o CLIP oferece uma solução única para todas elas. Uma arquitetura semelhante também é utilizada no GPT-4 para o processamento de imagens.
Imagem 1. A descrição que melhor corresponde à imagem, segundo o CLIP
A OpenAI descreve o CLIP como
Essas capacidades zero-shot permitem-lhe reconhecer conceitos que nunca viu antes. Por exemplo, o modelo nunca viu uma imagem de um "astronauta a cavalo no espaço", mas sabe o que são um astronauta, um cavalo e o espaço. Ao combinar estes conceitos, consegue atribuir a classificação correta. Para compreender como o CLIP alcança esta generalização e associa imagens a texto, vamos analisar a tecnologia mais de perto.
O CLIP relaciona texto e imagem através de embeddings—representações numéricas de dados num espaço de elevada dimensionalidade. Nesse espaço, as imagens e os textos correspondentes ficam próximos uns dos outros. Isto permite realizar tarefas como a descrição de imagens, a deteção de objetos e a classificação. Para classificar uma imagem, o CLIP compara o embedding da imagem com descrições textuais como “Uma fotografia de um cão” e “Uma fotografia de um gato”. O modelo escolhe a descrição que melhor corresponde à imagem.
O CLIP foi treinado com 400 milhões de pares imagem-texto recolhidos da internet. Isto dá-lhe uma vantagem face aos datasets tradicionais com rótulos simples como “gato”. O dataset do CLIP contém descrições mais detalhadas, como “um gato a dormir numa cadeira” ou “um gato a brincar com uma bola”. Assim, o modelo aprende não só o que é um gato, mas também o que é uma cadeira ou uma bola.
A conversão destes pares imagem-texto em embeddings úteis ocorre numa etapa chamada contrastive pre-training . Nesta etapa, o modelo é treinado para associar pares imagem-texto corretos dentro de um lote de N pares selecionados aleatoriamente do dataset. Um encoder de texto e um encoder de imagem transformam, cada um, a sua entrada num embedding. O objetivo é que os embeddings da imagem e do texto do par 1 coincidam, e o mesmo aconteça com todos os pares do lote. O processo de treino procura maximizar a similaridade do cosseno entre os embeddings dos pares corretos e minimizar a similaridade entre os embeddings dos pares incorretos.
Figura 2: Contrastive pre-training.
Ao repetir este processo várias vezes para todo o dataset, o CLIP consegue aprender representações de muitos conceitos. Depois do treino, os embeddings aprendidos podem ser usados para diferentes fins. O CLIP pode ser usado para a classificação de imagens já referida, mas há outros casos de uso interessantes que tiram partido das suas capacidades.
O CLIP foi originalmente desenvolvido para a classificação de imagens, mas agora é usado em muitas outras aplicações:
O CLIP é uma solução versátil para o desafio da generalização em computer vision. A sua capacidade de compreender imagens e texto abre caminho a diversas aplicações, desde a moderação de conteúdos à melhoria da acessibilidade, a sistemas de recomendação eficientes e a muitas outras aplicações.
Além disso, a sua integração em LLMs modernos, como o GPT-4, mostra que o CLIP vai além de computer vision. A tecnologia torna a IA ainda mais flexível e capaz. E, com a rapidez com que a IA evolui, isto é apenas o início.
Ao longo de dois anos, acompanhámos dezenas de projetos de IA, desde a exploração inicial até um modelo que é executado todas as noites. Alguns…
Muitas organizações já realizaram um projeto-piloto de IA. O modelo funciona, a demonstração é aplaudida e depois não acontece mais nada. Pela nossa…
A inteligência artificial está a evoluir rapidamente. Surgem novos modelos quase todas as semanas, e cada vez mais organizações experimentam a IA. Ao…
Quer ser a primeira pessoa a saber quando publicamos um novo artigo no blogue?
Obrigado pela sua inscrição!