Drie lessen uit onze AI-projecten
In twee jaar tijd begeleidden we tientallen AI-projecten, van een eerste verkenning tot een model dat elke nacht draait. Sommige liepen precies zoals…
Traditionele computer vision-modellen werken goed voor specifieke taken, maar generaliseren slecht. Een model dat katten en honden herkent, kan niet zomaar mensen herkennen. Zelfs ImageNET een dataset met 1000 categorieën, heeft zijn beperkingen. Het herkent bijvoorbeeld geen mensen, laat staan dat het onderscheid maakt tussen een kind en een volwassene. Maar nu is er CLIP.
Contrastive Language–Image Pre-training (CLIP), ontwikkeld door OpenAI, pakt dit probleem aan. CLIP is ontworpen als een algemeen model dat afbeeldingen begrijpt zonder specifieke training voor elke categorie. Het herkent niet alleen katten en honden, maar ook abstracte concepten zoals "een astronaut op een paard in de ruimte." Dit maakt het een krachtig computer vision-model: in plaats van meerdere modellen te trainen voor verschillende taken, biedt CLIP een one-size-fits-all oplossing. Een vergelijkbare architectuur wordt ook gebruikt in GPT-4 voor beeldverwerking.
Afbeelding 1. Best matchende beschrijving bij afbeelding volgens CLIP
OpenAI beschrijft CLIP als
Die zero-shot-mogelijkheden betekenen dat het concepten kan herkennen die het nooit eerder heeft gezien. Het model heeft bijvoorbeeld nooit een afbeelding van een "astronaut op een paard in de ruimte" gezien, maar weet wél wat een astronaut, een paard en de ruimte zijn. Door deze begrippen te combineren, kan het de juiste classificatie toekennen. Om te begrijpen hoe CLIP deze generalisatie bereikt en hoe het afbeeldingen met tekst matcht, duiken we dieper in de techniek.
CLIP koppelt tekst en beeld via embeddings—numerieke representaties van data in een hoogdimensionale ruimte. In deze ruimte staan bij elkaar horende afbeeldingen en tekst dicht bij elkaar. Dit maakt het mogelijk om taken zoals beeldbeschrijving, objectdetectie en classificatie uit te voeren. Bij het classificeren van een afbeelding vergelijkt het de afbeeldingsembedding met tekstuele beschrijvingen zoals “A photo of a dog” en “A photo of a cat”. Het model kiest de beschrijving die het beste overeenkomt met de afbeelding.
CLIP is getraind op 400 miljoen afbeelding-tekst paren die van het internet zijn gehaald. Dit biedt een voordeel ten opzichte van traditionele datasets met simpele labels zoals “kat”. CLIP’s dataset bevat rijkere beschrijvingen, zoals “een slapende kat op een stoel” of “een kat die speelt met een balletje”. Hierdoor leert het model niet alleen wat een kat is, maar ook wat een stoel of een balletje is.
Het omzetten van deze afbeelding-tekst paren naar bruikbare embeddings gebeurt in een stap die Contrastive pre-training heet. In deze stap wordt het getraind om echte afbeelding-tekst paren te matchen binnen een batch van N willekeurige paren uit de dataset. In deze stap transformeren een tekst- en afbeelding encoder hun input naar een embedding. Het doel is dat de embeddings van de afbeelding en de tekst van paar 1 hetzelfde zijn, en dit voor alle paren in de batch. Het training proces probeert de cosine-similarity tussen de embeddings van de echte paren te maximaliseren en de gelijkenis tussen de embeddings van de onjuiste paren te minimaliseren.
Afbeelding 2: Contrastive pre-training.
Door dit proces meerdere malen te herhalen voor de gehele dataset lukt het CLIP om representaties van vele concepten te leren. Na het trainen kunnen de geleerde embeddings gebruikt worden voor verschillende doeleinden. CLIP kan gebruikt worden voor de eerdergenoemde classificatie van afbeeldingen, maar er zijn nog meer interessante use cases waar de kwaliteiten van CLIP tot hun recht komen.
CLIP werd oorspronkelijk ontwikkeld voor beeldclassificatie, maar wordt nu voor veel meer toepassingen ingezet:
CLIP is een veelzijdige oplossing voor het probleem van generalisering in computer vision. De mogelijkheid om afbeeldingen en tekst te begrijpen opent de deur naar diverse toepassingen, van contentmoderatie tot verbeterde toegankelijkheid, efficiënte aanbevelingssystemen en nog vele andere toepassingen.
Bovendien laat de integratie in moderne LLMs zoals GPT-4 zien dat CLIP verder gaat dan computer vision alleen. De technologie maakt AI nog flexibeler en krachtiger. En met de snelheid waarmee AI zich ontwikkelt, is dit pas het begin.
In twee jaar tijd begeleidden we tientallen AI-projecten, van een eerste verkenning tot een model dat elke nacht draait. Sommige liepen precies zoals…
Veel organisaties hebben inmiddels een AI-pilot gedraaid. Het model werkt, de demo oogst applaus, en dan gebeurt er niets meer. Uit onze praktijk…
Artificial Intelligence ontwikkelt zich razendsnel. Vrijwel elke week verschijnen er nieuwe modellen en steeds meer organisaties experimenteren met…
Wil je als eerste op de hoogte zijn van een nieuwe blog?
Bedankt voor je aanmelding!