M11433005
CLIP(Contrastive Language–Image Pre-training) 是一種由 OpenAI 提出的多模態模型,可以理解圖片與文字之間的關聯。
它會透過大量的「圖片+文字描述」進行訓練,學習將相符合的圖片和文字放在相近的向量空間中,因此可以用來做圖片分類、圖片搜尋、文字搜尋圖片等工作。
簡單來說:
CLIP = 讓 AI 能夠理解「圖片」和「文字」之間關係的模型。
它會透過大量的「圖片+文字描述」進行訓練,學習將相符合的圖片和文字放在相近的向量空間中,因此可以用來做圖片分類、圖片搜尋、文字搜尋圖片等工作。
簡單來說:
CLIP = 讓 AI 能夠理解「圖片」和「文字」之間關係的模型。