[ICLR 2025] - Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion
image-classificationclipimage-retrievalvlmovitext-retrievalmultimodalvision-languageoticontrastive-learningtextual-inversionvision-language-modelsiglipiclr2025modality-gapmodality-inversionintra-modalinter-modalintra-modal-misalignmentvisual-inversion
-
Updated
Nov 30, 2025 - Python