Emergent semantic segmentation: training-free dense-label-free extraction from vision-language models

From an enormous amount of image-text pairs, large-scale vision-language models (VLMs) learn to implicitly associate image regions with words, which is vital for tasks such as image captioning and visual question answering. However, leveraging such pre-trained models for open-vocabulary semantic s...

وصف كامل

محفوظ في:

التفاصيل البيبلوغرافية
المؤلف الرئيسي:	Luo, Jiayun
مؤلفون آخرون:	Li Boyang
التنسيق:	Thesis-Master by Research
اللغة:	English
منشور في:	Nanyang Technological University 2024
الموضوعات:	Computer and Information Science Vision-language model Open-vocabulary semantic segementation
الوصول للمادة أونلاين:	https://hdl.handle.net/10356/175765
الوسوم:	إضافة وسم لا توجد وسوم, كن أول من يضع وسما على هذه التسجيلة!
المؤسسة:	Nanyang Technological University
اللغة:	English

الانترنت

https://hdl.handle.net/10356/175765

Emergent semantic segmentation: training-free dense-label-free extraction from vision-language models

الانترنت

مواد مشابهة