A visual grounding system for RefCOCO that freezes GroundingDINO candidates and trains a lightweight multimodal fusion reranker for region-text alignment and verifiable candidate ranking.
clip hard-negative-mining ranking-loss visual-grounding multimodal-fusion vision-language-model candidate-reranking region-text-alignment
-
Updated
Jul 11, 2026 - Python