R
Published on

CVPR 2026 — Image Retrieval & Matching

Image Retrieval & Matching

163 papers

1. Efficient and High-Fidelity Omni Modality Retrieval

2. Tackling Alignment Ambiguity in Person Retrieval through Conversational Attribute Mining

3. Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation

4. RetFormer: Multimodal Retrieval for Enhancing Image Recognition

5. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching

6. Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching

7. Robust Remote Sensing Image-Text Retrieval with Noisy Correspondence

8. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving

9. Beyond Soft Label: Dataset Distillation via Orthogonal Gradient Matching

10. GazeOnce360: Fisheye-Based 360deg Multi-Person Gaze Estimation with Global-Local Feature Fusion

11. Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bank

12. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching

13. EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

14. SAR2Net: Learning Spatially Anchored Representations for Retrieval-Guided Cross-Stain Alignment

15. Language-driven Fine-grained Retrieval

16. Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

17. Transition Matching Distillation for Fast Video Generation

18. Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matching

19. Towards Cross-Modal Preservation, Consistency and Alignment for Privacy-Preserving Visible-Infrared Person Re-Identification

20. HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognition

21. C-LaV: Conditional Latent Velocity Field Denoising for Weather-Robust LiDAR Place Recognition

22. Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrieval

23. Composite-Attribute Person Re-Identification via Pose-Guided Disentanglement

24. Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

25. R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment

26. Scaling Multi-Identity Consistency for Image Customization via Multi-to-Multi Matching Paradigm

27. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

28. Beyond Global Similarity: Multi-Conditional Retrieval for Fine-Grained Cross-Modal Understanding

29. POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval

30. PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding

31. SSM-Aware Token-Efficient VMamba via Adaptive Patch Pruning and Merging for Person Re-Identification

32. Scalable Feature Matching via State Space Modeling and Sparse Correlation

33. MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction

34. RMIR: A Benchmark Dataset for Reasoning-Intensive Multimodal Image Retrieval

35. Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching

36. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching

37. DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models

38. STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval

39. PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

40. COT-FM: Cluster-wise Optimal Transport Flow Matching

41. PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts

42. CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

43. Frequency-Aware Flow Matching for High-Quality Image Generation

44. Universal 3D Shape Matching via Coarse-to-Fine Language Guidance

45. MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

46. Spatial-Frequency Collaborative Learning for Occluded Visible-Infrared Person Re-Identification

47. COPE: Consistent Occlusion and Prompt Enhancement Network for Occluded Person Re-identification

48. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

49. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

50. Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching

51. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping

52. View-Aware Semantic Alignment for Aerial-Ground Person Re-Identification

53. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

54. Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification

55. RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation

56. RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval

57. MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation

58. Camouflage-aware Image-Text Retrieval via Expert Collaboration

59. Few-shot Acoustic Synthesis with Multimodal Flow Matching

60. WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

61. Thinking in 360deg: Humanoid Visual Search in the Wild

62. Beyond Caption-Based Queries in Video Moment Retrieval

63. Dataset Distillation by Influence Matching

64. SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross-Subject EEG-to-Image Retrieval

65. EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval

66. Object-Generalized Re-Identification: A Step Towards Universal Instance Perception

67. AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual Localization

68. GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

69. MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answering

70. R2^2TUA: Reconstruction-residual Based Targeted and Untargeted Attack Against Text-Image Person Re-Identification

71. TextFM: Robust Semi-dense Feature Matching with Language Guidance

72. ReMatch: Boosting Representation through Matching for Multimodal Retrieval

73. RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generation

74. Fast Markov Random Field Optimisation for Topologically Noisy 3D Shape Matching

75. Gravitation-Driven Semantic Alignment for Text Video Retrieval

76. WHU-MARS: A Multispectral Aerial-Ground Benchmark Towards Any-Scenario Person Re-Identification

77. Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

78. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

79. WeDetect: Fast Open-Vocabulary Object Detection as Retrieval

80. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose

81. Multimodal Distribution Matching for Vision-Language Dataset Distillation

82. Flow Matching for Multimodal Distributions

83. ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategy

84. MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction

85. Flowception: Temporally Expansive Flow Matching for Video Generation

86. Spatial Retrieval Augmented Autonomous Driving

87. UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching

88. FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

89. WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

90. Unified Number-Free Text-to-Motion Generation Via Flow Matching

91. PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching

92. Compositional Transformation Reasoning for Composed Video Retrieval

93. RAID: Retrieval-Augmented Anomaly Detection

94. BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation

95. Lite Any Stereo: Efficient Zero-Shot Stereo Matching

96. VRCLIP: Multimodal Canonical Correlation Alignment for CLIP-Driven Vision-Radio Person Re-Identification

97. TIGER: A Unified Framework for Time, Images and Geo-location Retrieval

98. OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

99. ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval

100. Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval

101. AR2-4FV: Anchored Referring and Re-identification for Long-Term Grounding in Fixed-View Videos

102. FMPose3D: monocular 3D pose estimation via flow matching

103. CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale

104. GS-ASM: 2DGS-Supervised Active Stereo Matching

105. LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories

106. TriSim: Tri-Dimensional Similarity Modeling with Extreme Value Theory for False-Negative Mitigation in Remote Sensing Image-Text Retrieval

107. FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selection

108. MFEN: Multi-Frequency Expert Network for Visible-Infrared Person Re-ID

109. Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identification

110. StreamRAG: Enhancing Real-Time Video Understanding with Retrieval Augmentation

111. CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval

112. Chain-of-Thought Guided Multi-Modal Object Re-Identification

113. R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

114. Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval

115. G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

116. Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval

117. What Makes Good Synthetic Training Data for Zero-Shot Stereo Matching?

118. Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

119. From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matching

120. Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Bases

121. SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval

122. Stepwise Credit Assignment for GRPO on Flow-Matching Models

123. Matching Every Pair to Track Every Point: PairFormer for All-Pairs Tracking and Video Trajectory Fields

124. SANER: Switchable Adapter with Non-parametric Enhanced Routing for Person De-Reidentification

125. Quota-Calibrated Fine-Grained Alignment with Context-Aware Marginals for Text-based Person Retrieval

126. Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

127. BluRef: Unsupervised Image Deblurring with Dense-Matching References

128. Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning

129. Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models

130. FedBPrompt: Federated Domain Generalization Person Re-Identification via Body Distribution Aware Visual Prompts

131. Dynamic Magic: Unleashing Restricted Knowledge for Lifelong Person Re-Identification

132. MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervision

133. SAG-GNN: Semantic-Aware Guided GNN for Descriptor-Free 2D-3D Matching

134. SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

135. RenderFlow: Single-Step Neural Rendering via Flow Matching

136. URICA: A Uniformity Region Affine Identifier Capture Algorithm for Arbitrary Region Retrieval in Pathology Images

137. Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

138. Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

139. EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancement

140. Spatiotemporal Pyramid Flow Matching for Climate Emulation

141. Factorized Context Aggregation for Robust Cancer Risk Estimation via Soft Re-Ranked Retrieval and Hierarchical Anchors

142. DiT-Distill: Open-Set Fine-Grained Retrieval via Generative Curriculum Knowledge

143. GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis

144. ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

145. Learning Straight Flows: Variational Flow Matching for Efficient Generation

146. RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

147. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

148. AdvFM: Lookahead Flow-Matching Velocity-Field Attacks for Imperceptible and Transferable Adversarial Examples

149. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics

150. MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re-Identification

151. DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

152. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

153. 2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

154. Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation

155. DialogueVPR: Towards Conversational Visual Place Recognition

156. FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

158. GM-R^2: Generative Matching Learning for Unsupervised Geometric Representation and Registration

159. BIT: Matching-based Bi-directional Interaction Transformation Network for Visible-Infrared Person Re-Identification

160. Adapting In-context Generation for Enhanced Composed Image Retrieval

161. CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

162. Self-guided Semantic Inspection for Zero-Shot Composed Image Retrieval

163. Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification