R
Published on

CVPR 2026 — Transformers & Architectures

Transformers & Architectures

503 papers

1. Continual Distillation of Teachers from Different Domains

2. GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

3. Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models

4. Reallocating Attention Across Layers to Reduce Multimodal Hallucination

5. Efficient and High-Fidelity Omni Modality Retrieval

6. APPO: Attention-guided Perception Policy Optimization for Video Reasoning

7. An Efficient Token Compression Framework for Visual Object Tracking

8. Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

9. GR-Gauge: Cost-efficient Training Configuration By Gauging the Gradient Redundancy

10. Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

11. DocPrune: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

12. The Missing Point in Vision Transformers for Universal Image Segmentation

13. HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork

14. LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imaging

15. WaDi: Weight Direction-aware Distillation for One-step Image Synthesis

16. MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe

17. CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models

18. EVA: Efficient Reinforcement Learning for End-to-End Video Agent

19. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer

20. Tri-Modal Fusion Transformers for UAV-based Object Detection

21. NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration

22. Computation and Communication Efficient Federated Unlearning via On-server Gradient Conflict Mitigation and Expression

23. Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers

24. Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives

25. HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning

26. I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

27. RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

28. GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Acceleration

29. Anchoring and Rescaling Attention for Semantically Coherent Inbetweening

30. LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimation

31. WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition

32. RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning

33. MeToM: Metadata-Guided Token Merging for Efficient Video LLMs

34. Breaking Spurious Correlations: Uncertainty-Driven Causal Transformers for AU Detection

35. Guiding a Diffusion Transformer with the Internal Dynamics of Itself

36. Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

37. Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

38. Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation

39. Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

40. MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs

41. Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

42. AVGGT: Rethinking Global Attention for Accelerating VGGT

43. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers

44. Correspondence-Attention Alignment for Multi-View Diffusion Models

45. CIGMA: Causal Information-Gain Mechanistic Attribution of Attention Heads in Vision Transformers

46. GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Grasping

47. Beyond Soft Label: Dataset Distillation via Orthogonal Gradient Matching

48. Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

49. Geometry-Guided 3D Visual Token Pruning for Video-Language Models

50. DyFCLT: Dynamic Frequency-Decoupled Cross-Modal Learning Transformer for Multimodal Tiny Object Detection

51. AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition

52. Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bank

53. Edge-RecViT: Efficient Vision Transformer via Semantic-Refined Dynamic Recursion

54. FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers

55. BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers

56. One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers

57. Hilbert Curve-Based Attention Enabling Topology-Preserving Image Tensor Representation for Semantic Segmentation Network

58. X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

59. FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

60. LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysis

61. Transition Matching Distillation for Fast Video Generation

62. SMV-EAR: Bring Spatiotemporal Multi-View Representation Learning into Efficient Event-Based Action Recognition

63. Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

64. Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes

65. Tea-Adapter: Teacher Adapter for Efficient Conditional Generation

66. Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation

67. CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

68. Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion

69. SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers

70. All Vehicles Can Lie: Efficient Adversarial Defense in Fully Untrusted-Vehicle Collaborative Perception via Pseudo-Random Bayesian Inference

71. Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

72. SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models

73. CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion

74. Stable and Efficient Single-Rollout RL for Multimodal Reasoning

75. Phrase-Grounding-Aware Supervised Fine-Tuning for Chart Recognition via Side-Masked Attention

76. SpikeTrack: High-performance and Energy-efficient Event-Based Object Tracking with Spiking Neural Network

77. MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

78. LazyVAR: Accelerating Visual Autoregressive Models via Scale-wise Token Pruning and Parallel Group Decoding

79. Complementary Prototype Mapping for Efficient Multimodal Anomaly Detection

80. DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

81. EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion

82. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

83. CausalLens: Sensitivity-Guided Multi-Head Causal Intervention for Hallucination Mitigation in Large Vision-Language Models

84. Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysis

85. SpikeTrack: A Spike-driven Framework for Efficient Visual Tracking

86. Adaptive Data Augmentation with Multi-armed Bandit: Sample-Efficient Embedding Calibration for Implicit Pattern Recognition

87. Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models

88. MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy

89. Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer

90. IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Models

91. Curvature-Aware Zeroth-Order Optimization for Memory-Efficient Test-Time Adaptation

92. Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

93. Discovering Adaptive Task Dependencies for Efficient Multi-Task Representation Compression

94. Selection-as-Nonlinearity: Bridging Attention and Activation via a Joint Game-Decision Lens for Interpretable, Discriminative Visual Representations

95. The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy

96. OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data

97. ART: Articulated Reconstruction Transformer

98. MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

99. Decoupled and Reusable Adaptation for Efficient Cross-Modal Transfer

100. LogCD: Local-to-global Consistency Distillation for Few-step Image Generation

101. EW-DETR: Evolving World Object Detection via Incremental Low-Rank DEtection TRansformer

102. QuietPrune: Query-Guided Early Token Pruning for Vision-Language Models

103. XPaintNet: An eXtreme Lightweight Framework for Stereoscopic Conversion without Inpainting Network

104. LoPrune: Efficient Data Pruning for LoRA-Based Fine-Tuning of Vision Transformer

105. Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability

106. ChimeraLoRA: Multi-Head LoRA-Guided Synthetic Datasets

107. PhaseWin Search Framework Enable Efficient Object-Level Interpretation

108. FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation

109. ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation

110. DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers

111. SSM-Aware Token-Efficient VMamba via Adaptive Patch Pruning and Merging for Person Re-Identification

112. SGI: Structured 2D Gaussians for Efficient and Compact Large Image Representation

113. Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection

114. SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead

115. Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

116. What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs

117. DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models

118. Submodel Extraction for Efficient and Personalized Federated Learning via Optimal Transport

119. AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM

120. AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

121. Parameter-efficient Continual Learning for Enhancing Plasticity without Forgetting under Limited Model Capacity

122. ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillation

123. Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

124. FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)N^N Diffusion Refinement

125. RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

126. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices

127. LiDeRe: A Lightweight Readout for Fast and Data-Efficient Dense Prediction

128. TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies

129. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

130. VisionLeaf: Entropy-Guided Leaf-First Reasoning for Efficient and Accurate Think-with-Image

131. Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learning

132. Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation

133. DP-FedAdamW: An Efficient Optimizer for Differentially Private Federated Large Models

134. Rethinking Dataset Distillation: Hard Truths about Soft Labels

135. LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models

136. Quantum-Gated Task-interaction Knowledge Distillation for Pre-trained Model-based Class-Incremental Learning

137. Align Once to Explain: Feature Alignment for Scalable B-cosification of Foundational Vision Transformers

138. Region-Adaptive Sampling for Diffusion Transformers

139. iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

140. PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedback

141. MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

142. VDOT: Efficient Unified Video Creation via Optimal Transport Distillation

143. UniCorrn: Unified Correspondence Transformer Across 2D and 3D

144. NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

145. InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space

146. MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes

147. SO(3)-Equivariant ViT-Adapter for Data-Efficient Zero-Shot Sim-to-Real Indoor Panoramic Depth Estimation

148. MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi-Scale Attention

149. CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation

150. VMonarch: Efficient Video Diffusion Transformers with Structured Attention

151. Batch Loss Score for Dynamic Data Pruning

152. Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

153. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation

154. Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

155. TokenHand: Discrete Token Representation for Efficient Hand Mesh Reconstruction

156. Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs

157. Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking

158. FlexiVideo: Variation-Aware Temporal Dynamics Modeling for Efficient Video Understanding

159. Momentum Memory for Knowledge Distillation in Computational Pathology

160. Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

161. DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers

162. Fast Spatial Tracking with Visual Geometry Transformer

163. Spherical Leech Quantization for Visual Tokenization and Generation

164. Emergent Outlier View Rejection in Visual Geometry Grounded Transformers

165. Z-Order Transformer for Feed-Forward Gaussian Splatting

166. Efficient Weighted Sampling via Score-based Generative Models

167. S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations

168. CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

169. QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer

170. Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

171. UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization

172. NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devices

173. Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization

174. Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification

175. Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

176. AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks

177. Towards Robust Multi-Modal Semantic Segmentation with Teacher-Student Framework and Hybrid Prototype Distillation

178. A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

179. Towards Robust Vision Transformers: Path Dependency Analysis and a Simple Two-Stage Adversarial Training

180. PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection

181. ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIP

182. EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

183. MeanFlow Transformers with Representation Autoencoders

184. Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation

185. GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologies

186. MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registration

187. EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation

188. Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers

189. Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learning

190. Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection

191. Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

192. PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement

193. FARMER: Flow AutoRegressive Transformer over Pixels

194. LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

195. VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

196. When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection

197. S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain

198. Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

199. PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

200. Frequency Switching Mechanism for Parameter-Efficient Multi-Task Learning

201. RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding

202. SMVRT: Implicit Human 3D Modeling Using Sparse Multi-View Volumetric Reconstruction with Transformer Fusion

203. A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

204. SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning

205. PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Models

206. HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement

207. Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

208. Dataset Distillation by Influence Matching

209. Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodel

210. Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation

211. MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention

212. Co-Me: Confidence Guided Token Merging for Visual Geometric Transformers

213. SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping

214. AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual Localization

215. PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning

216. DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

217. Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning

218. Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

219. PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligence

220. Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation

221. Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

222. SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection

223. MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

224. PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration

225. VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

226. Self-Attention Driven Tensor Representation for High-Order Data Recovery

227. Distilling Quasi-Conformal Mapping: A Generalizable and Efficient Solution for Wide-Angle Correction

228. DVGT: Driving Visual Geometry Transformer

229. FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention

230. Domain Sensitive Federated Learning with Fisher-Informed Pruning

231. Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers

232. TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts

233. Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

234. MUFASA: A Multi-Layer Framework for Slot Attention

235. Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformers

236. MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

237. MDCS-MoAME: Multi-directional Composite Scanning with Mixture of Attention and Mamba Experts for Cancer Survival Prediction

238. DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation

239. Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolution

241. MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mapping

242. UETrack: A Unified and Efficient Framework for Single Object Tracking

243. Streamlined Knowledge Distillation

244. Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers

245. One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control

246. PE3R: Perception-Efficient 3D Reconstruction

247. DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation

248. Multi-speaker Attention Alignment for Multimodal Social Interaction

249. YOLO-ULM: Ultra-Lightweight Models for Real-Time Object Detection

250. ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformers

251. LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priors

252. Precise Object and Effect Removal with Adaptive Target-Aware Attention

253. NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers

254. SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs

255. LitePT: Lighter Yet Stronger Point Transformer

256. Multimodal Distribution Matching for Vision-Language Dataset Distillation

257. Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing

258. RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation

259. End-to-End Hyper-Relational Information Extraction for Engineering Diagrams via Dynamically Tokenized Relation Transformer

260. FEAST: Fully Connected Expressive Attention for Spatial Transcriptomics

261. StreamingTOM: Streaming Token Compression for Efficient Video Understanding

262. From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution

263. JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization

264. Balanced Dataset Distillation via Modeling Multiple Visual Pattern Distribution

265. Differentiable Stroke Planning with Dual Parameterization for Efficient and High-Fidelity Painting Creation

266. Adaptive Depth Lightweight RGB-T Tracking with Holistic Token Routing

267. FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection

268. Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

269. Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression

270. Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

271. Test-Time Attention Purification for Backdoored Large Vision Language Models

272. SCoRe: Salience-Coverage Reduction for Vision Token Pruning in Vision-Language Models

273. Cross-Modal Guided Visual Synthesis for Data-Efficient Multimodal Depression Recognition

274. MARSS: Radar Semantic Segmentation via Modular Attention and State Space Models

275. Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation

276. Efficient Frame Selection for Long Video Understanding via Reinforcement Learning

277. PIX-TAB: Efficient PIXel-Precise TABle Structure Recognition Approach with Speculative Decoding and Region-Based Image Segmentation

278. VLM-PTQ: Efficient Post-Training Quantization for Large Vision-Language Models

279. Vision Transformers Need More Than Registers

280. PixelDiT: Pixel Diffusion Transformers for Image Generation

281. ReFTA: Breaking the Weight Reconstruction Bottleneck in Tensorized Parameter-Efficient Fine-Tuning

282. VAST: Video Ability-Stratified Taxonomy for Data-Efficient Video Reasoning

283. SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

284. PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference

285. Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

286. RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models

287. SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

288. Lite Any Stereo: Efficient Zero-Shot Stereo Matching

289. Adaptive Bayesian Early-Exit Networks for Efficient Non-Transferable Learning

290. Beyond Weak Supervision: MLLMs-Guided Graded Knowledge Distillation for Unsupervised Camouflaged Object Detection

291. Annotation-Efficient Coreset Selection for Context-dependent Segmentation

292. IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation

293. Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

294. WPT: World-to-Policy Transfer via Online World Model Distillation

295. MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations

296. 3D-Object Perception Transformer (3PT)

297. FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mapping

298. MAD: Motion Appearance Decoupling for efficient Driving World Models

299. LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds

300. Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation

301. Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression

302. GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

303. VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

304. NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filtering

305. OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation

306. PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

307. FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolution

308. Stronger Normalization-Free Transformers

309. Turning Pre-Trained Vision Transformers into End-to-End Histopathology Whole Slide Image Models for Survival Prediction

310. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

311. Keep It Frozen: Domain-Routed Conditional Residual Modulation for Multi-Domain Vision Transformers

312. Grid Distillation: Compositional Image Distillation via Structured Generative Grids

313. SpotEdit: Selective Region Editing in Diffusion Transformers

314. From Infusion to Assimilation Distillation for Medical Image Segmentation

315. UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking

316. DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

317. Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

318. Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splatting

319. NEAF: Natural Image Editing with Attention Fusion for Generalizable Test-time Optimization in Text-Guided Image Editing

320. VisiLock: Authorizing Instruction-based Image editing with Dual Score Distillation

321. YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection

322. ApET: Approximation-Error Guided Token Compression for Efficient VLMs

323. Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

324. LightRR: A Lightweight Network for Single Image Reflection Removal

325. Block-Sparse Global Attention for Efficient Multi-View Geometry Transformers

326. VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba

327. Cross-View Distillation and Adaptive Masking for Incomplete Multi-View Multi-Label Classification

328. Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration

329. UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution

330. Human-Centric Multi-Exposure Fusion: Benchmark and Bi-level Cognition Distillation Framework

331. DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression

332. DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer

333. Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights

334. Masked Region Transformer for Layered Image Generation and Editing at Scale

335. High-Quality and Efficient Turbulence Mitigation with Events

336. Efficient and Training-Free Single-Image Diffusion Models

337. Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings

338. Reviving ConvNeXt for Efficient Convolutional Diffusion Models

339. ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration

340. Cross-Modal Attention Calibration for LVLM Hallucination Mitigation

341. DDT: Decoupled Diffusion Transformer

342. VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

343. CICA: Coupling Confidence-Aware Pretraining with Confidence-Informed Attention for Robust Multimodal Sentiment Analysis

344. Sparse Task Vector Mixup with Hypernetworks for Efficient Knowledge Transfer in Whole-Slide Image Prognosis

345. Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelism

346. Temporal Interaction in Spiking Transformers with Multi-Delay Mixer

347. Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation

348. Efficient Equivariant Transformer for Self-Driving Agent Modeling

349. YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

350. Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

351. ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

352. MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

353. Mitigating The Distribution Shift of Diffusion-based Dataset Distillation

354. DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance

355. InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

356. Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

357. Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation

358. Vision-Oriented Lightweight Neural Architecture Search with Budget-Adaptive Evaluation

359. ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformers

360. ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models

361. ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers

362. Scaling View Synthesis Transformers

363. DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities

364. Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

365. Parameter-Efficient Adaptation for MLLMs via Implicit Modality Decomposition

366. Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models

367. Efficient Unrolled Networks for Large-Scale 3D Inverse Problems

368. SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training

369. CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection

370. Improving Sparse Autoencoder with Dynamic Attention

371. SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

372. UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders

373. Saliency-Driven Token Merging for Vision Transformers

374. Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation

375. Post-training Feature Pruning for Fundus Images Classification

376. RAAS: LLM Agentic System Architecture Search with GRPO

377. Progressive Mask Distillation for Self-supervised Video Representation

378. Cross-Architecture Adaptation: Cloud-Edge Continual Test-Time Adaptation with Dynamic Sampling and Heterogeneous Distillation

379. STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

380. CoV-Align: Efficient Fine-grained Cross-Modal Alignment with Cohesive Visual Semantics Priority

381. MERIT: Multi-domain Efficient RAW Image Translation

382. FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection

383. MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

384. PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representations

385. Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

386. GGPT: Geometry-Grounded Point Transformer

387. Progressive Neural Architecture Generation

388. EDGS: Eliminating Densification for Efficient Convergence of 3DGS

389. Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

390. From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matching

391. Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

392. WhisperNet: A Scalable Solution for Bandwidth-Efficient Collaboration

393. MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenes

394. AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

395. DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles

396. ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and Test-time Generative Adaptation

397. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

398. Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

399. Dual-Granularity Memory for Efficient Video Generation

400. A Bit is All You Need! Efficient Video Capture via Single Bit Imaging

401. Flow Map Distillation Without Data

402. ForeAct: Steering Your VLA with Efficient Visual Foresight Planning

403. RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion

404. Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

405. Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex

406. Structure-Aware Representation Distillation for Tiny-Dense Object Segmentation

407. VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm

408. AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

409. LOREAL: Mitigating Low-Resolution Challenges in Vision-Language Models with Attribute-driven Prompt Self-Distillation

410. ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders

411. Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models

412. Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction

413. Finding Distributed Object-Centric Properties in Self-Supervised Transformers

414. Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

415. Content-Aware Dynamic Patchification for Efficient Video Diffusion

416. ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoning

417. MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer

418. When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs

419. Learned Image Compression via Sparse Attention and Adaptive Frequency

420. SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker

421. SkillSight: Efficient First-Person Skill Assessment with Gaze

422. HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing

423. Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

424. Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding

425. Personalized Image Descriptions from Attention Sequences

426. Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models

427. ResCa: Residual Caching for Diffusion Transformers Acceleration

428. Graph Attention Prototypical Network for Robust Few-Shot Classification

429. Adapting Lightweight Image-based Counting Models for Video Crowd Counting

430. TaskIT: Memory-Efficient Fine-Tuning of Multi-LoRA LLMs via Cross-Task Importance Transfer

431. ESAM++: Efficient Online 3D Perception on the Edge

432. EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

433. Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

434. AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments

435. TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

436. EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancement

437. VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

438. Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspective

439. DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers

440. SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

441. CaT-GS: Efficient 3DGS Rendering for Large-Scale Scenes with Inter-frame Caching and Tile Scheduling

442. CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model

443. ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference

444. QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models

445. Learning Straight Flows: Variational Flow Matching for Efficient Generation

446. Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation

447. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

448. VidEoMT: Your ViT is Secretly Also a Video Segmentation Model

449. SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection

450. Learning Long-term Motion Embeddings for Efficient Kinematics Generation

451. MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA

452. PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learning

453. Sampling-Aware Quantization for Diffusion Models

454. SegMo: Co-Designing Content-Aware Sparsity and Locally-Cohesive Segment Parallelism for Efficient VLM Inference

455. TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction

456. SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models

457. Hi-Lo Prune: Look at What You'll Lose before Pruning with Hierarchical Token Selection

458. VL-Eraser: Vacuum Distillation for Machine Unlearning in Vision-Language Models

459. VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference

460. Collaborative Multi-Mode Pruning for Vision-Language Models

461. EEGiT: Teaching Vision Transformers to Understand the EEG signal

462. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

463. MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mapping

464. Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

465. RecTok: Reconstruction Distillation along Rectified Flow

466. Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation

467. 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

468. Multi-view Pyramid Transformer: Look Coarser to See Broader

469. LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformers

470. KV-Tracker: Real-Time Pose Tracking with Transformers

471. Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)

472. M4V: Multimodal Mamba for Efficient Text-to-Video Generation

473. Learnability-Guided Diffusion for Dataset Distillation

474. Progressive Supernet Training for Efficient Visual Autoregressive Modeling

475. Incremental Object Detection via Future-Aware Decoupled Cross-Head Distillation

476. TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model

477. SEA-Flow3D: Simplified, Efficient, and Accurate Scene Flow via Spatial Vector Sampling and Multi-scale Refinement

478. Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

479. VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension

480. Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Merging

481. FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

482. IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment

483. Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering

484. Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

485. TriLite: Efficient Weakly Supervised Object Localization with Universal Visual Features and Tri-Region Disentanglement

486. HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

487. dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

488. IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolution

489. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization

490. Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

491. Structural Action Transformer for 3D Dexterous Manipulation

492. HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation

493. MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

494. Self-Critical Distillation Network for Video-based Commonsense Captioning

495. TempoControl: Temporal Attention Guidance for Text-to-Video Models

496. RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

497. CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration

498. Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoising

499. ElasticFormer: Detecting Objects in HRW Shots via Elastic Computing Vision Transformer

500. CryoHype: Reconstructing a thousand cryo-EM structures with transformer-based hypernetworks

501. OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer

502. GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

503. EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing