cs.CV(2026-07-20)

📊 共 93 篇论文 | 🔗 8 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (29 🔗3) 支柱三:空间感知与语义 (Perception & Semantics) (25 🔗4) 支柱二:RL算法与架构 (RL & Architecture) (20) 支柱一:机器人控制 (Robot Control) (7 🔗1) 支柱八:物理动画 (Physics-based Animation) (5) 支柱七:动作重定向 (Motion Retargeting) (3) 支柱六:视频提取与匹配 (Video Extraction) (2) 支柱四:生成式动作 (Generative Motion) (2)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (29 篇)

#题目一句话要点标签🔗
1 SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification 提出SLAPBench以解决四指SLAP指纹验证的多模态模型评估问题 large language model multimodal
2 ABot-N1: Toward a General Visual Language Navigation Foundation Model 提出ABot-N1以解决视觉语言导航中的长尾语义和可解释性问题 foundation model instruction following chain-of-thought
3 Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion 提出多模态框架以解决视频中的模棱两可与犹豫识别问题 multimodal
4 HCIG: A Hierarchical Cross-Modal Incongruity Graph Network for Multimodal Sarcasm and Cyberbullying Detection 提出HCIG以解决多模态讽刺与网络欺凌检测问题 multimodal
5 MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation 提出MLLM-DataEngine以解决多模态指令调优数据生成问题 multimodal
6 Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents 提出Lucid框架以解决多模态AI代理的记忆脆弱性问题 multimodal
7 Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos 提出Audio-Visual Flamingo以解决长视频理解问题 large language model chain-of-thought TAMP
8 Where Will They Go? Modelling Multimodal Pedestrian Manoeuvres from Ego-centric Videos 提出MMPM框架以解决行人轨迹预测中的多模态问题 multimodal
9 Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology 提出TUM-Uteria数据集以解决病理报告与全切片图像配对不足问题 multimodal
10 A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation 提出PulmoFoundation以解决肺病理综合评估问题 foundation model
11 Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors 提出DAFS以解决长视频理解中的帧选择问题 large language model multimodal
12 Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging 提出基于PRAC的个性化图像美学评估方法 large language model multimodal
13 An Exam for Active Observers 提出ActiveVision基准以评估多模态大语言模型的主动观察能力 large language model multimodal
14 Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously 提出视频流思维以解决视频理解中的响应延迟问题 large language model chain-of-thought
15 LVSum: A Benchmark for Timestamp-Aware Long Video Summarization 提出LVSum基准以解决长视频摘要中的时间一致性问题 large language model multimodal
16 Orca: The World is in Your Mind 提出Orca模型以实现多模态世界状态预测 foundation model multimodal
17 Video = World + Event Stream 提出Wan-Streamer v0.3以实现视频世界与事件流的实时交互 vision-language-action multimodal
18 LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4 提出基于LLM的AutoML框架以解决跨语言手写OCR问题 large language model
19 Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference 提出视觉标记减少方法以提升视觉位置识别效率 foundation model
20 KD-Judge: A Knowledge-Driven Automated Judge Framework for Functional Fitness Movements on Edge Devices 提出KD-Judge框架以解决功能性健身动作评判的自动化问题 chain-of-thought
21 Depth-Semantic Alignment and Affinity-Guided Fusion for Structured Radar Point Cloud Generation 提出基于视觉-雷达融合的点云生成方法以解决雷达点云稀疏问题 multimodal
22 HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization 提出HAS方法以解决视频摘要中的信息损失问题 large language model multimodal
23 LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation 提出LFM框架以解决源无关的通用领域适应问题 large language model foundation model
24 GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis 提出GigaPath-Flash和GigaTIME-Flash以解决病理图像分析效率问题 foundation model
25 HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement 提出HOMIE框架以解决人机交互视频个性化问题 multimodal
26 SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark 提出SpEmoC以解决多模态情感识别数据集不平衡问题 multimodal
27 ShotPlan: Cinematic Video Generation with Learnable Planning Token 提出ShotPlan以解决电影视频生成中的镜头规划问题 foundation model TAMP
28 Pixel-Space Diffusion Transformers 提出像素空间扩散变换器以解决高分辨率图像合成问题 foundation model multimodal
29 VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction 提出VGOcc以解决视觉驱动的3D占用预测问题 foundation model

🔬 支柱三:空间感知与语义 (Perception & Semantics) (25 篇)

#题目一句话要点标签🔗
30 On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation 提出多模态网络以改进事件驱动的自我运动估计 optical flow motion estimation
31 On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training 通过RGB-D预训练提升外科视觉基础模型性能 depth estimation scene understanding foundation model
32 NoDrift3R: Raymap-Guided Coupling for Drift-Robust Unposed Feed-Forward 3D Reconstruction 提出NoDrift3R以解决长序列重建中的位姿漂移问题 3D gaussian splatting 3DGS 3D reconstruction
33 ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting 提出ImprovedVBGS以解决实时持续重建问题 gaussian splatting splatting NeRF
34 Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark 提出无训练的开放词汇3D点云分割方法以解决少样本问题 open-vocabulary open vocabulary
35 Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method 提出渐进式领域不变跨模态对齐方法以解决开放词汇物体检测问题 open-vocabulary open vocabulary
36 HybridSim: A Physics-Learning Hybrid Digital Twin for mmWave Human Sensing 提出HybridSim以解决毫米波人类感知中的高保真信号模拟问题 3D gaussian splatting gaussian splatting splatting
37 DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction 提出DPNeXt以解决多任务学习中的解码瓶颈问题 depth estimation scene understanding geometric consistency
38 MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction 提出MotionForesight以解决未来3D场景流预测问题 scene flow human-object interaction
39 Toward Semantic Communication for Real-time Mobile 3D Reconstruction 提出语义通信框架以解决实时移动3D重建问题 3D reconstruction scene understanding
40 Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs 提出UAV-DualCog以解决无人机双重认知能力不足问题 scene understanding large language model multimodal
41 A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects 综述视频场景解析的进展与挑战,提出未来研究方向 open-vocabulary open vocabulary foundation model
42 PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects 提出PIXIE框架以解决无纹理物体的6D姿态估计问题 6D pose estimation
43 ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction 提出ReCal3R以解决流式3D重建中的可靠性问题 3D reconstruction
44 CSS-BA: Gate-Guided Column Space Search for Bundle Adjustment 提出Gate-Guided CSS-BA以解决低视差下的束调整问题 3D reconstruction
45 Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation 提出层次化框架以解决长时间音乐到舞蹈生成问题 optical flow
46 QIRF Quantum-Inspired Non-Orthogonal Function-Space Compression for 3D Gaussian Splatting 提出QIRF以解决3D Gaussian Splatting中的冗余压缩问题 3D gaussian splatting 3DGS gaussian splatting
47 Exploration Matters for Escaping the Blur Trap in 3D Gaussian Splatting 提出探索策略以解决3D高斯点云中的模糊陷阱问题 3D gaussian splatting 3DGS gaussian splatting
48 Robust Multimodal Dynamic Object Segmentation 提出多模态动态物体分割框架以解决现有方法的不足 3D reconstruction scene reconstruction optical flow
49 CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling 提出CaT-GS以解决大规模场景渲染效率问题 3D gaussian splatting 3DGS gaussian splatting
50 ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video 提出ReViV框架以解决单目自我中心视频的4D重建问题 depth estimation egocentric multimodal
51 Plenoptic Condensation: A Novel Approach to Generalized Scene Reconstruction 提出Plenoptic Condensation以解决场景重建精度不足问题 splatting scene reconstruction scene understanding
52 MuViSeg: Multi-View Segment Correspondences from Dense Geometry Priors 提出MuViSeg以解决多视角图像分割对应问题 VGGT foundation model
53 Locality-Aware Density Control for Efficient Gaussian-based Image Representation 提出局部感知密度控制以解决高斯图像表示效率问题 gaussian splatting splatting
54 RayOcc: Occlusion-Aware Ray Occupancy Estimation via Gaussian Mixture Intensity 提出RayOcc以解决相机3D语义占用预测中的遮挡问题 depth estimation

🔬 支柱二:RL算法与架构 (RL & Architecture) (20 篇)

#题目一句话要点标签🔗
55 IoUPD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models 提出IoUPD以解决视觉定位中的训练与评估不匹配问题 distillation large language model multimodal
56 E3DGS: Unified Geometric-Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding 提出E3DGS以解决3D高斯点云表示对称性问题 world model world models 3D gaussian splatting
57 Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth 提出EpiDistill以解决单视图深度估计中的尺度模糊问题 distillation depth estimation monocular depth
58 MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning 提出MindDrive以解决自主驾驶中的在线强化学习问题 reinforcement learning imitation learning vision-language-action
59 Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning 提出OP-HRG以解决多模态语言模型对部分物体定位的挑战 reinforcement learning large language model multimodal
60 Reliability-Prioritized Fine-Grained Generation in Multimodal Large 提出GranFact以解决多模态大语言模型的可靠性挑战 direct preference optimization large language model multimodal
61 Event3R: Asynchronous-to-Global 3D Reconstruction from Event Camera via Spatial-Temporal Feature Aggregation 提出Event3R以解决事件相机的3D重建问题 representation learning 3D reconstruction geometric consistency
62 Orbis 2: A Hierarchical World Model for Driving 提出层次化世界模型以解决驾驶场景预测问题 world model world models
63 Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling 提出隐式文化对齐奖励模型以解决文本到图像评估中的偏见问题 reinforcement learning direct preference optimization large language model
64 BCG-Former: Toward Pareto-Efficient Hyperspectral Image Classification via Band-Contextual Gating 提出BCG-Former以解决高光谱图像分类中的效率与准确性问题 Mamba linear attention representation learning
65 CanonicalPhys: Pose-Robust Remote Photoplethysmography via Canonical-Space Priors 提出CanonicalPhys以解决姿态鲁棒性差的问题 MAE distillation PULSE
66 GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking 提出GoStop以解决事件摄像头特征跟踪中的动态适应问题 reinforcement learning
67 Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding 提出MoD-VLLM以解决长视频多事件理解问题 reinforcement learning large language model
68 VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning 提出VidNum-1.4K基准以解决视频数值推理评估不足问题 world model world models
69 ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning 提出ConsiSpace以解决长视频空间推理中的几何一致性问题 reinforcement learning geometric consistency large language model
70 BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis 提出BrainNext以解决脑MRI分析中的通用性问题 masked autoencoder MAE foundation model
71 Attention from Above: A Multimodal Model for Drone-Based Object Localization 提出多模态模型以提升无人机目标检测精度 world model world models multimodal
72 Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection 提出SIEVE框架以解决多模态视频虚假信息检测中的证据稀疏问题 reinforcement learning multimodal
73 Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation 提出未来状态条件的视觉语言导航方法以提升决策能力 behavior cloning egocentric VLN
74 TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning 提出TraversRL以解决行人通道生成问题 reinforcement learning

🔬 支柱一:机器人控制 (Robot Control) (7 篇)

#题目一句话要点标签🔗
75 Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting 提出Exo2EgoPose以解决动态视角下的3D手势预测问题 manipulation egocentric human-to-robot
76 Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding 提出VEGA-3D以解决多模态大语言模型的空间盲点问题 manipulation scene understanding spatiotemporal
77 WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing 提出WeEdit以解决文本中心图像编辑的挑战 manipulation reinforcement learning
78 FF-ProCams: Feed-Forward Gaussian Splatting for Projector-Camera System 提出FF-ProCams以解决投影仪-相机系统的高效逆渲染问题 manipulation Mamba 3D reconstruction
79 When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry 提出几何感知框架以解决图像操控定位问题 manipulation
80 CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging 提出CDIS以解决3D实例分割中的对象身份丢失问题 manipulation
81 DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation 提出DA-Fusion以解决未见物体实例分割问题 manipulation

🔬 支柱八:物理动画 (Physics-based Animation) (5 篇)

#题目一句话要点标签🔗
82 Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection 提出V-PVP以解决AI生成视频检测中的时序信息损失问题 spatiotemporal
83 PE-Field 4D: Video Generation Models as Canvas 提出PE-Field 4D以解决视频生成中的几何控制问题 spatiotemporal
84 Examining the Associations between Visual and Non-Visual Elements and Cyclists' Route Choices for Various Trip Purposes 通过数据驱动研究揭示骑行者路线选择的视觉与非视觉因素 spatiotemporal
85 Hardware-triggered Time Synchronization of Roadside Multi-lidar, Multi-camera Measurement System for Accurate Data Alignment 提出硬件触发的时间同步电路以解决多传感器数据对齐问题 PULSE
86 3D Motion Perception of Binocular Vision Target with PID-CNN 提出PID-CNN以解决双目视觉目标的三维运动感知问题 spatiotemporal

🔬 支柱七:动作重定向 (Motion Retargeting) (3 篇)

#题目一句话要点标签🔗
87 GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure 提出GeCo以解决视频生成中的几何一致性问题 geometric consistency
88 Unsupervised Keypoints for Real-Time Fall Detection: Comparative Analysis Under Real-world Conditions with Predictive Bandwidth Reduction 提出无监督关键点框架以解决老年人跌倒检测问题 motion representation
89 Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement 提出自引导稀疏体积细化方法以解决单目几何估计中的细节恢复问题 spatial relationship

🔬 支柱六:视频提取与匹配 (Video Extraction) (2 篇)

#题目一句话要点标签🔗
90 EgoExoMoCap: Distributed Ego-Exo Human Motion Capture 提出EgoExoMoCap以解决人类运动捕捉的局限性 egocentric human motion human motion estimation
91 Adaptive Contrast Enhancement and Optimised Feature Matching for RootSIFT-Based Palm-Vein Recognition 提出ILACS-BGOT方法以解决掌静脉图像低对比度问题 feature matching

🔬 支柱四:生成式动作 (Generative Motion) (2 篇)

#题目一句话要点标签🔗
92 Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance 提出基于动作单元的时间控制方法以解决文本到运动的时序问题 text-to-motion
93 Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models 提出一种训练无关的黎曼度量以改善扩散模型的生成质量 classifier-free guidance

⬅️ 返回 cs.CV 首页 · 🏠 返回主页