cs.CV(2026-07-13)

📊 共 32 篇论文 | 🔗 12 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (11 🔗4) 支柱二:RL算法与架构 (RL & Architecture) (10 🔗3) 支柱三:空间感知与语义 (Perception & Semantics) (8 🔗3) 支柱七:动作重定向 (Motion Retargeting) (2 🔗1) 支柱六:视频提取与匹配 (Video Extraction) (1 🔗1)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (11 篇)

#题目一句话要点标签🔗
1 Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools 提出BEE以解决多模态推理中的计算开销问题 large language model multimodal chain-of-thought
2 LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments 提出基于LoRA的级联多模态融合框架以提升医疗培训环境中的动作识别 multimodal
3 A Unified Framework for Comprehensive Cardiac CT Segmentation and Phenotyping: Human-in-the-Loop Data Annotation, Vision Foundation Model Development, Multicenter Evaluation and Clinical Validation 提出统一框架以解决心脏CT分割与表型分析问题 foundation model
4 GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents 提出GDP.pdf基准以解决专业PDF文档多模态推理问题 multimodal
5 TC-MAF: Train-Calibrated Bounded Multi-Evidence Fusion for Multimodal Industrial Anomaly Detection 提出TC-MAF以解决多模态工业异常检测中的信息融合问题 multimodal
6 Evidence-Backed Video Question Answering 提出证据支持的视频问答方法以解决可解释性问题 large language model visual grounding
7 Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding 提出SportMV-Agent以解决多视角体育视频理解问题 large language model multimodal
8 Technical Report on the CVPR 2026@AdvML Workshop Challenge 提出对抗性多模态攻击以增强自动驾驶视觉语言代理的鲁棒性 VLA multimodal
9 GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting 提出GFR-SAM以解决训练依赖的伪装目标检测问题 foundation model
10 HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding 提出HierCAD以解决复杂CAD设计中的结构一致性和参数精确性问题 large language model
11 SLVMBench: Skill Learning from Video Memory 提出SLVMBench以解决视频记忆中的技能学习问题 large language model

🔬 支柱二:RL算法与架构 (RL & Architecture) (10 篇)

#题目一句话要点标签🔗
12 ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space 提出ABot-3DWorld 0以实现多模态3D空间探索 world model world models 3D gaussian splatting
13 MonkeyOCRv2: A Visual-Text Foundation Model for Document AI 提出MonkeyOCRv2以解决文档图像处理中的视觉文本理解问题 visual pre-training large language model foundation model
14 LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models 提出LaGuadia框架以解决病理图像模型蒸馏效率问题 distillation foundation model
15 Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory 提出PSC-AVDN框架以解决高空无人机导航中的训练依赖问题 SSM chain-of-thought
16 Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency 提出Cycle-World以解决长视频生成中的误差累积问题 world model world models
17 HandFlow: Fully Generative 4D Hand Recovery with Flow Matching 提出HandFlow以解决单目视频中4D手部重建问题 flow matching MANO hand reconstruction
18 Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO 提出CycleGRPO以统一区域理解与定位问题 reinforcement learning large language model multimodal
19 Temporal Feature Distillation for Label-Efficient Precise Event Spotting in Sports Videos 提出时间特征蒸馏方法以解决体育视频中的精确事件识别问题 representation learning distillation
20 Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations 提出SAKD以解决单教师蒸馏中的视角多样性问题 distillation
21 WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation 提出WiFi-JEPA以解决WiFi-CSI人类姿态估计中的环境适应性问题 JEPA

🔬 支柱三:空间感知与语义 (Perception & Semantics) (8 篇)

#题目一句话要点标签🔗
22 AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling 提出AsySplat以解决长序列场景建模中的计算冗余问题 3D gaussian splatting gaussian splatting splatting
23 Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics 提出温度缩放校正以解决开放词汇检测中的信心分数偏差问题 open-vocabulary open vocabulary foundation model
24 SalientGS: Unified SfM-to-3DGS with Importance-Guided MCMC Gaussian Allocation 提出SalientGS以解决3D场景重建中的SfM瓶颈问题 3D gaussian splatting 3DGS gaussian splatting
25 SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception 提出SynCLIP以解决同义词引起的定位不一致问题 open-vocabulary open vocabulary
26 GHOST: Geometry-Guided Hallucination of Opaque Surface Textures 提出GHOST框架以解决透明物体深度估计问题 depth estimation 3D reconstruction foundation model
27 HyperGS: Fast and Generalizable Gaussian Video Representation 提出HyperGS以解决视频编码速度慢和泛化能力差的问题 gaussian splatting splatting spatiotemporal
28 SVI360: Spherical Video Interpolation 提出SVI360以解决全景视频插值问题 optical flow
29 When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning 提出深度序数提示以提升视觉语言空间推理能力 monocular depth

🔬 支柱七:动作重定向 (Motion Retargeting) (2 篇)

#题目一句话要点标签🔗
30 EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion 提出EquiFusion以解决人类运动预测中的运动学限制问题 human motion human motion prediction motion prediction
31 Parallax Portrait Matting 提出视差肖像抠图方法以解决复杂背景下的抠图问题 motion estimation

🔬 支柱六:视频提取与匹配 (Video Extraction) (1 篇)

#题目一句话要点标签🔗
32 Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos 提出Vinci2以解决主动辅助在连续自我中心视频中的挑战 egocentric

⬅️ 返回 cs.CV 首页 · 🏠 返回主页