cs.CV(2026-09-10)

📊 共 22 篇论文 | 🔗 2 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (9 🔗1) 支柱二:RL算法与架构 (RL & Architecture) (6) 支柱三:空间感知与语义 (Perception & Semantics) (3 🔗1) 支柱一:机器人控制 (Robot Control) (2) 支柱四:生成式动作 (Generative Motion) (1) 支柱六:视频提取与匹配 (Video Extraction) (1)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (9 篇)

#题目一句话要点标签🔗
1 Multimodal Taxonomic Conditioning for Generative Plankton Imagery 提出多模态分类条件生成以解决浮游生物图像不足问题 multimodal
2 Toward Interpretable Multimodal Fusion: Heat Conduction Modeling for Hyperspectral and LiDAR Joint Classification 提出M2Heat以解决多模态融合中的长距离依赖建模问题 multimodal
3 OmniKVQuant: KV Cache Quantization for Omni-LLMs 提出OmniKVQuant以解决Omni-LLMs的KV缓存量化问题 large language model multimodal
4 DINO-Med: A Unified Patch-Based Adaptation Framework for Multi-Modal Medical Image Analysis Applied to Liver Fibrosis Staging 提出DINO-Med框架以解决多模态医学影像分析问题 foundation model multimodal
5 Language-Augmented Semantic Priors for B-Spline Surface Fitting 提出语言增强的语义先验以解决B样条曲面拟合问题 large language model
6 Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation 提出Vidu S2以实现实时交互、可编辑的空间视频生成 instruction following
7 R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds 提出R4Tun以解决隧道衬砌分割的自适应问题 large language model
8 HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA 提出HALDETECT以解决多模态模型的幻觉检测问题 multimodal
9 CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation 提出CamPilot以解决专业电影生成中的镜头控制问题 large language model

🔬 支柱二:RL算法与架构 (RL & Architecture) (6 篇)

#题目一句话要点标签🔗
10 World in World: Explore the World with World Models 提出World in World以解决视频重渲染中的灵活控制问题 world model world models human motion
11 Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs 提出递归代码世界模型以重建复杂3D场景 world model world models scene reconstruction
12 SenseNova-U1.5: Towards Native Unified Visual Intelligence 提出SenseNova-U1.5以实现统一的视觉智能 reinforcement learning distillation multimodal
13 UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound 提出UBone3D以解决超声图像中三维形状补全问题 flow matching
14 Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation 提出不确定性DMD以解决视频蒸馏中的多样性崩溃问题 distillation
15 HiPerViT: A Hierarchical Perceiver-Vision Transformer Architecture for Multi-Scale Texture Recognition 提出HiPerViT以解决多尺度纹理识别问题 distillation multimodal

🔬 支柱三:空间感知与语义 (Perception & Semantics) (3 篇)

#题目一句话要点标签🔗
16 Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization 提出Tri-DehazeGS以解决雾霾图像中的3D场景重建问题 gaussian splatting splatting
17 3D Point Splatting for mmWave Radar Novel View Synthesis 提出3D点溅射技术以解决毫米波雷达新视图合成问题 splatting NeRF
18 FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation 提出FreeFlow以解决光流估计中的偏差问题 optical flow

🔬 支柱一:机器人控制 (Robot Control) (2 篇)

#题目一句话要点标签🔗
19 Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness 提出预测性多标志OCT跟踪以增强运动鲁棒性 motion tracking 6D pose estimation
20 BridgeMatch: Conditional Transport Bridges in Matching Matrix Space for 3D Deformable Registration 提出BridgeMatch以解决3D变形配准中的点云对应问题 manipulation flow matching 3D reconstruction

🔬 支柱四:生成式动作 (Generative Motion) (1 篇)

#题目一句话要点标签🔗
21 Multi-Modal Controlled Coherent Motion Generation 提出MOCO框架以解决多模态3D头像运动生成问题 motion generation multimodal

🔬 支柱六:视频提取与匹配 (Video Extraction) (1 篇)

#题目一句话要点标签🔗
22 Revisiting Avatar-As-Image: High-Fidelity Registration is All You Need 提出AvaImg以解决高保真3D人类模型注册问题 SMPL foundation model

⬅️ 返回 cs.CV 首页 · 🏠 返回主页