SiPhy: Single-Image Physical Property Reasoning

📄 arXiv: 2607.22355v1 📥 PDF

作者: Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

分类: cs.CV, cs.AI

发布日期: 2026-07-24

备注: Accepted to ECCV 2026 (main track)


💡 一句话要点

提出SiPhy以解决单图像物理属性推理问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 单图像推理 物理属性 深度学习 计算机视觉 多模态融合

📋 核心要点

  1. 现有方法在单图像推理物理属性方面存在局限,通常依赖多视角重建或复杂的物理监督。
  2. SiPhy通过结合3D视觉线索和语言基础的材料知识,提出了一种新的单图像物理属性推理框架。
  3. 在多个数据集上,SiPhy的性能超过了现有的多视角重建方法,显著提高了质量和密度的估计精度。

📝 摘要(中文)

从单张图像推断物理属性(如质量、刚度和弹性)对于仿真和具身人工智能至关重要,但现有方法大多依赖于多视角重建或基于物理的监督。我们提出了SiPhy,一个统一的单图像物理属性推理框架,结合了3D视觉线索和基于语言的材料知识。SiPhy从一张RGB图像中采样伪体素点,提取CLIP特征,并将其与VLM提出的材料候选进行对接。部分对比聚合器强制区域一致性,而重力感知的细化则改善了密集物体的厚度和体积估计。在ABO-500、MVImgNet-100和PhysXNet-100数据集上,SiPhy在单图像性能上达到了最先进水平,超越了多视角重建方法,质量MnRE提高了93%(与PUGS相比),密度MAE降低了35.5%(与NeRF2Physics相比),杨氏模量误差降低了23.5%。我们还在真实手-物体交互数据集上验证了SiPhy,展示了其作为单视图图像物理理解的数据注释引擎的潜力。

🔬 方法详解

问题定义:本论文旨在解决从单张图像推断物理属性(如质量、刚度和弹性)的问题。现有方法通常依赖于多视角重建或复杂的物理监督,限制了其应用范围和效率。

核心思路:SiPhy的核心思路是将3D视觉线索与基于语言的材料知识相结合,从而实现对单图像的物理属性推理。这种设计使得模型能够在缺乏多视角信息的情况下,仍然有效地推断物体的物理特性。

技术框架:SiPhy的整体架构包括几个主要模块:首先,从RGB图像中采样伪体素点;其次,提取CLIP特征并将其与VLM提出的材料候选进行对接;最后,通过部分对比聚合器和重力感知的细化模块来增强区域一致性和物体体积估计。

关键创新:SiPhy的主要创新在于其统一框架,能够在单图像条件下有效推理物理属性,且通过结合视觉和语言信息,克服了传统方法的局限性。

关键设计:在关键设计方面,SiPhy采用了部分对比聚合器来确保区域一致性,并引入重力感知的细化机制,以提高厚度和体积的估计精度。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SiPhy在多个数据集上表现出色,质量MnRE提高了93%(与PUGS相比),密度MAE降低了35.5%(与NeRF2Physics相比),杨氏模量误差降低了23.5%。这些结果表明,SiPhy在单图像物理属性推理方面超越了传统的多视角重建方法。

🎯 应用场景

该研究的潜在应用领域包括机器人抓取、虚拟现实中的物理模拟以及增强现实中的物体交互等。SiPhy能够为这些领域提供更准确的物理属性推理,从而提升用户体验和系统的智能化水平。

📄 摘要(原文)

Inferring physical properties such as mass, stiffness, and elasticity from a single image is essential for simulation and embodied AI, yet most existing approaches rely on multi-view reconstruction or physics-based supervision. We introduce SiPhy, a unified framework for single-image physical property reasoning that aligns 3D-aware visual cues, depth with language-based material knowledge. From one RGB image, SiPhy samples pseudo-voxel points, extracts CLIP features, and grounds them to material candidates proposed by a VLM. A part-based contrastive aggregator enforces region consistency, while a heaviness-aware refinement improves thickness and volume estimation for dense objects. Across ABO-500, MVImgNet-100, and PhysXNet-100, SiPhy achieves state-of-the-art single-image performance, surpassing multi-view reconstruction methods by improving mass MnRE by up to 93% (vs. PUGS), reducing density MAE by 35.5% (vs. NeRF2Physics), and lowering Young's modulus error by 23.5%. We further validate SiPhy on real hand-object interaction datasets, demonstrating its potential as a data annotation engine for physical understanding from single-view imagery.