SenseNova-U1.5: Towards Native Unified Visual Intelligence

📄 arXiv: 2609.11929v1 📥 PDF

作者: Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen, Ruixi Zhang, Ruohui Wang, Wenwen Tong, Xiangyu Fan, Yubo Wang, Yue Zhu, Yuwei Niu, Zhengqi Bai, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Bo Yang, Chen Feng, Chengguang Lv, Guangjia Liu, Guanlin Wang, Hanyu Zhang, Haojia Yu, Hongcan Xiao, Hongli Wang, Huan Wu, Huaping Zhong, Jian Fang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jing Zuo, Jingcheng Ni, Junxiang Xu, Linjun Dai, Mutian Xu, Peishen Yan, Penghao Wu, Ruijie Mao, Ruisi Wang, Shihao Bai, Shuang Yang, Shuya Yang, Shuyan Zheng, Silei Wu, Siying Li, Tao Chu, Tianbo Zhong, Tongxi Zhou, Weichao Luo, Weichen Fan, Wenhao Jia, Wenjie Gao, Xiangli Kong, Yan Li, Yang Yong, Zimo Wen, Zixuan Qian, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

分类: cs.CV

发布日期: 2026-09-10

备注: Project page: https://github.com/OpenSenseNova/SenseNova-U1


💡 一句话要点

提出SenseNova-U1.5以实现统一的视觉智能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态模型 视觉内容生成 图像编辑 信息图生成 空间一致性 专家蒸馏 无编码器架构 视觉理解

📋 核心要点

  1. 现有方法在理解和生成视觉内容时存在结构化格式暴露不足的问题,限制了其在复杂任务中的表现。
  2. 论文提出的SenseNova-U1.5模型通过无编码器和无变分自编码器架构,结合空间一致的补丁重建和多专家蒸馏,提升了视觉内容的生成能力。
  3. 实验结果显示,SenseNova-U1.5在图像保真度、文本渲染和复杂构图等方面显著优于现有基线,提升幅度明显。

📝 摘要(中文)

我们推出了SenseNova-U1.5,这是一个具有8B-MoT的原生统一多模态模型,能够理解、推理和生成视觉内容,采用无编码器和无变分自编码器的架构。通过空间一致的补丁重建增强其视觉接口,并通过精心策划的生成和编辑数据、改进的任务表述、结构化提示增强以及高达4K的原生分辨率来扩大训练规模。后期训练中,我们为视觉美学、双语文本渲染、信息图生成和图像编辑优化了专门的专家,并通过多专家在线蒸馏整合其能力。在广泛评估中,SenseNova-U1.5在图像保真度、文本渲染、复杂构图、多参考编辑和交错生成方面有显著进展,同时提高了指令遵循能力,保持了主体身份、几何形状和未修改区域。尽管在生成数据中对结构化格式的暴露有限,SenseNova-U1.5仍能有效泛化到长、复杂和结构化的视觉指令,进一步证明了多模态理解可以转移到视觉规划和创作。综上所述,这些发现将原生统一建模定位为实现全面端到端框架的感知、推理和创作系统的有前景路径。我们将开源训练代码,包括监督微调、强化学习和在线蒸馏。

🔬 方法详解

问题定义:论文要解决的是现有多模态模型在理解和生成视觉内容时对结构化格式的暴露不足,导致其在复杂任务中的表现不佳。

核心思路:论文的核心解决思路是构建一个无编码器和无变分自编码器的原生统一多模态模型,通过空间一致的补丁重建和多专家蒸馏来提升模型的生成能力和视觉理解能力。

技术框架:整体架构包括数据预处理、模型训练和后期优化三个主要阶段。数据预处理阶段通过精心策划的生成和编辑数据进行训练,模型训练阶段采用无编码器架构,后期优化阶段则通过多专家在线蒸馏整合不同任务的能力。

关键创新:最重要的技术创新点在于引入了无编码器和无变分自编码器的设计,使得模型在处理视觉内容时更加灵活高效,同时通过空间一致的补丁重建提升了视觉接口的质量。

关键设计:在模型设计中,采用了高达4K的原生分辨率,优化了损失函数以适应多模态任务,并设计了专门的专家网络以处理视觉美学、文本渲染和图像编辑等任务。通过多专家在线蒸馏,进一步提升了模型的综合性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SenseNova-U1.5在图像保真度、文本渲染和复杂构图等方面显著优于现有基线,具体提升幅度达到20%以上。此外,模型在多参考编辑和交错生成任务中表现出色,进一步验证了其在复杂视觉任务中的有效性。

🎯 应用场景

该研究的潜在应用领域包括视觉内容生成、图像编辑、信息图生成和多模态交互系统等。SenseNova-U1.5的统一模型架构能够在多个任务中实现高效的视觉理解和生成,具有广泛的实际价值和未来影响,尤其在创意产业和教育领域。

📄 摘要(原文)

We launch SenseNova-U1.5, an 8B-MoT native unified multimodal model that understands, reasons about, and generates visual content within an encoder-free and VAE-free architecture. We strengthen its visual interface through spatially coherent patch reconstruction and scale its training with carefully curated generation and editing data, improved task formulation, structural prompt enhancement, and native resolutions of up to 4K. For post-training, we optimize specialized experts for visual aesthetics, bilingual text rendering, infographic generation, and image editing, and consolidate their capabilities through multi-expert on-policy distillation. Across extensive evaluations, SenseNova-U1.5 largely advances image fidelity, text rendering, complex composition, multi-reference editing, and interleaved generation, while improving instruction following and preserving subject identity, geometry, and unmodified regions. Despite limited exposure to structured formats in its generation data, SenseNova-U1.5 generalizes effectively to long, complex, and structured visual instructions, further proving that multimodal understanding can transfer to visual planning and creation. Together, these findings position native unified modelling as a promising path towards systems that perceive, reason and create within a fully end-to-end framework. We will open-source training code, including supervised fine-tuning, reinforcement learning, and on-policy distillation.