Skip to content
Artwork for 每日AI
每日AI · Thursday · 16 min

商汤SenseNova-U1:原生多模态大脑 原生多模态统一模型

SenseNova-U1 是一个创新的原生多模态统一模型,由 NEO-unify 架构驱动,旨在消除视觉理解与图像生成之间的界限。该系统彻底舍弃了传统的预训练视觉编码器(VE)和变分自编码器(VAE),直接通过原生像素与文本输入进行端到端学习。模型推出了 8B-MoT(稠密型)和 A3B-MoT(专家混合型)两个版本,在保持顶尖多模态理解能力的同时,实现了高质量的图像合成、编辑及图文交错生成。研究团队采用了一种创新的混合专家转换器(MoT)架构,使感知与创作功能在一个统一的过程中协同演化。此外,通过流匹配技术和强化学习微调,模型在复杂的信息图表生成和空间智能任务中表现出色。这种范式转变标志着人工智能从连接独立系统向构建原生统一多模态智能体的重要跨越。

0:00-16:59

transcript

No transcript — this publisher did not publish one.

show notes

SenseNova-U1 是一个创新的原生多模态统一模型,由 NEO-unify 架构驱动,旨在消除视觉理解与图像生成之间的界限。该系统彻底舍弃了传统的预训练视觉编码器(VE)和变分自编码器(VAE),直接通过原生像素与文本输入进行端到端学习。模型推出了 8B-MoT(稠密型)和 A3B-MoT(专家混合型)两个版本,在保持顶尖多模态理解能力的同时,实现了高质量的图像合成、编辑及图文交错生成。研究团队采用了一种创新的混合专家转换器(MoT)架构,使感知与创作功能在一个统一的过程中协同演化。此外,通过流匹配技术和强化学习微调,模型在复杂的信息图表生成和空间智能任务中表现出色。这种范式转变标志着人工智能从连接独立系统向构建原生统一多模态智能体的重要跨越。