炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
你有没有想过一个问题:为什么现在的AI画图和AI看图,用的根本不是同一套眼睛?
这话听起来有点玄乎,但事实就是这样。当下几乎所有的多模态大模型,处理"看懂一张图"和"画出一张图"这两件事时,走的是两条完全不同的技术路线。理解图片的时候,模型用的是语义视觉编码器提取出来的高度抽象的特征。生成图片的时候,模型又要切换到另一套叫VAE的自编码器体系,在那个空间里去噪、去合成像素。这两套系统各管一摊,谁也不认识谁。
这就是本文要讲的这篇论文——UniSpace 的出发点。它问了一个听起来简单但没人真正做成的问题:能不能让理解、生成、编辑这三件事,全都发生在同一个视觉表示空间里?
先搞懂:为什么理解和生成非要分家
要弄明白UniSpace做了什么,得先搞清楚现在这套"分家"的局面是怎么形成的。
语义视觉编码器*:一种专门训练来提取图像语义信息的神经网络模型,代表作有CLIP、SigLIP,它们的目标是让图像特征和文字描述能对齐,方便做图文匹配、图像理解这类任务。
这类编码器天生就是为了"看懂"而生的。你给它一张猫的照片,它输出的特征向量能准确表达"这是一只猫",但你要是拿这个特征去尝试把原图像素级还原出来,会发现效果惨不忍睹。细节全丢了,纹理、文字、局部结构统统模糊成一团。
论文里给出了一个具体数字:把SigLIP2编码器的特征拿去做像素重建,最后一层输出的PSNR(峰值信噪比,数值越高说明重建越清晰)只有20.96。而与此同时,这层特征的语义分类准确率却能高达81.29%。
这两个数字放在一起看就很有意思了:语义能力越强,像素细节保留得越差。这不是巧合,而是这类编码器训练目标决定的必然结果——它们的训练信号只关心"这是什么",从来不关心"这些像素长什么样"。
正因为这个矛盾,现在的文生图模型只能退而求其次,走一条"分裂"的路:生成图片时用VAE的连续潜空间,需要语义引导时再单独接一个语义编码器进来搭把手。像BAGEL这样的统一多模态模型,虽然架构上把理解和生成放进了同一个Transformer骨架里,但视觉信息本质上还是两套表示体系在各自为战,没有真正统一。
这个问题在图像编辑任务上暴露得最明显。编辑一张图,你既需要知道"这个物体是什么、在哪里"这种语义信息,又要保留"这块布料的纹理、这片墙的颜色"这种像素级细节。两套系统各管一半,接口对不齐,效果自然打折扣。
瓶颈到底在哪:一个反直觉的实验
论文作者没有急着重新训练一个新的编码器,而是先做了一个很聪明的诊断实验,结果相当出人意料。
他们的假设是:既然语义ViT重建效果差,那是不是因为它的Transformer模块(也就是那些堆叠的自注意力层)本身就丢失了细节信息?
Transformer模块*:视觉Transformer(ViT)网络内部反复堆叠的核心计算单元,负责对图像切分出来的patch(图块)特征进行层层加工和抽象。
按常理猜测,答案应该是"是"。毕竟层数越深,特征越抽象,这在深度学习里几乎是常识。但作者做了一个巧妙的对照实验:把预训练好的patch embedding(也就是把原始图像切块并映射成向量的那一层)换成一个随机初始化的投影层,后面所有Transformer层原封不动,权重全部冻结不变。
结果是:仅仅换掉最开始那一层,最后一层输出的PSNR就从20.96飙升到24.66,直接涨了3.70分贝。
这个实验结果非常关键,值得停下来想一想它到底说明了什么。
如果Transformer模块自己没有能力承载像素细节,那不管你怎么改输入,最后的重建质量都不该有明显变化。但实验结果恰恰相反:同样的冻结骨架,仅仅因为输入的处理方式不同,就能输出信息量完全不同的特征。
这说明真正的瓶颈不在Transformer模块本身,而在于patch embedding这道"入口关卡"。预训练的patch embedding会激活一套语义主导的处理路径,让后面的层层Transformer逐渐把细节信息压缩、丢弃掉,专心去提炼语义。而一旦你打乱这套"入口习惯",用一个随机的投影层去接入,同样的Transformer反而会走上一条保留更多低层次变化的"备用通道"。
这就好比一家老字号餐馆,主厨(Transformer模块)手艺其实很全面,既能做精致小炒也能做家常大锅菜。但只要前厅服务员(patch embedding)每次点单都按照"高档宴请"的套路报菜名,主厨自然而然只会往精致方向发挥,那些家常口味的手艺就一直被闲置,看起来好像根本不会做。如果换一个不按套路报菜名的服务员,主厨立刻就能露一手完全不同的做菜风格——不是他学会了新手艺,而是原本被压抑的能力被重新激活了。如果你从一开始就认定"主厨不会做家常菜",直接把主厨换掉重新培训一个,那才是真正的资源浪费。
正是这个发现,让作者们没有走"重新训练一个视觉编码器"的老路,而是想出了一个成本低得多、也更聪明的方案。
核心方法:Patch Reparameterization,只加一条新路
Patch Reparameterization*(补丁重参数化):本文提出的核心技术,保留预训练语义ViT原有的patch embedding和所有Transformer层完全不动,另外新增一条独立的、可训练的patch embedding分支,专门负责把细节信息灌入到同一套冻结的Transformer里。
具体怎么做的?原始的语义路径依然存在,输入图像经过原来的patch embedding,再走过冻结的Transformer层,输出语义token,这条路一点没变,负责保留理解能力。同时,作者新增了一条"重建感知"的patch embedding,这条新分支的初始参数直接从原来那条语义分支复制过来,然后单独训练,让它学会给同一套冻结的Transformer层"喂"进重建所需要的细节信息。
这两条路的输出,最后通过一个叫Token Fusion(token融合)的模块拼在一起,形成统一表示。
Token Fusion*:本文提出的融合策略,先把重建token通过一个可学习的线性投影压缩到较低维度(比如128维),再和语义token沿通道维度直接拼接,而不是用一个复杂网络把两者混在一起。
这里有个细节特别值得展开讲讲:为什么不直接用一个MLP(多层感知机)把两路特征融合成一个纠缠在一起的表示,反而要费劲地做成"拼接"这种看起来很朴素的方式?
作者专门做了一个诊断实验来回答这个问题。他们尝试用MLP把语义特征和重建特征强行揉在一起,结果发现这种纠缠表示在"看得懂图"和"能重建图"这两个静态指标上都表现不错:零样本分类准确率78.53(跟基线的79.10相当接近),重建的PSNR能到33.83,rFID只有0.069(这个数值越低越好)。
单看这些指标,这个纠缠方案简直堪称完美。可一旦拿这个表示去训练一个生成模型(DiT),事情就崩了:生成出来的潜在向量,用专门的高保真重建解码器去解码,FID(生成图像质量指标,越低越好)竟然高达120.9,画面几乎不能看。但如果换成语义解码器去解码同一个生成结果,FID反而只有8.07。
这组数字放在一起意味着什么?意味着生成模型(DiT)在学习那个纠缠表示的时候,主要学到的是占主导地位的语义变化,而那些真正对高保真重建至关重要的细微信息方向,几乎被完全忽略了。作者进一步测算发现,这个融合输出里大约95%的变化量,都能被语义部分单独解释。也就是说留给重建细节的"表达空间"只占了可怜的5%左右,生成模型自然很难学到它。
这就像你把两种颜料强行搅拌成一种混合色,单看这瓶颜料的确是个"新颜色",用滴管吸出来测个色号也挺准。但如果让一个学徒去临摹这个颜色,他大概率只会模仿其中最显眼的那个主色调,那些混在里面比例很小的微妙成分,根本没法从这瓶已经搅匀的颜料里单独学出来。如果不做拆分处理,就相当于把两种本该各自可控的信息硬塞进同一个瓶子里,事后谁也别想把它们分开教会一个新学徒。
正是这个诊断结果,让作者坚定地采用"显式拆分、通道拼接"的策略:语义token和经过压缩的重建token各自占据独立的通道区间,谁也不混谁,这样生成模型在训练时就能针对两部分分别设置学习权重,不至于被语义信息的"强势"完全淹没。
平衡的艺术:balanced flow matching
有了拆分好的统一表示,接下来的问题是:怎么训练一个生成模型去建模这个表示?
如果只是简单地对整个拼接向量做均方误差(MSE)优化,那两部分信息会按照各自的维度数量和数值尺度自动分配权重,完全没有人为控制的余地。作者于是设计了一个叫做balanced flow matching(平衡流匹配)的目标函数。
balanced flow matching*:一种训练生成模型的损失函数设计,把语义部分和重建部分的预测误差分别按各自维度数归一化后,再乘以一个人为设定的权重系数λr,从而显式控制生成模型应该把多少精力放在重建细节上。
论文里最终把这个权重λr设为0.75,也就是把75%的优化权重分配给重建相关的部分,剩下25%留给语义部分。这个数字不是拍脑袋定的,论文附录里做了详细的消融实验:权重从0.25提升到0.75,FID从8.99降到7.10,说明确实需要给重建部分足够的关注度。但如果继续加到0.92,FID反而回升到7.39,说明语义信息也不能完全被压制,它对生成模型的学习同样有帮助。
这个平衡点的寻找过程,让我想起调收音机旋钮找信号的经历。如果不这样细致地调节权重,只用一个笼统的损失函数去优化整个拼接向量,就好比让两个声音大小完全不成比例的说话人同时对着一个话筒讲话,结果要么完全听不清声音小的那一位在说什么,要么就是为了听清那个人反而把主唱的声音压得太小,整体效果都不理想。
三个实例:不同编码器都能吃这一套
作者把这套Patch Reparameterization方案实际应用在三个不同的预训练语义ViT上,分别得到PR-SigLIP2、PR-DINOv2、PR-Qwen-ViT三个版本。
DINOv2*:Meta提出的一种自监督视觉预训练模型,不依赖文字标注,通过图像自身的多种视角变换来学习特征表示。
SigLIP2*:Google提出的一种图文对齐视觉编码器,是CLIP系列模型的改进版本,训练目标是让图像特征和对应文字描述的特征在向量空间中靠近。
具体参数上,SigLIP2-B在256×256分辨率下工作,切成16×16的patch网格,语义特征维度768;DINOv2-B用它原生的14×14网格,同样768维;Qwen-ViT支持任意分辨率输入,语义维度1152。重建部分统一压缩到128通道,最终拼出来的统一表示,SigLIP2和DINOv2版本是896维,Qwen-ViT版本是1280维。
重建效果好到什么程度:一张表看懂
重建质量是检验这套方法成不成立的第一道关卡。论文在ImageNet-1K验证集上做了大规模对比,几个关键数字值得认真看一看。
PR-DINOv2达到了rFID 0.14、PSNR 30.84、SSIM 0.90。跟同样用DINOv2-B编码器、但没有做Patch Reparameterization的RAE基线相比,rFID从0.57降到0.14,相对降低了75.4%;PSNR从18.86提升到30.84,几乎翻了一倍还多。
PR-SigLIP2这边,rFID从原本RAE基线的0.53降到0.18,相对降低66.0%。
更让人意外的是,这套用小模型(DINOv2-B)做出来的结果,居然比一些用了更大骨干网络的专门重建方案还要出色。比如RAEv2用的是规模更大的DINOv3-L模型,rFID是0.29,而PR-DINOv2用小得多的DINOv2-B,rFID反而做到了0.14,PSNR从22.57提升到30.84。
甚至和一些专门为生成任务设计的大规模VAE比,PR-DINOv2的rFID 0.14,也优于FLUX-VAE的0.18和SD-VAE 3的0.20。要知道FLUX-VAE和SD-VAE 3可都是专门训练来做像素重建的模型,从来没有承担过语义理解的任务,而PR-DINOv2是在一个原本专注于语义理解的冻结骨架基础上"顺带"实现的重建能力。
理解能力有没有被牺牲:答案是没有
高保真重建做出来了,但如果代价是语义理解能力垮掉,那这个方案也没什么实际意义。作者专门在LLaVA-v1.5这套标准评测框架下,用同样的语言模型(Vicuna-7B)、同样的训练数据、同样的评测流程,对比了原始语义编码器和加了Patch Reparameterization之后的版本。
结果显示PR-SigLIP2平均得分64.37,比原始SigLIP2-B基线的63.39还略高一点;PR-Qwen-ViT得分68.94,同样略优于原始Qwen-ViT基线的68.29。
这个结果说明什么?说明加了这条重建通道之后,理解能力不但没有掉,反而还有小幅提升。这也符合Patch Reparameterization的设计初衷:语义路径原封不动地保留,重建路径是额外新增的,两者互不干扰,甚至可能因为多任务学习带来一些正向的信息互补。
在ImageNet生成任务上(用DiT架构训练一个生成先验模型,考察生成质量),PR-DINOv2实现了rFID 0.14、无分类器引导条件下的gFID 2.10、有引导条件下的gFID 1.87。相比之下RAE、RAEv2、VTP-L虽然生成结果略强一些,但它们的tokenizer rFID分别高达0.57、0.29、0.36。这说明Patch Reparameterization找到了一个更好的平衡点:既保留了远超同类方案的重建保真度,又没有让生成模型的训练变得难以承受。
从表示到系统:UniSpace的架构设计
有了这套统一视觉表示,作者接下来做的事情是把它真正扩展成一个能用的多模态系统,这就是UniSpace。
UniSpace建立在Qwen3-8B这个解码器骨架之上,采用了一种叫Mixture-of-Transformer-Experts(MoT,混合Transformer专家架构)的设计。
Mixture-of-Transformer-Experts(MoT)*:一种模型架构,内部有多个"专家"子网络分别处理不同类型的输入,比如文本token走理解专家,需要预测的加噪视觉token走生成专家,各专家之间通过共享的自注意力机制相互交流信息。
这个架构本身不是UniSpace首创的,BAGEL之前就用过。但UniSpace跟BAGEL最大的不同,就在于视觉接口的设计。BAGEL的理解专家用SigLIP2的语义token,生成专家用FLUX-VAE的潜在向量,本质上还是两套视觉表示空间在共用一个Transformer骨架。而SenseNova-U1走的是完全不同的路子,直接用原生像素做端到端训练,不引入任何预训练视觉编码器。
UniSpace选择了一条介于两者之间的路:既不完全从零训练一个像素级接口,也不搞两套并行的视觉空间,而是用PR-Qwen-ViT这套patch重参数化后的编码器解码器,作为唯一的视觉接口,处理理解、生成、编辑这三种任务里所有涉及图像的地方。
这个设计选择有点像盖房子时不同的水电走线方案。BAGEL相当于给厨房和卫生间各拉一根独立的水管,虽然都能出水,但施工和维护要照顾两套系统。SenseNova-U1相当于完全不用现成的市政供水管道,自己从头打井取水,理论上灵活但工程量巨大。UniSpace则是把市政供水管道改造升级,让它既能供应厨房需要的净水,也能供应卫生间冲洗需要的水压,一套管网解决所有问题。如果继续沿用两套并行系统,那系统复杂度会一直堆积,模型也没法真正证明"一个视觉空间够不够用"这个核心问题。
理解、生成、编辑,三件事怎么共用一套表示
具体到任务层面,图像理解时,输入图像被编码成统一表示Tu,跟文字指令一起送进理解专家,预测文本回答,用的是标准的交叉熵下一token预测损失。
next-token prediction(NTP,下一token预测)*:语言模型最经典的训练方式,根据已经生成的token序列,预测下一个最可能出现的token,一步步生成完整的句子。
文生图任务时,目标图像同样被映射到Tu空间,沿着一条"流路径"逐步加噪,生成专家的任务就是学会预测这个加噪过程的速度场,把它反过来还原出干净的图像表示。
flow matching(流匹配)*:一种生成模型训练范式,通过构造一条从随机噪声到真实数据的线性插值路径,训练神经网络预测这条路径上每个时刻的"速度"(也就是变化方向),推理时通过求解微分方程从纯噪声逐步还原出目标数据。
图像编辑任务则是把前两种情况结合起来:参考图像编码成Tu送入理解专家,编辑指令一起给进去,同时生成专家去预测目标图像的加噪表示。由于自注意力机制的存在,生成专家在预测的时候能同时"看到"参考图像的完整信息和编辑指令的语义要求,从而做到既遵循指令又保留无关区域的细节。
三个任务共用同一套视觉编码器、同一个表示空间、同一个解码器,区别只在于token的排列方式和路由方向。整个训练目标可以写成三种损失的加权组合:理解任务用交叉熵,生成和编辑任务共用前面提到的balanced flow matching损失。
训练怎么做的:三阶段递进
UniSpace的训练分成三个正式阶段加一个微调阶段,分辨率从256一路涨到1024。
第一阶段,图像生成和理解任务联合优化,采样比例10:1,用了170K步、大约264.2M个训练样本、110B token。第二阶段引入编辑任务,生成、编辑、理解按10:3:1混合,115K步,196B token。第三阶段在1024分辨率下进一步扩大三种能力,60K步,151B token。最后的SFT阶段(监督微调)混入LLaVA-NeXT风格的视觉指令数据,生成、编辑、指令理解按10:3:2混合,12K步。
SFT(Supervised Fine-Tuning,监督微调)*:在预训练之后,用高质量的标注数据对模型做针对性微调,通常能显著提升模型对具体指令的遵循能力。
四个阶段加起来,UniSpace总共处理了大约510M个训练样本实例,对应约470B多模态token,用了256块昇腾910B NPU训练三个正式阶段,SFT阶段用128块NPU,总计约142K NPU小时。整套训练自始至终,视觉编码器和解码器都是冻结的,只有语言模型、专家模块和多模态投影层在更新。
这个训练规模投入意味着什么?意味着UniSpace不是一个只在小数据集上验证概念的实验室产物,而是真的按照工业级多模态大模型的标准去训练和验证的。
系统效果:编辑任务上的硬碰硬对比
在ImgEdit这个覆盖九大编辑类别(物体添加、调整、提取、替换、移除、背景替换、风格转换、混合编辑、动作变化)的评测基准上,UniSpace拿到了4.28的总分,这个数字放在同规模模型里相当能打。
对比一下同为8B规模的SenseNova-U1,只有3.90分;BAGEL(7B)只有3.20分。而UniSpace甚至逼近了参数规模大四倍、达到32B的Emu3.5(4.41分)。
在GEdit这个补充性评测里,UniSpace在英文和中文全集上分别拿到7.41和7.38的总分,双语平均7.395分,明显超过BAGEL(双语平均6.51分),跟同为8B的密集模型SenseNova-U1(7.47分)也相当接近。
论文里给出的定性对比结果也很说明问题:在"把工地场景换成海滩场景"这类背景替换任务里,UniSpace能够保持前景人物完全不变,只把背景成分自然替换;在把用户肖像转换成"乐高积木风格"这类风格迁移任务里,也能兼顾风格特征和原图结构的一致性。相比之下,BAGEL和SenseNova-U1在一些复杂场景下容易出现细节丢失或指令遵循不完整的问题。
生成能力:三个基准都不含糊
在文生图这一块,UniSpace在GenEval、OneIG-Bench(英文和中文)、DPG-Bench四个基准上都做了系统对比。
GenEval评测的是对象层面的组合对齐能力,UniSpace综合得分0.84,在单物体生成、双物体生成、位置对齐、属性绑定这几个子项上表现均衡,计数和颜色绑定相对偏弱一些。
OneIG-Bench评测更细粒度的多语言生成能力,UniSpace英文子集综合得分0.561,中文子集0.533,双语平均0.547,是所有对比的统一多模态模型里双语平均分最高的,略超Emu3.5(0.546)和SenseNova-U1(0.542)。而且在风格控制这一项上,UniSpace英文和中文得分分别是0.467和0.455,双双拿下所有对比方法里的最高分。
DPG-Bench考察密集提示词的遵循能力,涉及全局描述、实体、属性、关系等多个维度约束。UniSpace综合得分86.49,超过BAGEL的85.07和Show-o2的86.14。特别值得一提的是,UniSpace在关系维度上拿到94.97分,是所有对比模型里最高的,在实体维度也拿到92.26的高分。
这几个基准结果放在一起看,说明UniSpace这套统一视觉表示不仅没有拖累生成质量,反而在某些维度(比如风格控制和关系理解)上表现得格外突出。
诚实的局限:理解能力还有短板
论文没有回避一个问题:虽然在受控实验里(前面提到的LLaVA-v1.5对比),Patch Reparameterization确实很好地保留了原始编码器的理解能力,但系统层面的UniSpace,其理解性能相较专门的视觉语言模型还是有差距。
作者给出的原因也挺坦诚:因为这套视觉编码器要同时服务理解和生成两种任务,训练时不能随意在理解数据上大幅更新参数,否则可能会损害它已经建立起来的生成能力。这种"一个萝卜两个坑"的架构约束,反过来也限制了理解能力进一步提升的空间。
这就好比一个身兼数职的多面手员工,既要处理财务报表又要跑外勤谈业务,公司不可能让他把大量时间只专注财务系统的升级培训,因为一旦这么做,跑外勤的能力就可能被荒废掉。这种情况下,多面手的每一项能力单拎出来跟专职人员比,多少都会有些差距,这是身兼数职必然要付出的代价。
作者也明确指出,未来一个值得探索的方向,是研究怎么在联合优化视觉表示和多模态大模型的同时,找到理解能力和生成能力之间更好的平衡点。
Q&A
Q1:UniSpace是什么?
A:UniSpace是Meituan团队提出的一个8B规模的统一多模态模型,核心创新是用一个叫Patch Reparameterization(补丁重参数化)改造过的预训练语义ViT编码器,同时支撑图像理解、文生图生成和指令编辑三大任务,不再需要额外的VAE潜空间。
Q2:Patch Reparameterization解决了什么问题?
A:它解决了语义视觉编码器(如SigLIP、CLIP)语义能力强但像素重建效果差的问题。方法是保留原有的语义处理通路不变,另外新增一条重建感知的patch embedding分支,把细节信息注入同一套冻结的Transformer层,最终把语义和重建token拼接成统一表示。
Q3:UniSpace的效果到底怎么样?
A:在图像编辑基准ImgEdit上拿到4.28分,明显超过同规模的SenseNova-U1(3.90)和BAGEL(3.20);在文生图基准OneIG-Bench上双语平均分0.547,是对比模型里最高的;重建质量上PR-DINOv2的rFID做到0.14,优于多个专门设计的重建方案。