ECCV 2026|OmniColor:统一多模态线稿上色框架
创始人
2026-08-27 12:13:58

(来源:机器之心)

该论文的第一作者为张栩禄,香港理工大学博士生,指导老师为李青教授,研究方向为图像与视频生成。迄今已在 ECCV、AAAI、ACM MM 等顶级会议发表多篇论文。本文通讯作者为魏骁勇教授,作者团队来自香港理工大学 PolySmart Group。

在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。尤其在现实工作中,控制信号通常是混合出现的,如文字描述、稀疏颜色提示、角色参考图、近期或远期的历史帧。

然而,现有的线稿上色方法大多围绕单一或少量控制信号设计,缺少一套统一的机制来理解多条件输入下的控制对齐。更复杂的是,不同控制信号之间可能发生冲突。例如,参考图希望角色保持人物风格,局部颜色涂鸦却要求某个区域改变颜色。因此,一个面向真实创作流程的上色系统,不能简单地把所有输入拼在一起,而需要判断每类信号在当前场景下应该发挥多大作用。

针对这一问题,ECCV 2026 接收的论文 OmniColor 提出了一个统一的多模态线稿上色框架。其核心思路是把复杂控制信号拆分为两类:需要严格空间对齐的条件,以及不追求像素对齐的语义参考条件。基于这两种分类,模型设计了针对性的编码策略、训练策略、冗余消除机制与自适应门控模块,从而支持任意组合的多模态控制。

图 1:OmniColor 统一着色能力展示。 给定线稿 L ,模型可以通过文本 T、颜色提示 C、身份参考 I 和 历史帧 H 的不同组合,生成准确的上色结果。

  • 论文标题:OmniColor: A Unified Framework for Multi-modal Lineart Colorization

  • 作者:张栩禄、杜昊谦、魏骁勇、李青

  • 机构:香港理工大学、四川大学

  • 会议:ECCV 2026

  • 论文链接:https://arxiv.org/abs/2603.27531

  • 代码:https://github.com/zhangxulu1996/OmniColor

OmniColor 的核心思路

OmniColor 将常见的上色输入信号划分为两类。第一类是空间对齐条件,包括输入线稿、用户提供的颜色提示,以及近期历史帧。这类信息和目标图像在空间位置上存在强对应关系,上色后的图像需要在边界、局部色彩、整体风格和几何结构上与输入条件保持精准一致。

第二类是语义参考条件,包括文本描述、角色身份参考图,以及长期历史帧。这些信号提供的是更抽象的语义约束,例如角色外观、整体配色、镜头氛围或长期一致性,但它们并不要求和当前输出逐像素对齐。

针对两类条件,OmniColor 设计了不同的编码路径。对于空间对齐条件,OmniColor 使用双编码器策略:一条路径利用 VAE 编码器保留颜色边界和高频细节,另一条路径通过 VLM 编码器提取局部语义。此时,模型既能关注线条、边缘和色块位置,也能理解这些局部区域在语义上属于头发、衣服、背景还是其他对象。

对于语义参考条件,OmniColor 只采用 VLM 编码,压缩后的语义 token 已经能够表达关键属性,而且这一设计还可以减少 token 数量,在一定程度上提升推理效率。

图 2:OmniColor 的架构,辅助信号分为空间对齐条件(蓝)和语义参考条件(绿)。空间对齐条件通过双编码器策略进行处理,语义参考条件仅使用VLM编码器处理,TRE 模块用于过滤冗余 token。MMDiT 主干网络通过 AS-Gate 模块融合这些特征,以解决输入冲突。模型通过 Flow Matching Loss 和 Dense Feature Alignment Loss 进行优化。

三个关键模块

确定整体编码路径后,OmniColor 进一步优化了空间条件控制精度、推理效率和条件冲突处理能力。

Dense Feature Alignment(DFA):强化空间约束。仅在 VAE 潜空间里使用标准生成损失,往往不足以保证局部结构的严格对齐。OmniColor 引入了 DFA 损失,利用 DINOv3 提取预测图像和真实图像的稠密特征,并利用 MSE 损失约束二者对齐。由于早期生成状态噪声较多,该方法将这一监督限制在较晚的去噪阶段。

Temporal Redundancy Elimination(TRE):历史帧冗余去除。动画序列里相邻帧往往包含大量重复的静止内容,把所有历史帧全部编码后,模型会接收大量冗余 token,既影响效率,也可能稀释真正有益的变化信息。TRE 机制将参考帧划分为多个 patch,计算相邻帧对应 patch 的颜色直方图相似度,过滤掉高度相似的冗余区域,再通过连通域分析提取最小包围框,获得多个发生变化的局部区域图像。此时,模型将接收「历史帧中发生变动的部分」。

Adaptive Spatial-Semantic Gating(AS-Gate):动态处理多条件冲突。多模态控制的难点不只是信息多,还在于信息可能互相矛盾。OmniColor 提出 AS-Gate 模块,根据空间分支的信息密度动态调节语义分支的影响。当线稿、色块或近期历史帧已经给出强空间约束时,模型可以降低部分语义参考的干扰;反之,模型则更多依赖语义参考。该门控被集成到 MMDiT 的注意力结构中,并通过零初始化的 LoRA 保证训练初期接近恒等映射。

实验结果:质量、控制和一致性同时提升

论文基于 25 部高质量动画序列构建了训练数据,得到 12 万对高质量样本;测试集来自 6 部未见过的动画,包含 305 个视频片段和 900 个图像级测试样本。

论文与三类方法进行了比较。在相同的输入条件下,OmniColor 表现出了更高的性能。此外,该方法支持控制信号的自由组合,同一张线稿可以任意结合文本、颜色提示、身份参考和历史帧,生成高质量结果。

表 1:与当前先进方法的定量比较。注:L = 线稿;T = 文本描述;C = 颜色提示;I = 身份参考;H = 序列生成;G = 使用每个片段的第一张真实图像作为参考。

在文本引导的上色测试中,该方法实现了文本遵循与线稿结构的对齐。相比之下,通用多模态生成模型可以理解提示词,却难以严格贴合线稿结构;传统线稿上色方法又通常缺少足够灵活的多模态组合能力。

参考图像着色结果展示了模型对角色身份和风格信息的保持能力。即使目标画面与参考画面之间存在角色旋转、镜头推近或拉远,以及明显的视角变化,模型仍能稳定恢复角色的面部特征、发色和服饰风格。

图 4:基于参考图像的线稿着色定性结果。即使在旋转、缩放等多种运动以及显著的视角变化下,OmniColor仍能保持稳定的身份一致性和风格一致性。

多模态控制实验体现了 OmniColor 的细粒度控制能力。加入身份参考后,角色妆容、发色等个体属性能够得到更准确的上色;加入颜色提示后,模型可以将局部色块信息传播到对应的语义区域。

序列化生成体现出该方法在连续生成时的优势。当使用目标片段的第一帧作为空间参考时,生成效果与 GT 片段的相似性进一步提升。

最后,作者在真实线稿上进行了测试,并获得了出色的着色结果,展现出面向实际创作场景的应用潜力。

消融实验

消融实验结果显示,VLM-only 编码显著降低了推理延迟;DFA 损失增强了结构保真度;TRE 机制进一步减少了长期历史帧带来的 token 开销;最后加入的 AS-Gate 则取得了综合最优表现,说明自适应门控能够更好地平衡空间约束和语义参考。

表 3:消融实验。#Tokens 表示平均 token 开销。

结语

OmniColor 的贡献在于将这些输入信号纳入同一套框架,而不是为每种输入单独训练一个模型或设计一条独立流水线。这种统一性让模型能够适配更复杂的生产级场景,也为后续构建交互式 AI 上色工具提供了基础。随着未来推理速度进一步提升,并拓展到更抽象的草图或早期概念设计阶段,这类方法有机会成为动画、漫画和游戏资产生产中的高频辅助工具。

相关内容

热门资讯

广西融水县一家超市销售过期食品... 中国质量新闻网讯 为切实保障老年群体食品消费安全,严厉打击销售过期食品等违法经营行为,近日,广西融水...
单季1200亿资本开支,中国互... 来源:钛媒体当“降本增效”的口号还在大厂内网回荡时,报表上的资本开支数字已经先一步给出答案。2026...
正推进mRNA疫苗用于宫颈癌等... (来源:财闻) 本次合作面向全球,聚焦消化道实体瘤及罕见肿瘤治疗领域,覆盖...
花旗上调药明合联目标价至93港... 观点网讯:8月27日,花旗发表报告,将药明合联目标价由73港元上调至93港元,并维持“买入”评级。花...
神秘大模型“牛来”,已证实:来... 8月26日晚,智谱上线并开源GLM-5.3-Flash (320B-A18B),这是GLM-5系列的...