开源国产8B模型,比肩闭源Image 2了!
创始人
2026-08-21 14:55:56

金磊 发自 凹非寺

量子位 | 公众号 QbitAI

时隔仅仅三周,国产生图模型,又进化了。

这一次,它的正式版本来了!若是用三个词来概括,那就是——

更完整,更准确,更稳定。

例如我们现在一口气把九张不同的食物照片丢给它:

并简单附上一句Prompt:

请将这九款美食拼成一张精美的食谱分享卡片。

再来看一个编辑图片的例子。

我们在原图的基础上,用“框选+标注”的方式,把想要修改的图片局部细节给标了出来:

AI在接到任务改完以后是这样:

可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。

而这个AI,便是商汤科技这次正式开源的SenseNova U1.5 Lite,其亮点如下:

  • 3-4k字符超长复杂指令遵循:能一次理解更长、更复杂的要求,同时处理主体、数量、位置、文字、布局和风格等多种约束,不容易漏细节。

  • 更高质量的视觉生成:构图、色彩、材质、光影和细节更自然,整体完成度更高。

  • 更可靠的原生图像编辑:改指定内容时更精准,同时更好地保持人物、结构、版式和其他区域不变。

  • 更好的文字与复杂布局:中英文文字、海报、信息图和多文本排版更准确,也更擅长组织复杂画面。

  • 更精细的视觉控制:支持框选、标记和多图参考等方式,更准确地指定“改哪里、改什么”。

  • Native 4K高分辨率输出:直接生成4K高清图,同时保住构图、纹理、小字和光影等细节。

而且啊,SenseNova U1.5 Lite依旧保持了8B的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的GPT-Image-2:

如果说三周前的SenseNova U1.5 Lite Preview版本是验证一个统一模型能够把视觉能力扩展到哪里。

那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。

效果怎么更强了?看细节

接下来,我们继续拿效果来说话。

第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。

要在一张竖版信息图里,需要同时塞进Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六个阶段。

每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。

从最终的效果来看,SenseNova U1.5 Lite已经做到了可以组织一整套视觉表达,包括长文本、多层级结构、插画、数字顺序和版式关系。

这种能力再落到更日常的内容生产里,就变成了类似做社交媒体封面这类任务。

比如下面这张图:

这类图看上去虽然元素不算多,但难点就在于要做到“封面感”这三个字。

标题要立得住,主体要足够抓眼,三只狗的造型、服饰和表情既要各有区分,又不能彼此打架;同时,整张图还得维持住统一的时尚调性,而不是变成几个可爱元素拼在一起。

从最后的结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张能够直接拿来用的封面作品。

接下来,我们再来看下SenseNova U1.5 Lite的局部编辑能力。

Prompt是这样的:

仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。

乍一眼看过去,两张图片整体的结构和风格几乎是没有变化的,因为我们的要求就是“仿照参考图”。

仔细看细节,原来属于教育项目的元素被替换成厨师帽、砧板、菜谱等厨房相关视觉,左侧的信息也跟着变成Membership Fees、Commercial Rental、Cooking Classes、Market Sales和Event Hosting。

在这类任务中,模型得先分辨出一张图里哪些东西属于主题内容,哪些东西属于更底层的设计逻辑。然后保留后者,再让新内容沿着原来的视觉语言长出来。

不过若是参考图从一张变成了多张,那任务难度就会更大了。

例如我们输入下面这三张参考图片:

然后附上这样的Prompt:

Edit Image 1usingImages 2and3ascontent referencesrather than pasted rectangular images. Replace the framed band silhouettes withallfive Radiohead members fromImage 2, transformed intothe poster’s distressed monochrome halftone style. Reflow the four lower feature blocks intoa compact leftcolumnandaddan ESSENTIAL LISTENING list onthe rightusingImage 3onlyforwording andhierarchy. Render the newlist directly onthe same continuous black distressed background withmatching off -white type; do notretain anywhite orcream card background. Preserve alloriginal text andallother poster elements.

这次Prompt更细节的一点是,第三张参考图只允许参考内容和信息层级,原来的白色卡片背景不能一起搬过来,新歌单需要直接长在海报原来的黑色做旧背景上。

SenseNova U1.5 Lite给到的结果如下:

从结果来看,Radiohead五个人进入了原来的乐队区域,人物处理后的质感和整张海报基本接上了;左下方的信息重新压缩,ESSENTIAL LISTENING则直接融进右侧版面,没有留下一块突兀的白底。

而对于刚才给到的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先把这三件事分开理解,最后才能重新合成到一张图里。

但在真实设计工作里,还有一种需求没有前面这么复杂,却可能出现得更频繁——改几个字

这次我们在输入原始图片后,Prompt如下:

请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从

“JUNE 15 - JULY 30, 2024

URBAN GALLERY

123 CREATIVE WAY

ARTSVILLE, USA”

替换为

“AUGUST 10 -

SEPTEMBER 28, 2024

METRO MUSEUM

456 DESIGN ROAD

CREATIVITY CITY, UK”,

保持原有的白色与粉色字体样式及排版布局不变。

最终,左下角的信息完成替换,画面中心巨大的“RHYTHM OF FORM”、周围高饱和度的几何图形,以及原本的文字层级都留在原来的位置。

先拆开练,再合回来

在看完的效果之后,接下来的一个问题就是,一个8B模型是如何做到文字、审美、复杂布局、长指令、局部编辑都过关的?

据了解,SenseNova U1.5 Lite继续沿用了NEO-unify原生统一多模态架构,把视觉理解、图像生成和编辑放在同一套模型里。

也就是说,在真正动像素之前,模型先要理解画面。

哪里是主体,谁在谁旁边,哪些是文字,用户指的是哪块区域,一张参考图里到底哪些东西值得保留……这些理解过程,并不会和后面的生成、编辑彻底分家。

而正式版这次比较关键的一处变化,发生在训练阶段。商汤采用了一套很容易理解的办法:先拆开练,再合回来。

文字渲染、美学表达、图像编辑这些目标,先会分别训练对应的专项Expert

等这些Expert练完以后,再通过多教师在线策略蒸馏技术MOPD,把它们的专项能力重新融合回同一个SenseNova U1.5 Lite里。

所以训练时虽然有多个专项老师,到了最后真正交付和部署的时候,用户拿到的依然只有一个8B模型。

没有额外Router在背后判断“这次应该调用哪个子模型”,用户也不用在文字、美学、编辑几个模型之间自己来回切。

这种做法和前面的案例其实是能对上的。

到了海报改字也是一样。

“只改左下角”首先得先理解什么叫“左下角”,哪些文字属于目标区域,周围哪些图形、字体和版式不能动。等这些判断做完,才轮到最后的像素生成。

所以在统一训练体系里,视觉语义理解和空间建模形成的结构化认知,可以继续反过来帮助生成和编辑。商汤在新闻稿里把这件事概括为“理解与生成双向反哺”。

而要让这种能力在复杂任务里稳定下来,正式版后训练又专门强化了三件事。

第一件叫指令遵循。用户写了一大串要求,主体有几个、谁在左边、文字放哪儿、什么颜色、哪些东西不许改,最后模型到底执行了多少。

第二件叫视觉偏好。指令都完成以后,整张图的构图、材质、光影和最终质感到底过不过关。

第三件是编辑保持。要改的区域能不能改准,原本已经正确的地方还能不能留下来。

这三项其实刚好对应了前面几个案例最容易出问题的地方:复杂信息图怕漏要求,STYLE这样的封面直接考验美学完成度,而卧室修改、Radiohead和文字替换,则都离不开对非编辑区域的保持。

另外还有提示词增强。如果用户只给一句比较简短的需求,PE可以先帮忙把意图整理成更完整的创作方案,再交给U1.5 Lite执行。

以上便是正式版SenseNova U1.5 Lite背后的技术关键了。

生图模型的标准,得变了

若是把时间线拉长一些,回头再看SenseNova U系列这几次变化,其实我们会发现一个比较明显的趋势。

早期大家看生图模型,最容易比较的是够不够惊艳。但当AI的生图能力越发的普及,真正决定模型能不能进入工作流的问题,开始出现在第一张图生成以后。

这也是SenseNova U1.5 Lite正式版反复强调“稳定”的原因。相比再增加几个看起来新鲜的玩法,它更想解决的是一项视觉任务从生成到交付的完整链路。

对应地,评价模型的标准也在发生变化。一张图够不够漂亮依然重要,但真正拉开差距的,越来越可能是模型能不能从理解需求、生成内容,一路完成修改、细化和最终交付。

统一模型的价值也正是在这里体现出来。

SenseNova U1.5 Lite最终交付出去的依然只有8B。它没有不断叠加外部路由,也没有把不同任务拆给多个模型分别完成,而是先通过多个专项Expert补强能力,再把这些能力重新收进一个统一模型里。这样做的好处很直接:调用链路更短,部署更轻,同时还能尽量保住不同任务之间的一致性。

落到开发者和创作者的实际使用里,最终对应的其实就是三个字,快、好、省。

商汤的判断是,多模态仍然会是AI走向物理世界、真正进入生产环节的重要方向。因此这次U1.5 Lite正式版继续把大量精力放在稳定性、指令遵循和编辑精度上。它们未必像某个新玩法一样第一眼就很抓人,却更直接决定了模型能不能被真正用起来。

如果说三周前的Preview版本更多是在验证,一个8B统一模型的视觉能力究竟能铺到多宽。

那么到了正式版,问题已经开始变成另一件事:

这些已经铺开的能力,究竟能不能稳定地拿来干活。

GitHub:

https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:

https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在线体验:

https://unify.light-ai.top/

相关内容

热门资讯

银行如何帮助企业管理资金流动? 企业在运营过程中,资金的高效周转是维持生命力的关键。 商业银行作为金融中介,通过多元化的产品体系,协...
最新或2023(历届)平顶山市... 最新或2023(历届)已经到来,今年平顶山市养老金调整吗?上涨金额多少?下面小编为您介绍平顶山市养老...
最新或2023(历届)焦作市养... 最新或2023(历届)已经到来,今年焦作市养老金调整吗?上涨金额多少?下面小编为您介绍焦作市养老金最...
最新或2023(历届)鹤璧市养... 最新或2023(历届)已经到来,今年鹤璧市养老金调整吗?上涨金额多少?下面小编为您介绍鹤璧市养老金最...
最新或2023(历届)新乡市养... 最新或2023(历届)已经到来,今年新乡市养老金调整吗?上涨金额多少?下面小编为您介绍新乡市养老金最...