客户看完海报只说了一句「价格数字再大一点,往左挪半厘米」,你却要回去重新抽卡二十次——用纯文生图工具做真实交付的人,大概都经历过这一幕。像素图一旦生成就是烙死的,文字、主体、背景全压在同一层里,任何一处微调要么靠提示词重新赌运气,要么退回 Photoshop 手动抠。RabbitVis 想接上的正是这段断裂:它背后的自研模型 UniWorld-Design 把「图层」而不是「像素」当成生成的基本单位。
UniWorld-Design 出自北京大学与 Rabbitpre AI 的研究团队,论文在 2026 年 8 月公开。它的核心主张挺直白:像素决定一张图怎么被渲染,图层决定一张图怎么被创建、被理解、被修改。所以它把带透明通道的语义 RGBA 图层当作生成、理解和编辑的原子单位,而不是最后一步的后处理。
论文里明确提到两条能力路径。一条是 Text-to-RGBA,直接从文字描述生成独立、带透明背景、可复用的 RGBA 素材;另一条是 Image-to-Layer,输入一张已经完成的图像,把它还原成分层结构。前者意味着你要的那朵花、那个标签、那块光斑可以单独产出,拿来就能拼;后者意味着历史稿件、参考图甚至客户甩过来的一张截图,都有机会重新变成可以拆动的东西。
对设计师来说,这个差别的实际含义是「可寻址」。图层化之后,改动的对象不再是整张画布的概率分布,而是某一个具体元素。想看原始论文的可以直接翻 arXiv 页面。
纯生图工具的优化目标是单帧画面的观感,它在视觉探索阶段极强:给个模糊方向,几分钟出十几个氛围完全不同的版本,帮你把审美判断快速收敛。但它的迭代方式本质是重新生成,你没法保证第二版还留着第一版里客户点头的那部分。
图层原生工具的优化目标不一样,它在意的是这张图后面还要被改多少次。所以两类工具更像前后段关系,而不是替代关系:前者定调,后者落地。如果你的产出物是发朋友圈的一张概念图,前者够了;如果产出物要过三轮修改、要换尺寸、要换文案、要交付给甲方或印厂,后者才是省命的那一环。
中文字形笔画密、结构复杂,像素级生成模型处理起来天然比拉丁字母吃力,糊字、缺笔画、造出不存在的字都很常见。更麻烦的是,就算某一次侥幸生成对了,字号、行距、对齐、留白这些排版量也全是不可控的——你无法要求一张已经渲染完的图把标题缩小两个字号。
把文字从画面里剥离成独立图层,这些操作才重新有意义。但这里有个必须自己动手验证的点:文字图层到底是真实可编辑的文本对象,还是只是被切出来的位图?两者在演示里看着一样,落到「换一句文案」时差别巨大。同理还有被遮挡区域的还原质量,元素抠离之后背后原本被压住的部分补得干净不干净,直接决定你是省了时间还是多了返工。
按图层化的思路走,流程和传统设计习惯反而更接近。第一步仍然是生成或导入,你可以从文字描述直接产出分层稿,也可以把手上的现成图丢进去做分层还原。第二步是检查拆解结果,这一步不能跳,图层颗粒度决定了后面能改多细——主体和背景分开只是及格,标题、副标题、装饰元素各自独立才算好用。
第三步才是真正省时间的环节:定向修改。改哪个元素动哪个元素,其余部分保持不变,客户的第五轮意见不会重置前四轮的成果。最后是导出交付,这一步的关键是格式能不能对接你现有的工作流,能否分层导出、能否再回到主力软件里做最终精修。链路断在哪一环,前面省下的时间就会在那一环还回去。
这几项建议拿一个真实的交付需求去跑,而不是用官方演示素材。演示稿的图层结构通常是精心准备过的,你自己那张排版拥挤、中英混排、还带着二维码的活动海报才是真正的考场。产品功能和模型版本都在迭代,具体表现以你实测为准。
对经常被反复改稿折磨的 UI 和平面设计师,图层原生这条路线值得花一个下午认真试。它未必让你出图更快,但可能让「改图」这件事从重做变成微调——对交付型工作来说,后者的价值通常更大。
Δ
Ctrl+D