大家好。这期视频是一次经验分享,聊一聊我认为上个月比较重要的几项技术进展。距离我上一期关于 Kontext 的视频已过去一段时间。当时我还在研究提示词对模型的影响,包括单图、双图输入的选择,以及不同模型在融图任务中的表现。
但仅仅过了一两周,社区中就涌现出大量基于 Kontext 训练的多用途 LoRA 模型。这些模型针对特定场景进行优化,能够稳定完成特定图像编辑任务。我自己尝试了多个用于融图的 Kontext LoRA,发现这项技术确实非常关键。
在过去,若想将任意产品图无缝融入任意背景图,整个流程不仅复杂,成功率也不高——尤其是在对成像质量要求较高的情况下。搭建一套可靠的工作流同样繁琐。而借助 Kontext LoRA,目前这一任务已达到极高水准,基本解决了“固定产品 + 固定背景”的高质量图像融合问题(此处特指电商应用场景)。
我们直接来看对比效果:这是原图。我在其中随意选取一个产品,放入一个背景中,再用 Kontext 模型处理。可以看到,打光与投影效果非常真实,产品本身的细节几乎完全保留。我特意选择了无 Logo 和文字的产品,但即使是有 Logo 或文字的产品,模型也极少破坏原有信息;如有轻微变化,后续只需简单修复即可。重点在于,该 LoRA 能精准统一光源方向、生成合理投影,并自动校正背景透视,使产品与背景在空间关系上保持一致。
即便所选背景与产品原始透视严重不符,Kontext LoRA 也能智能调整背景透视,使其与产品匹配。我们来看它的参考案例——效果惊艳,且适用范围远不止于展示图。即使透视夸张的图像,也能达成同等质量的融合效果。可以说,它一步实现了透视校正、光影统一与投影生成三大核心能力。
这不是本期视频要介绍的唯一 LoRA。另一个值得关注的是“绿色标记转特效”类 LoRA:只要在图中用绿色点/区域标注位置,模型就能将其转化为指定视觉元素,例如泡沫、水、雪花、沙尘或烟雾。我实测过该模型,效果出色,有需要的朋友可以尝试类似方案。
还有一类 LoRA 专用于精修:将拍摄好的产品图直接输入,即可输出专业级精修结果。由于 Kontext LoRA 的底层机制,其精修效果通常优于传统 ComfyUI 工作流产出的结果。
接下来介绍一个被广泛使用的 Kontext LoRA,我称之为“万物迁移”。使用它时,仅需提供一张白底产品图和目标场景图,甚至无需任何提示词,模型即可自动去除白底,并将产品自然融合进新场景。我亲自验证过多个案例——无论是物品、人物还是复杂场景,融合效果都非常自然、可信。
此外还有不少功能各异的 Kontext LoRA,这里不再一一展开。下面两张图用于说明 Kontext LoRA 为何能实现过去需要复杂工作流才能达成的效果。
相信许多人都有类似体验:在 Kontext 初期(甚至尚未开源、仅限付费阶段),输入一张图加提示词后,输出结果常常与原图完全一致——输入什么样,输出还是什么样。如果此前没用过 GPT-4o 这类强生图模型,可能不会觉得异常;但用过之后就会意识到:GPT-4o 等模型无论提示是否合理,都会尝试重绘,输出必然与输入不同。而 Kontext 在“听不懂”时则选择保持原图不变——这种机制起初令人困惑,但结合实际效果来看,它其实是一种优势:尽量保留不应修改的部分(如产品上的 Logo、文字等),只对需编辑区域进行精准干预。
那么,Kontext LoRA 是如何训练出来的?或者说,它的训练数据应如何构建?如果你曾训练过其他类型 LoRA(比如用于风格迁移的 SDXL 或 Flux 模型),会知道传统 LoRA 更侧重“风格抽象”:例如收集 30 张日漫风格图像,训练出的 LoRA 就会显著影响生成图的艺术风格;又如用同一产品 20 个视角的图像训练,目标是让模型理解该产品的三维结构,从而响应“这个产品在海边”“在沙滩上”等提示。
但 Kontext LoRA 不同——它学习的是“动作”,即图像编辑行为本身。因此其训练数据集结构也不同:不是“一张图 + 一段描述”,而是“两张图 + 一段描述”——一张为输入图(编辑前),一张为输出图(编辑后)。例如训练“打光+投影”类 LoRA,就需要一组配对图像:左图为无投影的产品图,右图为已添加合理投影与光影的产品图。
现实中,获取大量成对训练数据并不容易。除非身处企业环境,拥有设计团队或渲染师支持,否则很难批量产出高质量配对图。但有一个实用技巧:从结果图反推原始图。例如,拿到一张带投影的成品图后,复制一份,在副本中用绿色画笔覆盖掉投影区域,即可得到对应的“无投影原始图”。训练时,只需在原始图中用绿色标记待编辑区域(如“在此处添加投影”),再辅以简洁描述词,例如:“消除图像中的绿色区域”“为产品添加投影”“统一产品与背景的光影”等。