今天使用RTX 4060笔记本显卡(8GB显存 + 16GB系统内存),成功跑通720p分辨率、15秒时长的视频直出任务,总耗时35分钟。虽然耗时较长,但该配置在常规条件下已属极限突破。

本工作流基于黑鹤大佬此前公开的工作流进行优化调整。黑鹤是一位活跃于ComfyUI社区的技术分享者,其原始工作流稳定性与兼容性表现良好,值得参考。

以下为本次优化的核心思路:

一、启用笔记本智能显卡模式

关键前提:必须使用支持“智能显卡切换”的笔记本平台(桌面独显平台不支持)。该模式可将系统界面渲染、基础图形负载交由核显处理,使独显在低负载状态下释放额外显存资源。实测可稳定节省约0.5GB显存,正是这0.5GB成为能否跑通480p/15秒甚至720p/15秒的关键阈值。

此方法并非本人原创,由一位粉丝偶然提及后验证可行。在ComfyUI v31版本更新后,显存占用相较v30普遍上升0.1–0.2GB,导致原可运行的480p/15秒任务失效;而通过智能显卡模式腾出空间后,不仅恢复了480p/15秒能力(v31下实测用时约520秒),还进一步实现了720p/15秒直出。

二、引入KZ优化节点替代旧方案

采用KZ开发的两个专用节点:

  • 降低显存占用节点
  • 降低内存占用节点

相较早期流行的Swap和Swap-T等节点,KZ节点在兼容性与效率上均有显著优势:

  • 完全兼容Tiled Diffusion(TSB)加速方案;
  • 不牺牲推理速度,避免旧节点“以慢换省”的弊端;
  • 实测中未出现明显性能拖累现象。

三、区分高低压环境,动态配置参数

根据目标分辨率与时长,将运行场景划分为低压与高压两类,并匹配不同策略:

低压环境(如480p/10秒、540p/15秒)

  • 推荐优先启用TSB加速;
  • KZ节点参数建议设为较低值(例如显存降级系数=4,内存降级系数=2);
  • 实测480p/10秒任务可在177秒内完成(4步采样)。

高压环境(如720p/15秒、640p/15秒、768p/10秒)

  • 禁用TSB,改用双KZ Load节点组合;
  • 原因:TSB虽可提速,但会额外增加约0.4GB显存占用,在8GB显存临界状态下极易触发OOM;
  • 推荐参数(基于RTX 4060 8GB实测):
分辨率与时长 显存降级系数 内存降级系数
720p / 15秒 10 4
640p / 15秒 6 2
768p / 10秒 8 4
540p / 15秒 4 2

注:以上参数为多次实测后得出的8GB显存设备较优解,实际使用请结合自身硬件微调。

四、关于LoRA模型的选择说明

本次测试选用T8版本LoRA,主要因其内置“报错机制”——每执行1/50步即输出一次日志。该机制有助于判断高负载任务是否仍在正常运行(尤其适用于单步耗时达十余分钟的极端场景),避免误判卡死。

需说明的是,T8并非当前最优性能LoRA。例如Light-X2 v3.0(300MB版)在显存与内存占用、推理速度等方面均优于T8。若追求更高效率,可优先尝试新版轻量LoRA,仅需注意确认其与当前工作流的兼容性。

五、关于图像放大方案的说明

测试中使用了RTX超分放大模块,对480p输出结果升频至1080p。该方案在二次元风格内容上效果尚可(如天空细节保留较好),但在三次元内容中易出现重影或结构模糊问题,暂不推荐作为通用放大手段。

六、提示词复杂度说明

本次测试采用高复杂度提示词,主要出于兼容性验证目的:有群友反馈复杂提示词可能提升显存/内存占用并延长生成时间。为确保工作流在各类提示词下均能稳定运行,特此验证其鲁棒性。实际使用中,仍可根据需求选择简洁或复杂提示词。