少步数是主要杠杆
Turbo、PDD、FastH3、PDMD、DMAD 都在缩短采样轨迹。直接降低原生模型 steps,与训练少步数模型,效果不同。
从少步数蒸馏到完整服务链路,梳理公开方案、实现入口,以及每个性能数字成立的条件。
性能结论来自作者或社区公开记录;本报告核验资料,不将宣传当作独立复现。
Turbo、PDD、FastH3、PDMD、DMAD 都在缩短采样轨迹。直接降低原生模型 steps,与训练少步数模型,效果不同。
Attention kernel、去噪、首个 latent、可播放片段和完整 MP4 是不同指标。多卡 warm 数据也不能代替单卡冷启动体验。
T2VA 表现不能代表 Ref2VA。用于人物替换或造数据时,身份、动作、背景和音画同步需要与速度一起评估。
先确定 T2VA / FL2VA / Ref2VA
Sol、SLA、VSA 或 Veda
检查真实低比特 GEMM
融合、分块与流水并行
加载、延迟、吞吐、质量
这些优化的收益不能直接相乘。缓存对 20–50 步通常更有空间,2–4 步时未必划算;多个缓存或 attention override 也可能相互覆盖。
只比较 FastH3 同一发布记录中的真实 GPU。图中数值越短越快,不跨项目拼接排名。
| GPU | V2 · 480p | Trim · 480p | V2 · 768p | Trim · 768p |
|---|---|---|---|---|
| RTX 5090 · 32GB | 14.8 s | 13.4 s | 38.6 s | 35.4 s |
| RTX 4090 · 24GB | 54.6 s | 43.9 s | 154.6 s | 132.8 s |
| RTX PRO 6000 · 96GB | 13.5 s | 12.0 s | 36.5 s | 32.5 s |
计时条件:Warm server,prompt → 成品 MP4,包含文本编码、8 步去噪、音视频解码及导出;480p = 832×480,768p = 1344×768。每个 prompt 两次运行,两个 prompt,按作者公布的中位数口径。技术记录 ↗ · 2026.10.06 X 原帖 ↗
同一技术的移植和组合分别保留。缺少 X 原帖或受控 benchmark 的条目明确标注。
以上是根据公开能力与限制给出的评估顺序,不是已经完成的你的业务场景验收。
Sol 27.7×:H3 低分辨率 draft + LTX-2.5 refine 的两模型链路。来源 ↗
TaoMate 27.66×:首个 final chunk latent,不是完整视频 MP4 耗时。来源 ↗
VC 约 1.6×:H3 attention kernel 的 B200 对照,不能等同于生成全流程。来源 ↗
VAE 约 2×:只影响编解码时间。更新已内置的优化,不应再与旧插件宣传倍率相乘。来源 ↗
按正文取回结果记录作者和 UTC 发布时间;原帖可点击。正文取回不代表性能独立复现。
检索方式:组合 MiniMax-H3 / MiniMax H3 / minimax_h3 与 speed、acceleration、turbo、distillation、cache、sparse、quant、FP8、NVFP4、INT8、4090、5090、ROCm、Metal;沿 X 讨论追踪代码、论文、权重与作者 benchmark。
第一手来源优先:X/Grok 自动趋势摘要及第三方聚合仅用于发现链接。方案解释优先采用作者仓库、模型卡或论文,历史 X 数字保留发布条件。
证据分开:30 条原帖正文已通过公开镜像取回;45 项中包含补充实现及商业记录。关联 X 讨论不一定是对应仓库的受控测试。没有硬件或完整计时条件时,不补猜倍率。
未完成的验证:本次没有运行 GPU 性能或画质实测,也没有证明任何方案适用于你现有 Character Swap 工作流。私密、删除、未索引的帖子及缺失回复可能未覆盖。
资料时点:2026-10-08;仓库可能更新,特别是 ComfyUI 接口、原生优化和废弃插件。清单保留当前核对状态及对应来源。