技术报告 / H3
Technical landscape · October 2026

MiniMax H3加速技术报告

从少步数蒸馏到完整服务链路,梳理公开方案、实现入口,以及每个性能数字成立的条件。

发布日期:  ·  资料检索截止:2026-10-08
X 公开内容与第一手技术资料交叉核对
45方案、实现及商业变体
30已取回正文的 X 原帖
9可筛选技术类别
0本次 GPU 独立复测
01

先读这三个判断

性能结论来自作者或社区公开记录;本报告核验资料,不将宣传当作独立复现。

COMPUTE LESS

少步数是主要杠杆

Turbo、PDD、FastH3、PDMD、DMAD 都在缩短采样轨迹。直接降低原生模型 steps,与训练少步数模型,效果不同。

MEASURE THE WHOLE PATH

口径比倍率更重要

Attention kernel、去噪、首个 latent、可播放片段和完整 MP4 是不同指标。多卡 warm 数据也不能代替单卡冷启动体验。

MATCH THE TASK

参考驱动需要单独验证

T2VA 表现不能代表 Ref2VA。用于人物替换或造数据时,身份、动作、背景和音画同步需要与速度一起评估。

一个可评估的组合路径

01 · MODEL匹配任务的蒸馏

先确定 T2VA / FL2VA / Ref2VA

02 · ATTENTION一种注意力后端

Sol、SLA、VSA 或 Veda

03 · HARDWARE硬件适配的量化

检查真实低比特 GEMM

04 · DECODE优化 VAE 与编码

融合、分块与流水并行

05 · SERVING实测最终工作流

加载、延迟、吞吐、质量

这些优化的收益不能直接相乘。缓存对 20–50 步通常更有空间,2–4 步时未必划算;多个缓存或 attention override 也可能相互覆盖。

02

消费卡:同口径比较

只比较 FastH3 同一发布记录中的真实 GPU。图中数值越短越快,不跨项目拼接排名。

生成 5 秒带音频视频,需要多久?

FastH3 V2 · 8 步FastH3 Trim · 8 步
0 秒60 秒
GPUV2 · 480pTrim · 480pV2 · 768pTrim · 768p
RTX 5090 · 32GB14.8 s13.4 s38.6 s35.4 s
RTX 4090 · 24GB54.6 s43.9 s154.6 s132.8 s
RTX PRO 6000 · 96GB13.5 s12.0 s36.5 s32.5 s

计时条件:Warm server,prompt → 成品 MP4,包含文本编码、8 步去噪、音视频解码及导出;480p = 832×480,768p = 1344×768。每个 prompt 两次运行,两个 prompt,按作者公布的中位数口径。技术记录 ↗ · 2026.10.06 X 原帖 ↗

两个容易误读的数字:“5090 约 15 秒”指 480p;“最低 8GB”是限制 4090 可用显存的容量测试,不能当作真实 8GB 显卡速度。Trim 删除 8 个 Transformer block,复杂场景可能减少细节。
03

全部方案与实现

同一技术的移植和组合分别保留。缺少 X 原帖或受控 benchmark 的条目明确标注。

45 项方案
04

如何使用这些结论

Character Swap / 数据生成优先级

  1. 先评估 Ref2VA 专用的 LightX2V Turbo 或 PDD,确认身份、动作和背景保持。
  2. 选择一种兼容稀疏注意力,再加入 INT8 VAE,测试最终组合收益。
  3. 批量生产看 UniServe / SGLang 的并行、解码及服务调度,同时检查任务和硬件支持。
  4. PDMD、DMAD 或激进缓存可增加候选数量,但需要筛查细节与时序误差。

以上是根据公开能力与限制给出的评估顺序,不是已经完成的你的业务场景验收。

倍率不能这样读

Sol 27.7×:H3 低分辨率 draft + LTX-2.5 refine 的两模型链路。来源 ↗

TaoMate 27.66×:首个 final chunk latent,不是完整视频 MP4 耗时。来源 ↗

VC 约 1.6×:H3 attention kernel 的 B200 对照,不能等同于生成全流程。来源 ↗

VAE 约 2×:只影响编解码时间。更新已内置的优化,不应再与旧插件宣传倍率相乘。来源 ↗

05

X 原帖索引

按正文取回结果记录作者和 UTC 发布时间;原帖可点击。正文取回不代表性能独立复现。

30 条原帖
06

证据与检索边界

覆盖公开可检索内容,不能声称穷尽 X

检索方式:组合 MiniMax-H3 / MiniMax H3 / minimax_h3 与 speed、acceleration、turbo、distillation、cache、sparse、quant、FP8、NVFP4、INT8、4090、5090、ROCm、Metal;沿 X 讨论追踪代码、论文、权重与作者 benchmark。

第一手来源优先:X/Grok 自动趋势摘要及第三方聚合仅用于发现链接。方案解释优先采用作者仓库、模型卡或论文,历史 X 数字保留发布条件。

证据分开:30 条原帖正文已通过公开镜像取回;45 项中包含补充实现及商业记录。关联 X 讨论不一定是对应仓库的受控测试。没有硬件或完整计时条件时,不补猜倍率。

未完成的验证:本次没有运行 GPU 性能或画质实测,也没有证明任何方案适用于你现有 Character Swap 工作流。私密、删除、未索引的帖子及缺失回复可能未覆盖。

资料时点:2026-10-08;仓库可能更新,特别是 ComfyUI 接口、原生优化和废弃插件。清单保留当前核对状态及对应来源。