# Sol-H3 / HyperFlow 测试结果

HSG、Poly 共 58 条独立实测记录。全部来自本次 Slurm 推理输出；GitHub B300 历史数字单独标注。

[公开对比 Space](https://huggingface.co/spaces/Lawrence-cj/sol-h3-hyperflow-comparison) · [逐次实测计时 CSV](benchmark-evidence.csv) · [完整公开结果 JSON](data.json)

## 15 秒效果样片

20 个场景 × 4 个 H3 checkpoint，共 80 段重新生成的音视频。全部使用 1344×768、362 帧、24 FPS，目标时长 15 秒；同一场景的 prompt 和 seed 完全相同。效果区使用 HSG 4 卡、BF16、SOL/BSA。

旧版 5 秒样片使用了普通社区文本，未整理为 H3 格式。本版已按 H3 T2VA 的 `integrated_multimodal_description`、`overall_soundscape`、`non_diegetic_music` 三字段整理；首镜头为 `[Shot 1]`，切镜时间在 15 秒内，原文中的明确台词保留并加上说话人和 `<d>` 标签。社区原文与本次实际输入分别展示，新增镜头节奏、环境音等明确属于本次整理，并不声称是作者的原版结构化提示词。

20 条实际输入通过字段顺序、镜头编号、时间范围、引用完整性、语音标签及哈希检查；80 段输出逐一核对输入哈希、seed、步数、362 帧、几何尺寸、FPS、双声道音频，并完整解码音视频。此检查证明数据对应关系和媒体完整性，不等同于模型逐条服从了全部镜头和台词。

## 计时与环境

速度表使用独立的 [quiet-room 测速 prompt](benchmark_prompt.txt)，seed 20260903。每种配置预热一次、测三次取中位数，包含文本编码、DiT、视频 VAE 和音频 VAE；排除权重加载、预热编译和 MP4 编码。效果卡片则显示该复杂 prompt 的单次耗时，可能含新形状首次编译，因此不与预热后的测速表混用。

HSG 和 Poly 都重新建立了独立推理环境，PyTorch 2.10.0+cu130、CUDA toolkit 13.0.2、Triton 3.6.0、cuDNN 9.15.1.9、Transformers 5.8.1；Diffusers 与 cuDNN frontend 均固定到相同提交。HSG Python 3.12.13，Poly Python 3.12.3。硬件均报告 NVIDIA GB200，4 卡/节点，8 卡跨两节点；单卡测试只启用一个 GPU 进程。

## HSG 本次实测

| Checkpoint / 计算 | 使用卡数 | 5 秒 / 124f | 10 秒 / 243f | 15 秒 / 362f |
|---|---:|---:|---:|---:|
| fasth3-4 / BF16 | 1 | 14.144 s | 37.886 s | 71.524 s |
| fasth3-4 / BF16 | 4 | 2.996 s | 7.041 s | 12.621 s |
| fasth3-4 / BF16 | 8 | 1.666 s | 3.754 s | 6.676 s |
| hyperflow-8 / MXFP8 | 1 | 22.428 s | 65.486 s | 129.516 s |
| hyperflow-8 / MXFP8 | 4 | 4.607 s | 11.552 s | 21.511 s |
| hyperflow-8 / MXFP8 | 8 | 2.759 s | 6.552 s | 12.065 s |
| hyperflow-8 / BF16 | 1 | 25.560 s | 71.960 s | 137.426 s |
| hyperflow-8 / BF16 | 4 | 5.519 s | 13.347 s | 24.273 s |
| hyperflow-8 / BF16 | 8 | 3.224 s | 7.476 s | 13.338 s |
| lightx2v-4 / BF16 | 4 | 2.964 s | — | — |
| lightx2v-8 / BF16 | 4 | 5.536 s | — | — |

## POLY 本次实测

| Checkpoint / 计算 | 使用卡数 | 5 秒 / 124f | 10 秒 / 243f | 15 秒 / 362f |
|---|---:|---:|---:|---:|
| fasth3-4 / BF16 | 1 | 13.841 s | 37.857 s | 71.750 s |
| fasth3-4 / BF16 | 4 | 3.077 s | 7.225 s | 12.986 s |
| fasth3-4 / BF16 | 8 | 1.631 s | 3.787 s | 6.707 s |
| hyperflow-8 / MXFP8 | 1 | 21.857 s | 63.848 s | 127.023 s |
| hyperflow-8 / MXFP8 | 4 | 4.649 s | 11.837 s | 22.035 s |
| hyperflow-8 / MXFP8 | 8 | 2.714 s | 6.550 s | 12.104 s |
| hyperflow-8 / BF16 | 1 | 24.940 s | 70.312 s | 135.545 s |
| hyperflow-8 / BF16 | 4 | 5.514 s | 13.581 s | 24.797 s |
| hyperflow-8 / BF16 | 8 | 3.122 s | 7.369 s | 13.218 s |
| lightx2v-4 / BF16 | 4 | 2.928 s | — | — |
| lightx2v-8 / BF16 | 4 | 5.112 s | — | — |

## GitHub 历史参照（B300）

以下数字从已公布的 Sol-H3 源码快照引用，未当作本次实测。原表没有公开完整测速 prompt，因此属于跨硬件参照，不是严格同条件复现。

| FastH3 4-step BF16 卡数 | 5 秒 | 10 秒 | 15 秒 |
|---:|---:|---:|---:|
| 1 | 13.745 s | 37.813 s | 52.260 s |
| 4 | 2.918 s | 6.993 s | 12.542 s |
| 8 | 1.653 s | 3.732 s | 6.612 s |

HSG 单卡 15 秒为 71.524 秒，相对 GitHub 的 52.260 秒慢 36.86%。该差距在两套新环境中都出现，不能归因为本次忘了重新配环境；也不能在没有 B300 分阶段记录时，把原因确定为某一项依赖或硬件。

POLY 单卡 15 秒为 71.750 秒，相对 GitHub 的 52.260 秒慢 37.29%。该差距在两套新环境中都出现，不能归因为本次忘了重新配环境；也不能在没有 B300 分阶段记录时，把原因确定为某一项依赖或硬件。

## 实际启用的加速

- BF16 主测试开启融合 RMSNorm/调制/残差、QKNorm/RoPE、SwiGLU，以及 AdaLN 预计算。HyperFlow 缓存完整 `(t,r)` 条件。
- 多卡启用 SOL/BSA 与 Ulysses；实际记录每次请求的稀疏注意力调用和 INT8 QKV / FP8 输出通信。部分层与前几个步骤按既定策略保留 dense，并非漏开稀疏。
- 单卡使用发布实现的 dense 路径。视频 VAE decoder 编译；多卡额外启用视频 VAE 分片与批处理。音频 VAE 未做同样的并行改造。
- MXFP8 作为独立配置测试，量化第 2–46 层共 180 个线性层；与 BF16 主表分别列出。首次仅测了 8 卡，现已完成两集群 1/4 卡补测；不能把最初 BF16 主表描述为所有可选量化均已开启。
- 融合 SwiGLU 的大张量地址已改为 64 位，独立 GB200 边界数值检查与完整单卡 15 秒推理通过。

## HyperFlow 8-step 与 LightX2V 8-step

两者每个视频都做 8 次联合音视频 DiT 前向，但时间条件与采样网格不同。

| 项目 | HyperFlow v1.0 | 本次 LightX2V 8-step v1.0 |
|---|---|---|
| 时间条件 | 当前时间 t 与区间终点 r | 单时间条件 |
| 时间嵌入 | 独立两套嵌入，gate 0.25 | 原始 H3 时间嵌入 |
| 网格 | 权重元数据内的固定非均匀网格 | 对应推理配置的均匀原始网格 |
| video / audio shift | 12 / 3 | 6 / 3 |
| LoRA rank / alpha | 256 / 256 | 128 / 8 |

HyperFlow 保留原 Euler 状态更新；额外设计主要在两时间条件、时间嵌入和对应训练网格。接入时同时安装这些逻辑，不能仅把它作为普通 LoRA 换文件。每种 adapter 在新推理实例中加载，避免 LoRA 累加；该验证不代表支持已融合模型的原地热切换。

GPU 效果验证覆盖 T2VA，并新增下节的 Ref2VA 图片参考测试。FL2VA 仅完成已有结构和数值检查，没有新增 GPU 效果验证。HyperFlow 所述训练画布为 124 帧，15 秒属于更长时长的实际测试。

## 来源与复现

- 基础代码：[NVlabs/Sana Sol-H3](https://github.com/NVlabs/Sana/tree/sol-engine/models/minimax_h3/Sol-H3)，本次适配提交 `bcce779cbe6bd7aa46d92adb4182136fc90a5724`。
- 社区提示词：[BeatAPI awesome-minimax-h3-prompts](https://github.com/BeatAPI/awesome-minimax-h3-prompts)，逐条保留原作者链接和原始文本。
- 比较仅包含 H3：HyperFlow 8-step、FastH3 4-step、LightX2V 8-step v1.0、LightX2V 4-step v1.2。
- 公开数据包含 checkpoint SHA256、基础模型 revision、prompt/seed、NFE、GPU 数、精度、逐次计时和媒体哈希；内部节点与调度日志保留在本地实验记录。

## 分阶段与算子实测

以下为独立插桩诊断，未混入上面的 58 条无插桩测速。GPU 阶段各自取三次中位数，不要求相加恰等于整体中位数。完整记录见 [加速诊断 JSON](acceleration-audit.json)。

| FastH3 单卡 15 秒 | 总耗时 | DiT | 视频 VAE | 文本编码 |
|---|---:|---:|---:|---:|
| HSG | 73.099 s | 61.422 s | 11.419 s | 0.076 s |
| POLY | 71.798 s | 62.553 s | 8.977 s | 0.060 s |

单卡每次实际调用 AdaLN 缓存 200 次、融合 QKNorm/RoPE 400 次，融合 RMSNorm/调制、残差/调制和 SwiGLU 各 200 次，视频 VAE decoder 已编译。15 秒的耗时主要在 DiT；这证明这些加速实际执行了，但还不足以解释相对 B300 的差值，仍缺少原始 B300 分阶段记录。

## Ref2VA 图片参考效果

[打开同一 Space 的 Ref2VA 标签](https://lawrence-cj-sol-h3-hyperflow-comparison.static.hf.space/#ref2va)

目前 12 / 12 段：三组上游完整案例、四个 H3 adapter，全部 15 秒，HSG 4 卡 BF16 + SOL/BSA。同一案例共用 prompt、参考图和 seed；页面提供原始参考图、六字段实际输入、上游原文及出处。

案例分别为双人霓虹街头对决（三图）、书房双人对话（三图）、沙漠观星者（一图）。原始参考图来自 [ModelTC/Minimax-H3-Turbo examples](https://github.com/ModelTC/Minimax-H3-Turbo/tree/02e26d591f7a04d5d1a074c9566d5dd4f22f6225/examples)，保持内容不变；原始提示词约 5.17 秒，本次按要求改为 15 秒并规范镜头、说话人和声音字段，页面明确展示改写说明。

比较包含 HyperFlow 8-step、FastH3 4-step、LightX2V Ref2VA 专用 8-step v1.0 和 4-step v0.1。HyperFlow 为 FL2VA 训练、作者支持用于 Ref2VA；FastH3 是 T2VA 权重迁移实验。专用 Ref2VA adapter 与 T2VA 页使用的 LightX2V 文件不同，各自版本和哈希独立记录。

运行记录逐条确认真正启用了图片参考条件，且执行次数为对应的 4 / 8 次。所有已收集视频通过 362 帧及完整音视频解码检查。本轮仅验证图片作为参考输入，输出包含生成声音；没有测试音频或视频参考输入，也不等同于已验证声音复刻。
