查看作品文字内容
MiniMax H3 · 部署手册 结论 硬件体检 国内下载 选 torch 部署步骤 避坑 参数速查 排障 链接 本地部署实战手册 · ComfyUI 版 在你的双路 E5 服务器上,跑通 MiniMax H3 面向:2×Xeon E5-2680 v4 · 64GB DDR4-2133 · RTX 5060 Ti 16G · 1TB 固态。 目标:在本地 ComfyUI 里生成带原生立体声的短视频。 先说结论:能跑通,但要管好预期。 真正的瓶颈不是那张 5060 Ti,而是这台机器的 PCIe 3.0 ×8 通道 和 64GB 内存 ——H3 是 33B 稠密模型,16G 显存装不下, 必须把大部分权重放在内存里来回搬运,而搬运速度被你 2016 年的老平台卡住了。 所以: 768p、5~8 秒片段 是现实目标,单条耗时以“十几分钟”量级起步,优化后才可能压到个位数分钟。 ComfyUI ≥ 0.30.0 原生支持 显存 16G:可行 内存 64G:偏紧 PCIe 3.0 ×8:主要瓶颈 本地只出 768p 00 先搞清楚你要装的到底是什么 「MiniMax H3」=「海螺3」=「Hailuo 3」,是同一款模型的不同叫法。 MiniMax(稀宇科技)于 2026 年 7 月 31 日 发布、 8 月 3 日 公开权重的 通用全模态音视频生成系统 。它不是“文生视频小模型”: 它把文字、图片、视频、音频放进同一个上下文理解,并且 在同一次前向传播里同时生成画面和 32kHz 立体声 ——口型、音效、环境音天然对齐, 不是后期配音贴上去的。 规格 数值 对你的影响 参数量 330 亿(33B)稠密 ,非 MoE 每帧全部参数参与计算,这就是它吃资源的原因 本地分辨率 短边 768px(16:9 ≈ 1344×768,约 0.98MP) 本地只能出这个档 2K 输出 走 MiniMax 托管服务(Context-IR + Regenerate-2K) 2K 不是纯本地能力 ,别被标题党骗 时长 / 帧率 4~15 秒(整数)· 24fps 单次片段上限 15 秒 音频 原生 32kHz 立体声,11 种语言口型 提示词不写声音,它会自己猜 两套权重 FL2VA(文生/首尾帧)· Ref2VA(多参考) 按需下载,别两个都下(每个都很大) 参考上限 9 图 + 3 视频 + 3 音频,混合最多 12 个文件 Ref2VA 最吃资源 授权 H3 Community License(开源权重,非 OSI 开源) 见下文「授权边界」 别混淆 公开的只有 H3-Base 基座权重(本地产 768p)。 H3-Regenerate-2K 和 H3-Context-IR 属于完整系统里的托管模块, 没有开放权重、本地跑不了。看到“33B + 2K + 全离线”的宣传,请默认它是错的。 01 先给你这台机器做个体检 逐项过一遍,哪些是优势、哪些是硬伤、哪些可以调。 部件 你的配置 判断 说明与建议 CPU 2×Xeon E5-2680 v4 (28核56线程) 够用 Broadwell-EP,只有 AVX2、无 AVX-512。但 H3 的重计算在 GPU,CPU 主要负责调度与搬运,够用。核多对 offload 和 VAE 分块略有帮助。 内存 64GB DDR4-2133 偏紧 模型组件峰值驻留约 35~40GB,系统再占 5~8GB,64G 能过但没余量。 务必关掉浏览器、Docker、其他大内存程序。 预算允许建议加到 96~128GB。频率 2133 低于 2400 规格,带宽略损。 显卡 RTX 5060 Ti 16G 可行 Blackwell(sm_120), 必须用 CUDA 12.8+ / PyTorch 2.7+ 的版本 ,驱动 570+。16G 属于“能跑、靠 offload”档,装不下完整模型。 总线 PCIe 3.0(X99/C612 平台) 主瓶颈 5060 Ti 是 PCIe 5.0 ×8 的卡,插在 3.0 槽位只能跑 3.0 ×8(约 6~7GB/s)。H3 靠 offload,权重频繁在内存↔显存之间搬,这条路越窄,出片越慢。 硬盘 1TB 固态 够放 模型约 40GB + 环境约 20~40GB,1TB 放得下。 但要确认是 NVMe 而不是 SATA :SATA 首次加载慢得多,offload 也受拖累。 BIOS 服务器/工作站主板 必须检查 50 系卡对新平台特性更敏感,务必按下面「BIOS 四件事」逐条设置。 电源/机箱 — 确认 5060 Ti 16G 约 180W,需 1×8-pin PCIe 供电。服务器电源常是专用接口,可能要用转接线;2U 机箱要确认显卡长度和散热空间。 BIOS 四件事(开机按 Del/F2 进设置) ① Above 4G Decoding → Enabled 现代 NVIDIA 大显存卡的必要条件。关闭时轻则不识别、重则点不亮。 ② Resizable BAR → 尽量开启 X99/C612 老主板多数没有这项。没有 ReBAR 也能用,但显存访问效率略降。部分 X99 主板有社区改版 BIOS 可开启,有风险,谨慎。 ③ 启动模式 → UEFI,关闭 CSM 50 系卡依赖 UEFI GOP。若主板处于 Legacy/CSM 模式,可能直接黑屏无输出。 ④ 内存交错 → Node Interleaving = Enabled 双路平台关键项。开启后系统看到统一内存,两个 CPU 的内存带宽都能用上;否则单进程往往只吃一个节点的带宽。 预期管理 社区实测里,RTX 5060 Ti 16G 在较新的平台上用 Turbo LoRA 跑 768×448 的 5 秒片段, 可以做到“约 2 分钟一条”。但你多了一道 PCIe 3.0 ×8 的闸门, 实际耗时大概率明显高于此 。把它当成“能稳定出片、但需要耐心”的工作站,而不是实时工具。 02 国内从哪里下载(软件 + 模型) 原则:能走魔搭就走魔搭,Hugging Face 一律走镜像,大文件一律用多线程工具并支持断点续传。 2.1 下载渠道优先级 要下载的东西 国内首选渠道 备选 ComfyUI 本体 秋叶整合包(B 站 @秋葉aaaki ,官网/网盘发布) 或 ComfyUI 官网桌面版 comfy.org GitHub Release: Comfy-Org/ComfyUI → ComfyUI_windows_portable_nvidia.7z (直连慢可用 ghproxy 类镜像) H3 模型(ComfyUI 适配版) 魔搭 ModelScope modelscope.cn/models/Comfy-Org/MiniMax-H3 Hugging Face 镜像 hf-mirror.com (设 HF_ENDPOINT ) H3 官方原始权重(全精度) 魔搭 modelscope.cn/models/MiniMax/MiniMax-H3 HF MiniMaxAI/MiniMax-H3 (约 498GB,家用别下) 更省显存的 GGUF 量化版 魔搭 modelscope.cn/mo…