正文

想把 MiniMax H3 部署到自己的机器上,第一件事不是找“单机 2K”参数,而是确认目标:官方开源的是可本地推理的 H3-Base,默认生成较短边 768 像素、带 32 kHz 立体声音频的视频;官方演示中的完整 2K 工作流还会调用 H3-Context-IR 和 H3-Regenerate-2K 服务。

这篇按官方给出的 SGLang 路径跑通 H3-Base。官方示例使用 4 张 GPU、ulysses-degree 4,所以它适合有多卡 CUDA 环境的团队或云端 GPU 节点。只有一张显卡时,不要先按这条命令下载整套权重再期待原样跑通;先看 SGLang、vLLM、diffusers 或 ComfyUI 的当前支持情况和实际资源要求。

先选 FL2VA 还是 Ref2VA

H3 公开了两套 BF16 checkpoint,模型和输入形式要对应:

FL2VA 不带图片时就是文生音视频;带一张图片时可作为首帧或尾帧;带两张图片时作为首尾帧。Ref2VA 最多可接 9 张图片、3 段视频、3 段音频,全部文件合计最多 12 个。参考音频不能单独作为输入,必须同时提供图片或视频。

两套权重都输出视频和原生立体声音频。官方定义的输出时长是 4 到 15 秒、帧率 24 FPS,默认较短边为 768 像素。

文本生成视频,或用首帧 / 尾帧控制视频H3-Base-FL2VA
用多张图、参考视频和参考音频控制视频H3-Base-Ref2VA

下载与你的推理框架匹配的权重

SGLang 和 vLLM 使用原始 checkpoint。安装好 Hugging Face CLI 并完成模型仓库所需的访问授权后,先只下载你要运行的任务族。下面命令下载 FL2VA 到当前目录的 MiniMax-H3

需要同时提供 FL2VA 和 Ref2VA 两个服务时,再下载两套:

不要把 diffusers 与原始 checkpoint 的下载方式混在一起。官方说明中,diffusers 可以通过 ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 按需获取组件;SGLang / vLLM 则使用上面的原始目录结构。

下载结束后,FL2VARef2VA 目录中应能看到 processortokenizertext_encodertransformervisual_vaeaudio_vae。缺少其中任一组件时,服务通常不能正确加载;重新检查下载过滤规则和磁盘空间。

Bash
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3
Bash
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3

用 SGLang 启动 FL2VA 服务

官方 SGLang 示例按模型仓库 ID 直接加载,并使用 4 张 GPU。要使用已下载的本地目录时,把 --model-path 改成该目录的绝对路径或当前目录下的 ./MiniMax-H3;其余参数保持和 FL2VA 模型一致:

服务成功后,30010 端口应处于监听状态,日志会显示模型加载和服务启动信息。此时先用仓库提供的 T2VA 或 FL2VA 可复现示例发一次请求,再接入自己的队列、Web UI 或业务接口。先验证一条官方场景,可以区分部署问题和提示词问题。

如果节点只应被内网服务访问,把 --host 0.0.0.0 配合安全组、反向代理或防火墙限制来源。不要把未鉴权的推理端口直接暴露到公网,也不要在启动日志、工单或截图中泄露平台 Token。

Bash
sglang serve \
  --model-path ./MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

需要参考素材时启动 Ref2VA

Ref2VA 是另一套任务权重,建议单独端口运行。官方示例端口为 30011:

把 FL2VA 请求发送到 Ref2VA,或反过来发送,都会让输入约束和模型变体不匹配。排查时先确认三件事:请求的模式、下载的 checkpoint 目录、--model-variant 是否都是同一个任务族。

想从图形界面开始测试,也可以采用官方列出的 ComfyUI 路径,使用其 H3 T2V 或 R2V 模板。ComfyUI 更适合交互式验证;需要长期提供 HTTP 服务、调度多卡资源或接入现有服务时,SGLang / vLLM 的服务化路径更直接。

Bash
sglang serve \
  --model-path ./MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30011 \
  --model-variant ref2va

为什么本地只有 768P,不是官方展示的 2K

这不是遗漏了一个分辨率开关。官方的完整系统分为三段:

因此,“权重已经下载完但效果和官方 2K Web 演示不同”通常不是安装失败。纯本地 H3-Base 的成功标准是生成符合提示词的 768P 音视频;想复现完整 2K 流程,需要把本地 SGLang 服务接到官方 H3-Context-IRH3-Regenerate-2K API,并配置 MiniMax 平台 Token。

官方给出的组合流程需要三个环境变量:本地 SGLang 服务地址、MiniMax API Base 和平台 Token。中国区 API Base 为 https://api.minimaxi.com,国际区为 https://api.minimax.io。Token 应放在部署系统的密钥管理或环境变量中,不要提交到仓库。

生产环境调用再生接口时,官方建议将本地生成的视频上传为受控的可访问 URL 并作为 base_video 传入,而不是长期通过 Base64 Data URL 传递大文件。这里要同时检查对象存储的过期时间、访问范围和用户素材授权,避免把参考媒体留在公开链接中。

H3-Context-IR解析、关联并整理复杂文本、图片、视频和音频上下文
H3-Base根据上下文生成 768P 音视频
H3-Regenerate-2K将 768P 结果和原始上下文再次生成到 2K
Bash
export SGLANG_DEPLOYMENT_URL="http://127.0.0.1:30010"
export MINIMAX_API_BASE="https://api.minimaxi.com"
export TOKEN="replace-with-platform-token"

服务启动不了或输出不对时先查哪里

服务加载后立即退出

先核对 GPU 数量与并行参数。官方示例是 --num-gpus 4--ulysses-degree 4 的组合;可见 GPU 数量、容器的 GPU 透传或分布式通信配置不满足时,先按 SGLang 的 H3 部署文档调整环境,再重启服务。不要只把 GPU 数改成 1 后继续沿用官方多卡配置并把错误归因给模型权重。

FL2VA 与 Ref2VA 请求报输入不匹配

先确认服务的 --model-variant。纯文本、首帧或首尾帧走 fl2va;图片、视频、音频等多模态参考走 ref2va。再检查下载目录中对应任务族是否完整。

本地输出只有 768P

这是 H3-Base 的设计范围。检查视频是否为 4 到 15 秒、24 FPS,且带有预期的立体声音轨;这些条件满足后,本地部署已经跑通。2K 需要进入 Context-IR、H3-Base、Regenerate-2K 三段组合流程,并使用官方 API。

输出被拦截或素材无法提交

官方流程会对文本、图片和视频进行自动审核,违法、色情或可能侵害第三方权利的内容可能被拦截。更换素材前先确认你拥有图片、视频、音频及人物肖像的使用权;不要尝试通过改写提示词绕过安全限制。

跑通后的验收结果

一次有效的本地验收应同时满足:

MiniMax H3 的开源部分已经足够用于搭建本地 768P 音视频生成和验证环境,但它不是“下载权重即可完整复刻网页 2K 成品”的单一模型。把 H3-Base 当作本地推理层,把上下文预处理和 2K 再生当作单独的服务依赖,部署、成本和素材治理都会更容易控制。

  • SGLang 服务在指定端口稳定监听,且没有在首个请求时因缺组件退出。
  • FL2VA 或 Ref2VA 与实际输入模式一致。
  • 生成结果为 4 到 15 秒、24 FPS 的视频,包含可播放的立体声音轨。
  • 输出较短边为约 768 像素时不被误判为部署失败。
  • 需要 2K 时,调用链中已明确包含官方 Context-IR 与 Regenerate-2K 服务,而不是将它们误当作可本地下载的权重。

参考来源

MiniMax H3 official repository and local deployment guideMiniMax GitHubMiniMax H3 release announcementMiniMaxMiniMax H3 deployment guideSGLang DocsMiniMax H3 Community License AgreementHugging Face

相关文章

7 个关键洞察:AI Coding 工具真正改变的不是写代码,而是验证代码智能编程 / 约 18 分钟Claude、GPT、Gemini 怎么选:AI Coding 任务分配和验证清单智能编程 / 约 12 分钟AI 编程开始按量计费后,团队终于得给每次 Agent 长跑算账了智能编程 / 约 11 分钟当 AI Agent 开始替人动手,企业最先缺的不是更强模型智能编程 / 约 9 分钟

作者信息