fal H3 Max 是 fal 基于 MiniMax H3 继续训练、面向高速 480p 和 768p 音画生成推出的模型。 fal 于 2026 年 8 月 27 日正式开放文生视频和图生视频 API, 支持 5–15 秒时长、原生同步音频和可选尾帧。fal 称 5 秒 768p 视频的推理时间不到 3 秒;这里指模型推理时间,并不等同于包含排队和网络传输在内的实际等待时间。
这次更新尤其适合需要反复试镜头的制作流程:草稿生成快于视频本身的播放时长,团队便能在同样时间内比较更多运镜、动作和对白方案。不过,H3 Max 并不能完全取代标准 MiniMax H3。 H3 Max 最高输出 768p,而标准 H3 支持 2K 和视频编辑。本文首次发布后,fal 又上线了 H3 Max 参考生视频端点,并推出价格更低的 H3 Max Turbo。
fal H3 Max速览
| 项目 | 截至2026年9月3日的核验结果 |
|---|---|
| 发布日期 | 2026年8月27日 |
| 开发方 | fal Research基于MiniMax H3进行后训练 |
| fal模型ID | minimax/h3-max/text-to-video、image-to-video、reference-to-video |
| 输入 | 文本、首帧与可选尾帧;或最多12个图像、视频、音频混合参考 |
| 输出 | 480p或768p、24 FPS、带原生同步音频的视频 |
| 时长 | 5–15秒 |
| 文生视频比例 | 21:9、16:9、4:3、1:1、3:4、9:16 |
| 图生视频比例 | 跟随输入图片 |
| 官方公布推理速度 | 5秒768p低于3秒;15秒视频约15秒 |
| 常规API价格 | 480p每秒0.05美元;768p每秒0.08美元 |
| 端点显示的促销价 | 480p每秒0.0125美元;768p每秒0.02美元,至9月7日 |
| fal展示的免费额度 | 登录用户每滚动24小时5次生成 |
H3 Max是什么?
H3 Max 是由 fal 托管的 MiniMax H3 后训练版本。fal 表示,团队加入了新的训练数据,并用自有强化学习框架改善提示词遵循、音画质量和视觉表现; 模型与自研推理引擎也经过协同优化,并非简单地把新权重接入通用推理服务。
两者的开发方和发布方式需要区分:MiniMax 开发了 H3 基础模型,fal 则开发并托管 H3 Max。此次公开的是 fal API,并不是可下载的 H3 Max 权重。 除非 fal 后续另行发布权重和许可证,否则不能因为 MiniMax H3 开放了权重,就认定 H3 Max 也可下载部署。
H3 Max这次发布了什么?
fal在8月27日公告中提出三项值得实测的变化:
- 速度: fal给出的后端去噪时间约为2.5秒,5秒768p视频推理低于3秒。
- 主观质量: fal 的内部人工评测显示,H3 Max 在整体偏好、提示词理解和视觉美感三项中均排名第一;对比范围包括 12 款主流视频模型。
- 可用性: H3 Max已上线fal Playground、Agent和API,并提供临时五折与每日免费沙盒额度。
速度数字只覆盖模型推理。真实应用还要计算提示词扩写、排队、素材上传、结果下载、Webhook和重试时间。fal文档说明,quality扩写模式本身最多可能花约30秒, 而balanced通常约增加1秒。
独立榜单是否支持质量第一的说法?
独立偏好数据在特定评测范围内支持这一结论,但不能代表所有制作场景。截至8月28日, Artificial Analysis带音频图生视频榜单将MiniMax H3 Max列为第一: Elo 1,202,置信区间±9,共5,322个样本。榜单会随新投票变化。
Design Arena图生视频榜单在fal引用的发布快照中也将H3 Max列为第一。 fal自有评测则通过两两人工比较衡量整体偏好、提示理解与美感,并用贝叶斯Elo汇总。
这些榜单回答的是“面对同一组测试输入,投票者更喜欢哪一个结果”。它们无法反映整集内容中的角色一致性、成片可编辑性、队列稳定性、安全过滤表现,也不能直接换算出每秒可用成片的成本。 生产选型仍应使用自己的剧本和参考资产做序列测试。
H3 Max API输入与输出
fal现在提供三个供应商模型ID。首发时预告的参考转视频端点已于9月3日确认上线:
| 工作流 | 端点 | 主要控制项 |
|---|---|---|
| 文本转视频 | minimax/h3-max/text-to-video | 提示词、时长、分辨率、画幅、种子、安全检查、提示词扩写 |
| 图像转视频 | minimax/h3-max/image-to-video | 提示词、首帧、可选尾帧、时长、分辨率、种子、安全检查、提示词扩写 |
| 参考转视频 | minimax/h3-max/reference-to-video | 提示词、有序图像/视频/音频参考、时长、分辨率、画幅、种子 |
三个端点都返回视频URL,也可能返回扩写后的提示词与timings.inference。后者记录后端去噪时间,而不是整次请求耗时。图生视频跟随首图比例;文生视频可选六种画幅。
参考端点合计最多接受12个文件。每段参考视频或音频需为2–15秒,视频总时长和音频总时长各自最多15秒;音频不能作为唯一参考模态。 素材在提示词中按顺序以Image 1、Video 1、Audio 1等名称引用。
当前 Schema 提供 balanced 和 quality 两种扩写模式。需要快速迭代时,建议先用 balanced;只有在更细致的提示词改写值得多等约 30 秒时,再尝试 quality。 返回的扩写提示词也应一并保存,便于复现和核对已采用的镜头。
最小JavaScript调用示例
把FAL_KEY保留在服务端,并使用当前的@fal-ai/client:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("minimax/h3-max/text-to-video", {
input: {
prompt:
"五秒中景,赛璐璐风格侦探走入雨夜小巷。镜头缓慢推进,风吹动外套和头发。声音:雨声、远处车流、一声清晰脚步。",
duration: 5,
resolution: "768P",
aspect_ratio: "16:9",
prompt_expansion_mode: "balanced",
},
});
console.log(result.data.video.url);
console.log(result.data.timings?.inference);
生产环境建议按 fal 文档使用队列和 Webhook,避免长时间占用同步请求。每次生成至少保存模型 ID、请求 ID、原始提示词、扩写提示词、种子、调用时价格、输出 URL 和端到端耗时。
H3 Max多少钱?
截至9月3日,实时文生视频端点显示促销价为:480p每输出秒0.0125美元,768p每输出秒0.02美元。页面称75%折扣于9月7日结束, 之后常规价格分别为每秒0.05美元与每秒0.08美元。fal已调整过首发优惠,做预算时应重新查看端点。
| 时长 | 480p首发价 | 480p常规价 | 768p首发价 | 768p常规价 |
|---|---|---|---|---|
| 5秒 | $0.0625 | $0.25 | $0.10 | $0.40 |
| 10秒 | $0.125 | $0.50 | $0.20 | $0.80 |
| 15秒 | $0.1875 | $0.75 | $0.30 | $1.20 |
fal的H3 Max落地页仍写首发五折,端点页目前则显示9月7日前减免75%,两处官方信息存在冲突。因此,提交任务时应以端点显示的实时价格为准。 落地页还称登录用户每滚动24小时可免费生成5次、单次最长15秒768p;免费政策也可能在不变更API版本的情况下调整。
生成单价不等于最终制作成本。预算还要算上无效结果、提示词扩写、素材上传、存储、审核、剪辑和最终放大。真正值得比较的是“每秒可用成片成本”,而不是单次生成的最低标价。
H3 Max和MiniMax H3有什么区别?
| 问题 | fal H3 Max | fal上的标准MiniMax H3 |
|---|---|---|
| 谁改进了模型 | fal对H3基础模型做后训练 | MiniMax发布基础模型 |
| 文档化优势 | 5秒768p快于实时生成,提示遵循更强 | 更高分辨率与更广泛多模态控制 |
| 分辨率 | 480p或768p | 最高2K |
| 时长 | 5–15秒 | 5–15秒 |
| 输入 | 文本、首尾帧、有序图像/视频/音频参考 | 文本、首尾帧、图像、视频和音频参考 |
| 编辑/参考端点 | 参考转视频已上线;未记录H3 Max视频编辑端点 | 已记录参考转视频与视频编辑工作流 |
| 音频 | 原生同步音频 | 原生立体声音频 |
| 接入方式 | fal托管端点 | 托管端点,另有MiniMax H3基础权重发布 |
如果主要需求是快速出草稿、预览对白与声音、使用多模态参考、测试运镜或批量生成 768p 视频,可以优先试 H3 Max。需要 2K 或局部视频编辑时,标准 H3 更合适。 也可以用H3 Max打样、再把入选镜头交给H3或其他高分辨率模型,但必须验证二次生成是否保留已批准的动作与节奏。
如何用动态漫画场景测试H3 Max?
不要只用一条漂亮提示词判断模型。应构建能暴露观众可见问题的短序列:
- 对白特写: 单角色说一句短台词,指定情绪与安静室内环境声。
- 重复特写: 同一角色再次出现,检查面部、服装、配色与声音方向是否稳定。
- 双人镜头: 检查走位、视线、比例与说话顺序。
- 全身动作: 加入手部接触道具、明确运镜与清晰起止姿势。
- 竖屏版本: 把已批准镜头改为9:16,检查主体和关键动作是否丢失。
- 首尾帧过渡: 检查两张已批准分镜之间的路径是否符合物理与叙事逻辑。
每项都按固定指标评估:指令遵循、角色一致性、动作、构图、口型、声音、瑕疵、延迟和可用成片成本。再用多个种子观察波动。榜单只能帮助你缩小候选范围,连续镜头测试才能判断 H3 Max 是否适合整集制作。
AniKuku如何承接制作流程?
H3 Max解决单镜头生成,但不会管理剧本、拆分镜头、保存批准的角色参考,也不会记录某次生成属于哪一集。 AniKuku制作工作区把剧本、镜头表、角色与场景资产、分镜和输出版本放在模型调用前后的同一条流程中。
这种分层让模型测试更安全:先准备同一份镜头包,再让H3 Max和对比模型生成选定镜头,最后按同一制作简报审核。即使之后换模型,故事结构与已批准资产也不会困在某个供应商的生成历史里。
常见问题
H3 Max是MiniMax还是fal开发的?
fal基于MiniMax H3基础模型进行后训练,并结合fal推理栈优化,形成H3 Max。MiniMax开发的是底层H3基础模型。引用fal托管端点时,应保留minimax/h3-max/...完整模型ID。
H3 Max是开源或开放权重吗?
底层MiniMax H3基础模型已发布权重,但fal的H3 Max公告只提供托管API,没有宣布H3 Max检查点可下载。除非fal另行发布权重与许可证,否则应把H3 Max视为fal托管模型。
H3 Max能生成音频吗?
能。fal文档记录H3 Max原生生成同步音频,可包含提示词描述的对白、音乐、音效和环境声。实际使用前仍应针对目标语言、声音风格与镜头时长测试音质和口型。
H3 Max支持2K吗?
不支持。H3 Max支持480p与768p。fal建议需要2K或视频编辑时使用标准MiniMax H3。
H3 Max到底有多快?
fal称5秒768p视频推理低于3秒,示例响应的后端去噪时间约2.53秒。提示词扩写、排队、传输与业务处理会让用户看到的总时间更长。
H3 Max建议从什么设置开始?
建议从768p、5–10秒、balanced提示词扩写开始,这与fal给出的质量和延迟起点一致。需要更便宜草稿时测试480p;只有丰富改写值得额外等待时再用quality。
H3 Max发布后又有哪些变化?
参考转视频端点已经上线;fal 还推出了独立的 H3 Max Turbo 文生视频和图生视频端点。Turbo 常规价格减半,官方示例也更快,但目前没有 Turbo 专用的多模态参考端点。 详见H3 Max Turbo指南。
资料来源与核验日期
本文于2026年9月3日核验。价格、免费额度、榜单与端点会继续变化。