fal H3 Max是基于MiniMax H3后训练、面向高速480p和768p音画生成的模型。 fal于2026年8月27日正式发布文本转视频与图像转视频API, 支持5–15秒时长、原生同步音频以及可选尾帧。fal称5秒768p视频的推理时间低于3秒;这是模型推理指标,不代表任何队列与网络条件下的端到端耗时都相同。
这次发布对迭代型制作很有价值:草稿能以快于实时的速度返回,团队就能在相同时间内审更多镜头、动作与对白方案。但H3 Max并非全面替代标准MiniMax H3。 首发版本最高为768p,而标准H3提供2K、多模态参考转视频和视频编辑能力。
fal H3 Max速览
| 项目 | 截至2026年8月28日的核验结果 |
|---|---|
| 发布日期 | 2026年8月27日 |
| 开发方 | fal Research基于MiniMax H3进行后训练 |
| fal模型ID | minimax/h3-max/text-to-video、minimax/h3-max/image-to-video |
| 输入 | 文本;或文本加首帧及可选尾帧 |
| 输出 | 480p或768p、24 FPS、带原生同步音频的视频 |
| 时长 | 5–15秒 |
| 文生视频比例 | 21:9、16:9、4:3、1:1、3:4、9:16 |
| 图生视频比例 | 跟随输入图片 |
| 官方公布推理速度 | 5秒768p低于3秒;15秒视频约15秒 |
| 常规API价格 | 480p每秒0.05美元;768p每秒0.08美元 |
| 端点显示的首发价 | 480p每秒0.025美元;768p每秒0.04美元,至9月1日 |
| fal展示的免费额度 | 登录用户每滚动24小时5次生成 |
H3 Max是什么?
H3 Max是fal托管的MiniMax H3后训练版本。fal表示,它加入了新的训练数据,并使用自有强化学习框架提升提示词遵循、音画质量和美感;同时围绕自研推理引擎 共同设计服务路径,而不是把新权重直接放进通用推理栈。
名称归属需要说清楚:MiniMax开发了H3基础模型,fal开发并托管H3 Max变体。发布资料宣布的是fal API上线,并未宣布H3 Max权重可下载。 除非fal另行发布权重与许可证,否则不能把底层MiniMax H3的开放权重状态自动套用到H3 Max。
H3 Max这次发布了什么?
fal在8月27日公告中提出三项值得实测的变化:
- 速度: fal给出的后端去噪时间约为2.5秒,5秒768p视频推理低于3秒。
- 偏好结果: fal内部人工评测把H3 Max列为整体偏好、提示理解和美感三项第一,对比对象包含12款主流视频模型。
- 可用性: H3 Max已上线fal Playground、Agent和API,并提供临时五折与每日免费沙盒额度。
速度数字只覆盖模型推理。真实应用还要计算提示词扩写、排队、素材上传、结果下载、Webhook和重试时间。fal文档说明,quality扩写模式本身最多可能花约30秒, 而balanced通常约增加1秒。
独立榜单是否支持质量第一的说法?
独立偏好数据在特定评测范围内支持这一结论,但不能代表所有制作场景。截至8月28日, Artificial Analysis带音频图生视频榜单将MiniMax H3 Max列为第一: Elo 1,202,置信区间±9,共5,322个样本。榜单会随新投票变化。
Design Arena图生视频榜单在fal引用的发布快照中也将H3 Max列为第一。 fal自有评测则通过两两人工比较衡量整体偏好、提示理解与美感,并用贝叶斯Elo汇总。
这些榜单回答的是“针对给定测试输入,投票者更喜欢哪个结果”。它们不能证明整集角色一致性、批准后的可编辑性、队列稳定性、安全过滤行为或每秒过审内容成本。 生产选型仍应使用自己的剧本和参考资产做序列测试。
H3 Max API输入与输出
首发提供两个供应商模型ID:
| 工作流 | 端点 | 主要控制项 |
|---|---|---|
| 文本转视频 | minimax/h3-max/text-to-video | 提示词、时长、分辨率、画幅、种子、安全检查、提示词扩写 |
| 图像转视频 | minimax/h3-max/image-to-video | 提示词、首帧、可选尾帧、时长、分辨率、种子、安全检查、提示词扩写 |
两个端点都返回视频URL,也可能返回扩写后的提示词与timings.inference。后者记录后端去噪时间,而不是整次请求耗时。图生视频跟随首图比例;文生视频可选六种画幅。
fal记录了disabled、balanced、quality三种提示词扩写模式。追求周转时建议从balanced开始;只有当更丰富的改写值得额外等待约30秒时再用quality。 应保存返回的扩写提示词,方便后续核查已通过的镜头。
最小JavaScript调用示例
把FAL_KEY保留在服务端,并使用当前的@fal-ai/client:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("minimax/h3-max/text-to-video", {
input: {
prompt:
"五秒中景,赛璐璐风格侦探走入雨夜小巷。镜头缓慢推进,风吹动外套和头发。声音:雨声、远处车流、一声清晰脚步。",
duration: 5,
resolution: "768P",
aspect_ratio: "16:9",
prompt_expansion_mode: "balanced",
},
});
console.log(result.data.video.url);
console.log(result.data.timings?.inference);
生产流量应按fal建议使用队列提交与Webhook,不要长期占住同步请求。每次结果至少保存模型ID、请求ID、原始提示词、扩写提示词、种子、提交时价格、输出URL和实际墙钟耗时。
H3 Max多少钱?
截至8月28日,实时文生视频端点显示首发价为:480p每输出秒0.025美元,768p每输出秒0.04美元。页面称促销于9月1日结束, 之后常规价格分别为每秒0.05美元与每秒0.08美元。
| 时长 | 480p首发价 | 480p常规价 | 768p首发价 | 768p常规价 |
|---|---|---|---|---|
| 5秒 | $0.125 | $0.25 | $0.20 | $0.40 |
| 10秒 | $0.25 | $0.50 | $0.40 | $0.80 |
| 15秒 | $0.375 | $0.75 | $0.60 | $1.20 |
fal的H3 Max落地页写“首14天五折”,端点页则明确写“9月1日结束”,两处官方信息存在冲突。因此,提交任务时应以端点显示的实时价格为准。 落地页还称登录用户每滚动24小时可免费生成5次、单次最长15秒768p;免费政策也可能在不变更API版本的情况下调整。
生成秒单价不等于制作成本。预算还要纳入废片、扩写耗时、上传、存储、审核、编辑和最终放大成本。真正应比较的是“每秒通过审核内容成本”,而不是第一次生成的最低标价。
H3 Max和MiniMax H3有什么区别?
| 问题 | fal H3 Max | fal上的标准MiniMax H3 |
|---|---|---|
| 谁改进了模型 | fal对H3基础模型做后训练 | MiniMax发布基础模型 |
| 文档化优势 | 5秒768p快于实时生成,提示遵循更强 | 更高分辨率与更广泛多模态控制 |
| 分辨率 | 480p或768p | 最高2K |
| 时长 | 5–15秒 | 5–15秒 |
| 首发输入 | 文本、首帧、可选尾帧 | 文本、首尾帧、图像、视频和音频参考 |
| 编辑/参考端点 | 参考转视频宣布稍后上线;首发无编辑端点 | 已记录参考转视频与视频编辑工作流 |
| 音频 | 原生同步音频 | 原生立体声音频 |
| 接入方式 | fal托管端点 | 托管端点,另有MiniMax H3基础权重发布 |
快速草稿循环、对白/声音预览、镜头运动测试和高吞吐768p生成适合先测H3 Max。需要2K、视频或音频参考、多素材身份控制或局部视频编辑时,标准H3更合适。 也可以用H3 Max打样、再把入选镜头交给H3或其他高分辨率模型,但必须验证二次生成是否保留已批准的动作与节奏。
如何用动态漫画场景测试H3 Max?
不要只用一条漂亮提示词判断模型。应构建能暴露观众可见问题的短序列:
- 对白特写: 单角色说一句短台词,指定情绪与安静室内环境声。
- 重复特写: 同一角色再次出现,检查面部、服装、配色与声音方向是否稳定。
- 双人镜头: 检查走位、视线、比例与说话顺序。
- 全身动作: 加入手部接触道具、明确运镜与清晰起止姿势。
- 竖屏版本: 把已批准镜头改为9:16,检查主体和关键动作是否丢失。
- 首尾帧过渡: 检查两张已批准分镜之间的路径是否符合物理与叙事逻辑。
每项都用固定指标评估:指令遵循、身份一致性、动作、构图、口型、声音、瑕疵、延迟和过审成本。用多个种子暴露波动。榜单只能决定先测谁,序列测试才能决定H3 Max是否适合整集流程。
AniKuku如何承接制作流程?
H3 Max解决单镜头生成,但不会管理剧本、拆分镜头、保存批准的角色参考,也不会记录某次生成属于哪一集。 AniKuku制作工作区把剧本、镜头表、角色与场景资产、分镜和输出版本放在模型调用前后的同一条流程中。
这种分层让模型测试更安全:先准备同一份镜头包,再让H3 Max和对比模型生成选定镜头,最后按同一制作简报审核。即使之后换模型,故事结构与已批准资产也不会困在某个供应商的生成历史里。
常见问题
H3 Max是MiniMax还是fal开发的?
fal基于MiniMax H3基础模型进行后训练,并结合fal推理栈优化,形成H3 Max。MiniMax开发的是底层H3基础模型。引用fal托管端点时,应保留minimax/h3-max/...完整模型ID。
H3 Max是开源或开放权重吗?
底层MiniMax H3基础模型已发布权重,但fal的H3 Max公告只提供托管API,没有宣布H3 Max检查点可下载。除非fal另行发布权重与许可证,否则应把H3 Max视为fal托管模型。
H3 Max能生成音频吗?
能。fal文档记录H3 Max原生生成同步音频,可包含提示词描述的对白、音乐、音效和环境声。实际使用前仍应针对目标语言、声音风格与镜头时长测试音质和口型。
H3 Max支持2K吗?
首发不支持。H3 Max支持480p与768p。fal建议需要2K、参考转视频或视频编辑时使用标准MiniMax H3。
H3 Max到底有多快?
fal称5秒768p视频推理低于3秒,示例响应的后端去噪时间约2.53秒。提示词扩写、排队、传输与业务处理会让用户看到的总时间更长。
H3 Max建议从什么设置开始?
建议从768p、5–10秒、balanced提示词扩写开始,这与fal给出的质量和延迟起点一致。需要更便宜草稿时测试480p;只有丰富改写值得额外等待时再用quality。
资料来源与核验日期
本文于2026年8月28日核验。价格、免费额度、榜单与端点会继续变化。