精选
已更新2026年9月3日
2 min read
UllrAI

fal H3 Max 详解:API、速度、价格与 H3 区别(2026)

fal H3 Max 支持文本、首尾帧和多模态参考输入,可生成 5–15 秒、带原生音频的 480p 或 768p 视频。本文梳理其 API、价格、速度实测依据,以及它与 H3、H3 Max Turbo 的区别。

H3 MaxMiniMax H3 Maxfal AIAI视频APIAI视频模型

fal H3 Max 是 fal 基于 MiniMax H3 继续训练、面向高速 480p 和 768p 音画生成推出的模型。 fal 于 2026 年 8 月 27 日正式开放文生视频和图生视频 API, 支持 5–15 秒时长、原生同步音频和可选尾帧。fal 称 5 秒 768p 视频的推理时间不到 3 秒;这里指模型推理时间,并不等同于包含排队和网络传输在内的实际等待时间。

这次更新尤其适合需要反复试镜头的制作流程:草稿生成快于视频本身的播放时长,团队便能在同样时间内比较更多运镜、动作和对白方案。不过,H3 Max 并不能完全取代标准 MiniMax H3。 H3 Max 最高输出 768p,而标准 H3 支持 2K 和视频编辑。本文首次发布后,fal 又上线了 H3 Max 参考生视频端点,并推出价格更低的 H3 Max Turbo

fal H3 Max速览

项目截至2026年9月3日的核验结果
发布日期2026年8月27日
开发方fal Research基于MiniMax H3进行后训练
fal模型IDminimax/h3-max/text-to-videoimage-to-videoreference-to-video
输入文本、首帧与可选尾帧;或最多12个图像、视频、音频混合参考
输出480p或768p、24 FPS、带原生同步音频的视频
时长5–15秒
文生视频比例21:9、16:9、4:3、1:1、3:4、9:16
图生视频比例跟随输入图片
官方公布推理速度5秒768p低于3秒;15秒视频约15秒
常规API价格480p每秒0.05美元;768p每秒0.08美元
端点显示的促销价480p每秒0.0125美元;768p每秒0.02美元,至9月7日
fal展示的免费额度登录用户每滚动24小时5次生成

H3 Max是什么?

H3 Max 是由 fal 托管的 MiniMax H3 后训练版本。fal 表示,团队加入了新的训练数据,并用自有强化学习框架改善提示词遵循、音画质量和视觉表现; 模型与自研推理引擎也经过协同优化,并非简单地把新权重接入通用推理服务。

两者的开发方和发布方式需要区分:MiniMax 开发了 H3 基础模型,fal 则开发并托管 H3 Max。此次公开的是 fal API,并不是可下载的 H3 Max 权重。 除非 fal 后续另行发布权重和许可证,否则不能因为 MiniMax H3 开放了权重,就认定 H3 Max 也可下载部署。

H3 Max这次发布了什么?

fal在8月27日公告中提出三项值得实测的变化:

  1. 速度: fal给出的后端去噪时间约为2.5秒,5秒768p视频推理低于3秒。
  2. 主观质量: fal 的内部人工评测显示,H3 Max 在整体偏好、提示词理解和视觉美感三项中均排名第一;对比范围包括 12 款主流视频模型。
  3. 可用性: H3 Max已上线fal Playground、Agent和API,并提供临时五折与每日免费沙盒额度。

速度数字只覆盖模型推理。真实应用还要计算提示词扩写、排队、素材上传、结果下载、Webhook和重试时间。fal文档说明,quality扩写模式本身最多可能花约30秒, balanced通常约增加1秒。

独立榜单是否支持质量第一的说法?

独立偏好数据在特定评测范围内支持这一结论,但不能代表所有制作场景。截至8月28日, Artificial Analysis带音频图生视频榜单将MiniMax H3 Max列为第一: Elo 1,202,置信区间±9,共5,322个样本。榜单会随新投票变化。

Design Arena图生视频榜单在fal引用的发布快照中也将H3 Max列为第一。 fal自有评测则通过两两人工比较衡量整体偏好、提示理解与美感,并用贝叶斯Elo汇总。

这些榜单回答的是“面对同一组测试输入,投票者更喜欢哪一个结果”。它们无法反映整集内容中的角色一致性、成片可编辑性、队列稳定性、安全过滤表现,也不能直接换算出每秒可用成片的成本。 生产选型仍应使用自己的剧本和参考资产做序列测试。

H3 Max API输入与输出

fal现在提供三个供应商模型ID。首发时预告的参考转视频端点已于9月3日确认上线:

工作流端点主要控制项
文本转视频minimax/h3-max/text-to-video提示词、时长、分辨率、画幅、种子、安全检查、提示词扩写
图像转视频minimax/h3-max/image-to-video提示词、首帧、可选尾帧、时长、分辨率、种子、安全检查、提示词扩写
参考转视频minimax/h3-max/reference-to-video提示词、有序图像/视频/音频参考、时长、分辨率、画幅、种子

三个端点都返回视频URL,也可能返回扩写后的提示词与timings.inference。后者记录后端去噪时间,而不是整次请求耗时。图生视频跟随首图比例;文生视频可选六种画幅。

参考端点合计最多接受12个文件。每段参考视频或音频需为2–15秒,视频总时长和音频总时长各自最多15秒;音频不能作为唯一参考模态。 素材在提示词中按顺序以Image 1Video 1Audio 1等名称引用。

当前 Schema 提供 balancedquality 两种扩写模式。需要快速迭代时,建议先用 balanced;只有在更细致的提示词改写值得多等约 30 秒时,再尝试 quality 返回的扩写提示词也应一并保存,便于复现和核对已采用的镜头。

最小JavaScript调用示例

FAL_KEY保留在服务端,并使用当前的@fal-ai/client

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("minimax/h3-max/text-to-video", {
  input: {
    prompt:
      "五秒中景,赛璐璐风格侦探走入雨夜小巷。镜头缓慢推进,风吹动外套和头发。声音:雨声、远处车流、一声清晰脚步。",
    duration: 5,
    resolution: "768P",
    aspect_ratio: "16:9",
    prompt_expansion_mode: "balanced",
  },
});

console.log(result.data.video.url);
console.log(result.data.timings?.inference);

生产环境建议按 fal 文档使用队列和 Webhook,避免长时间占用同步请求。每次生成至少保存模型 ID、请求 ID、原始提示词、扩写提示词、种子、调用时价格、输出 URL 和端到端耗时。

H3 Max多少钱?

截至9月3日,实时文生视频端点显示促销价为:480p每输出秒0.0125美元,768p每输出秒0.02美元。页面称75%折扣于9月7日结束, 之后常规价格分别为每秒0.05美元每秒0.08美元。fal已调整过首发优惠,做预算时应重新查看端点。

时长480p首发价480p常规价768p首发价768p常规价
5秒$0.0625$0.25$0.10$0.40
10秒$0.125$0.50$0.20$0.80
15秒$0.1875$0.75$0.30$1.20

fal的H3 Max落地页仍写首发五折,端点页目前则显示9月7日前减免75%,两处官方信息存在冲突。因此,提交任务时应以端点显示的实时价格为准。 落地页还称登录用户每滚动24小时可免费生成5次、单次最长15秒768p;免费政策也可能在不变更API版本的情况下调整。

生成单价不等于最终制作成本。预算还要算上无效结果、提示词扩写、素材上传、存储、审核、剪辑和最终放大。真正值得比较的是“每秒可用成片成本”,而不是单次生成的最低标价。

H3 Max和MiniMax H3有什么区别?

问题fal H3 Maxfal上的标准MiniMax H3
谁改进了模型fal对H3基础模型做后训练MiniMax发布基础模型
文档化优势5秒768p快于实时生成,提示遵循更强更高分辨率与更广泛多模态控制
分辨率480p或768p最高2K
时长5–15秒5–15秒
输入文本、首尾帧、有序图像/视频/音频参考文本、首尾帧、图像、视频和音频参考
编辑/参考端点参考转视频已上线;未记录H3 Max视频编辑端点已记录参考转视频与视频编辑工作流
音频原生同步音频原生立体声音频
接入方式fal托管端点托管端点,另有MiniMax H3基础权重发布

如果主要需求是快速出草稿、预览对白与声音、使用多模态参考、测试运镜或批量生成 768p 视频,可以优先试 H3 Max。需要 2K 或局部视频编辑时,标准 H3 更合适。 也可以用H3 Max打样、再把入选镜头交给H3或其他高分辨率模型,但必须验证二次生成是否保留已批准的动作与节奏。

如何用动态漫画场景测试H3 Max?

不要只用一条漂亮提示词判断模型。应构建能暴露观众可见问题的短序列:

  1. 对白特写: 单角色说一句短台词,指定情绪与安静室内环境声。
  2. 重复特写: 同一角色再次出现,检查面部、服装、配色与声音方向是否稳定。
  3. 双人镜头: 检查走位、视线、比例与说话顺序。
  4. 全身动作: 加入手部接触道具、明确运镜与清晰起止姿势。
  5. 竖屏版本: 把已批准镜头改为9:16,检查主体和关键动作是否丢失。
  6. 首尾帧过渡: 检查两张已批准分镜之间的路径是否符合物理与叙事逻辑。

每项都按固定指标评估:指令遵循、角色一致性、动作、构图、口型、声音、瑕疵、延迟和可用成片成本。再用多个种子观察波动。榜单只能帮助你缩小候选范围,连续镜头测试才能判断 H3 Max 是否适合整集制作。

AniKuku如何承接制作流程?

H3 Max解决单镜头生成,但不会管理剧本、拆分镜头、保存批准的角色参考,也不会记录某次生成属于哪一集。 AniKuku制作工作区把剧本、镜头表、角色与场景资产、分镜和输出版本放在模型调用前后的同一条流程中。

这种分层让模型测试更安全:先准备同一份镜头包,再让H3 Max和对比模型生成选定镜头,最后按同一制作简报审核。即使之后换模型,故事结构与已批准资产也不会困在某个供应商的生成历史里。

常见问题

H3 Max是MiniMax还是fal开发的?

fal基于MiniMax H3基础模型进行后训练,并结合fal推理栈优化,形成H3 Max。MiniMax开发的是底层H3基础模型。引用fal托管端点时,应保留minimax/h3-max/...完整模型ID。

H3 Max是开源或开放权重吗?

底层MiniMax H3基础模型已发布权重,但fal的H3 Max公告只提供托管API,没有宣布H3 Max检查点可下载。除非fal另行发布权重与许可证,否则应把H3 Max视为fal托管模型。

H3 Max能生成音频吗?

能。fal文档记录H3 Max原生生成同步音频,可包含提示词描述的对白、音乐、音效和环境声。实际使用前仍应针对目标语言、声音风格与镜头时长测试音质和口型。

H3 Max支持2K吗?

不支持。H3 Max支持480p与768p。fal建议需要2K或视频编辑时使用标准MiniMax H3。

H3 Max到底有多快?

fal称5秒768p视频推理低于3秒,示例响应的后端去噪时间约2.53秒。提示词扩写、排队、传输与业务处理会让用户看到的总时间更长。

H3 Max建议从什么设置开始?

建议从768p、5–10秒、balanced提示词扩写开始,这与fal给出的质量和延迟起点一致。需要更便宜草稿时测试480p;只有丰富改写值得额外等待时再用quality

H3 Max发布后又有哪些变化?

参考转视频端点已经上线;fal 还推出了独立的 H3 Max Turbo 文生视频和图生视频端点。Turbo 常规价格减半,官方示例也更快,但目前没有 Turbo 专用的多模态参考端点。 详见H3 Max Turbo指南

资料来源与核验日期

本文于2026年9月3日核验。价格、免费额度、榜单与端点会继续变化。

将创意转化为动画故事

在统一的工作空间中构建剧本、分镜清单、角色、分镜及动画场景。