7 月 23 日,Black Forest Labs 发布 FLUX 3。最抓眼球的能力是:单次生成最长 20 秒视频,并且自带原生音频。

有人很快把它概括成“开源版 Veo / Sora 来了”。我觉得这句话喊早了。

截至发布时,FLUX 3 仍处于 Early Access。官方没有公布 API 价格,也没有承诺 FLUX 3 视频权重何时开放。Black Forest Labs 确实有发布开放权重模型的历史,但公司有 open-weight 产品,不等于新模型已经开源。把两件事揉成一句,会把最关键的问题带偏。

现在没法诚实回答“FLUX 3 每 20 秒多少钱”。价格表根本还没出来。

但这不妨碍我们先算另一笔更重要的账:它会不会把每个可用成片的总成本砍下来。

视频模型最会骗人的数字,是每秒生成价

AI 视频的报价通常按秒、按次或按积分展示,看起来很直观。问题是,创作者买的并不是“20 秒像素”,而是一条能发布的视频。

一条带声音的短片,至少包含几层成本:

  • 画面生成
  • 配音或角色对白
  • 对口型
  • 环境音和动作音效
  • 多镜头衔接
  • 角色与场景一致性
  • 失败重试和人工返工

如果一个模型只负责画面,标价再低,后面也要接语音模型、音效库、口型工具和剪辑软件。每多接一层,就多一次等待、多一次格式转换,也多一个失败点。

所以我不太关心 FLUX 3 最后会报“每秒几美分”还是“每段几美元”。我更关心一个更接近业务的公式:

每个可用成片成本 = 总生成与后期支出 ÷ 最终通过审核的成片数量。

再往内容生产里走一步,还可以看“每个可发布秒”的成本。抽卡十次才留下十秒,跟一次生成二十秒且大部分能用,完全不是同一门生意。

原生音频的价值,不是多一个功能勾选框

FLUX 3 把图像、视频和音频放在同一个架构里联合训练。官方说,它能从文本、图片或视频参考中生成最长 20 秒的带声音视频,支持文生视频、图生视频、视频续写、关键帧控制、多语言对话和多镜头序列。

“自带音频”听起来像功能列表里多了一行,其实它碰的是视频生产里最烦的一段接力。

传统拼装式工作流先生成画面,再做配音,再对口型,再补动作音效。四个模型各自都可能表现不错,合在一起却经常互相打架:嘴已经闭上,台词还没说完;杯子落地了,碎裂声晚半拍;镜头切到室外,室内混响还在。

FLUX 3 官方给了一个很能说明问题的数据:在 720p 带音频视频里,音频 token 不到总 token 的 0.5%。从训练负担看,视频预测才是大头,占 FLUX 3 总训练算力的 95% 以上。音频本身并不“贵”,难的是让声音与画面共享同一个因果关系。

这意味着原生音频真正可能省下来的,不是一次 TTS 调用,而是同步失败带来的整条链路返工

如果声音、嘴型、碰撞和环境变化能在一次生成里对齐,FLUX 3 即使单次 API 标价高于纯视频模型,最终每个可用成片也可能更便宜。反过来,如果原生音频经常要重做,那“一体化”只是把多个抽卡按钮合并成一个更大的抽卡按钮。

20 秒为什么比看起来更重要

20 秒并不长,离“一句话生成一部电影”还远。但对短视频广告、产品展示、人物对白、分镜预演和素材 B-roll 来说,它已经越过一个实用门槛。

很多模型能做出惊艳的 5 秒 demo,难点在于往后续。片段一短,创作者就要多生成几段,再处理镜头之间的人物、光线、服装、声音和节奏。时长从 5 秒涨到 20 秒,不只是输出长度变成四倍,也可能少掉三次拼接和三组一致性风险。

官方还说,多段序列可以用视觉参考保持角色一致,组合成数分钟内容。这个承诺要等真实使用验证,但方向很明确:BFL 想卖的不是一个更长的片段,而是一段更少需要外部工具补洞的连续素材。

官方早期评测里,FLUX 3 在 10 秒、720p、带音频的成对人工比较中,对 Grok Imagine Video 的偏好率最高到 69%,对 Kling v3 Pro 是 60%,对 Seedance 2.0 和 Gemini Omni Flash 都是 52%。它对 Runway Gen-4.5 和 Luma Ray 3.2 的数字更高,分别是 77% 和 93%。

这些结果只能说明早期样片有竞争力,不能直接推导生产成本。官方自己也强调模型和评测框架仍在开发。真正决定账单的数字还缺着:失败率、可用率、排队时间、并发限制、可编辑性,以及正式价格。

“开源会砍价”这件事,先别急着庆祝

BFL 对图像模型市场的影响,确实让人自然联想到开源降价。开放权重会带来本地部署、第三方托管、量化、蒸馏和工作流集成,供应商一多,价格通常就更难守住。

可 FLUX 3 目前没有走到这一步。

它现在是 Early Access,视频价格未公布,权重开放计划也未公布。所以今天更准确的说法是:一个有开放权重历史的厂商,把统一音视频模型推进到了早期访问阶段。 这会给 Veo、Sora、Runway、Kling 和 Seedance 施加压力,但压力来自能力路线和未来分发可能性,不是已经发生的开源价格战。

而且,就算未来开放权重,视频模型的价格也不会像小语言模型那样轻易跌到底。官方披露,视频预测吃掉了总训练算力的 95% 以上。推理端同样要搬运大量时空信息。权重免费不等于 GPU 免费,能下载不等于普通工作站跑得动。

开源真正能砍的,可能是三类费用:

  1. 平台溢价:第三方托管竞争会压缩封闭 API 的利润空间。
  2. 工作流税:ComfyUI 和各类自动化工具能把批处理、缓存、素材复用做得更细。
  3. 迁移成本:团队不必把素材、提示词和生产管线锁死在一个供应商里。

算力成本不会消失,但定价权会松动。这才是开源对 Veo 和 Sora 最现实的威胁。

FLUX 3 x mimic 暴露了更大的野心

同日发布的 FLUX 3 x mimic,让这件事更有意思。

BFL 与 mimic robotics 把 FLUX 3 的视频骨干接到机器人动作预测上,做成 FLUX-mimic,并在奥迪的生产任务中测试部署。加入动作预测后,视频生成质量最初下降最多 10%,经过 3500 个训练步骤又恢复到原水平。

这个结果说明,BFL 并不只想做一个“便宜的视频生成器”。它押的是同一个世界模型同时理解画面、声音和动作。内容生成负责模拟世界,机器人控制负责在世界里行动,两边共用一套底座。

对创作者来说,这条支线暂时不会让账单立刻下降。但它解释了 FLUX 3 为什么把视频训练看得那么重。视频模型如果真的学到了接触、重量、运动与因果关系,收益不只是一段更顺滑的广告片,还可能变成仿真、自动化和机器人训练的基础设施。

这也带来一个反直觉的商业可能:未来内容生成未必是 FLUX 3 最赚钱的业务。创作者 API 可能负责扩散和收集反馈,工业机器人与仿真才负责支付高毛利账单。若真走成这条路,视频 API 的价格反而有条件压得更低。

当然,这只是商业推演,不是 BFL 已公布的定价策略。

我会怎么判断它有没有真的砍价

等 FLUX 3 正式开放后,我不会先看发布会里的单次价格,而会测五个数:

  • 生成 100 条后,有多少条不经大改就能用
  • 一条可用视频平均重试几次
  • 原生音频有多少次需要重配、重对口型
  • 20 秒长片段与四个 5 秒片段,哪种方案的可用成片成本更低
  • 同一角色跨镜头时,人工修复要花多久

这五个数能回答它究竟是降本工具,还是更贵的 demo 机器。

我也会把它跟上一代工作流做同任务对比:同一段脚本、同一套参考图、同一条验收标准,分别跑 FLUX 3 一体化方案和“视频模型 + TTS + 口型 + 音效”的拼装方案。最后比较的不是生成按钮上的价格,而是从脚本到审核通过一共花了多少钱、多少分钟、多少次重做

这跟我昨天写 Opus 5 时的判断有点像:token 单价正在让位给 cost per task。到了视频这里,单位还要再换一次,从 cost per second 换成 cost per usable second

现在能下的结论

FLUX 3 会把 Veo 和 Sora 的价签砍到哪?现在没人能给出一个可信数字,BFL 自己都还没报价。

能确认的是,它把竞争从“谁能生成更漂亮的画面”推到了“谁能一次交付更完整的音视频素材”。20 秒、原生音频、多镜头与参考一致性如果在真实工作流里站得住,后期拼装和返工成本会被明显压缩。

至于“开源降价”,现在只能算一张期权,不能算已经兑现的事实。等权重、许可和正式价格公布,再谈它能不能把 Veo / Sora 的平台溢价打下来。

我更愿意先盯住那个不那么性感、却更诚实的指标:一百元预算,最后能留下多少秒真正敢发的视频。

参考链接