黑森林实验室发布FLUX 3多模态流模型,击败Seedance 2.0、Gemini Omni和Grok Imagine
黑森林实验室推出FLUX 3,一个统一的多模态模型,涵盖图像、视频、音频和动作预测,在多项基准上超越竞争对手,并展示了向机器人领域迁移的能力。
[AINews] 黑森林实验室 FLUX 3 - 多模态流模型击败 Seedance 2.0、Gemini Omni 和 Grok Imagine,以及 FLUX-mimic 视频动作机器人模型BFL 取得巨大胜利!
周四是 AI 发布最密集的日子,尽管 OpenAI 在推出新的 ChatGPT Voice(面向消费者)和 OpenAI Presence(面向企业)方面战胜了 Anthropic,并且今天比 Claude Voice 获得了更多曝光(我们确信这完全是时间上的巧合),
但两者似乎都不如 BFL 今天发布的 FLUX 3 Video 具有里程碑意义:
我们上次报道 BFL 是在广受好评的 Anjney Midha 播客中:大多数 GenMedia 人士都会记得 BFL 在 2024 年首次推出 Flux 1 时的主页,其标志位于森林中,并暗示接下来将推出视频模型。
两年后,它终于成为现实:这篇博文概述了 Self Flow,涵盖了所有模态,并提出了强烈的性能主张:“其核心能力包括以下内容(所有输出均带有原生音频生成):文本到视频生成。图像到视频生成,可以从起始帧继续(“动画”)或使用图像作为视觉参考。
从参考片段进行视频到视频生成,将源视频的核心元素(例如相同角色)带入新场景或上下文中。从输入视频和音频生成视频音频延续。关键帧到视频生成,用于在定义的时刻之间进行受控过渡。多语言对话。
广泛的视觉风格和宽高比,远远超出传统的电影输出。将单个片段智能链接成更长的多镜头序列。高风格多样性——FLUX 3 Video 轻松处理从手持摄像机镜头到动画和电影等各种风格。强大的文字生成和动画设计。
”上述部分功能是其他前沿实验室模型的 SOTA 特性,正如我们在 Grok Imagine 播客中讨论的那样,因此社区已经注意到,这些能力现在已被独立地、或许是 SOTA 地复现,并且开放权重的 Dev 版本即将推出。
仿佛这次发布还不够,团队还宣布了 FLUX3-mimic,这证明了 FLUX 3 模型正在学习足够的世界模型来驱动机器人…………并预测它们在真实工厂环境中的影响……2026年7月22日至23日的 AI 新闻。
我们检查了12个子版块、544条推文,没有进一步的 Discord 消息。AINews 网站允许您搜索所有过往期刊。提醒您,AINews 现在是 Latent Space 的一部分。您可以选择加入/退出邮件频率!
AI Twitter 回顾开放代码、开放模型以及围绕蒸馏的政策分歧Stack v3 是当天最重要的开放数据发布:@anton_lozhkov 宣布了 The Stack v3,这是目前公开发布的最大开放代码数据集:114 TB 原始数据、2.24 亿个仓库、
440 亿个文件、770 种语言,以及大约 5 万亿去重/过滤后的 token。
与 v2 相比,过滤后的语料库从约 5500 亿 token 跃升至约 5 万亿 token,其中 C++(增长15倍)、TypeScript(增长7.5倍)、Rust(增长7倍)和 Python(增长4.8倍)增长尤为显著。
值得注意的操作变化是,v3 以内联方式提供内容而非 Software Heritage ID,包含截至2025年8月的新 GitHub 重新抓取,排除了限制性许可代码,并提供了即用型训练拆分和用于自定义去重/过滤的完整桶。
Hugging Face 的研究人员明确将其定位为下一代开放代码模型和网络防御工具的基础设施:参见 @LoubnaBenAllal1、@lvwerra 以及 @eliebakouch 的评论,指出之前的 Stack 版本已被用于许多公开的代码模型训练混合中。
蒸馏仍然是活跃的意识形态分歧线:几条高信号帖子反驳了将“互联网规模预训练”与输出级蒸馏截然分开的尝试。@GergelyOrosz 将通过提示词进行模型检查比作逆向工程竞争对手的产品,而 @SchmidhuberAI 则强调了蒸馏的悠久历史。
@Suhail 认为,实际的应对措施不是禁止,而是加大对开放权重国内模型的投资,@garrytan 说得更简单:开放权重具有战略重要性。
这些帖子的潜台词是,像 The Stack v3 这样的开放数据集极大地提高了每个希望在不依赖封闭生态系统的情况下构建有竞争力代码模型的实验室的基准。
多模态前沿:FLUX 3、机器人迁移以及新的音频/TTS 系统黑森林实验室的 FLUX 3 将多模态前沿扩展到图像/视频之外:@bfl_ai 推出了 FLUX 3,这是一个统一的多模态模型,涵盖图像、视频、音频和动作预测,FLUX 3 Video 提供早期访问,
并明确声称相同的架构可以扩展到机器人领域。团队成员将其与早期的 Self-Flow 研究联系起来,包括 @hila_chefer 和 @robrombach。技术上的关键在于统一的训练故事:不是一个松散的专业生成器家族,而是一个旨在连接媒体生成和控制的单一架构。
mimic 的 FLUX-mimic 是该论点的具体机器人实例化:@mimicrobotics 将 FLUX-mimic 描述为基于 FLUX 3 构建的视频动作模型,在机器人和可穿戴数据上训练,以实现通用灵巧操作,并可在单个本地 GPU 上部署。
他们的核心主张是,更好的视频世界建模直接转化为机器人控制质量和样本效率;他们已经在与奥迪进行测试。
这与 @GeneralistAI 不谋而合,其 GEN-1 现在支持多种末端执行器,并且可以在“手”在部署过程中发生变化时进行适应,这强化了这样一种观点:通用具身策略可能来自对形态的条件化,而不是针对每个操作器进行专门化。
音频方面有两个值得注意的发布,分别位于堆栈的两端:@Alibaba_Qwen 推出了 Qwen-Audio-3。
0-TTS 的 Flash 和 Plus 变体,支持16种语言,内联控制标签如[whisper]/[angry],自然语言风格引导,噪声参考鲁棒性,以及长达3分钟的一次生成;他们还声称在 Artificial Analysis TTS 排行榜上排名第一。
另外,@HuggingApps 强调了 WordVoice TTS,这是一个较小的模型,支持对每个词的时长、响度、音高和语调进行控制——与其说是排行榜上的竞争,不如说是音频工具的控制面实验。
智能体基础设施:Harnesses、动态工作流、程序化记忆和基准测试重心正在从提示词转向 harnesses:多条推文汇聚到同一个工程论点上。@unclebobmartin 描述了一种“极端约束”工作流,其中信任来自测试、QA、突变测试和指标,而不是手动代码审查。
@ThePrimeagen 表示他对 AI 编码工作流的态度变得更加积极,尤其是对于大型结构重构。@TheTuringPost 提出了更清晰的系统观点:“图工程”大多只是旧软件架构的重新命名,大多数智能体仍然不需要复杂的图,除非工作流需要分支、验证或人工审批。
几个具体的 harness/编排发布脱颖而出:@omarsar0 总结了 Harness Handbook 论文,该论文将运行时行为映射到源代码位置,提高了编码智能体的规划成功率,同时减少了规划器的 token 使用量。
同一位作者还将动态工作流描述为对循环/图/路由器模式的通用抽象,可以支持模型委员会、顾问-法官-执行者设置以及跨 Claude/Codex/Hermes 等的多后端编排。
@witcheer 发布了 Hermes Profiles,实际上是命名空间的智能体实例,具有独立的内存、API 密钥、会话、网关和导出/导入路径——这是务实的智能体生命周期基础设施,而非模型创新。
@davidfowl 还宣布了微软 VS Code 智能体应用程序的新协议。记忆和协调正在变得更加形式化:@dair_ai 强调了 PRO-LONG,一种“程序化记忆”方法,它存储完整的结构化交互历史,并像数据库一样查询它们。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。