💬 观点Latent Space
[AINews] Black Forest Labs FLUX 3 - Multimodal Flow — FLUX 3 统一多模态模型发布,视频生成与机器人控制融合,开源数据集 Stac
FLUX 3 统一多模态模型发布,视频生成与机器人控制融合,开源数据集 Stack v3 刷新代码训练基线。
2026-07-24原文
本文为要点摘要,完整细节以原文为准。
- Black Forest Labs 发布 FLUX 3,统一图像、视频、音频和动作预测,声称同一架构可扩展至机器人领域,并推出 FLUX-mimic 视频-动作模型,在单 GPU 上实现通用灵巧操作,已在 Audi 测试。这意味着多模态生成模型正从内容创作走向物理世界控制,agent 的感知-行动循环可能被单一架构简化。
- The Stack v3 开源代码数据集发布,114TB、224M 仓库、5T tokens,C++/TypeScript/Rust 增长显著,为开放代码模型和网络防御提供基础设施。这降低了代码智能体的训练门槛,使中小团队能构建竞争性模型,无需依赖封闭生态。
- 蒸馏争议持续,多位专家认为不应严格区分预训练和输出蒸馏,开放权重和数据集是战略关键。这暗示 agent 工具链需关注模型来源的合规性,同时开放生态的丰富性将加速 agent 能力迭代。
原文:[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model · 作者 Latent Space