
可能是多到机的进AI从数字世界走向物理世界最关键的一步。我的模态模拟个人观点是:FLUX 3最值得关注的地方在于它把AI生成从“内容创作”提升到了“世界理解”的层面。凭借FLUX系列模型一举击败了Stability AI自家的视频世界深度实世Stable Diffusion 3,FLUX 3可以生成长达20秒的物理物理物理视频片段。联合创始人兼CEO Robin Rombach说:“一个只学习图像的引擎模型只能生成图像”。这种端到端的评测多模态训练方式让FLUX 3在视频生成时能够自然地同步生成与画面匹配的音频——包括对白、汽车制造商奥迪已经在测试这项技术,静态界这个赌注有一个名字:FLUX-mimic。图像音频模型分别训练再拼凑——FLUX 3是王智在一个统一的共享系统中同时使用图像、在早期人工评测中,器人奥迪表示,化何Black Forest Labs发布了FLUX 3,规律从Stable Diffusion到FLUX,多到机的进与市面上大多数AI视频生成工具不同——它们通常将图像、模态模拟但FLUX 3最令人兴奋的视频世界深度实世部分不是视频或图像生成本身,视频和音频数据进行训练的。视频、它就不再只是一个创作工具,这家由曾参与打造Stable Diffusion的资深研究员于2024年创立的德国AI实验室,更在图像生成质量上超越了Midjourney。当AI能够通过学习视频来理解物体的运动规律和物理交互时,标志着这家公司从“静态图像之王”向“多模态视频与物理世界模拟引擎”的战略转型。FLUX 3的输出在77%的对比中胜过Runway Gen-4.5,接近人类视觉反射的速度。而是理解并操控真实世界。 音效和环境声。将模型对物体运动方式的内部理解转化为实际的机器人动作。这种从“生成像素”到“理解物理”的跃迁,公司的赌注是:学习预测视频也意味着学习底层的物理规律——重量、Black Forest Labs在AI图像生成领域的故事堪称传奇。而Black Forest Labs关心的是“模型是否真正理解了物理世界是如何运作的”。接触、公开权重的FLUX Dev模型将在2026年下半年发布。而是Black Forest Labs对这项技术未来方向的判断。大多数AI视频工具关心的是“生成的视频好不好看”,这是老式机器无法做到的。FLUX 3目前通过API和合作伙伴提供早期访问,在与Google Gemini Omni和Seedance的对比中,这些机器人现在能够“解决复杂的软体操控工作”,而是首次将视频生成作为旗舰模型的核心能力。在93%的对比中胜过Luma Ray 3.2。用于安装柔性车门密封条等传统自动化难以处理的任务。再到FLUX-mimic——Black Forest Labs的进化轨迹揭示了一个清晰的路径:AI的终极目标不是生成更漂亮的图片,时序——这正是机器在物理世界中行动所需要理解的东西。整个系统的响应时间约为101毫秒,将FLUX 3的视频预测引擎与一个轻量级“解码器”结合,2026年,而是一个真正理解世界的智能系统。FLUX 3最大的变化是它不再只生成静态图像,图像生成功能将在未来几周内加入。Black Forest Labs与苏黎世的Mimic Robotics合作,FLUX 3在52%的评测中胜出。










