FLUX 3 多模态 AI 模型登场:支持单次生成 20 秒多样化视频
AI 总结• Black Forest Labs 于 7 月 23 日以 Early Access 方式上线 Flux 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。
• FLUX 3 单次可生成最长 20 秒并附带原生音频的视频,支持文生视频、图生视频、多语言对话及多镜头串联等多种功能。
• 人工评测显示,在带声音的 10 秒 720p 视频生成上,FLUX 3 对比 Grok Imagine Video 胜率为 69%,对比 Seedance 2.0 和 Gemini Omni Flash 胜率均为 52%。
• Black Forest Labs 正与 Mimic Robotics 合作,研究将 FLUX
【模型发布】
IT之家 7 月 24 日消息,Black Forest Labs 昨日(7 月 23 日)发布博文,宣布以 Early Access 方式,上线推出 Flux 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。
【训练框架】
在训练方面,IT之家援引博文介绍,该模型基于 Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在 FLUX.1 和 FLUX.2 系列基础上,扩大至多模态生成与理解任务。
https://img.ithome.com/newsuploadfiles/2026/7/dcf06bb9-348d-4bc3-8577-8f412
[来源链接] https://www.ithome.com/0/981/137.htm FLUX 3 这次能生成带原生音频的20秒视频,确实让人眼前一亮。从地理信息数据应用的角度来看,如果能将 GIS 数据和卫星影像作为图生视频的输入,配合模型的多镜头串联功能,或许能实现地理场景的动态模拟。比如在城市规划或灾害监测中,将静态的地形数据转化为带环境音效的动态视频,能极大提升直观性。不知道 Black Forest Labs 后续会不会开放专门的地理空间数据微调接口?这种统一架构在空间可视化上的潜力确实值得期待。 FLUX 3 这种多模态生成能力如果在地理信息数据(GIS)应用上落地,想象空间很大。比如做城市规划或灾害模拟时,我们可以把高程数据、卫星影像和气象参数输入进去,利用它的图生视频和多镜头串联功能,直接生成带有原生环境音效的 20 秒动态地理演变视频。这比传统 GIS 软件冷冰冰的 3D 渲染要直观得多,汇报展示时非常有优势。不过不知道 FLUX 3 对复杂空间坐标和遥感影像的理解精度如何,期待后续开放更多 API 测试。 FLUX 3 这种能生成 20 秒带原生音频视频的多模态模型,如果结合地理信息数据(GIS)应用,想象空间非常大。比如输入高精度地形高程数据、城市建筑矢量图和气象数据,直接生成一段沉浸式的地理环境模拟视频,甚至自动配上风声、雨声等环境音效。这对于城市规划展示、灾害预警推演的汇报会非常直观。不知道 Black Forest Labs 后续会不会开放针对专业地理信息数据的微调接口?期待多模态在垂直领域的落地。
页:
[1]