黑森林实验室推出FLUX 3人工智能:抛弃静态图像,转向视频——以及机器人手。

CN
Decrypt
关注
3小时前

黑森林实验室于周四发布了FLUX 3,这是该公司旗舰模型首次生成视频,而不仅仅是静态图像。这家德国人工智能实验室以FLUX系列图像生成器而闻名,新的系统在一个共享系统内同时对图像、视频和音频进行了训练。


这就是所谓的多模态性:一个模型同时学习几种类型的信息,而不是将多个工具并排组合在一起。





视频部分是其主要特点。FLUX 3生成长达20秒的片段,并且在图像生成的同时产生音频,与屏幕上发生的内容同步——对话、音效、环境噪音。在早期评估中,人工评审在77%的面对面比较中更喜欢FLUX 3的输出,93%的比较中胜过Luma Ray 3.2。它似乎比Gemini Omni和Seedance略好,在52%的评估中击败了这些模型。




当然,这只是一个偏好测试,而不是固定的评分标准:评估者只是观看两个片段并选择看起来和听起来更具说服力的那个,BFL统计FLUX 3获胜的次数。


除此之外,该模型在静态图像方面似乎也非常有能力,延续了其之前的遗产。BFL分享了一些图像,FLUX 3似乎非常多才多艺,能够生成超越照片真实感的各种风格。


BFL将这视为一种超越内容工具的产品。“一个只学习图像的模型只能生成图像,”联合创始人兼首席执行官罗宾·隆巴赫表示。公司的赌注是,学习预测视频也意味着学习其背后的物理知识——重量、接触、时机——这正是机器在物理世界中移动所需要的。


这个赌注有个名字:FLUX-mimic。该技术与位于苏黎世的仿生机器人公司合作,利用FLUX 3的视频预测引擎,增加了一个轻量级的“解码器”——一个小型附加组件,将模型内部关于物体运动的感知翻译为实际的机器人动作。汽车制造商奥迪已经在测试诸如安装柔性门密封条等任务,这些任务是传统自动化难以处理的。




“奥迪代表了我们为FLUX-mimic打造的制造合作伙伴,”仿生联合创始人斯特凡-丹尼尔·格拉韦特说。奥迪的克里斯托夫·施奈德表示,这些机器人现在“解决复杂的软体操作工作”,而老旧的机器无法实现。BFL表示,整个系统的反应时间约为101毫秒,接近人类的视觉反射时间。


FLUX的崛起并非在真空中发生。黑森林实验室于2024年8月由帮助构建原始稳定扩散模型的资深研究人员创立,推出的Flux模型超越了MidJourney,优于稳定性的乏善可陈的稳定扩散3


开源的Flux Dev和Schnell模型获得了“Ai艺术家曾期待稳定扩散3.5最终重新夺回的最佳开源图像生成器”称号。


但它从未做到。FLUX 1.1 Pro在那年十月的人工分析图像领域中排名第一。不过,那不是开源的。


BFL于2025年11月发布了FLUX.2,但人气不如前。原始Flux所持有的开源王冠一直持续到阿里巴巴的Z-Image Turbo在2025年底将其推翻,能够在低端消费显卡上匹配其质量。“这就是SD3本应是的样子,”一位CivitAI用户当时写道。


FLUX 3是BFL的回归,目前还没有完全开放。视频和动作现在通过API和精选合作伙伴(包括仿生机器人)进行早期访问,图像生成将在“未来几周内”跟进,BFL表示。开放权重的Dev版本是BFL计划发布的唯一本地使用层级,预计要到2026年后期才能推出。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接