2026年6月4日星期四

字节开源Bernini模型 免费视频编辑修改替换控制天气

字节跳动最新开源模型Bernini,免费提供视频编辑、修改、替换功能,支持控制视频中的天气变换及色调调整。该模型采用语义规划器,在生成前先理解用户模糊描述,实现风格场景编辑、对象添加等操作。适用于AI视频创作者和爱好者,需较高电脑配置。模型地址可在评论区获取。

Tags:

要么是充,要么是买硬件,总有一个适合你。
前不久Omni,这次字节来了个bernini?这2个模型到底谁强?
Bernini语义规划器,能先理解再生成。
Omini全模态对话式编辑,一句话改视频,具体例子可看这篇:Omni
听起来,这俩完全不同,但,我觉得,其实是解决同一个问题。
还是老规矩,地址我放在评论区,需要的留言获取,我会逐一回复。
图片
都是让AI听得懂,我们想要的什么?
比如你跟AI说:把这个视频做的更有质感?或,我希望视频生成要有节奏该慢的慢,该快的快,可能有人会说,你这么写提示词的?
图片
我想说的是,我们大多数人描述视觉的语言,天生就是比较模糊,只不过我们为了生成的更准确,为了让AI更理解,逼着我们换了主观表达。
但,按照船长这么抽象的写,估计能把AI干抽搐,你这么想,那说明你悟了,这正是AI在不断加深理解的过程。
这一层,说的稍微技术点,叫翻译层,也是这2个模型,我认为共同的方向。
只是,他们选择了不同的技术路径而已。
所以,我们带着这个概念,再去看,Bernini效果怎么样?是否真的理解我们真正想要的东西?
比如:风格和场景编辑,它的理解,原视频:

编辑要求:用一条细细的黑色黏土线将画面一分为二;保留左侧的原有战争场景,并将右侧变成俄罗斯古典宫廷舞蹈黏土动画定格场景。

看着效果,我们接着接着代入我上面说的概念,那么Bernini,是怎么理解的?
专业点讲:它的处理方式,是在Diffusion模型前面,加了一个多模态大模型规划器,这听起来,是不是懵了?什么东西?
船长给你翻译成一句白话:就是在AI生成之前,先想清楚,再动手,是不是直接了点?听懂了,但脑子里没多少画面?咱们来加深下,毕竟船长主打的是胃饭式教程。
在来个例子:再看看它是怎么理解的?
原视频:它是怎么理解添加对象和色调调成的?

看看调整后的效果,提示词在视频中添加两个角色,并将视觉效果调整为温暖、浓郁的复古色调,带有金色和赭红色调。

其他的例子我就不放了,我只想告诉大家原理,懂这个才是最重要的,其余的其官网大家一看便知,不需要我多叭叭。
这种路径的弊端在哪?
会存在一个天然的局限,如果你超出了它本身理解的边界,它可能会直接替你做个决定,从而导致生成的不是自己想要的,这句话有点绕。
我举个例子,比如你提示词:让这个视频更有电影感,它的理解是,加上宽屏比例和加点色调,但你真实想要的是,镜头要有点节奏,而不是急促。
所以,这种靠语义的模式,我认为都会碰到这个瓶颈。
图片
再来说说Omni
它的解法不是生成前理解到位,而是进行多轮对话。
对,你理解的没错,就是反复不知道你什么意思,让你继续说,直到你崩溃来了句,山炮,AI,只知道你说什么,它改什么。
但是这有个好处,越改越准,如果不准,反思下自己,是不是加班少了?
图片
未来,编辑的价值是什么?
当生成变成一种低成本能力的时候,生成,本身不是壁垒,真正的壁垒而是,从N个版本里,找出最对的那个,并且知道把他改成能用的程度,这种就是AI学不会的,审美判断,情绪感知,品牌理解,所以,未来之前的,不是能用AI生成视频的人。
而是快速用AI生成100个版本,精准挑出最合适的,并且知道怎么调到完美的人,这种人,我管他叫——AI视频编辑师。
图片
怎么安装?可以跟你的AI深聊,可以共同探讨怎么安装。
图片
电脑配置要求:这是最佳配置,我看了下我的电脑,望尘莫及。
图片
开源精神,请字节继续保持,我觉得可以呱唧呱唧,鼓一下掌,如果能把seedance2开源,你就看我上不上高配就完了。
虽然苦梦久已,但你该说不说,你还得用,此处省略一万个XXX话,只希望,其他模型都给点力吧。
看到这里:希望留下你的关注,如果觉得不错,点个赞,推荐,转发三连。想进群的船员,可以打赏下,之后私我拉你。

没有评论:

发表评论

GPT-5。6全面评测对比Claude Fable5 性能跑分价格三档实测

OpenAI发布GPT-5.6三档模型Sol/Terra/Luna,输入价格低至1美元每百万token,性能在Agent长任务和浏览器操作上显著提升。对比Claude Fable5,智能跑分接近但代码修复仍有差距。实测前端生成和办公任务表现出色,macOS桌面端已开放,适合开发者...