|
Sora是一款独特的视频生成工具,其工作原理深入浅出,值得我们深入了解。something new/old创始人brett goldstein在X上给大家拆解了Sora工作原理,通俗易懂。
Sora的工作原理结合了扩散模型和Transformer架构。扩散模型从噪声开始,逐渐精细化到所需的视频。而Transformer架构则负责处理连续的视频帧,确保视频中的动作流畅自然。
Sora的独特之处在于其处理视频生成的方法。它不是直接将文本转换为视频帧,而是依赖于所谓的“空间时间补丁”。这种方法不直接将文本转换为视频帧,而是处理空间(发生的事情)和时间(何时发生)的快照。这可以看作是微观视频拼图的每一小块。
通过这种方式,Sora将视频视为一个包含空间和时间维度的巨大立方体,然后再将其切割成更小的立方体,每个立方体代表空间和时间的片段。
剖析描述并确定了核心要素:
• 物体(盛开的花朵、阳光普照的窗台)
• 行动(随着时间的推移而增长)
• 位置(郊区环境)
• 甚至艺术风格(定格动画美学)
为了能够将这些补丁有意义地组合成一个连贯的视频,Sora利用了其内部的知识图谱。这些知识图谱包含了关于物理世界、对象如何相互作用,甚至包括不同艺术风格的信息。借助这些知识,Sora能够理解例如一朵花如何逐渐开放、如何与阳光互动以及如何保持停动画风格等复杂过程。
在视频生成的下一阶段,扩散模型开始对每个嘈杂、抽象的补丁进行处理,逐渐精细化,直至最终呈现出清晰的图像。而Transformer架构则负责分析时间跨度上补丁之间的关系,确保视频中的动作流畅自然,停动画风格在整个视频序列中保持一致。
尽管Sora能够执行各种与视频相关的任务,并展现出惊人的视频生成能力,但仍有一些挑战需要克服。例如,它在模拟一些基础物理互动的精确性方面还有待提高,有时会产生不自然的效果,如人物的手势看起来不够真实。尽管如此,Sora在视频生成技术方面展示了巨大的潜力,为未来的人工智能应用开辟了新的可能性。
当前新闻共有0条评论 | 分享到: |
|
||||||||||
评论前需要先 登录 或者 注册 哦 |
48小时新闻排行榜 | 更多>> |
1 | 中国疯传一则消息!越来越多渠道证实 |
2 | 中南海怂了 赶在年底突然宣布… |
3 | 马斯克重大信号突袭 |
4 | 中国曝光全球首架六代战机 马斯克这样评论 |
5 | 异常高调 胡春华或将接任这个要职 |
6 | 温家宝亲笔信释放敏感政治信号 |
7 | 公务员大幅降薪 “铁饭碗”难保 |
8 | 武汉房价跌的离谱 |
9 | 当下中国气氛何等肃杀!网传温家宝回信 |
10 | 韩国空难很可能指向一个可怕的结论 |
一周博客排行 | 更多>> |
1 | 孤勇者!真理往往掌握在少數人 | Winston Sm |
2 | 中国有私有产权吗? | 施化 |
3 | 每当看到这种场面,就觉得出国 | 旅泉 |
4 | 陈辉上将不可能是胡锦涛人马 | 胡亥 |
5 | 一地鸡毛/中央最新决定/你知道 | 体育老师 |
6 | 人不可貌相 | 云儿云儿 |
7 | 全聚德烤鸭倒闭了,全国高校思 | 体育老师 |
8 | 一条阴险恶毒的栽赃排华谣言 | 溪边树下 |
9 | 短诗三首 | 北极雪橇 |
10 | 苏联解体33周年:厘清一些中国 | 革命军中马 |
一周博文回复排行榜 | 更多>> |
1 | 中国有私有产权吗? | 施化 |
2 | 川普MAGA目标宏远脚踏实地.若 | 木秀于林 |
3 | 台奸是否已经泛滥 | 右撇子 |
4 | 台湾最佳防御 - 非军事化 | 山货郎 |
5 | 吉米卡特盖棺论定 | 施化 |
6 | 中国人群体性的十个恶习 | 汪翔 |
7 | 天之大棋 | 特有理 |
8 | 从“六福客栈”谈还原历史真相 | 老贫农 |
9 | 解禁"抖音",将成为 | must |
10 | 每当看到这种场面,就觉得出国 | 旅泉 |