现状
目前的主流视频模型在人物场景占位、镜头调度、打斗镜头,整体表现不太好。现有的解决方案就是使用一些 3D 软件进行预演,导出视频发给视频模型进行模仿生成。
遐想
如果能训练出一个比较廉价的白膜视频模型,能够使用提示词或结构化的数据(可以使用主流大模型生成)准取的处理完成白膜视频的预演。这样是不是就可以解决目前的问题。
问题
- 由于是现在视频模型的能力问题,但是后面肯定迭代这个能力问题肯定会被解决。
目前的主流视频模型在人物场景占位、镜头调度、打斗镜头,整体表现不太好。现有的解决方案就是使用一些 3D 软件进行预演,导出视频发给视频模型进行模仿生成。
如果能训练出一个比较廉价的白膜视频模型,能够使用提示词或结构化的数据(可以使用主流大模型生成)准取的处理完成白膜视频的预演。这样是不是就可以解决目前的问题。
1
andforce 7h 44m ago
|
4
levn 6h 50m ago
世界模型
|
5
Rorysky 6h 48m ago
你这个不就是 jev 的思路么? 输出简化
|
6
Rorysky 6h 48m ago
大有可为!
|
9
strobber16 4h 51m ago via Android
您是不是在找:DLSS5
|
10
cKnight OP @strobber16 之前在 gta 的视频中看到过这个,我瞅瞅
|