我又给 Codex 造了一个 Skill:动作视频,直接变游戏精灵

用 AI 做 2D ACT,最痛苦的不是没有画面,而是画面进不了游戏。

现在的模型,已经能把角色做出很漂亮的攻击、跳跃和受击动作。可一段看起来很爽的 4 秒视频,仍然只是一段视频。

游戏真正需要的是透明序列帧、统一的脚底锚点、准确的播放帧率、命中时机、同步音效、Atlas,以及能直接导入引擎的资源包。

少一环,都没有用啊。

所以最近,我又给 Codex 造了一个新的 Skill:
sloth-codex-video2sprite-skill

它做的事情很直接:给它一张确认好的角色母图,再给它一段单动作视频,它负责把后面整条生产线跑完。

它不是“视频转 GIF”

这套 Skill 最终交付的不是一个动图,而是一组真正能进游戏的资产:透明逐帧 PNG、atlas.png、同步的 sfx.ogg、带声音的预览视频、动作时间信息、事件标记、质检结果,以及通用包或 Godot 的 SpriteFrames 资源。

最重要的是,它会保留有效动作区间里的原生帧率。

如果源视频是 24 FPS,快速挥剑、预备、命中、跟随和回收,就按 24 FPS 完整留下来。只去掉动作前后故意留出的静止等待,不再把一个高速动作平均抽成几张姿势图。

以前用动作表生成精灵,适合批量做小怪和 Boss。但主角的快速攻击、连招和复杂位移,几帧很容易丢掉力量和节奏。视频路线正好补上这一块,而且连动作原生音效也能一起保住。

这不是把视频切碎,而是把视频重新整理成游戏能够理解的时间、空间和声音。

真正难的,是每一帧都不能乱跳

视频切帧并不难。难的是切完之后,角色不能忽大忽小,脚底不能漂,武器不能一会儿长一会儿短,透明边缘也不能留下一圈脏色。

我们的做法不是逐帧重新居中、重新缩放,而是给整段动作只做一次固定画布变换。所有帧共用同一个尺寸、同一个位置规则和同一个 pivot,角色原本的动作幅度被保留下来,问题也不会被“自动修正”偷偷藏掉。

去背景也没有默认使用绿幕。Skill 会选择角色身上没有的深色哑光,只删除和画面边缘连通的背景区域。这样,角色衣服里接近背景色的封闭部分不会一起被抠掉,半透明边缘也会继续清理串色。

切完之后,机器会检查空帧、裁切、背景污染、锚点漂移、动作首尾差异、Atlas 几何、音频缺失和同步问题。

但程序检查全部通过,仍然不代表动作就能用。

角色像不像、出招有没有力量、武器方向对不对、声音和命中是否合拍,这些最后还是要人看。

我最喜欢的,是它直出的本地工作台

运行 review 后,Skill 会直接启动一个 localhost 工作台。

左边铺开这段动作的全部透明帧;右上角循环播放处理后的带声动作视频;右下角显示当前选中的放大单帧。点击任意帧,或者按左右方向键,就能一帧一帧检查动作,同时继续对照完整视频。

页面顶部还会标出当前是第几个 Sprite、总数、动作名和候选模型。哪怕截一张图,也知道自己正在看什么。

这个工作台故意没有评分、备注、通过和重做按钮。

因为机器可以检查文件,不能替人决定动作好不好。最后仍然由我在对话里说“用这个”或者“重做”,Skill 再把这次选择和当前产物的哈希绑定起来。换了视频、改了帧或重新处理,旧的通过结果就不能继续冒充新结果。

我很喜欢这个设计。

AI 负责把结果做到可检查,人负责做最后的审美和玩法判断。

下面就是主角在 review 工作台里的真实动作。每张 GIF 只对应一个动作:右上角持续播放完整动作,右下角的单帧也会缓慢向前切换。

这次不只挑四个例子。我把正式动作库里的 15 个运行时动作和 2 个特殊技,一共 17 个动作全部放了进来。

基础移动

持剑呼吸

持剑起跑

持剑奔跑

持剑刹停

持剑转身

地面五连击

地面连击第一段

地面连击第二段

地面连击第三段

地面连击第四段

地面连击终结段

跳跃与空中攻击

原地直跳

向前跳跃

原地起跳动作

原地空中挥剑

前跳空中挥剑

特殊技

重斩

旋转四连击

先跑一个最难动作,再决定要不要批量

我第一次给主角跑关键动作时,光一轮素材大概就花了 50 元。

一个主角 50 元,还可以接受。但如果生产线没验证,就把几十个动作一起提交,错误也会跟着批量放大。

所以这套 Skill 默认先跑一个最难、最有代表性的付费样片。等它完成切帧、质检,并由用户明确选择“用这个”以后,才继续扩到其它动作。草稿档用来挑方向,最终采用的候选再用成品档重建。

输入没变时,处理会直接命中缓存,不重复解码、切帧和打包;同一张角色母图也会按指纹复用,避免因为重复命令再次计费。视频模型可以自己选择,Seedance 是支持路线,但不是唯一答案。我增加了 liblibtv 的 cli,也可以用 liblib 的会员用 h3 来生成。

还有一条我很在意:图片、视频、音频、Base64 和服务商完整响应,都不会进入 Codex 对话。媒体只在本地路径和受控 worker 之间流动,Codex 看到的只是哈希、状态和小型质检摘要。

这不是为了把流程搞复杂。

是因为一个真正能反复跑的生产工具,除了效果,还要管成本、隐私、缓存、失败和验收。

两条精灵路线,现在终于接上了

前一套 my-codex-sprite-skill,从角色母版和动作表出发,适合稳定地批量生产角色。

这套 video-to-sprite,从角色母图和动作视频出发,更适合需要完整节奏、连续动作和原生声音的关键动画。

它们路线不同,但解决的是同一个问题:AI 能做出好看的素材,怎么让素材真正变成可复用、可验收、能进游戏的资产。

上次我说,做 Sprite Skill 不是让 AI 随便画几张图,而是让 AI 对“能不能进游戏”负责。

这次还是一样。

现在,一段动作视频,终于不只是能看了。

它可以真的走进游戏。

后记,如果显卡足够好,自己部署 minimax h3,朋友实测 3090 大概 3 分钟能出 4 秒样片。我看效果还是很不错的。

安装地址

https://github.com/jhwreal/sloth-codex-video2sprite-skill

展开阅读全文

更新时间:2026-08-06

标签:游戏   精灵   动作   视频   角色   工作台   地面   完整   批量   质检   路线

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top