
用 AI 做 2D ACT,最痛苦的不是没有画面,而是画面进不了游戏。
现在的模型,已经能把角色做出很漂亮的攻击、跳跃和受击动作。可一段看起来很爽的 4 秒视频,仍然只是一段视频。
游戏真正需要的是透明序列帧、统一的脚底锚点、准确的播放帧率、命中时机、同步音效、Atlas,以及能直接导入引擎的资源包。
少一环,都没有用啊。
所以最近,我又给 Codex 造了一个新的 Skill:
sloth-codex-video2sprite-skill。
它做的事情很直接:给它一张确认好的角色母图,再给它一段单动作视频,它负责把后面整条生产线跑完。

这套 Skill 最终交付的不是一个动图,而是一组真正能进游戏的资产:透明逐帧 PNG、atlas.png、同步的 sfx.ogg、带声音的预览视频、动作时间信息、事件标记、质检结果,以及通用包或 Godot 的 SpriteFrames 资源。
最重要的是,它会保留有效动作区间里的原生帧率。
如果源视频是 24 FPS,快速挥剑、预备、命中、跟随和回收,就按 24 FPS 完整留下来。只去掉动作前后故意留出的静止等待,不再把一个高速动作平均抽成几张姿势图。
以前用动作表生成精灵,适合批量做小怪和 Boss。但主角的快速攻击、连招和复杂位移,几帧很容易丢掉力量和节奏。视频路线正好补上这一块,而且连动作原生音效也能一起保住。
这不是把视频切碎,而是把视频重新整理成游戏能够理解的时间、空间和声音。
视频切帧并不难。难的是切完之后,角色不能忽大忽小,脚底不能漂,武器不能一会儿长一会儿短,透明边缘也不能留下一圈脏色。
我们的做法不是逐帧重新居中、重新缩放,而是给整段动作只做一次固定画布变换。所有帧共用同一个尺寸、同一个位置规则和同一个 pivot,角色原本的动作幅度被保留下来,问题也不会被“自动修正”偷偷藏掉。
去背景也没有默认使用绿幕。Skill 会选择角色身上没有的深色哑光,只删除和画面边缘连通的背景区域。这样,角色衣服里接近背景色的封闭部分不会一起被抠掉,半透明边缘也会继续清理串色。

切完之后,机器会检查空帧、裁切、背景污染、锚点漂移、动作首尾差异、Atlas 几何、音频缺失和同步问题。
但程序检查全部通过,仍然不代表动作就能用。
角色像不像、出招有没有力量、武器方向对不对、声音和命中是否合拍,这些最后还是要人看。
运行 review 后,Skill 会直接启动一个 localhost 工作台。
左边铺开这段动作的全部透明帧;右上角循环播放处理后的带声动作视频;右下角显示当前选中的放大单帧。点击任意帧,或者按左右方向键,就能一帧一帧检查动作,同时继续对照完整视频。
页面顶部还会标出当前是第几个 Sprite、总数、动作名和候选模型。哪怕截一张图,也知道自己正在看什么。

这个工作台故意没有评分、备注、通过和重做按钮。
因为机器可以检查文件,不能替人决定动作好不好。最后仍然由我在对话里说“用这个”或者“重做”,Skill 再把这次选择和当前产物的哈希绑定起来。换了视频、改了帧或重新处理,旧的通过结果就不能继续冒充新结果。
我很喜欢这个设计。
AI 负责把结果做到可检查,人负责做最后的审美和玩法判断。
下面就是主角在 review 工作台里的真实动作。每张 GIF 只对应一个动作:右上角持续播放完整动作,右下角的单帧也会缓慢向前切换。
这次不只挑四个例子。我把正式动作库里的 15 个运行时动作和 2 个特殊技,一共 17 个动作全部放了进来。
基础移动
持剑呼吸

持剑起跑

持剑奔跑

持剑刹停

持剑转身

地面五连击
地面连击第一段

地面连击第二段

地面连击第三段

地面连击第四段

地面连击终结段

跳跃与空中攻击
原地直跳

向前跳跃

原地起跳动作

原地空中挥剑

前跳空中挥剑

特殊技
重斩

旋转四连击

我第一次给主角跑关键动作时,光一轮素材大概就花了 50 元。
一个主角 50 元,还可以接受。但如果生产线没验证,就把几十个动作一起提交,错误也会跟着批量放大。
所以这套 Skill 默认先跑一个最难、最有代表性的付费样片。等它完成切帧、质检,并由用户明确选择“用这个”以后,才继续扩到其它动作。草稿档用来挑方向,最终采用的候选再用成品档重建。
输入没变时,处理会直接命中缓存,不重复解码、切帧和打包;同一张角色母图也会按指纹复用,避免因为重复命令再次计费。视频模型可以自己选择,Seedance 是支持路线,但不是唯一答案。我增加了 liblibtv 的 cli,也可以用 liblib 的会员用 h3 来生成。
还有一条我很在意:图片、视频、音频、Base64 和服务商完整响应,都不会进入 Codex 对话。媒体只在本地路径和受控 worker 之间流动,Codex 看到的只是哈希、状态和小型质检摘要。
这不是为了把流程搞复杂。
是因为一个真正能反复跑的生产工具,除了效果,还要管成本、隐私、缓存、失败和验收。
前一套 my-codex-sprite-skill,从角色母版和动作表出发,适合稳定地批量生产角色。
这套 video-to-sprite,从角色母图和动作视频出发,更适合需要完整节奏、连续动作和原生声音的关键动画。
它们路线不同,但解决的是同一个问题:AI 能做出好看的素材,怎么让素材真正变成可复用、可验收、能进游戏的资产。
上次我说,做 Sprite Skill 不是让 AI 随便画几张图,而是让 AI 对“能不能进游戏”负责。
这次还是一样。
现在,一段动作视频,终于不只是能看了。
它可以真的走进游戏。

后记,如果显卡足够好,自己部署 minimax h3,朋友实测 3090 大概 3 分钟能出 4 秒样片。我看效果还是很不错的。
https://github.com/jhwreal/sloth-codex-video2sprite-skill
更新时间:2026-08-06
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号