我又给 Codex 造了一个 Skill:动作视频,直接变游戏精灵

树懒的第264篇原创

用 AI 做 2D ACT,最痛苦的不是没有画面,而是画面进不了游戏。

现在的模型,已经能把角色做出很漂亮的攻击、跳跃和受击动作。可一段看起来很爽的 4 秒视频,仍然只是一段视频。

游戏真正需要的是透明序列帧、统一的脚底锚点、准确的播放帧率、命中时机、同步音效、Atlas,以及能直接导入引擎的资源包。

少一环,都没有用啊。

所以最近,我又给 Codex 造了一个新的 Skill:sloth-codex-video2sprite-skill。

它做的事情很直接:给它一张确认好的角色母图,再给它一段单动作视频,它负责把后面整条生产线跑完。

它不是“视频转 GIF”

这套 Skill 最终交付的不是一个动图,而是一组真正能进游戏的资产:透明逐帧 PNG、atlas.png、同步的 sfx.ogg、带声音的预览视频、动作时间信息、事件标记、质检结果,以及通用包或 Godot 的 SpriteFrames 资源。

最重要的是,它会保留有效动作区间里的原生帧率。

如果源视频是 24 FPS,快速挥剑、预备、命中、跟随和回收,就按 24 FPS 完整留下来。只去掉动作前后故意留出的静止等待,不再把一个高速动作平均抽成几张姿势图。

以前用动作表生成精灵,适合批量做小怪和 Boss。但主角的快速攻击、连招和复杂位移,几帧很容易丢掉力量和节奏。视频路线正好补上这一块,而且连动作原生音效也能一起保住。

这不是把视频切碎,而是把视频重新整理成游戏能够理解的时间、空间和声音。

真正难的,是每一帧都不能乱跳

视频切帧并不难。难的是切完之后,角色不能忽大忽小,脚底不能漂,武器不能一会儿长一会儿短,透明边缘也不能留下一圈脏色。

我们的做法不是逐帧重新居中、重新缩放,而是给整段动作只做一次固定画布变换。所有帧共用同一个尺寸、同一个位置规则和同一个 pivot,角色原本的动作幅度被保留下来,问题也不会被“自动修正”偷偷藏掉。

去背景也没有默认使用绿幕。Skill 会选择角色身上没有的深色哑光,只删除和画面边缘连通的背景区域。这样,角色衣服里接近背景色的封闭部分不会一起被抠掉,半透明边缘也会继续清理串色。

切完之后,机器会检查空帧、裁切、背景污染、锚点漂移、动作首尾差异、Atlas 几何、音频缺失和同步问题。

但程序检查全部通过,仍然不代表动作就能用。

角色像不像、出招有没有力量、武器方向对不对、声音和命中是否合拍,这些最后还是要人看。

我最喜欢的,是它直出的本地工作台

运行 review 后,Skill 会直接启动一个 localhost 工作台。

左边铺开这段动作的全部透明帧;右上角循环播放处理后的带声动作视频;右下角显示当前选中的放大单帧。点击任意帧,或者按左右方向键,就能一帧一帧检查动作,同时继续对照完整视频。

页面顶部还会标出当前是第几个 Sprite、总数、动作名和候选模型。哪怕截一张图,也知道自己正在看什么。

这个工作台故意没有评分、备注、通过和重做按钮。

因为机器可以检查文件,不能替人决定动作好不好。最后仍然由我在对话里说“用这个”或者“重做”,Skill 再把这次选择和当前产物的哈希绑定起来。换了视频、改了帧或重新处理,旧的通过结果就不能继续冒充新结果。

我很喜欢这个设计。

AI 负责把结果做到可检查,人负责做最后的审美和玩法判断。

下面就是主角在 review 工作台里的真实动作。每张 GIF 只对应一个动作:右上角持续播放完整动作,右下角的单帧也会缓慢向前切换。

这次不只挑四个例子。我把正式动作库里的 15 个运行时动作、2 个特殊技,以及独立空中剑气,一共 18 个动作全部放了进来。

基础移动

持剑呼吸

持剑起跑

持剑奔跑

持剑刹停

持剑转身

地面五连击

地面连击第一段

地面连击第二段

地面连击第三段

地面连击第四段

地面连击终结段

跳跃与空中攻击

原地直跳

向前跳跃

原地起跳动作

原地空中挥剑

前跳空中挥剑

特殊技与剑气

重斩

旋转四连击

先跑一个最难动作,再决定要不要批量

我第一次给主角跑关键动作时,光一轮素材大概就花了 50 元。

一个主角 50 元,还可以接受。但如果生产线没验证,就把几十个动作一起提交,错误也会跟着批量放大。

所以这套 Skill 默认先跑一个最难、最有代表性的付费样片。等它完成切帧、质检,并由用户明确选择“用这个”以后,才继续扩到其它动作。草稿档用来挑方向,最终采用的候选再用成品档重建。

输入没变时,处理会直接命中缓存,不重复解码、切帧和打包;同一张角色母图也会按指纹复用,避免因为重复命令再次计费。视频模型可以自己选择,Seedance 是支持路线,但不是唯一答案。我增加了 liblibtv 的 cli,也可以用 liblibtv 的会员用 h3 来生成。

两条精灵路线,现在终于接上了

前一套 my-codex-sprite-skill,从角色母版和动作表出发,适合稳定地批量生产角色。

这套 video-to-sprite,从角色母图和动作视频出发,更适合需要完整节奏、连续动作和原生声音的关键动画。

它们路线不同,但解决的是同一个问题:AI 能做出好看的素材,怎么让素材真正变成可复用、可验收、能进游戏的资产。

上次我说,做 Sprite Skill 不是让 AI 随便画几张图,而是让 AI 对“能不能进游戏”负责。

这次还是一样。

现在,一段动作视频,终于不只是能看了。

它可以真的走进游戏。

后记,如果显卡足够好,自己部署 minimax h3,朋友实测 3090 大概 3 分钟能出 4 秒样片。我看效果还是很不错的。

安装地址

https://github.com/jhwreal/sloth-codex-video2sprite-skill

本文转载自公众号「树懒的读书号」,原文:我又给 Codex 造了一个 Skill:动作视频,直接变游戏精灵,作者:树懒。版权归原作者所有,如有侵权请联系删除。


我又给 Codex 造了一个 Skill:动作视频,直接变游戏精灵
https://www.youxihun.top/archives/codex-skill-video-game-sprite
作者
闻君
发布于
2026年08月29日
许可协议