AI 自主写游戏自动玩,最全大模型实测效果与费用对比

AA (aardio autos)今天发布的版本有较大改进。当其他 Agent 还在 Shell 命令行里苦苦挣扎读写文件出错,不小心清空了 C 盘等问题,在 AA里 AI 已经可以流畅地自主写游戏 …… 自己玩游戏了,全程自主操作。

最重要的是 AA 的运行环境只有几 MB,下载开箱即用。不需要任何复杂的配置,鼠标点几下就会用。最古老的 XP 电脑都能流畅运行(不需要安装任何其他东西)。

今天我们就顺手使用 AA 对全部主流模型做一次测试与对比。

以下是测试总结,位置靠上的模型效果更好,位置靠右费用成本更高。

DeepSeek 4 Pro

在 AA 新版里用 DeepSeek 4 Pro(推理强度=xhigh)“写个见缝插针”的效果如下图(GIF 画质受限,实际效果非常惊艳,吊打 Claude Fable 5 肯定没问题。测试过程的思考风格与平时差别很大,怀疑是撞到了什么隐藏实力的版本),本次测试费用 ¥0.88

GPT 5.6 Sol

AA 新版里 GPT 5.6 Sol(推理强度=max) “写个见缝插针” 的效果如下图,配色比上次的截图效果低调,但仅凭在内存里手绘就可以将 UI 细节做得很精致。本次测试费用 ¥16

DeepSeek 4 Flash

DeepSeek Flash(推理强度=max)在新版 AA 里测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.25

GPT 5.6 Luna

AA 最新版本中 GPT 5.6 Luna(推理强度=max) 测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.27

Gemini Flash 3.6

Gemini Flash 3.6(推理强度=high) 在 AA 新版中测试“写个见缝插针”的效果截图如下,测试费用 0 元(AI Studio 免费)。很多人以为 Gemini 弱 —— 这其实是很大的一个误解。Gemini 最大的问题就是不愿意调用工具(而 Agent 是一个勤能补拙的环境),例如这个任务,它调用了几次工具就立即交付代码了,有的模型调用几十次工具做得还不如它。

Kimi3

Kimi3(推理强度=max) 在 AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥4.2

Hy3

Hy3(推理强度=high)大模型在 AA 中AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.28

Doubao Seed Evolving

豆包家的最新模型是 Doubao Seed Evolving , 号称持续进化、滚动升级,高频迭代,没有版本号 …… 让我们也来试试它到底如何。

注意火山的 openai / responses 协议都存在不兼容的字段,我已经做了处理,请先升级到 aardio 最新版本。

AA 最新版 Doubao Seed Evolving 模型(推理强度=high)测试“写个见缝插针”的效果截图如下,本次测试费用 0 元(火山协作计划每天有几百万免费 tokens)。Doubao Seed Evolving 实际定价与 GLM 5.2 在同一梯队。

Claude Fable 5

Claude Fable 5(推理强度=xhigh) 在 AA 最新本测试“写个见缝插针”的效果截图如下,本次测试费用 ¥56 元。每一个像素都散发着美元烧焦的味道 。

GLM 5.2

GLM 5.2 (推理强度=high) 在 AA 最新本测试“写个见缝插针”的效果截图如下,本次测试费用 ¥5.8 元。有一个缺陷:绘图区覆盖了窗口标题栏。

Qwen 3.8 Max

Qwen 3.8 Max (推理强度=max), 在 AA 最新本测试“写个见缝插针”的思考时间有点长。估计超过了半小时,其他模型最多几分钟就完成任务),因为我想看看它想这么久到底会写出什么效果,所以一直等待没有点中止。最后输出的成果截图如下。本次测试费用 ¥12.62

展开阅读全文

更新时间:2026-08-11

标签:科技   模型   自主   费用   效果   游戏   测试   见缝插针   强度   截图   最新   新版

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top