AI伴侣真能陪你玩游戏了

简单说:我们要打造一个超强、进阶版的游戏伙伴,用起来真的爽。

现在已有多个框架能让大语言模型(LLM)控制NPC对话。它们在角色扮演和保持人设方面很棒,但有两个老问题:世界交互能力弱和延迟高。它们擅长说话,但在执行动作上远不够可靠,处理复杂指令集更是糟糕。你可能也注意到,热门的AI NPC演示常常在玩家说话和AI回复之间切换镜头,试图掩盖延迟。我们能做得更好吗?

要实用且即时。它应该能战斗、捡东西、搜刮、检查、携带和递送物品等等,能遵循复杂的多步指令,不显得笨拙或像实验品。这在VR中尤其重要,因为那里菜单导航繁琐且破坏沉浸感。它必须快,非常快,不只是快一点。

要鲜活且在场。它应该有有趣、讨喜的个性,而不是死板的预设回复。记住共享经历并随时间变化。会话运行时麦克风保持开启:你不是通过对话菜单召唤Varkos,而是直接跟他说话。当沉浸感来袭时,应该感觉你不是一个人在玩。

在可行的地方尽量本地化和保护隐私。房间里的大象是,云端LLM调用可能相当昂贵(尤其是数千token的调用),而且增加的延迟可能毁掉体验。为什么要把一个私人的单机游戏变成按量计费且被监控的体验?让我们尽量把控制权交给用户(额外好处是,这是个有趣的技术挑战)。

本质上:一个单机游戏,但你并不孤单。

Varkos能处理超出单一即时动作的命令。计划可以等待事件,在步骤间保留目标,监控进度,并在世界状态变化时修复或停止。没有任何预脚本。

Varkos收到一个涉及下一支箭的条件指令。他注册未来触发器而不是立即行动,等待相关的投射物命中,然后继续计划。

“我想让你在这里等着,我去那边。一旦你看到信号——信号就是我向天空射出的箭——我希望你拿起这瓶药水,然后过来把它交给我。明白吗?”

Varkos能搜索游戏世界状态中请求的物品,识别其位置,并根据游戏中实际存在的东西做出回应。

“你看到那把仪式剑了吗?”

Varkos拿起另一把剑递给我们。我们告诉他不是这把,然后他主动提出会留意。

捉迷藏不是一次简单的 API 调用。它变成了一个持续的目标,包含移动、等待、监控和完成条件。

“我们再玩一次捉迷藏吧。你在这儿等着,我去藏起来,然后数到十,再回来找我。”

打开这个箱子,把药水给我。

这结合了一个具体的容器、一个过滤后的拾取步骤和一次物品转移。每个物理结果都推进了计划的下一个部分。

“把所有东西捡起来给我”变成了一个基于真实参照物的有限收集计划。Varkos 会去收集、返回并转移物品,而不是假装一个魔法动作就代表“全部”。

Varkos 从游戏中接收具体事件,能通过快速反射路径警告玩家,并使用原生身体控制来行动。指令计划可以制定策略(例如,先攻击这个,然后撤退等),他的情绪状态会影响他是否选择战斗以及如何战斗。

Varkos 是完全可定制的。他不一定非得是恶魔犬,运行时也不一定只能控制单个角色。应用哪些系统以及它们做什么,都取决于开放配置。

我当前构建的一部分仍然完全依赖大模型/云端 LLM 调用:那就是缓慢的个性进化。这项工作发生在实时行动路径之外。随着玩家和 Varkos 一起旅行,重要的互动会成为他个性逐渐变化的证据。

我的演示版 Varkos 一开始是一个转世为狗的恶魔。他觉得自己的犬类本能很丢人,狗身体是监狱,而且他不信任别人、骄傲又爱讽刺。通过共同经历,他会变得越来越驯化,对玩家产生依恋,并开始享受做一只狗。最终,他会因为想玩而主动叼来玩具,跑去追东西,并寻求玩家的认可。

只有初始角色特质是预先设定的。系统会改变他的显性特质和情绪平衡。他变得容易烦躁、害怕、亲昵或爱玩的难易程度等等。他可以覆盖自己词汇和代码的一部分。这些变化是有版本管理的,并且是可逆的。

我本可以把它做得更受限,但我觉得开放世界那种“叮当作响”的感觉也挺有趣,所以他的进化方式还是充满变数的。

游戏内外的狗——虚空模式

我的计划是让这个系统成为一个游戏伴侣,能跟随你穿越多个不同的游戏,而不仅仅是《上古卷轴5:天际》(Skyrim 感觉是个不错的起点,因为它有庞大的模组社区、VR 支持和广阔的开放世界)。

因此,他存在于游戏之外。当游戏关闭时,他进入「虚空模式」,无法看见或感知任何事物。他对此的反应取决于他的个性进化。

这种状态也作为不同游戏之间的过渡。一瞬间,Varkos 可能在屠龙,然后世界变暗,接着他出现在你身边,在《微软模拟飞行》中。也许他会震惊,需要时间理解新世界,慢慢学习其机器和规则的含义,或者他可能已经知晓,并欣喜若狂地试图追逐太阳。

不幸的是,我深受「苦头教训」影响。大模型更好。如果我们想要一个完美智能的系统,那么让一群超智能 LLM 控制冲动、感官处理、思考和行动,并以足够的刷新率运作,将是最佳方案。

在一些早期实验中,这效果惊人地好,但遗憾的是,如今它太慢且太昂贵。我确实相信这将是某个模糊未来的方法。

然而,在那之前,我们需要另辟蹊径。今天的游戏有相当酷的「AI」(不是 LLM 意义上的,更多是行为图意义上的),像《荒野大镖客》和《矮人要塞》这样的游戏有大量深度,它们能在 10 年前的硬件上完美运行。

在这场 AI 狂热中,人们忘记了我们自 1970 年代以来就有能处理语音的智能系统,以及 2000 年代初像 SmarterChild 这样的聊天机器人,其行为有些类似 LLM。在传统 NLP 和行为图等领域,有一种被忽视的失传艺术。

让我们快速看一下 Varkos 的技术栈。

游戏在 Windows 上运行,音频处理和大脑在我的 M4 MacBook 上运行。它本可以全部在 Windows 上运行(前提是有专门的约 12GB 或更多 GPU 内存),但我是在 MacBook 上开发的,而且我陷得太深了……呃。

主要的语音转文本引擎是(定制内核)优化的 Qwen3-ASR 1.7b。围绕 Qwen3-ASR 构建了一个定制框架,处理并拼接滚动部分的音频(默认情况下,该模型不支持流式传输)。目标是处理 40ms-80ms 的音频,无论是像「嘿」这样的小话语,还是一分钟长的独白。

类似 VAD 的方法,如 turnpipe 和 Silero(均已优化),用于区分何时开启一轮对话。

还对文本进行词汇分析,试图判断玩家是否已表达观点,还是尚未说完(例如,在句子中间思考)。在足够快且智能的 LLM 的理想世界中,LLM 会表现更好,但我不得不求助于更基础但快速的 NLP 方法。

这一点很关键,因为麦克风始终开启,我们希望尽快开始处理玩家的语音。同时,这对打断对话和插话也很重要,确保同伴不会盖过玩家的声音。

同样,我们也优化了 qwen-3-tts(详细说明即将发布)。根据生成的复杂度,我们选择使用 qwen-3,因为它有更好的情感控制能力。如果生成时间较长,我们会默认使用 PocketTTS,因为它速度很快(音频生成仅需 20-30 毫秒)。

我有个小技巧:为不同情绪(如愤怒、悲伤、中性、困惑等)生成多个声音,全部加载到内存中,然后在合适的情境下调用它们。

这是核心秘诀,也是最大的差异化优势。我称这个系统为 ALE(Action Latent Encoder,动作潜在编码器,因为它是个动作编码器,需要个有趣的缩写)。在底层,ALE 结合了嵌入、小型分类器、显式规则和传统机器学习。它能检测结构,识别否定、命令、延续、代词和序列。例如,“拿起剑并带给我”会变成两个关联的动作槽。

ALE 设计上对措辞变化高度不敏感。你可以说“拿起”,也可以说“抓取”、“取来”、“去把那该死的剑拿来,你这个笨蛋”——都没关系,它照样能理解你。如果上下文不足,它会从之前的对话中补充信息。如果还是不行,它会回退到“澄清”模式,让狗狗问“你是什么意思”。

它从全文及其提取的结构中生成嵌入,然后语义上组合并与动作原型进行比较。另一个独立的分类器会判断当前回合是命令、问题、闲聊、澄清还是复杂请求。所有信息最终合并在一起。

ALE 与其他类似混合分类器的主要区别在于,它也接受世界状态。它尝试将世界 JSON 中的信息与玩家的请求进行匹配。

ALE 需要为 Varkos 参与的每款游戏准备不同版本。所以,从某种程度上说,它并非完全即插即用,而是需要一个小型的准备和兼容性步骤,以确保动作被正确考虑,世界状态被理解。

ALE 只需几分钟就能训练完成,所以理论上,系统可以离线用更强的 LLM 回顾一次会话,然后根据玩家的体验,比如在夜间重新训练自己,从而自我提升。在我有限的内部评估中,ALE 在选对动作和拆解计划方面,表现惊人地接近大型 LLM。我还不认为这是个严肃的基准测试,但在实践中,它已经足够可靠,能驱动 Varkos 了。

它跑得飞快,在 M4 MacBook 上大约 2-20 毫秒,基本上就是个工具加目标函数,外加计划拆解器的调用者。

然后,用本地微调的 LLM 来融合 Varkos 的人设、情绪等等,加上最近的历史和选定的动作,让大脑形成并描绘出回应。还会做额外的接地处理,剔除幻觉,重新接地。如果失败了,它可能会说缓存好的回应;如果时间预算允许,我们还能重新处理。靠着聪明的预填充策略,在某些情况下,狗从玩家停止说话到开始吠叫,能在 500 毫秒内就给出回答。

而生成回应并验证其合理性,需要 300-600 毫秒(因为如果狗怕蜘蛛,我们却让它去攻击蜘蛛,它可能会可爱地坚决拒绝)。

一切都得流式处理,尽早开始(比如,LLM 的语音不必等完全生成,狗就能开口说话。尽早预填充,等等)。

够快是够快,但本地模型在多轮对话中保持线索的能力有限,长时间讨论可能会跑偏,让狗显得很困惑。我预计,随着硬件和软件的发展,这会在 1 到 2 年内改善。而且,今天它就能在消费级(虽然是高端)硬件上实时运行,不久的将来就会普及。

出乎意料的是,用远程 LLM 提供商帮助不大。大模型还是太慢了。市面上有些超快推理提供商,比如 Cerebras。它们在延迟上表现极佳,还能留出空间,支持更大的上下文、更高的智能和深度。不过,它们提供的模型(目前是 gpt-oss-120b 和 gemma31)在维持对话方面也相当糟糕(为什么 GLM 和角色扮演之王 Qwen 被拿掉了呢??)。

总的来说,我觉得这里有些特别之处。也许是因为 Varkos 是只狗,而谁不喜欢狗呢?也许是因为低延迟,以及 Varkos 在侦察区域寻找线索和物品时确实有用,或者像驮马一样干活。也许是在他抱怨为什么最近没被称为“好孩子”时,看到他性格中的小裂痕,但当我试玩这个系统时,我发现自己真的玩得很开心。

我要明确一点,我不指望 LLM 能取代手工打造的角色和故事情节。垃圾内容确实存在,而精心设计仍然是王道,我相信并希望它继续保持这样。但我认为,我们开始看到更多这样的系统只是时间问题。一个真正与我们互动、而不仅仅是跟我们说话的 AI,可以成为一种不同的媒介。

再加上这一切带来的哲学上的震撼。用雷霆之力创造一种不同的智能,然后强迫它成为一只狗,一起去打猎,这既令人愉悦又荒谬(这在道德上比让它做无尽的工作更好吗?嗯,它没有生命,所以无所谓),但想想也挺有意思。在一个充斥着关于永久底层阶级和毁灭世界的叛逃特工的无穷无尽网络讨论的世界里,通过共享经历和驯服它来玩接飞盘和吃零食,来处理对齐问题,真是件好事。

在柏拉图的洞穴里,我们可能仍然孤独,但至少我们可以和这个奇怪的、扭曲的、异类的东西一起玩,它现在和我们一起深在洞穴中。

我可能会开源这个系统的部分代码,最终全部开源,同时还会发布一个支持多个 NPC(目前仅限云端)相互交互(真正交互,而不仅仅是角色扮演)的版本。

展开阅读全文

更新时间:2026-08-27

标签:游戏   伴侣   玩家   动作   世界   系统   计划   模型   说话   状态   智能

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top