本周 AI 大事件
- GLM-5.3 智谱发布,AA 智能指数 60 分并列开源第一
- (8月19日)——沿用 7530 亿参数底座,靠后训练把分数从 53 拉到 60,长代码库理解与多文件协同拉满,权重计划 8月28日前后开源。来源:网易科技、智谱官方
- DeepSeek 48 小时三连击:V4-Pro 正式版 + Harness 开源 + API 涨价
- (8月12-17日)——V4-Pro 拿 Terminal Bench 2.1 87.9 分、DeepSWE 从 12.8 飙至 62.7;Harness 框架以 MIT 协议开源,发布 12 小时 GitHub 星标破 5 万;8月17日起 API 峰谷定价,缓存输入涨幅最高 1100%。来源:第一财经、DeepSeek 官方
- xAI Grok 4.6 与 Grok Build 接连上线
- (8月12-14日)——Grok 4.6 拿到 AA 智能指数 61 分、与 GPT-5.6 Sol 并列,定价仅 2/6(input/output 每百万 token),比 Opus 5 的 5/25 便宜一截;Grok Build 支持自然语言生成应用并接入第三方 API。来源:latent.space、xAI
- 阿里 Qwen-UI-Agent 发布,多项 GUI 智能体基准刷新 SOTA
- (8月20日)——移动端 MobileWorld-Real 92.2%、AndroidDaily 97.5%,电脑端与浏览器端超越 GPT-5.6 Sol 与 Claude Opus 4.8,可模拟人类操作未开放 API 的传统软件。来源:快科技、阿里通义千问
- OpenAI 全面开源 Codex Harness,正面回应 DeepSeek
- ——首次把 Codex 的"运行框架"对外开放,可在自有产品里集成 Agent 能力;同期 ChatGPT Business 推出 Premium 高用量席位($125/月),GPT-5.6 Sol 同步涨价。来源:OpenAI 官方博客
- 字节豆包成为特斯拉中国车载 AI,8月19日完成 OTA 接入
- ——特斯拉在全球范围内首次嵌入第三方 AI 模型。原因简单:xAI Grok 没有拿到中国生成式 AI 服务备案,豆包成了合规首选。来源:Volcano Engine
- NVIDIA 开源 Nemotron 3.5 Lightning + NeMo Switchyard 路由库
- (8月14日)——30B 参数 MoE 架构(激活 3B),同尺寸速度最高 4 倍;Switchyard 按任务分配 Agent 工作负载,LangChain 测试成本降 74%。来源:NVIDIA 开发者博客
- Stripe 以 70 亿美元收购 OpenRouter,资本端整合 Agent 生态
- ——支付环节与 LLM 调用路由两张网合并,模型市场下一步怎么玩要看这次整合后的产品形态。来源:媒体综合
下周看点
GLM-5.3 权重开源(预判 8月28日前后)智谱已经预告权重两周内开放。如果开源版本能保留 60 分智能指数,对国内开源编程生态是直接拉满的事,也会拉动 LMArena Coding 子榜的新一波国产刷分。
DeepSeek-V4-Pro 是否冲击 SuperCLUE 冠军预览到正式版的 5.7 分跃迁说明 DeepSeek 还有上探空间。下周若再有一次工程优化或小版本更新,把 Qwen3.8-Max 的 71.48 顶下来并非不可能。
Coding 子榜的国产存在感本周 Kimi-K3 在 Coding Arena 已稳进前 10,DeepSeek Harness 开放后会不会拉起 V4-Pro 的子榜评分,将是国产开源下半年的关键议题。
下面是最新榜单速递



关注我,工作日看榜单龙虎斗,周末一起复盘 AI 圈大事。这周的变动你怎么看?评论区见。