OpenAI 在华盛顿演示全新模型系列 Astra,主打长周期任务能力;DeepSeek 同步更新 V4 Flash,多项基准逼近 Opus 4.8;
一、OpenAI 曝光 Astra 新模型:主打长周期任务能力
据 The Information 8 月1日报道,OpenAI CEO Sam Altman 本周在华盛顿向政策制定者演示了全新的 AI 模型系列——**Astra**。
Astra 源自拉丁语,意为"群星"或"星辰",与 OpenAI 现有的 Sol(太阳)、Terra(地球)、Luna(月亮)形成一套宇宙主题命名体系。
核心能力,Astra 的最大亮点在于:
知情人士透露,Astra 已经进入测试阶段,有望成为首批按照特朗普政府拟议新框架、在公开发布前提交美国联邦政府审查的 AI 模型。但目前尚未确定是命名为 GPT-6 还是 GPT-5.7。
二、DeepSeek V4 Flash 上线公测:性能逼近 Opus 4.8
根据官方披露的数据,这款 2840 亿参数模型在多项基准测试中表现惊艳:
测试场景 | 得分 |
Terminal Bench 2.1 终端操作 | 82.7 |
NL2Repo 代码仓库任务 | 54.2 |
DeepSWE 代码任务 | 54.4 |
Cybergym 网络安全 | 76.7 |
Agent Last Exam 综合智能体 | 25.2 |
DSBench-FullStack 全栈开发 | 68.7 |
DSBench-Hard 难度升级版 | 59.6 |
更值得关注的是价格。新版本 API 定价仅为 Claude 同类产品的 1/90。在 Artificial Analysis 7 月 31 日更新的综合指数中,GPT-5.6 Luna(max)得分 51,DeepSeek-V4-Flash-0731(max)得分 50,仅差 1 分。
跑完整套评测的账单对比更直观:Luna 约 190.87 美元,DeepSeek 约 72.02 美元,便宜约 62%。
对于开发者而言,这是一个机会窗口:开源模型在性能上正在快速追赶闭源旗舰,同时成本远低于商业 API。在选型时,不妨将目光从单一的"模型能力榜"转向"任务适配度+成本结构+安全可控性"的综合评估。
你觉得 DeepSeek 的"性价比路线"会让 OpenAI 真正紧张吗?欢迎在评论区聊聊你的观察。
更新时间:2026-08-04
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号