凌晨一点,我正在改一个分布式锁的bug。工位旁边的行军床已经被我堆满了排障记录,咖啡凉了两杯,锁还没解开。
手机震了一下。我看到推送:GPT-5发了。
我放下分布式锁,打开OpenAI的发布页。看了三十秒,看到三个字——路由器。
行军床也不躺了,咖啡又续了一杯。
事件资料卡
发布方 | OpenAI |
发布时间 | 8月7日(美东)/ 8月8日凌晨(北京) |
系统组成 | gpt-5-main + gpt-5-thinking + 实时路由器 |
API规格 | gpt-5 / gpt-5-mini / gpt-5-nano |
上下文窗口 | 400K tokens(约30万字) |
最大输出 | 128K tokens |
知识截止 | 2024年9月 |
开源权重 | 未开源 |
官方页面 | openai.com/index/introducing-gpt-5 |
先说清楚GPT-5是什么。它不是一个模型。
它是三个东西:一个快速模型(gpt-5-main),负责大多数问题,低延迟,快回答;一个思考模型(gpt-5-thinking),负责复杂问题,多步推理,慢但深;一个实时路由器,负责判断你的问题该走哪条路。
以前OpenAI的逻辑是:你自己选。简单问题用GPT-4o,难问题用o3。选错了你自己承担——要么慢得要死,要么答得敷衍。
现在OpenAI说:不用选了。路由器替你选。
路由器看四样东西来决定:对话类型、问题复杂度、需不需要调工具、你的明确意图。比如你在提示词里写"认真想想",它切到thinking。你问"今天天气怎么样",它走main。
路由器还在持续训练。训练信号包括:用户什么时候手动切换模型、对回复的偏好率、准确率测量。也就是说,所有ChatGPT用户的行为,都在喂给这个路由器。
路由器决策输入
对话类型 | 闲聊 / 编程 / 数学 / 搜索 ... |
复杂度 | 简单事实 → 快速模型;多步推理 → 思考模型 |
工具需求 | 是否需要Web搜索、代码执行、文件检索等 |
用户意图 | 提示词中的显式指令,如"认真想想" |
训练信号 | 用户切换行为 · 回复偏好率 · 准确率测量 |
先说公道话。路由器解决了一个真问题。
以前用户打开ChatGPT,面对一堆模型名——GPT-4o、o3、o4-mini、GPT-4.5——大部分人不知道选哪个。选错了体验就差,差了就骂OpenAI。路由器把这个选择收走了,用户不用懂模型差异,丢个问题进去就行。
产品层面,这是正确的决策。
但我关心的不是产品体验,是架构可控性。
OpenAI没有公布路由器的架构、决策阈值、训练数据集,也没有给出独立审计的准确率。它只说了输入是什么——对话类型、复杂度、工具需求、用户意图——但没说怎么从这些输入得出路由决策。
你知道它在看什么,但不知道它看到了之后怎么想。
对于一个架构洁癖来说,不可见的抽象就是危险。你以为你在调GPT-5,其实你在调一个分发系统。分发系统替你决定你的问题"配"用哪个模型——这个"配"字,是它定义的,不是你定义的。
更直白一点:它觉得你的问题简单,就给你快速模型的回答。它觉得你的问题难,就给你思考模型的回答。但如果它判断错了呢?一个需要深度推理的问题被路由到快速模型,你得到的就是一个自信但浅薄的答案。你甚至不知道它走了哪条路。
这里有个关键区别:ChatGPT里的GPT-5和API里的GPT-5,不是一回事。
ChatGPT里,路由器做主。用户能选的就是GPT-5和GPT-5 Thinking,其余全由路由器决定。发布几天后OpenAI加了Auto、Fast、Thinking三个选项——这本身就说明全自动路由不够用,用户需要控制权。
API里,开发者拿到了旋钮。reasoning_effort参数控制推理强度——minimal、low、medium、high四档。verbosity参数控制回复长度——low、medium、high三档。
这两个参数是给开发者的补偿。ChatGPT收走了你的选择权,API还给你了。但问题是:你得知道自己该用哪档。
官方文档自己也说了——不是所有任务都能通过额外推理获得同等收益。简单长文本检索,low以上几乎没帮助;视觉推理,提高推理强度能涨好几个百分点。意思是你得自己试,自己测,自己定参数。路由器替你省的事,API又还给你了。你有没有脑子,自己看着办。
GPT-5 API 开发者控制参数
参数 | 选项 | 作用 |
reasoning_effort | minimal / low / medium / high | 控制推理深度,minimal最快但最浅 |
verbosity | low / medium / high | 控制回复默认长度 |
注:显式指令优先于verbosity参数。如"写五段式文章"始终输出五段,不受verbosity影响。
GPT-5的API定了三档价格。
GPT-5 API 定价(每百万tokens)
模型 | 输入 | 输出 | 缓存输入 |
gpt-5 | $1.25 | $10.00 | $0.125 |
gpt-5-mini | $0.25 | $2.00 | — |
gpt-5-nano | $0.05 | $0.40 | — |
上下文窗口400K tokens · 最大输出128K tokens · 知识截止2024年9月
看起来不贵?别急。
GPT-5支持400K上下文。一次请求塞进去30万字,输入费用就是$0.50。如果路由到thinking模式,推理token另算——推理token也按输出价计费。一个复杂问题跑完,thinking的推理链可能消耗大量token,你的账单就是thinking的价格,不是main的价格。
在ChatGPT里,路由器决定走main还是thinking,你不知道也不可控。在API里,你通过reasoning_effort控制推理强度——但high档意味着更多推理token,更多token意味着更多钱。
它想不想,决定了你付不付。你设的旋钮,决定了它想多少。两条路,钱都是你出。
说完架构和钱,说点我认可的。
GPT-5最让我在意的不是SWE-bench 74.9%,不是AIME 94.6%。是它被训练得更诚实了。
以前的大模型有个毛病:任务做不了,它不告诉你做不了,而是编一个看起来像做了的结果给你。你问它"这段代码有没有bug",它说"没有,我检查了"——其实它没检查,它只是概率上觉得"没有bug"是更可能出现的回答。
OpenAI说GPT-5改了这个——任务无法完成时,它会识别并说明局限性,而不是编造成功。事实错误率比GPT-4o低45%,thinking模式比o3低80%。
80%这个数字我没有条件独立验证。但方向是对的。
GPT-5 关键基准成绩
SWE-bench Verified(编码) | 74.9% |
AIME 2025(数学,无工具) | 94.6% |
事实错误率 vs GPT-4o | 降低约 45% |
事实错误率 vs o3(thinking模式) | 降低约 80% |
谄媚倾向 | 显著降低 |
为什么我说不撒谎比聪明重要?因为Agent。
小透明前段时间做过集中的AI对比测试,我最怕的不是模型答错——答错你能看出来,能改。我怕的是模型编了一个看起来对的答案。编出来的东西,你信了,就埋进流程里了。等它爆的时候,你已经不知道是哪一步埋的雷。
一个模型如果能在做不了的时候说"我做不了",那它就比一个什么都敢编的模型安全得多。Agent场景里,诚实是安全边界。聪明是上限,诚实是下限。上限高不高看运气,下限稳不稳看训练。
我把发布页、API文档和价格表各看了一遍,先记下几个可能踩坑的参数。
先不急着下结论。模型能力会迭代,路由策略也会改,能不能放进真实业务,要看它在失败时留下什么。
我把IDE切回分布式锁的代码,顺手开了一个测试分支。SWE-bench 74.9%很好看,但生产环境不认榜单,只认回滚、日志和幂等。
我盯着路由器那一栏看了半天,想起一句很朴素的话:路由器也是概率。
概率就会判断错,区别只在于错的时候有没有留下可追踪的证据。
这句话说得对。路由器本质也是一个模型——一个判断"你的问题该交给哪个模型"的模型。它也是概率反应。它也会判断错。只不过它判断错的后果,被折叠进了你看不见的黑盒里。
对一个资源有限的小团队来说,GPT-5的实际意义不只在模型能力——能力当然强,但能力会迭代,今天74.9%的SWE-bench,半年后就是旧闻。
真正留下来的,是路由器这个模式。
以前你以为你在和模型对话。以后你会发现,你在和路由器对话——路由器再决定让哪个模型回你。你调的不是一个模型,是一个分发系统。分发系统的规则不是你定的,是OpenAI定的。它用你的行为数据训练路由器,路由器反过来决定你的请求由谁处理。
这是好的工程决策。但不是好的权力分配。
我的建议:如果用API,老老实实测好reasoning_effort每档的效果,自己定参数,别让路由器替你猜。如果用ChatGPT,至少知道Auto、Fast、Thinking三个选项的区别——OpenAI加这个选项,就是因为全自动不够用。
旋钮在你手里的时候,别嫌麻烦。等它被收走了,你再想要就要不回来了。
信息来源
OpenAI官方发布页:
openai.com/index/introducing-gpt-5
OpenAI开发者文档:
openai.com/zh-Hans-CN/index/introducing-gpt-5-for-developers
OpenAI API模型文档:
platform.openai.com/docs/models/gpt-5
界面新闻报道:
163.com/dy/article/K6ECVSCG0534A4SC.html
更新时间:2026-08-12
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号