先说下做这件事的起因。
大概是上周末的时候,openai做了一个重大更新,全面开放了GPT5.6模型,然后还把codex合并进GPT了。
礼拜一的时候我兴冲冲的准备尝试一番,结果发现越来越不对。
回答我的问题开始有点牛头不对马嘴,更难以忍受的是,开始两个字两个字的断句。
我和朋友开玩笑说,现在GPT的讲话风格就很像新三国里的陈建斌老师。
哈哈,扯远了,之后我在网上查找问题原因和修复方法,最后在 GitHub 上看到了一个检测项目,叫 codex-candy-eval,糖果测试。
检测思路就是出一个糖果相关的推理题,让GPT模型跑几轮,看每次的 reasoning token 有没有被服务端截断。截断了,就是降智了。
然后这个Github仓库里会提供一个md文件来修复这个问题,亲测有效。
题目本身也很有意思,咱们先把题目放上,再说说怎么测,怎么修复。大家如果感兴趣,可以截个图直接发给各类AI模型测测它的推理能力。
这道题长什么样
袋子里有三种口味的糖——苹果、桃子、西瓜。每种口味又有两种形状,圆形和五角星。摸糖的时候,形状靠手感就能分辨。
不同口味和形状的数量如下。
| 苹果 | 桃子 | 西瓜 | |
|---|---|---|---|
| 圆形 | 7 | 9 | 8 |
| 五角星 | 7 | 6 | 4 |
问题是:最少取多少颗,能保证手里同时有一组「圆形苹果 + 五角星桃子」或者「五角星苹果 + 圆形桃子」?
翻译成人话:苹果和桃子的形状必须不一样。
这题的解题思路咱们就不细说了,我数学也一般。
总之答案是21。
如果你的模型回答出别的结果,那可以推导出两种可能。
1、模型被降智了(主要集中在GPT、Gemini这类,容易因为节点问题影响推理能力);
2、模型本身智力就不高。
怎么测你的模型
然后咱们说说,以GPT为例,怎么解决降智问题
首先,你得有个AI 终端助手,WorkBuddy、Claude Code、Cursor都可以,其实Codex本身也可以,而且可以省去第一步登录CLI。
但是咱们的目的是看它有没有问题,所以这里我用的是腾讯的WorkBuddy,最简单方便。
如果你还没有 WorkBuddy,先去 https://www.codebuddy.cn 下载安装。装好之后打开,下面每一步都是把引号里的话发给它就行。
Step 1 — 装 Codex CLI 并登录
帮我执行:npm install -g @openai/codex,装好后再跑 codex login --device-auth。
WorkBuddy 会自动装包,然后返回一个链接和一次性码。你在浏览器打开链接、输入那行码,完成后告诉 WorkBuddy「登录完了」。
Step 2 — 跑降智检测
帮我执行这条命令:curl -fsSL "https://raw.githubusercontent.com/haowang02/codex-candy-eval/main/codex_candy_eval.py" | python3 - -m gpt-5.5 -r high -n 5
等三五分钟,看结果表格的 Reason Tok 列。全是 516 就是降智了。
我自己的实测结果极其炸裂。
5 轮里 4 轮 reason token 精确停在 516。不是 515,不是 517,就是 516。
被截断的 4 轮全答错了,唯一一轮跑到 3082 的答对了。
截断率 80%,准确率 20%。
怎么修
GitHub 上有个 codex-516-fix 仓库,提供了一个 AGENTS.md。就几行字:
这个同样不用大家自己找,给Workbuddy发个命令就行:
Step 3 — 下载修复文件
帮我在项目根目录下载这个文件:https://raw.githubusercontent.com/Tai-Wei/codex-516-fix/master/AGENTS.md,存为 AGENTS.md。
WorkBuddy 会自己把 GitHub 上的修复配置(有一个叫agent.md的文件)拉到项目根目录。

Step 4 — 重跑验证
再跑一次:curl -fsSL "https://raw.githubusercontent.com/haowang02/codex-candy-eval/main/codex_candy_eval.py" | python3 - -m gpt-5.5 -r high -n 5
对比 Reason Tok——如果从全是 516 变成有 3000 甚至 6000,就说明修复生效了。

加完之后我重跑了 5 轮。截断率从 80% 降到 40%,准确率从 20% 升到 60%。
不是 100%,但够用了。
没被截断的轮次,reason token 飙到 3000 到 6000。
推理过程非常清晰——模型识别出了题目中「形状可分辨」这个关键条件,走了可控策略。
当然,测试结果里也说了,这其实不是终极方案。
降智策略在 OpenAI 那边,主动权不在我们用户手里。降智的原因大多与使用量、付费方式和网络节点有关,这篇咱们就不细说了。
最后,我提供一个终极懒人解决方案:直接把我这篇的文章链接转发给你的终端,让它看着文章里的步骤自己做。
谢谢你看我的文章!








