万维IIP通栏广告位当云华纳云
ChatGPT2026-09-06文案编辑:好主机测评5 阅读

如何用“糖果检测”评估你的GPT有没有被降智(附修复方案)

本文摘要先说下做这件事的起因。大概是上周末的时候,openai做了一个重大更新,全面开放了GPT5.6模型,然后还把codex合并进GPT了。礼拜一的时候我兴冲冲的准备尝试一番,结果发现越来越不对。回答我的问题开始有点牛头不对马嘴,更难以忍受的是,开始两个字两个字的断句。我和朋友开玩笑说...
丽萨主机
AD:
【广告招商】文章正文文字广告位开放合作

先说下做这件事的起因。

大概是上周末的时候,openai做了一个重大更新,全面开放了GPT5.6模型,然后还把codex合并进GPT了。

礼拜一的时候我兴冲冲的准备尝试一番,结果发现越来越不对。

回答我的问题开始有点牛头不对马嘴,更难以忍受的是,开始两个字两个字的断句。

我和朋友开玩笑说,现在GPT的讲话风格就很像新三国里的陈建斌老师。

哈哈,扯远了,之后我在网上查找问题原因和修复方法,最后在 GitHub 上看到了一个检测项目,叫 codex-candy-eval,糖果测试

检测思路就是出一个糖果相关的推理题,让GPT模型跑几轮,看每次的 reasoning token 有没有被服务端截断。截断了,就是降智了。

然后这个Github仓库里会提供一个md文件来修复这个问题,亲测有效。

题目本身也很有意思,咱们先把题目放上,再说说怎么测,怎么修复。大家如果感兴趣,可以截个图直接发给各类AI模型测测它的推理能力。

这道题长什么样

袋子里有三种口味的糖——苹果、桃子、西瓜。每种口味又有两种形状,圆形和五角星。摸糖的时候,形状靠手感就能分辨。

不同口味和形状的数量如下。

苹果桃子西瓜
圆形798
五角星764

问题是:最少取多少颗,能保证手里同时有一组「圆形苹果 + 五角星桃子」或者「五角星苹果 + 圆形桃子」?

翻译成人话:苹果和桃子的形状必须不一样。

这题的解题思路咱们就不细说了,我数学也一般。

总之答案是21。

如果你的模型回答出别的结果,那可以推导出两种可能。

1、模型被降智了(主要集中在GPT、Gemini这类,容易因为节点问题影响推理能力);

2、模型本身智力就不高。


怎么测你的模型

然后咱们说说,以GPT为例,怎么解决降智问题

首先,你得有个AI 终端助手,WorkBuddy、Claude Code、Cursor都可以,其实Codex本身也可以,而且可以省去第一步登录CLI。

但是咱们的目的是看它有没有问题,所以这里我用的是腾讯的WorkBuddy,最简单方便。

如果你还没有 WorkBuddy,先去 https://www.codebuddy.cn 下载安装。装好之后打开,下面每一步都是把引号里的话发给它就行。

Step 1 — 装 Codex CLI 并登录


帮我执行:npm install -g @openai/codex,装好后再跑 codex login --device-auth。

WorkBuddy 会自动装包,然后返回一个链接和一次性码。你在浏览器打开链接、输入那行码,完成后告诉 WorkBuddy「登录完了」。

Step 2 — 跑降智检测

帮我执行这条命令:curl -fsSL "https://raw.githubusercontent.com/haowang02/codex-candy-eval/main/codex_candy_eval.py" | python3 - -m gpt-5.5 -r high -n 5

等三五分钟,看结果表格的 Reason Tok 列。全是 516 就是降智了。

我自己的实测结果极其炸裂。

5 轮里 4 轮 reason token 精确停在 516。不是 515,不是 517,就是 516。

被截断的 4 轮全答错了,唯一一轮跑到 3082 的答对了。

截断率 80%,准确率 20%。

怎么修

GitHub 上有个 codex-516-fix 仓库,提供了一个 AGENTS.md。就几行字:

这个同样不用大家自己找,给Workbuddy发个命令就行:

Step 3 — 下载修复文件


帮我在项目根目录下载这个文件:https://raw.githubusercontent.com/Tai-Wei/codex-516-fix/master/AGENTS.md,存为 AGENTS.md。

WorkBuddy 会自己把 GitHub 上的修复配置(有一个叫agent.md的文件)拉到项目根目录。

Step 4 — 重跑验证


再跑一次:curl -fsSL "https://raw.githubusercontent.com/haowang02/codex-candy-eval/main/codex_candy_eval.py" | python3 - -m gpt-5.5 -r high -n 5

对比 Reason Tok——如果从全是 516 变成有 3000 甚至 6000,就说明修复生效了。

加完之后我重跑了 5 轮。截断率从 80% 降到 40%,准确率从 20% 升到 60%。

不是 100%,但够用了。

没被截断的轮次,reason token 飙到 3000 到 6000。

推理过程非常清晰——模型识别出了题目中「形状可分辨」这个关键条件,走了可控策略。

当然,测试结果里也说了,这其实不是终极方案。

降智策略在 OpenAI 那边,主动权不在我们用户手里。降智的原因大多与使用量、付费方式和网络节点有关,这篇咱们就不细说了。

最后,我提供一个终极懒人解决方案:直接把我这篇的文章链接转发给你的终端,让它看着文章里的步骤自己做。

谢谢你看我的文章!


广告招商文章内容详情页下 · 优质席位开放中合作咨询
咨询2 位在线

广告投放、资源交换、友情链接