一项最新测试显示,GPT-5.6 的多个版本在 Tracking AI 的离线 IQ 测试中拿到了 136 分。
如果按人类 IQ 的常见划分,130 分通常被视为“高智商”或“天才”区间的起点,处于这一水平的人约占总人口的 1%。因此,GPT-5.6 这次的成绩很容易让人得出一个颇具冲击力的结论:至少在这类标准化推理测试中,它的表现已经超过了绝大多数人。
不过,136 分究竟意味着什么,还得拆开来看。
这次刷新的,是哪一种“智商”?
Tracking AI 手里有两套测试。
第一套是公开的 Mensa Norway 风格题目,网上任何人都能接触到。由于题目公开、传播范围广,模型在这类测试中拿到很高分数,并不算特别令人意外——此前已有模型跑到 140 分以上。
真正值得关注的是第二套:Tracking AI 自建的离线题库。虚拟卡
这套题不公开,目的是尽量避免模型因为训练时接触过类似题目,而获得“提前背题”的优势。GPT-5.6 此次拿到的 136 分,正是来自这套更强调防泄题的离线测试。
在最新榜单中,GPT-5.6 的多个版本,包括视觉版本,都达到了 136 分。排在它之后的是 Claude 5 Fable,成绩为 130 分;GPT-5.6 LUNA Max、Claude 4.8 Opus 等模型则大多在 117 至 123 分之间。
130 分这道门槛,过去一直没人真正跨过去。过去一年,从 o3 到各家的旗舰模型,虽然不断逼近,但始终停在门口。GPT-5.6 的出现,第一次把分数推到了这一档位之上。
更值得注意的是,这并不是某一个版本偶然发挥。Sol、Terra 等多个版本都拿到了相近成绩,连视觉模型也没有明显掉队。
从“会做题”,到“能干活”?
除了测试分数,一些开发者的实际体验也让 GPT-5.6 获得了更多讨论。
开发者 Amir Bohlooli 曾用同一段物理模拟提示词,分别测试 Claude 5 Fable 和 GPT-5.6 Sol。原本他更看好 Fable,结果却被 Sol 的表现惊到。
GPT-5.6 Sol 选择了粒子流体模拟方案,按真实时间推进物理计算,而不是简单地按每帧执行固定运算;同时,它还将 CSS、界面和渲染逻辑整合进一个 HTML 文件,并自动部署成可分享的网页。用户只给出一句需求,最后得到的却是一个可以直接运行的成品。虚拟卡
另一位开发者 Ramanpal Singh,则让 GPT-5.6 根据一句提示词生成一个基于 RAG 的客服工单系统。系统包含四类角色、管理后台和可嵌入组件,还能自动对投诉分类、识别情绪并起草回复。
据他介绍,类似的应用,他一口气做了五个,成本远低于使用 Fable 5。
还有一个颇有代表性的案例来自 Claire Vo。她此前被一个 Bug 困住,起初以为是自己的代码出了问题。换成 GPT-5.6 Sol 后,她只留下一句:“我就是不信搞不定。”
结果,Sol 一次解决了问题,还顺手让其他模型生成的代码也跑通了。她的感受很直接:有些模型过于执着于技术上的绝对精确,反而容易把问题做复杂;Sol 的思路更务实,最终更容易把事情落地。
136分,不等于“AI已经比人类更聪明”
“对 99% 的人来说,这已经是 AGI 了。”有网友这样评价。
这话很有传播力,但也需要冷静一点看。
136 分只是 GPT-5.6 在 Tracking AI 特定离线测试中的得分。它主要考察的是抽象模式识别、逻辑推理等能力,并不能完整代表一个模型的综合智能。虚拟卡
一张 Mensa 风格试卷,测不出模型会不会胡编事实,测不出它调用工具时是否可靠,也测不出它在真实工作场景里能否长期稳定地完成任务。
IQ 测试只是从“智能”中切出了一小块,告诉我们模型在这一块上有多强。
但开发者的实际体验也提供了另一面证据:GPT-5.6 似乎不只是更会做题了,它开始更像一个能把问题真正做完的助手。
真正难的,从来不是回答那些已有标准答案的题目,而是面对从未见过、也无法照搬答案的新问题时,能不能稳定地找到可行方案。
如果一个模型既能在测试中表现出色,也能在真实任务里把活干明白,那么“智商”这两个字,才算有了更实在的含义。
原创文章,作者:wp-chen,如若转载,请注明出处:https://visaspay.com/2026/07/16/gpt-5-6%e5%9c%a8%e7%a6%bb%e7%ba%bfiq%e6%b5%8b%e8%af%95%e4%b8%ad%e6%8b%bf%e5%88%b0136%e5%88%86%ef%bc%9a%e9%a6%96%e6%ac%a1%e8%b7%a8%e8%bf%87130%e5%88%86%e5%a4%a9%e6%89%8d%e7%ba%bf/