分享好友 健康资讯首页 健康资讯分类 切换频道

GPT-5.6智商首破130天才线,比99%人类聪明

2026-07-16 17:2013036kr

如今,全世界99%的人类,在IQ这方面竟拼不过一个AI。

在Tracking AI最新离线IQ测试中,GPT-5.6「全家桶」多个版本,齐刷刷地飙到了136分。

这是LLM第一次,把IQ推过了130这道坎。

在人类的智商分布里,130分是「天才」的起跑线,全球仅有大约1%的人能站上去。

换言之,GPT-5.6要比99%的人类还聪明。

GPT-5.6狂刷136分,IQ首破「天才线」

这个「智商」,含金量有多高?

实际上,Tracking AI手里有两套题。

一套是公开的Mensa Norway风格测试,网上人人能做,模型早就刷到140多分了。

另一套,是它自己攒的「离线题库」。不公开、防泄题,专门用来堵住「模型提前背过答案」的漏洞。

GPT-5.6这次拿下136分,破的正是这套最难、最防作弊的离线题。

在这份离线排行榜上,GPT-5.6的一众变体(连视觉版都算上)集体冲到136分,把身后所有对手甩开了一大截。

紧咬在后面的,是Claude-5 Fable,130分。

再往下,GPT-5.6 LUNA Max、Claude-4.8 Opus这些名字,还在117到123分之间打转。

要知道,130这道门槛之前一直没被跨过去。

过去一年里,从o3到各家旗舰,一茬又一茬的模型冲上来,全卡在130的门口,谁也没能真正踏进「天才区间」。

GPT-5.6,是第一个把门踹开的。

而且它不是单枪匹马上分,SOL、TERRA一整个家族集体飙到136,连视觉版都没掉队。

在Reddit上,一位开发者亲自下场测试,最终体感GPT-5.6明显要比GPT-5.5的智商更高。

在如下的测试题中,GPT-5.6均在最短时间内,拿下了出色的成绩。

一个分数可能难以令人信服,那么,GPT-5.6离开考场、真刀真枪干活时是什么样?

光有分不够,把GPT-5.6拉去干活

开发者Amir Bohlooli拿同一个物理模拟prompt,同时喂给Fable 5和GPT-5.6 Sol,本以为会被Fable碾压,结果反被GPT惊到。

它选了粒子流体模拟,物理按真实时间推进而非每帧盲跑固定运算,CSS、界面、渲染全塞进一个HTML文件,

还自动托管成可分享网页。一句话,一个成品。

Ramanpal Singh同样用了一句prompt,造出一个基于RAG的客服工单系统。

四种角色、管理后台、可嵌入组件,还能自动给投诉分类、识别情绪、起草回复。

这样的app它一口气造了5个,成本只有Fable 5的零头。

最有画面感的,是Claire Vo的桥段。

几天前,她卡在一个bug上,以为是自己代码写崩了,换到GPT-5.6 Sol后只甩下一句「我就是不信搞不定」。

Sol一次修好,还顺手让别的模型也跑通了。

她的评价一针见血,Fable 死磕技术上的绝对精确,反而作茧自缚,Sol的务实却把活干成了。

不得不说,AI会做题,和AI能救场,中间隔着一整个真实项目。

这算AGI吗?

有网友表示,「对99%的人来说,这已经是AGI了」。

冷静下来看,这136分,是Tracking AI一个特定的离线 / Mensa Norway风格测试跑出来的。

它测的,主要是抽象模式识别、逻辑推理这一类「标准化认知」。

问题在于:IQ测试,本来就不是为大模型量身定做的。

一张Mensa卷子,测不出一个模型的事实可靠性,测不出它的工具调用能力,也测不出它在真实职业场景里到底靠不靠谱。

它只是切下了「智能」的一个薄片,然后告诉你,这一片有多亮。

不过,人们上手后的实测,恰恰给出了另一半答案:GPT-5.6好像,正在把「会做题」和「会做事」这两件事,慢慢拧到一起。

标准化测试里的题目,模型多半在训练数据里见过千百遍;真正见功夫的,是那些它从没遇到、也无处抄答案的新问题。

谁能在那儿稳住,谁才配得上「智商」这两个字。

参考资料:

https://x.com/davidpattersonx/status/2077049232490672458 

https://trackingai.org/

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

举报
收藏 0
打赏 0
评论 0
上海土拍揽金90.6亿 一家不锈钢企业青山实业成最大赢家
上海第七批次土拍终于落槌。如果只看实时拍地数据,这似乎是波澜不惊的一天:上架5宗地块全部拍出,总揽金90.6亿元,没有所谓的地王地块,也没有超高溢价率的房企争夺战。但如果将视角拉远,会发现这场土拍背后,筛选出了上海楼市中两种截然不同的资本面孔。第一类,是常年参与上海土拍的各大房企们:从绿城、招商,再到华润、联发,几家企业已沉浸这片楼市多年;第二类,则是那些选择“跨界”入局的实业企业们,而本场土拍中

0评论2026-08-0570

早期项目 | 从智能喂养切入,一家创业公司想搭建母婴AI生态
作者 | 张子怡编辑 | 袁斯来母婴市场在全球拥有万亿级规模。中国的母婴消费市场规模已突破5万亿元,年均增速保持12%的稳健水平;全球母婴市场总量更是达到约2万亿美元。庞大的母婴市场背后,其智能化渗透率较低,尚不足1%。全球母婴家庭普遍面临养育压力大、成本高、信息繁杂等核心痛点,而传统母婴产品仍停留在基础功能阶段,智能化程度不足、生态割裂,无法满足新一代家庭需求。以喂奶为例,不少家庭依然采用着极为

0评论2026-08-0572

壹酒店“失败”启示录……
近日,三亚海棠湾阳光壹酒店正式撤牌,原址将引入希尔顿旗下康莱德品牌。这意味着新喜达屋在中国内地的唯一酒店黯然离场,也宣告康莱德阔别四年后重回海棠湾。为何是小众先锋的壹酒店退出,而老派奢华的康莱德归来?在存量竞争白热化的当下,业主为何要么自持、要么纷纷转向国际酒店巨头?壹酒店换牌康莱德,新喜达屋退出中国市场?近日,三亚海棠湾康莱德酒店项目悄然落地了。令人意外的是,该项目曾一度传出要换牌凯悦旗下的奢华

0评论2026-08-0576