分享好友 健康资讯首页 健康资讯分类 切换频道

刚刚,GPT-5.6「太阳系」全家桶上线,Codex消失了

2026-07-10 08:0611036kr

OpenAI终于把GPT-5.6「全家桶」交到所有人手里。同时,ChatGPT和Codex彻底合并,全新AI打工神器ChatGPT Work杀疯。

终于等到了!

就在刚刚,OpenAI一口气把GPT-5.6「全家桶」——Sol、Terra、Luna全放了出来。

毫不夸张地说,Sol这次就是冲着Claude Fable 5来的:

· Agents' Last Exam:Sol豪取53.6%,把Fable 5甩开13.1分;

· Terminal-Bench 2.1:Sol拿88.8%,开Ultra顶到91.9%,Fable 5才83.1%;

· Coding Agent Index:Sol狂揽80分刷新SOTA,力压Fable 5 2.8分。

更刺激的的价格——

Fable 5每百万token的输入是$10、输出是$50;

Sol直接对折,只要$5和$30,Terra再砍半到$2.5和$15,Luna干脆只要$1和$6。

同在今天,ChatGPT和Codex终于完成合体,OpenAI「超级应用」真的来了。

从此,只剩下ChatGPT这一个应用。

GPT-5.6,全面上线

自6月27日初次亮相以来,全网翘首以盼的GPT-5.6终于「到手」了。

Sol、Terra、Luna,一个不差,全部交给所有人。

旗舰Sol(太阳):专治硬核编码、知识工作、网络安全和科学领域「硬骨头」,堪称地表最强。

Terra(大地)+ Luna(月亮):主打一个极致性价比,用更少的成本体验卓越的性能。

干翻Fable 5,编程新王登场

先看最硬核的编程,OpenAI直接把Sol称为「迄今最强编程模型」。

在Artificial Analysis Coding Agent Index上,Sol开max推理拿下80分,创下新SOTA,比Fable 5高2.8分。

而且,输出token不到一半、耗时不到一半、成本还低约1/3。

这种碾压贯穿整条产品线:Terra略高于Fable 5,Luna则直接越过Opus 4.8。

而且各自都只用了约1/3的时间、约一半的输出token、约1/4的成本。同样的活,OpenAI这次是用小得多的代价干完的。

在考验命令行长程工程的Terminal-Bench 2.1和DeepSWE上,Sol同样刷新了SOTA。

四个Agent一起上,Ultra模式上线

如果一个模型不够,那就上四个。

这一次,GPT-5.6新增了两档高能力设置——

max档:比原来的xhigh给模型更多时间去推理;

ultra档:默认一次派四个Agent并行开工,重活还能上到十六个。

用更多的token,换更强的结果和更快的出活速度。

在BrowseComp、SEC‑Bench Pro、Terminal‑Bench 2.1三项评测上,加了并行Agent之后,「分数‑耗时」曲线整体向左上方移动——分更高,还更快。

这一代GPT‑5.6,还悄悄补上了一块过去的短板——设计审美。

它能自己去「看」渲染出来的结果,检查视觉和功能上的毛病,然后动手修,最后再把成品交给你。

如下,GPT‑5.6设计的航海小游戏、博物馆网站、室内设计展示等,都展现出其设计能力上质的飞跃。

GPT-5.6在「端到端知识工作」上的成绩,同样亮眼。

Sol在BrowseComp上拿下92.2%、在OSWorld 2.0上拿下62.6%,双双刷新SOTA。

尤其是在OSWorld上,它超过Opus 4.8的同时,输出token少用了85%。

GPT‑5.6炼出自己

OpenAI「AI永动机」成真

GPT‑5.6最科幻的一面,藏在OpenAI自己的办公室里。

OpenAI官方称,GPT‑5.6,是他们迄今最能加速AI研究的模型。

研究员用它来诊断故障、优化训练系统、跑实验、解读结果。

在GPT‑5.6内测期间,每位活跃研究员的日均输出token量,是GPT‑5.5最高水平的两倍多。

更夸张的是,过去半年,OpenAI投入到内部编程推理的研究算力份额涨了100倍,内部Agent的token用量涨了约22倍。

在一套衡量「递归自我改进(RSI)」的内部评测上,Sol比GPT‑5.5高出16.2分。

说白了,OpenAI正在用AI,加速造下一个更强的AI。

发布会直播中,研究员透露了一个关键细节——

全家桶里最小的Luna,是老大哥Sol后训练出来的!

过程是这样,先输入大致的需求,然后Sol就开始自己去找训练配置、挑选GPU、启动脚本、确认跑通,把一个模型的后训练从头到尾全包圆了。

这活儿放在过去,是一整队资深研究员的工作。

而现在,那个「自动化研究员」,真的已经很近了。

这也许就是当下这个AI时代之所以愈发疯狂,最有说服力的注脚。

ChatGPT和Codex

终于合体了

同在今天,ChatGPT桌面端迎来重大升级。

新增内置浏览器和Computer Use,能直接调用你本地的文件和应用,替你点击、打字、搬文件。

真正的关键在,原来的Codex应用,也和全新的ChatGPT桌面端合并了!

跟GPT-5.6一起端上来的,另一大重量级产品,便是ChatGPT Work。

它是一个能跨App和文件自主干活的Agent,能盯着一个项目连续跑好几个小时,把一个目标变成真正的成品。

可以说,这就是OpenAI版的「Claude Cowork」!

同样的,它可以通过手机端ChatGPT直接操控。

即便是电脑不在身边,也能继续推进工作。

从预览到全量上线,不过半个月;从追赶到反超,OpenAI只用了一次发布会。

但真正让人后背发凉的,不是那几张榜单,是GPT-5.6 Sol亲手训出了Luna。

当AI开始训练AI,时间就不再是线性的了。

竞赛的终点线正在消失,剩下的只是下一个版本号。

参考资料:

https://openai.com/index/gpt-5-6/

https://openai.com/index/chatgpt-for-your-most-ambitious-work/

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:桃子 摩西,36氪经授权发布。

举报
收藏 0
打赏 0
评论 0
上海土拍揽金90.6亿 一家不锈钢企业青山实业成最大赢家
上海第七批次土拍终于落槌。如果只看实时拍地数据,这似乎是波澜不惊的一天:上架5宗地块全部拍出,总揽金90.6亿元,没有所谓的地王地块,也没有超高溢价率的房企争夺战。但如果将视角拉远,会发现这场土拍背后,筛选出了上海楼市中两种截然不同的资本面孔。第一类,是常年参与上海土拍的各大房企们:从绿城、招商,再到华润、联发,几家企业已沉浸这片楼市多年;第二类,则是那些选择“跨界”入局的实业企业们,而本场土拍中

0评论2026-08-0570

早期项目 | 从智能喂养切入,一家创业公司想搭建母婴AI生态
作者 | 张子怡编辑 | 袁斯来母婴市场在全球拥有万亿级规模。中国的母婴消费市场规模已突破5万亿元,年均增速保持12%的稳健水平;全球母婴市场总量更是达到约2万亿美元。庞大的母婴市场背后,其智能化渗透率较低,尚不足1%。全球母婴家庭普遍面临养育压力大、成本高、信息繁杂等核心痛点,而传统母婴产品仍停留在基础功能阶段,智能化程度不足、生态割裂,无法满足新一代家庭需求。以喂奶为例,不少家庭依然采用着极为

0评论2026-08-0572

壹酒店“失败”启示录……
近日,三亚海棠湾阳光壹酒店正式撤牌,原址将引入希尔顿旗下康莱德品牌。这意味着新喜达屋在中国内地的唯一酒店黯然离场,也宣告康莱德阔别四年后重回海棠湾。为何是小众先锋的壹酒店退出,而老派奢华的康莱德归来?在存量竞争白热化的当下,业主为何要么自持、要么纷纷转向国际酒店巨头?壹酒店换牌康莱德,新喜达屋退出中国市场?近日,三亚海棠湾康莱德酒店项目悄然落地了。令人意外的是,该项目曾一度传出要换牌凯悦旗下的奢华

0评论2026-08-0576