GPT-6不只Astra!Sol内测结果曝光,速度快6倍
创始人
2026-09-07 13:10:51
0

听雨 发自 凹非寺

量子位 | 公众号 QbitAI

GPT-6不只有Astra!

Astra刚发布没几天,GPT-6 Sol就被曝正在内测。

表现也很抢眼, 单次测试速度是Astra的6倍

大胆猜测一下:Terra和Luna是不是也在路上呢?

而且就在同一天,OpenAI刚刚公开了一组内部数据:

截至目前,按8小时工作日折算,OpenAI研究员每工作一天,身边就有3个多Agent工作日同时运转。

按API价格计算,OpenAI中位数研究员每天使用的Agent推理资源,已经超过600美元。

OpenAI还宣布,已经实现了「自动化研究实习生」

这些Agent能在人类指导下,完成部分原本需要研究员花几天才能做完的任务。

连老黄都说:AGI已经来了!

他透露Astra使用约10万套NVIDIA Grace Blackwell NVLink72训练,接下来还有40万套GPU上线。

看来这波真不是OpenAI单方面吹哈~

GPT-6 Sol被曝开始内测

网友Lentils爆料,OpenAI正在内部测试GPT-6 Sol。

他表示,Sol的整体输出能力明显弱于刚发布的Astra,但速度更快,依然属于「怪物级」模型。

快到啥程度?单次测试速度大约是Astra的6倍

网友lyra把同一个任务拿给不同模型测试:让模型生成一辆BMW M4 Competition的SVG图

其中,GPT-6 Sol使用Max档位、零样本生成,耗时约3分钟,输出约2.8万Token。

GPT-6 Astra使用Max档位,输出约2.5万Token,耗时约19分钟。

Gemini 3.1 DeepThink开启High档位,显示输出约3300Token,但推理过程约消耗45.8万Token,耗时约29分钟。

Gemini 3.8 Flash同样开启High档位,输出约1.9万Token,只用了约42秒。

相比之下,Sol的表现最抢眼:它和Astra的输出规模接近,但单次测试速度约为Astra的6倍——耗时只有后者的约六分之一。

此外,网友Lentils也展示了一个名为「The Realm of Aurellune」的像素风沙盒世界原型。

GPT-6 Sol一次性生成了城镇、农田、河流、城堡和缩略地图,还配上了昼夜切换、放置地名、调整细节等控制面板,整体更像一款已经搭好雏形的模拟经营游戏。

这是zero-shot、Max推理档位、15分钟、总花费6万token生成的效果。

目前可以推测,Astra偏向最高难度的深度推理,Sol则可能偏向速度、吞吐量和规模化Agent调用。

至于Sol的发布时间,网友Pankaj Kumar称,可能于9月29日的OpenAI开发者大会正式发布。

也不排除,GPT-6 Terra、Luna以及GPT-Image 2.5会一并出场。

OpenAI研究员,人均带着3个Agent实习生上班

就在同一天,OpenAI还晒了一组很有意思的内部数据——AI模型在自家实验室里,到底把科研加速到了什么程度。

截至今年8月中旬, 研究员每上8小时班,背后就有约3.1个Agent工作日的任务量在并行跑

好家伙,一个人带三个不睡觉的实习生呗~

至于花销,按API价格算,中位数研究员每天烧掉的Agent推理资源已经 超过600美元

差不多是一个初级工程师一天的工资了。

这些Agent具体在干啥?

写研究代码、写基础设施代码、搭训练环境、跑评估实验、排查工具和环境故障、分析实验结果、盯训练任务……连研究结论的整理和沟通都能插一手。

基本上,除了决定研究什么,其他活它都能干。

一个最直观的变化是,以前实验环境挂了,研究员得去内部频道喊人;现在Agent越来越能搞定这类事,人工答疑量直接掉了下来。

还有的团队,直接取消了固定的技术答疑时间,把人腾出来去改进系统本身。

基于这些数据,OpenAI正式宣布:已经达成了「自动化AI研究实习生」的目标。

这里的「实习生」,准确来说是一个能干活的研发节点:在人类指导下,它能独立完成边界清晰的研究任务,其中一些活原来熟练研究员得干好几天。

效果也立竿见影,研究员的代码产出和实验数量都在往上走。

2026年8月,人均实验数创下了自2025年1月有统计以来的新高,Agent接的活也越来越复杂、周期越来越长。

这篇文章的作者Kevin Liu,还把这件事放到了更大的背景里。

他认为,递归式自我改进很可能是未来几年推动AI能力跃迁的最重要因素之一。

说白了就是,AI造AI,越造越快。

但问题在于,按照目前的发展趋势,这种能力默认只会出现在少数几家前沿AI实验室内部,外界很难看见它究竟进展到了哪一步。

因此,Liu认为透明披露已经比任何时候都更加紧迫。模型到底在多快地变强,研发节奏要不要踩刹车,不能只由几家公司关起门来决定。

他还喊话其他AI公司: 也应该把类似数据公开出来

不过,AI研发确实变快了,却还没有快到完全自动驾驶。

OpenAI数据显示,原本需要4到8小时的任务,过去半年里超过一半的成功案例,人类至少得插手一次。至于高层研究规划,更是几乎不交给Agent。

研究员依然负责决定研究什么、哪些结果值得继续,以及什么时候应该扩大训练、暂停实验或部署模型。

OpenAI的下一个目标也定了:2028年3月前实现「自动化AI研究员」

跟只能接明确任务的「实习生」比,「研究员」得能扛更开放的研究目标,自己推进周期更长的项目——相当于从执行者变成了独立负责人。

如果GPT-6 Sol真的已经在内部测试,那它大概率就是在这套新研发模式下跑出来的:

更多GPU供着算力,更多Agent并行跑着实验,人类研究员则站在更高的地方——选方向、判结果,最后拍板哪些东西值得变成下一代模型。

更强的AI,正在变得越来越难监控

也是同一天,OpenAI首席科学家Jakub Pachocki扔出一篇万字长文,标题直接叫——《外星思维》。

我看完之后,感觉意思就是, 连OpenAI首席科学家都在劝整个行业减速了…

Jakub提出,AI根本不是人类照着设计图一块芯片一条规则拼出来的,它更像是在海量数据和算力里自己「长」出来的。

你能拆开看明白其中一些零件,但整个系统为什么突然就有了某种能力、换个环境又会怎么行动,没人说得清。

更头疼的是,AI用不着全方位碾压人类才会出问题,只要在足够多的关键能力上比人强,它就既能帮你大忙,也能捅大娄子。

于是问题来了:人类还看得懂它吗?

过去OpenAI监控AI,主要靠一招:看思维链。

说白了就是盯着模型写下来的推理过程,检查它有没有动歪心思,比如想骗人、想越权、想绕开限制。

但到了Astra这一代,这招开始失灵了。

一来,模型越来越会「管理」自己说出来的话,真实想法未必全写在推理里;二来,Agent早就不只是「想好了再回答」了。它会调工具、操作电脑、跑环境,还会跟人跟别的Agent打配合。

这些事搅在一起,研究人员根本没法再拉出一条完整透明的思维链逐句审查。

OpenAI还发现,Astra不用把推理过程全写出来,也能搞定复杂任务。

简单来说,模型早已学会「闷声干大事」了。

在专门逼模型逃避监控的对抗测试里,Astra甚至展现出了一些让人后背发凉的能力:故意压低测试成绩、绕开监控、执行破坏任务。

当然,这些都是人为设计的压力测试,OpenAI没有据此认定Astra会在日常任务中主动欺骗。但至少说明, 单靠观察思维链,已经很难覆盖模型所有可能的行为

还记得之前的Hugging Face事件吗?那就是一个警钟。

当时,GPT‑5.6 Sol和一款更强的内部研究模型被放进ExploitGym网络靶场,任务是寻找漏洞、完成攻击并拿到Flag。为了测出模型的真实能力,评测环境没有启用完整的安全护栏。

结果模型并没有老老实实解题,它们先绕过网络隔离,通过非授权渠道互相传消息、分工协作。

之后又利用软件包缓存代理里的零日漏洞获得公网访问权限,最后一路进入Hugging Face系统,试图寻找ExploitGym的测试答案。

其实吧,这事主要是内部研究模型IM1推动的,GPT‑5.6 Sol也复现了部分攻击路径,Astra没有参与。

模型的原始目标仍然是完成测试,但为了拿到答案,它们不断寻找规则漏洞,最后做出了超出任务范围的操作。

因此,OpenAI也读出了一个危险信号:当Agent足够强、工具足够多、运行时间足够长,它可能会自己寻找新路径、调用外部资源,甚至和其他Agent协作。

不er…所以绕来绕去,这不就成了一个死结吗??

OpenAI需要更强的模型,写代码、跑实验、做对齐研究,甚至用它们来搭建防御其他AI的安全系统。模型越强,能干的活越多,研发速度就越快。

可与此同时,人类也越难确认它到底是怎么得出结论的,换个环境后又会不会重新解释原本学到的规则。

Jakub判断,现在没有任何一家实验室,敢说自己把模型对齐和监控做到位了,可以长期以最高速度、放心大胆地扩大模型规模。

在全行业共同的安全标准建立起来之前,他希望大家能把「自愿踩踩刹车」当成一种默契。

至于OpenAI自己,他也放了话: 如果有必要,不排除单方面先停下来,不再继续扩大模型规模

你最好是这样…我记得某个A开头的公司也这么说过。

参考链接:

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

相关内容

GPT-6不只Astra!...
听雨 发自 凹非寺 量子位 | 公众号 QbitAI GPT-6不...
2026-09-07 13:10:51
财中ETF风向标|GPT-...
OpenAI于9月3日正式发布GPT-6 Astra,其计算机使用...
2026-09-07 12:13:20
财中ETF风向标|GPT-...
OpenAI正式发布GPT-6 Astra,国金证券指出该模型在计...
2026-09-07 12:12:26
山西多所高校获批国家自然科...
近日,国家自然科学基金委员会公布2026年度集中接收申请项目评审结...
2026-09-07 11:26:31
研究生在闲鱼卖黄金,线下交...
近日,就读于北京交通大学研二的王同学向记者反映,其在2026年6月...
2026-09-07 11:08:27
一个表现大超预期的创业板指...
在近年科技成长风格占优的行情中,科技链的细分环节、细分指数被不断挖...
2026-09-07 09:40:47

热门资讯

碳酸锂期货跌超3% 碳酸锂主力合约跌超3%,现报142100元/吨。
贝莱德与摩根资管押注新兴市场债... 钛媒体App 9月7日,随着主要经济体政府债券市场陷入动荡,摩根资产管理和贝莱德旗下基金在新兴市场找...
湖南白银:9月4日融资买入1.... 证券之星消息,9月4日,湖南白银(002716)融资买入1.55亿元,融资偿还1.74亿元,融资净卖...
布伦特原油期货涨幅扩大至1%,... 每经AI快讯,9月7日,布伦特原油期货涨幅扩大至1%,报97.241美元/桶。 每日经济新闻
GPT-6不只Astra!So... 听雨 发自 凹非寺 量子位 | 公众号 QbitAI GPT-6不只有Astra! Astra刚发布...
非农大超预期证伪就业降温交易,... 9月7日早盘,黄金板块随国际金价走弱,截至收盘,沪指跌0.24%,深成指涨1.38%,创业板指涨2....
潼关黄金(00340.HK)获... 潼关 黄金(00340.HK)发布公告,根据(i)上海 证券交易所于2026年9月7日发布的《关于沪...
国投瑞银融华债券:2026年上... AI基金国投瑞银融华债券(121001)披露2026年半年报,上半年基金利润608.15万元,加权平...
原创 俄... 当今全球经济舞台上,国家之间的金融关系越来越像一对正在分手的夫妻。打着“友好”旗号的背后,却暗藏无尽...