ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

AGI来没来不好说,但GPT-6真把Token省下来了

AGI来没来不好说,但GPT-6真把Token省下来了 会刷题不算什么能干活才真有用文魏琳华编刘俊宏多年以后人类或许会想起AGI时代的到来是在一个平平无奇的夜晚。9月3日整个AI圈可能都没睡好。先是晚间全球AI大宕机就当所有人准备洗洗睡的时候9月4日凌晨三点半GPT-6 Astra亮相了。虽然发布会上OpenAI宣布还只对部分企业用户开放不过好在它没让我们等太久。9月5日OpenAI全量推送了GPT-6 Astra让付费用户们及时体验上了新模型。“欢迎来到AGI时代。”在介绍GPT-6 Astra时OpenAI总裁Greg Brockman说。和前几代大模型相比OpenAI交出的新模型成绩上确实相当耀眼正如模型的名字“星辰”它在多个关键基准上跑出了“饱和”的成绩把编程、长程任务的能力往上拔了一截。但“会刷题”算不得什么能干活才真有用。实际干活时GPT-6 Astra能做到“又快又省”——交付质量更高的同时它单次任务的Token消耗和任务耗时都明显低于上一代。Perplexity在自家AI研究智能体评估框架中甚至测出Astra的单次任务花销低于Fable 5.1。发布不到一周Anthropic的新模型Fable 5.1就被GPT-6 Astra抢去了风头。现场演示和网友实测里各种复杂的活儿都被丢给了它操作电脑、填表单、建网站甚至把电子原理图排成可投产的PCB、在Blender里建好房间模型再转进虚幻引擎让用户可以在建模场景中走动查看房屋细节。支撑这一跃迁的是又一次“大力出奇迹”据外媒报道GPT-6 Astra的训练动用了10万 GPU 的集群是OpenAI迄今最大规模的一次训练。那么这一代模型到底变了什么所谓AGI时刻到底是真的还是只是又一次宣言性能“饱和”的GPT-6 Astra成色几何这次GPT-6 Astra没有“见光死”实际体验和演示效果差距不大。昨天GPT-6 Astra已经正式全量向所有订阅用户开放使用。早上晒出的一众测评案例中有人惊叹它干活的交付质量有人提到它跑任务更省Token、成本低。具体到能力表现层面GPT-6 Astra在一些特定领域跑出了接近满分的极限分数。人类的考卷已经快“考不下”了。比如它在研究级数学基准FrontierMath Tier 4跑到98官方形容为“饱和”也就是它的分数已经达到了测试的上限在强调陌生环境中学习与抽象推理的ARC-AGI-3上GPT-6 Astra从上一代GPT-5.6 Sol的7.8%直接跳到99.9%。可以说是直接实现了“从0到100”的突破漏洞利用测试ExploitBench则直接满分100%GPT-5.6 Sol为78.5%。最夸张的是ARC-AGI-3它相当于把大模型扔进一个陌生环境不给规则说明看它能不能自己摸索规则并做出正确决策。这个测试对人类来说并不难100分轻轻松松但AI之前一直搞不定徘徊在不及格的区间。然后GPT-6 Astra就满分了。三个月时间AI就进化成人类了用ARC Prize Foundation的Greg Kamradt的话来说“在96%的测试层级上Astra超越了我们的人类行为效率基线实际上达到了人类水平。”OpenAI是怎么做到的还是用了一点“手段”的——将模型和Harness打配合。这个99.9%的高分的前提是它跑在OpenAI为自家模型适配的Harness上所以效果会更突出。但这并不意味着去掉Harness就立刻“拉胯”。根据X上ARC Prize发布的测评结果是62.7%这已经是第二名Claude Opus 5的两倍。但这种成绩还是容易令人质疑。自家模型自家特调测出来的分这不是忽悠人么厂商自报分数用自家框架确实是常规操作DeepSeek上月底发布的DeepSeek V4 Flash官方在注释里写明基于自家DeepSeek Harness测得它还同步把Harness作为独立产品推向市场。所以这并不是问题。不过GPT-6 Astra的提升也有些许“偏科”。从OpenAI给出的成绩来看它在部分任务上出现了“倒退”的情况。以测评模型Agent能力的指标之一——人类终极测试Humanity’s Last Exam上GPT-6 Astra的成绩为57.2%反而低于GPT-5.6 Sol与Fable 5.1。这样的偏科成绩也让测评机构给出了不一样的评估分数。比如按照Artificial Analysis的通用智能指数Astra 为61.2与Sol的60.9基本持平导致新模型也被不少网友戏称是“更贵版本的Sol”。但实际上AA测评的指标更多集中在知识、推理等能力上GPT-6 Astra的强项多数不在它的测评范围内。说完上面这些“虚的”测试我们来看看GPT-6 Astra在商业化已经被验证领域的表现。在Coding场景上GPT-6 Astra显然是冲着最强目标冲击的。它在Terminal-Bench 4.0测评智能体在复杂终端任务上的表现为57.9%超过了Fable 5.1的55.8%而GPT-5.6 Sol在这个基准上只有37.3%。得益于编程能力的提升现在人们拿GPT-6 Astra已经能做出媲美真实游戏的作品。不少网友已经晒出了他们拿新模型做出的射击游戏、开放世界冒险游戏等等。从建模和实际体验来看已经可以算得上成品级别。智能体维度相较于上一代GPT-6 Astra在长程任务的处理能力上了一个台阶。单看智能体维度的跑分其中GPT-6 Astra在Agents Last Exam真实软件中完成金融建模、工程设计、媒体制作等专业任务拿到59.3%略高于上代Sol的53.6%OSWorld 2.0真实桌面环境里看屏幕、点鼠标、敲键盘完成操作72.6%在跨系统业务流程的AutomationBench一项上GPT-6 Astra的得分从GPT-5.6 Sol的18.1%大幅提升至41.4%。那么强大能力的代价是什么训练出这样的模型OpenAI靠的是又一次“大力出奇迹”。据外媒报道GPT-6 Astra的训练动用了10万GPU的集群这是OpenAI迄今为止最大的训练规模。不得不感慨Scaling Law的强度还是立竿见影。但AI圈还有一个共识高分不一定就“高能”模型到底好不好用还得干活层面见真章。响应更快、Token消耗更少 GPT-6更擅长“干活”比起跑分本次大家讨论的一个共识是GPT-6 Astra充分展示了它“干活能力”的跃升——操作电脑、长任务、端到端交付等能力它的演示效果都让打工人心动不已。X上展示的测评也高度一致地落在干活测评上。多数测评图中GPT-6 Astra在“干的快、干的好”这两项上遥遥领先Perplexity在自家面向AI研究智能体的评估框架中测试GPT-6 Astra不仅分数最高它花的钱也比Fable 5.1更便宜。是什么让用户纷纷“爽歪歪”主要是两个关键体验一是降低成本二是压缩任务的处理时长。GPT-6 Astra讨人喜欢就在于这两点。通过有效降低任务输出TokenGPT-6 Astra实现了降低成本的效果。不仅输出冗余大幅精简比如在考察复杂专业任务的Agents Last Exam最高分设置下相比Claude Opus 5少用了约65%的输出Token面向终端任务的Terminal-Bench 4.0中Astra 的预估API成本比自家上一代Sol缩减约9%对比Fable 5.1的降幅更是高达63%。作为OpenAI的客户Higgsfield AI CEO Alex Mashrabov表示Astra比他们测过的其他模型少用了高达20%的Token。时间消耗上和上一代模型相比GPT-6 Astra将部分任务的时间压缩掉近一半。OSWorld 2.0上Astra完成一个计算机使用任务的平均耗时约40分钟比上一代Sol的75分钟少了 47%Mind2Web基准上Codex任务完成速度做到上一代的1.9倍。这些改变不仅和模型各项能力提升相关可能和OpenAI采用的模型新架构有关。据The Information报道OpenAI在GPT-6 Astra采用了一种叫“循环深度”recurrent depth的架构技术它通过复用同一组网络层进行多次内部循环计算中间推理在隐藏状态中完成不会全部转化为输出文本。简单来说就是原来OpenAI o系列的思考模型基本上会把中间推理步骤以自然语言写出来变成一条人类可读的思维链。这种“想什么都写出来”的方式好处是透明坏处是啰嗦一个复杂任务可能输出几千个Token的推理过程。新的架构让模型内部思考更多但它输出的Token却减少了这让它能在办事时做到“又快又省”。从OpenAI的分享中另一个可以确认的事实是通过对Harness能力优化是它办事能力提升的关键。先从Computer Use计算机使用说起也就是让大模型自主操作电脑浏览、干活的种种能力。对此OpenAI直接称它“世界上最好的Computer Use模型”GPT-6 Astra把软件当作“人的工具”来用——让AI填网页表单、更新CRM记录、整理日程分析数据出图、搭好网站再自己跑一遍前端QA。OpenAI现场还展示了在KiCad里把电子原理图排成可投产的PCB、在Blender建模后转进虚幻引擎5让设计师和客户在3D场景中“看”到实际效果。根据平面图GPT-6 Astra能从零搭建出完整的房屋3D模型包括墙体、门窗、楼层结构等建筑元素。X上有用户分享的实测效果对比中也能看到GPT-6 Astra的细节做得已经相当完善。第二处升级在Codex的“记忆”机制新增的跨上下文管理机制起到了作用。Astra可以跨上下文窗口保存“工作笔记”同时让更早的完整上下文保持可搜索之前的消息和工具输出都能找回。重点内容主动记下来漏记的细节还能回头翻避免因上下文压缩导致细节丢失。此外Codex同步推出的“异步提问”机制做了一个产品细节上的优化有开发者在X上贴出自己让Codex连跑数小时的记录模型在中途遇到歧义时不再卡死等人工确认而是先把能独立推进的部分做完同时攒好问题等用户回答。这层优化简直救了程序员的命。之前还得守在电脑前一步步确认需求现在AI终于能清净一会可以多“摸会鱼”了。总而言之GPT-6 Astra确实是一次重磅升级无论是能力还是实际应用层面。但AGI时代有没有到来很显然现在还不该回答这个问题。参考电力时代的经验AI迟早会走到那一天——当大模型解决复杂工作变得更快速、更便宜时AI本身的讨论会逐渐退居幕后取而代之的是各种AI原生的产品。到那时候“用不用AI”的讨论就该翻篇了就像现在早已没人会讨论“要不要用电”。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表