OpenAI GPT-6跑分作弊是怎么一回事 测试工具的胜利[看点] - 社会 - 国内资讯 - 亿席商务网
标王 热搜: 广州  SEO  贷款  深圳    医院  用户体验  网站建设  机器人  贵金属 
 
 
当前位置: 首页 » 资讯 » 国内资讯 » 社会 » 正文

OpenAI GPT-6跑分作弊是怎么一回事 测试工具的胜利[看点]

放大字体  缩小字体 发布日期:2026-09-06 22:39:52  来源:互联网  作者:亿席商务网  浏览次数:97
核心提示:2026年9月4日,OpenAI发布了GPT-6 Astra,CEO山姆·奥特曼和总裁格雷格·布罗克曼宣称“AGI时代到来”。该模型在ARC-AGI-3基准测试中获得了99.9%的高分,这一成绩被媒体广泛引用

2026年9月4日,OpenAI发布了GPT-6 Astra,CEO山姆·奥特曼和总裁格雷格·布罗克曼宣称“AGI时代到来”。该模型在ARC-AGI-3基准测试中获得了99.9%的高分,这一成绩被媒体广泛引用。然而,这个数字的真实意义值得探讨。

根据公开报告,GPT-6 Astra在不同测试框架下的表现差异显著。使用OpenAI定制版工具时,得分为99.9%,而使用标准测试框架时仅为62.7%。这种差距主要源于测试工具本身的能力:标准工具每次行动后丢弃私有推理状态,而定制工具则保留这些状态并能压缩长对话以复用之前的工作。换句话说,99.9%的成绩是基于“模型加记忆机制加调用策略”,而非裸模型本身。

此外,从2026年3月到8月,整个行业在ARC-AGI-3基准上的得分迅速提升,从不到1%上升至100%。这表明该基准更多地反映了测试工具的进步,而非模型的实际能力。

关于真实进步幅度,GPT-5.6 Sol在标准框架下得分为7.8%,而在定制框架下估计为30%左右。因此,GPT-6 Astra的真实进步是从30%到99.9%,而不是从7.8%到99.9%。

尽管GPT-6 Astra在某些特定基准上表现出色,例如数学考试、网络安全和软件工程等,但在综合智能指数上仅获得61分,与一些其他模型相当甚至更低。这说明其综合智能水平仍有待提高。

API定价方面,GPT-6 Astra的输入每百万Token 10美元,输出每百万Token 50美元,是GPT-5.6 Sol的2.5倍。实际使用中的成本可能会更高,特别是涉及长代码或分析报告生成时。

对于普通用户而言,看到“XX基准近乎满分”时应谨慎判断,了解具体测试框架。OpenAI宣布达到AGI不仅具有学术意义,还涉及商业利益。同时,GPT-6 Astra的安全性和可监控性有所下降,这可能会影响其在实际应用中的表现。

建议开发者在安全研究、代码Agent、逆向工程等领域测试GPT-6 Astra。普通ChatGPT用户不必急于升级,企业采购时应考虑完整任务成本,通过实际工作流测试来评估模型性能。这场AGI宣告更像是OpenAI IPO周期的一部分,技术的实际应用效果才是关键。



 

  以上是“OpenAI GPT-6跑分作弊是怎么一回事 测试工具的胜利[看点]”的全部内容,希望对大家有所帮助。


免责声明:以上所展示的信息由网友自行发布,内容的真实性、准确性和合法性由发布者负责。亿席商务网对此不承担任何直接责任及连带责任。任何单位或个人如对以上内容有权利主张(包括但不限于侵犯著作权、商业信誉等),请与我们联系并出示相关证据,我们将按国家相关法规即时移除。
 

[ 资讯搜索 ]  [ 加入收藏 ]  [ 告诉好友 ]  [ 打印本文 ]  [ 违规举报 ]  [ 关闭窗口 ]

 
 
本企业其他资讯

 
网站首页 | xml | top资讯 | 粤ICP备11090451号