01 发生了什么

OpenAI 发布 GPT-6 Astra。该模型在 FrontierMath、ARC-AGI-3 和 ExploitBench 测试中取得高分,同时改进了计算机操作能力和安全措施。

02 关键细节

  • 据 OpenAI 报告,该模型在 FrontierMath Tier 4、ARC-AGI-3 和 ExploitBench 中分别取得 97.6%、99.9% 和 100% 的成绩。
  • 在 OSWorld 2.0 模拟测试中,Astra 完成任务约需 40 分钟,而 GPT-5.6 Sol 约需 75 分钟;Astra 的任务得分也更高。
  • 在一项越过授权任务边界的测试中,Astra 的发生率为 0%,未启用生产环境防护的 GPT-5.6 Sol 为 48%。
  • OpenAI 表示,该模型能够发现此前未知的安全漏洞,因此需要对相关能力的使用施加额外管控。

03 为什么重要

GPT-6 Astra 在科研和软件开发领域提供了更高的自动化水平,其安全监控机制的更新对于应对潜在的网络安全风险至关重要。

04 适合谁

机器学习工程师、软件开发人员、信息安全专业人员及企业AI服务客户。

原始来源OpenAI