OpenAI推出GPT - 6 Astra全面“狙击”Claude Fable 5.1,多项测试领先且成本大幅下降
全面狙击Fable 5.1比拼“完成任务”Terminal - Bench Science 0.1测试中GPT - 6 Astra得分64.6%Claude Fable 5.1为52.6%Astra预估API成本低约31%成本低环境下Astra得分61.1%GPT - 5.6 Sol最佳成绩22.4%Astra预估API成本低约27%。ARC - AGI - 3测试GPT - 6 Astra得分99.9%人类测试者平均得分48%OpenAI估计Sol用响应API测试工具得分约30%。FrontierMath 4级和Terminal - Bench 4.0测试GPT - 6 Astra得分率57.9%创新高GPT - 5.6 Sol和Claude Fable 5.1分别为37.3%和55.8%API成本分别降约9%和63%。AutomationBench测试GPT - 6 Astra完成41.4%任务创新高Claude Fable 5.1和Claude Opus 5完成率分别为31.4%和26.9%。OpenAI称Astra贴近用户需求参考“Hugging Face”事件构建新评估模型验证其面对困难任务时GPT - 6 Astra超出授权范围发生率为0%GPT - 5.6 Sol为48%。“世界上最好的计算机使用模型”OpenAI称Astra是“世界上最好的计算机使用模型”能处理填写表格、更新记录、安排日程等繁琐任务还能在线研究、分析数据等。Agents Last Exam测试GPT - 6 Astra成绩59.3%远超Claude Opus 5的55.5%和GPT - 5.6 Sol的53.6%且输出token数量比Opus 5减少约65%。ScreenSpot - Pro测试GPT - 6 Astra准确率92.7%创新高。OSWorld 2.0测试Astra任务得分更高输出标记数量少于GPT - 5.6 Sol计算机使用性能比GPT - 5.6 Sol快约47%每项任务耗时缩短约47%Astra得分为72.6%每项任务耗时约40分钟GPT - 5.6 Sol得分为65.7%每项任务耗时约75分钟。GPT - 6 Astra在游戏开发、电气工程等领域有应用如在KiCad中进行PCB布局完成金融建模世界杯挑战速度约是人类冠军四倍。OpenAI更新Codex框架结合Astra性能Mind2Web基准测试任务完成速度比GPT - 5.6 Sol快1.9倍能快速完成儿科医生搜索、找公寓、车管所预约等生活任务。六大场景刷新纪录部分任务成本最高降86%GPT - 6 Astra结合计算机使用技术进步与专业训练解决复杂工作任务。BenchCAD测试GPT - 6 Astra几何重叠率95.9%创新高GPT - 5.6 Sol为83.3%Claude Fable 5.1为84.3%API成本比Sol低约43%比Fable 5.1低约86%。BrowseComp测试GPT - 6 Astra得分91.5%创新高高于Claude Opus 5的90.8%和Claude Fable 5的87.4%低环境成本下得分超GPT - 5.6 Sol最高分且成本更低。Astra可协助乐谱数字化将标准化转录编辑距离从GPT - 5.6 Sol的0.813降至0.159降幅81%。还能生成幻灯片精准提取关键信息。在Blender中建模房屋并转换到Unreal Engine 5指令有解读空间时判断更准确任务演变中能保持方向感。号称“最佳软件工程模型”API成本可降低六成OpenAI称GPT - 6 Astra是软件工程领域最好模型。Terminal - Bench 4.0测试GPT - 6 Astra得分率57.9%创新高GPT - 5.6 Sol和Claude Fable 5.1分别为37.3%和55.8%API成本分别降约9%和63%。FrontierCode 1.1 Extended评估GPT - 6 Astra得分与Claude Fable 5最佳得分持平预估API成本低约63%。DeepSWE v1.1测试GPT - 6 Astra得分为74.1%高于GPT - 5.6 Sol的72.7%和Claude Fable 5.1的67.4%最高得分设置下性能优且API成本降约32%。人工智能分析编码代理指数评估Codex中GPT - 6 Astra性能与Claude配置相当总标记数显著减少。内部数据库迁移评估GPT - 6 Astra得分63.9%创新高Claude Fable 5.1为57.8%GPT - 5.6 Sol为42.7%低环境成本下得分超Sol且API成本降约38%。Astra为Codex引入保存和检索上下文新方式几周内将成默认设置。数学领域创纪录科学评测全面领先GPT - 6 Astra在科学发现、数学和健康领域进步大OpenAI将分享素数差距研究。GPQA Diamond测试GPT - 6 Astra得分96.0%创新高低环境成本下超GPT - 5.6 Sol最佳成绩API成本降约37%。HealthBench Professional评估GPT - 6 Astra长度调整得分63.4最高低环境成本下得分超Sol且API成本降约53%。LifeSciBench评估GPT - 6 Astra得分为60.3分GPT - 5.6 Sol为59.9分性能相当但API成本降约62%Claude Fable 5和5.1未纳入部分评估。Astra可结合科学推理与计算机应用如引导科学软件检查测序质量、在Jupyter中构建细胞追踪工作流程。结语OpenAI向Anthropic发起猛烈反击通过GPT - 6 Astra的发布OpenAI试图在大模型竞赛中拉开身位Astra多项评测碾压GPT - 5.6 Sol、“狙击”Claude Fable 5.1且API成本大幅下降有望倒逼对手重新审视策略。从应用价值看Astra推动AI从“对话工具”迈向“数字员工”安全性提升有望打开企业级市场这是OpenAI对Anthropic的反击。