GPT-6 Astra 评测解读
本文综合 OpenAI 官方资料与 Artificial Analysis 独立评测。引用数据均注明来源;目前不作为 NovaModelHub 独立实测结论。
发布于 2026-09-16 · 资料核验于 2026-09-16先看结论
Astra 更适合复杂编程、长链路工具调用和高价值专业任务。单 Token 价格高于 Sol,但独立评测显示其 Token 效率能够抵消部分成本;简单、批量任务仍应比较 Terra 或 Luna。
官方规格与价格
1.05M上下文窗口
128K最大输出
$10输入 / 1M Token
$50输出 / 1M Token
模型 ID 为 gpt-6-astra,支持 Responses API、Chat Completions、Computer Use、Web Search、MCP 与工具调用。查看 OpenAI 官方模型页 ↗
独立评测怎么说
以下数字来自 Artificial Analysis 于 2026 年 9 月 9 日发布的独立分析。该机构把模型放进相同的评测体系,并同时观察能力、Token 使用和单任务成本。


报告结果:Astra 在 Intelligence Index 得分 53,与 Claude Fable 5.1 并列;Coding Agent Index 得分 62,高于 Sol 的 55;Terminal-Bench v4.0 为 Astra 59%、Sol 40%。
| 指标 | GPT-6 Astra | GPT-5.6 Sol | 解读 |
|---|---|---|---|
| Intelligence Index | 53 | 未列入此处同口径对比 | 与 Claude Fable 5.1 并列 |
| Coding Agent Index | 62 | 55 | Astra 得分更高 |
| Terminal-Bench v4.0 | 59% | 40% | 终端软件工程任务领先 |
| AutomationBench-AA | 69% | 60% | 工作流自动化任务领先 |
| Coding Agent 单任务成本 | $7.09 | 约低 15% | Astra 单价更高,但 Token 效率更好 |
这些结果不能合并为一个“总分”。报告也记录了反例:GDPval-AA v2 中 Astra 比 Sol 低约 45 Elo,说明表达质量和职业任务并非全面领先。查看原始报告与完整图表 ↗