按每个模型各自的最佳可用成绩重新核对后,GPT-6 Astra 在 14 个共同 benchmark 中领先 13 项,GPT-5.6 Sol 领先 1 项。Astra 在 ARC-AGI-3、Terminal-Bench-Science 0.1、Terminal-Bench 4.0 和 FrontierMath Tier 4 v2 上拉开明显差距,但 AA Intelligence Index 仅为 61.20 对 61.00,GPQA Diamond 也只是 96.00 对 93.50;Sol 则在 AA Coding Agent Index 以 80 对 67 反超。两者上下文均为 1.05M、最大输出均为 128K,而 Astra 标准 API 输入/输出价格是 Sol 的 2.5 倍。