Luna、Terra、Sol 三个怎么选?
按任务难度和成本敏感度选。Luna 面向成本敏感、高吞吐的日常任务(摘要、起草、常规自动化),AA Intelligence Index 51 分、每任务约 $0.21;Terra 面向高并发生产场景(客服、内部工具、文档分析),55 分、约 $0.55;Sol 面向最高难度的编程、科研与安全任务,59 分、约 $1.0 量级。Luna 的性价比约为每美元 24 个基准分,是三者中最高的。
GPT-5.6 Luna 是 OpenAI 于 2026 年 6 月 26 日限定预览、7 月 9 日正式全面开放的 GPT-5.6 系列低成本模型,面向摘要、起草、分类和常规自动化等高吞吐日常任务。2026 年 7 月 30 日 OpenAI 将其价格一次性下调 80%,当前为每百万 tokens 输入 0.20 美元、输出 1.20 美元,比旗舰 Sol 便宜约 25 倍。反直觉的是它的智能体成绩并不低:Agents’ Last Exam 50.3 分,与 Terra 的 50.4 和 Sol 的 53.6 仅差 3.3 分;其余为 AA Intelligence Index 51、Terminal-Bench 2.1 84.70、DeepSWE 67.20、AA Coding Agent Index 74.6,每任务成本约 0.21 美元。但它有一个必须避开的硬伤:MRCR 长上下文召回仅 41.3%,而 Sol 为 91.5%、Terra 为 89.6%,因此尽管名义上下文同为 1.05M tokens,也不应用于大文档分析或长代码库推理,只适合较短、范围明确的任务。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.200/ 1M tokens | $1.20/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.400/ 1M tokens | $1.80/ 1M tokens |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | 30m | $0.250/ 1M tokens | $0.020/ 1M tokens |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
GPT-5.6 Luna 当前已收录的代表性评测结果包括 AA-LCR(11 / 174,得分 83.70)、PinchBench v2(4 / 45,得分 88.67)、ECI(21 / 167,得分 156.32)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
GPT-5.6 Luna 是 OpenAI 于 2026 年 6 月 26 日限定预览、2026 年 7 月 9 日随 GPT-5.6 系列正式全面开放的低成本高吞吐模型,面向摘要、起草、分类和常规自动化这类量大、单价敏感的日常任务。
它最戏剧性的变化发生在 2026 年 7 月 30 日:OpenAI 一次性把 Luna 的价格下调了 80%,当前为每百万 tokens 输入 0.20 美元、输出 1.20 美元,缓存输入 0.02 美元。对比同系列旗舰 Sol(促销价 4/20 美元),Luna 在输入和输出两端都便宜 约 25 倍。
便宜 25 倍通常意味着能力断崖,但 Luna 在部分基准上的表现相当反直觉:Agents’ Last Exam 50.3 分,而旗舰 Sol 是 53.6、Terra 是 50.4——三者只差 3.3 分。其它成绩包括 Artificial Analysis Intelligence Index(max 档)51 分、Terminal-Bench 2.1 84.70、DeepSWE 67.20、AA Coding Agent Index 74.6,每任务成本约 0.21 美元,约为 Sol 的五分之一,折算下来性价比约为每美元 24 个基准分。
Luna 的长上下文召回是整个系列的明显断点:MRCR 仅 41.3%,而 Sol 为 91.5%、Terra 为 89.6%。这不是「略差一些」,而是量级差异。
它的直接含义是:不要把 Luna 用在大文档分析、长代码库推理或任何需要跨长上下文准确检索的场景——哪怕它名义上也支持 1.05M tokens 的上下文窗口,塞进去的内容它未必找得回来。真正适合它的是较短、范围明确、单步能完成的任务。需要读长文档时,升到 Terra 的成本仍然远低于 Sol。
上下文窗口 1.05M tokens(输入最高 922K、最大输出 128K),知识截止 2026 年 2 月 16 日,输入支持文本与图像。与系列一致,单次输入超过 272K tokens 后按输入 2 倍、输出 1.5 倍计费。
Luna 与 Sol、Terra 共享同一份 OpenAI GPT-5.6 系统卡,网络安全与生物/化学两项风险能力评级均为 High,详细披露见 GPT-5.6 Sol 页面。
按任务难度和成本敏感度选。Luna 面向成本敏感、高吞吐的日常任务(摘要、起草、常规自动化),AA Intelligence Index 51 分、每任务约 $0.21;Terra 面向高并发生产场景(客服、内部工具、文档分析),55 分、约 $0.55;Sol 面向最高难度的编程、科研与安全任务,59 分、约 $1.0 量级。Luna 的性价比约为每美元 24 个基准分,是三者中最高的。
不适合大文档长链路工作流。它的长上下文召回相对偏弱,MRCR 只有 41.3%,虽然名义上下文是 1.05M tokens,但实际在超长上下文里精确检索信息的能力跟不上。官方和实测都指向同一结论:把它用在较短、范围明确的任务上。
每百万 tokens 输入 $1.00、缓存命中输入 $0.10、输出 $6.00(另有 $2.00 / $9.00 一档的计价档位)。作为对比,Terra 是 $2.50 / $15.00,Sol 是 $5.00 / $30.00——Luna 大约是 Sol 的五分之一。
在库内已收录的成绩中,Terminal-Bench 2.1 无工具档 84.70 排 44 个模型第 10,DeepSWE 67.20 排 27 个第 6,Agents' Last Exam 50.30 排 11 个第 3,FrontierMath v2 82.11 排 34 个第 8,GPQA Diamond 91.60 排 226 个第 27。作为系列里最便宜的一档,这些成绩相当能打。但 AA Intelligence Index 51 分在 8 个模型中排第 7,综合智能水平确实是三者最低。
Luna 与 Sol、Terra 共享同一份 OpenAI GPT-5.6 system card 安全评估,网络安全与生物/化学风险两项能力评级均为「High」。详细披露内容在 GPT-5.6 Sol 页面。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
