DataLearner 标志

GPT-6 LunavsDeepSeek-V4.1-Flash

在 12 个共同 benchmark 中,DeepSeek-V4.1-Flash 整体领先:GPT-6 Luna 领先 4 项,DeepSeek-V4.1-Flash 领先 8 项,持平 0 项,平均分差 -37.48。

OpenAI
GPT-6 Luna

OpenAI · 2026-09-22 · 推理大模型

DeepSeek-AI
DeepSeek-V4.1-Flash

DeepSeek-AI · 2026-09-10 · 多模态大模型

GPT-6 Luna4 (33%)(67%)8 DeepSeek-V4.1-Flash

评测分数

按能力类目分组,每组内按分差大小排列;共 12 项。

Coding and Software Engineer

DeepSeek-V4.1-Flash 领先 2/3
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
Program Bench0.5015 / 15Max (With Tools)20.309 / 15Max (With Tools)-19.80
DeepSWE66.6037 / 91Max (With Tools)74.202 / 91Max (With Tools)-7.60
SciCode5539 / 134Max (No Tools)51.9061 / 134Max (No Tools)+3.10

Productivity Knowledge

DeepSeek-V4.1-Flash 领先 3/3
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
GDPval-AA v21,36758 / 110Max (With Tools)1,63216 / 110Max (With Tools)-265
AA-Briefcase1,29938 / 88Max (With Tools)1,42427 / 88Max (With Tools)-125
AutomationBench20.7022 / 23Max (With Tools)54.801 / 23Max (With Tools)-34.10

AI Agent - Tool Usage

DeepSeek-V4.1-Flash 领先 2/2
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
Terminal-Bench 2.173.0389 / 199Max (With Tools)90.604 / 199Max (With Tools)-17.57
Terminal-Bench 4.01348 / 95Max (With Tools)26.8028 / 95Max (With Tools)-13.80

Agent Level Benchmark

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
Agents' Last Exam50.905 / 24Max (With Tools)31.808 / 24Max (With Tools)+19.10

General Knowledge

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
CritPt1943 / 204Max (No Tools)14.3061 / 204Max (No Tools)+4.70

Long Context

DeepSeek-V4.1-Flash 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
AA-LCR8315 / 174Max (No Tools)848 / 174Max (No Tools)-1

Multimodal Understanding

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
GDP.pdf2040 / 122Max (No Tools)12.8070 / 122Max (No Tools)+7.20

规格对比

字段GPT-6 LunaDeepSeek-V4.1-Flash
发布机构OpenAIDeepSeek-AI
发布时间2026-09-222026-09-10
模型类型推理大模型多模态大模型
架构稠密模型MoE 架构
参数规模暂无数据5520亿
上下文长度1.05M1M
最大输出128K384K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-6 LunaDeepSeek-V4.1-Flash
文本输入$0.1 / 1M tokens¥1 / 1M tokens
文本输出$0.5 / 1M tokens¥4 / 1M tokens
缓存读取$0.01 / 1M tokens¥0.02 / 1M tokens
缓存写入$0.125 / 1M tokens暂无公开价格

小结

  • GPT-6 Luna在以下类目领先:Agent Level Benchmark (1/1)、General Knowledge (1/1)、Multimodal Understanding (1/1)
  • DeepSeek-V4.1-Flash在以下类目领先:Coding and Software Engineer (2/3)、Productivity Knowledge (3/3)、AI Agent - Tool Usage (2/2)、Long Context (1/1)

12 个共同 benchmark 上,DeepSeek-V4.1-Flash 平均高出 37.48 分。

单项差距最大的 benchmark:GDPval-AA v2 — GPT-6 Luna 1,367,DeepSeek-V4.1-Flash 1,632(分差 -265)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。