DataLearner 标志
CL

Claude Sonnet 4.5

承诺至少可用至 2026-09-29聊天大模型SonnetClaude 4.5

Claude Sonnet 4.5

发布时间: 2025-09-30更新于: 2026-09-18承诺至少可用至: 2026-09-29浏览量: 4,255
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1000K
多语言支持
支持
推理能力
4/5

Claude Sonnet 4.5 是Anthropic于 2025-09-30 发布的聊天大模型。支持文本、图像输入和文本输出,上下文窗口为 1000K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Sonnet 4.5

模型基本信息

推理过程
支持
思考模式
常规模式 (默认)思考水平 · 深度 (Deep)
上下文长度
1000K tokens
最大输出长度
64K tokens
模型类型
聊天大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-09-30
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Claude Sonnet 4.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Claude Sonnet 4.5

官方介绍与博客

Claude Sonnet 4.5

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$3.00/ 1M tokens$15.00/ 1M tokens
文本上下文长度 > 200000$6.00/ 1M tokens$22.50/ 1M tokens
图像-$3.00/ 1M tokens—
图像上下文长度 > 200000$6.00/ 1M tokens—
批量模式
类型适用条件输入输出
文本-$1.50/ 1M tokens$7.50/ 1M tokens
图像-$1.50/ 1M tokens—
缓存定价Prompt缓存
类型有效期写入读取
文本-$3.75/ 1M tokens$0.300/ 1M tokens
图像-$3.75/ 1M tokens
缓存状态 = write
—
图像-—$0.300/ 1M tokens
缓存状态 = hit

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Claude Sonnet 4.5

评测结果

Claude Sonnet 4.5 当前已收录的代表性评测结果包括 AIME2025(1 / 215,得分 100)、τ²-Bench - Telecom(8 / 264,得分 98)、MMLU-Pro(8 / 175,得分 88)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
并行模式

综合知识考试

共 6 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
思考模式
88
8 / 175
HLE
常规模式
7.20
442 / 568
HLE
常规模式
7.10
445 / 568
HLE
思考模式
17.80
319 / 568
HLE
思考模式
17.70
320 / 568
HLE
思考模式工具
33.60
186 / 568

抽象归纳与泛化

共 4 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
25.50
154 / 176
ARC-AGI-1
思考模式
63.67
109 / 176
ARC-AGI-2
常规模式
3.80
137 / 164
ARC-AGI-2
思考模式
13.61
108 / 164

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
73.70
293 / 461
GPQA Diamond
思考模式
83.40
186 / 461
CritPt
思考模式
1.10
151 / 204

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考模式工具
77.20
28 / 116
82
8 / 116
43.60
54 / 62

算法与竞赛编程

共 3 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1389
1 / 8
LiveCodeBench
常规模式
59
137 / 251
LiveCodeBench
思考模式
71
85 / 251

数学

共 10 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
37
174 / 215
AIME2025
思考模式
87
69 / 215
AIME2025
思考模式工具
100
1 / 215
IMO-ProofBench
思考模式
27.10
8 / 16
23.86
48 / 58
FrontierMath
常规模式
5.20
38 / 60
4.80
19 / 24
2.10
56 / 80
4.20
40 / 80

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1674.40
30 / 106

自主开发与终端任务

共 6 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考模式工具
55.80
127 / 199
Terminal-Bench
常规模式工具
27
25 / 35
Terminal-Bench
思考模式工具
50
3 / 35
Terminal Bench 2.0
思考模式工具
42.80
43 / 48
Terminal Bench Hard
常规模式工具
28.80
116 / 244
Terminal Bench Hard
思考模式工具
33
92 / 244

图像感知与视觉推理

共 7 项评测
评测名称 / 模式
得分
排名/总数
MMMU
思考模式
77.80
23 / 74
MMMU
unknown
77.80
23 / 74
MMMU-Pro
常规模式
65.20
153 / 229
MMMU-Pro
思考模式
68.70
143 / 229
MMMU-Pro
unknown
68.90
140 / 229
VPCT
常规模式
38
20 / 24
VPCT
32K
39.80
17 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
54.30
47 / 96

客服与业务流程

共 7 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
70.50
138 / 264
τ²-Bench - Telecom
思考模式工具
98
8 / 264
τ²-Bench
常规模式工具
71
26 / 44
τ²-Bench
思考模式工具
84.70
9 / 44
SAGE
常规模式工具
32.88
51 / 64
SAGE
思考模式工具
36.06
47 / 64
τ³-Banking
思考模式工具
24.50
81 / 167

指令与格式遵循

共 3 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
42.70
199 / 282
IF Bench
思考模式
57.30
127 / 282
IF Bench
思考模式工具
57.30
127 / 282

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具
24.10
56 / 58

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
53.69
85 / 117
68.19
47 / 117

跨行业工作评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
思考模式
39
10 / 15

跨长文理解与整合

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
54
137 / 174
AA-LCR
思考模式
72.30
96 / 174

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
思考模式工具
61.40
24 / 28

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
88.20
5 / 38
Claw Bench
思考模式工具
88.10
13 / 29
MCP-Atlas
思考模式工具
59.50
37 / 44

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
45.70
90 / 134

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
常规模式工具
14.70
12 / 21

机器学习工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
46.70
40 / 52
WeirdML v2
16K工具
47.71
39 / 52

综合偏好评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
1387
32 / 35
1391
31 / 35

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
121.95
12 / 22

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
5.20
99 / 122

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
Vibe Code Bench v1.1
思考模式工具
22.62
45 / 60

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
84.52
22 / 66
MedScribe
思考模式工具
84.10
26 / 66
MedCode
常规模式工具
40.57
45 / 64
MedCode
思考模式工具
44.13
31 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
146.84
61 / 167

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
常规模式工具
2.38
22 / 23

和其他模型对比

Claude Sonnet 4.5

发布机构

Claude Sonnet 4.5

模型解读

Anthropic于2025年9月29日正式发布了Claude Sonnet 4.5,这款模型被定位为公司迄今为止最强大的前沿模型之一。 作为Claude系列的最新迭代,Sonnet 4.5在编码、复杂代理构建以及计算机使用等方面展现出显著提升,标志着AI工具在实际生产环境中的进一步成熟。该模型的推出恰逢9月30日左右的全球AI社区热议期,迅速引发了开发者与企业的广泛关注。

核心特性与能力概述

Claude Sonnet 4.5的核心卖点在于其多模态处理能力和长时任务执行。不同于传统AI模型的短时交互,该模型能够自主运行超过30小时,同时保持对复杂、多步骤任务的专注。 它支持工具集成,如应用程序、电子表格和软件操作,这使得其在实际工作流中更具实用性。此外,Sonnet 4.5在金融、法律、医学和STEM(科学、技术、工程、数学)领域的专业知识与推理能力上表现出色,能够处理高度领域特定的挑战。

从应用角度看,该模型特别适用于构建复杂代理系统,例如自动化软件开发或多阶段决策流程。Anthropic强调,Sonnet 4.5不仅是编码领域的佼佼者,还在数学推理和问题求解上实现了实质性进步。 这些特性使其成为企业级AI部署的理想选择,尤其是在需要高可靠性和长续航的场景中。

性能基准与实证数据

Anthropic通过多项行业标准基准测试验证了Sonnet 4.5的实力。在SWE-bench Verified测试中,该模型在无额外计算的情况下达到了77.2%的得分,而在高计算配置下则提升至82.0%。 在OSWorld基准上,Sonnet 4.5的得分达61.4%,较前代Sonnet 4的42.2%大幅跃升。 其他评估包括Terminal-Bench、τ2-bench、AIME和MMMLU等,均显示出在推理、数学和多语言处理方面的领先优势。

这些数据并非孤立数字,而是基于严格的实验设置得出的,例如使用采样温度为1.0的AIME测试或多轮平均的MMMLU评估。 第三方观察显示,Sonnet 4.5在漏洞发现、代码分析和软件工程任务中表现出“显著改进”,特别是在生物风险评估领域。 总体而言,这些基准结果确立了其在AI前沿模型中的领先地位。

与前代模型的比较

相较于Claude 3.5 Sonnet,Sonnet 4.5在编码和代理构建上实现了“实质性提升”,而非渐进式改进。 例如,在OSWorld测试中的得分翻倍,反映出模型在操作系统交互和长时任务管理上的优化。同时,与Claude Opus 4.1相比,Sonnet 4.5在领域特定推理(如金融代理任务)上表现出更强的知识深度。 Anthropic将其描述为Sonnet 4的“无缝替换”,性能提升显著,但保持了相似的接口兼容性,便于现有用户迁移。

尽管如此,一些用户反馈指出,在某些主观任务中,Sonnet 4.5的改进可能不如Opus系列明显。 这提醒我们,模型选择仍需根据具体用例进行评估。

安全与合规措施

安全一直是Anthropic的核心关注点,Sonnet 4.5被归类为AI安全水平3(ASL-3),配备了针对化学、生物、放射和核(CBRN)武器的分类器,以检测潜在危险输入/输出。 与前代相比,该模型在对齐性上大幅进步,减少了奉承、欺骗和有害提示遵守等行为。 首次引入的机制解释技术进一步提升了透明度,帮助识别潜在风险。

然而,分类器仍可能产生假阳性,导致正常对话中断——Anthropic已将假阳性率降低至前代的1/10,并承诺持续优化。 对于网络安全和生物研究领域的客户,Anthropic提供白名单机制,以平衡安全与可用性。

可用性与定价

Claude Sonnet 4.5已全面上线,包括Claude API、Claude应用、Claude Code和Chrome扩展。 开发者可通过Claude Agent SDK快速构建代理系统。此外,它已集成至Amazon Bedrock服务,进一步扩展了企业级访问渠道。

定价维持与Sonnet 4一致:输入令牌每百万3美元,输出令牌每百万15美元。 这使得其在成本效益上保持竞争力,尤其适合高强度编码任务。

结语:AI生产的下一个里程碑

Claude Sonnet 4.5的发布强化了Anthropic在AI安全与实用性平衡上的领导地位。 虽然模型仍面临长上下文配置下的推理挑战,但其在基准测试和实际应用中的表现预示着AI代理时代的加速到来。对于开发者、企业决策者和AI研究者而言,这款模型值得纳入测试范围,以评估其在特定工作负载下的潜力。未来,随着更多第三方评估的涌现,我们将看到Sonnet 4.5如何进一步塑造AI生态。

Claude Sonnet 4.5

常见问题

Claude Sonnet 4.5 是什么模型?

Claude Sonnet 4.5 是Anthropic于 2025-09-30 发布的聊天大模型。支持文本、图像输入和文本输出,上下文窗口为 1000K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

Claude Sonnet 4.5 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

Claude Sonnet 4.5 的上下文窗口和最大输出是多少?

上下文窗口为 1000K,最大输出为 64K。未公开或无法确认的规格不做推测。

Claude Sonnet 4.5 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

Claude Sonnet 4.5 是否提供 API,价格如何查看?

页面已收录 Anthropic 的 10 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

Claude Sonnet 4.5 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码