DataLearner 标志DataLearnerAI
最新AI资讯
大模型排行榜
大模型评测基准
大模型列表
大模型对比
资源中心
工具
语言中文
DataLearner 标志DataLearner AI

专注大模型评测、数据资源与实践教学的知识平台,持续更新可落地的 AI 能力图谱。

产品

  • 评测榜单
  • 模型对比
  • 数据资源

资源

  • 部署教程
  • 原创内容
  • 工具导航

关于

  • 关于我们
  • 隐私政策
  • 数据收集方法
  • 联系我们

© 2026 DataLearner AI. DataLearner 持续整合行业数据与案例,为科研、企业与开发者提供可靠的大模型情报与实践指南。

隐私政策服务条款
首页AI 大模型Claude Sonnet 4.5 vs Claude Sonnet 4

Claude Sonnet 4.5vsClaude Sonnet 4

在 25 个共同 benchmark 中,Claude Sonnet 4.5 整体领先:Claude Sonnet 4.5 领先 22 项,Claude Sonnet 4 领先 1 项,持平 2 项,平均分差 +5.83。

Anthropic
Claude Sonnet 4.5

Anthropic · 2025-09-30 · 聊天大模型

Anthropic
Claude Sonnet 4

Anthropic · 2025-05-23 · 推理大模型

Claude Sonnet 4.522 项(88%)持平2(4%)1 项Claude Sonnet 4

评测分数

按能力类目分组,每组内按分差大小排列;共 25 项。

综合评估

Claude Sonnet 4.5 领先 6/6
评测项Claude Sonnet 4.5Claude Sonnet 4分差
GPQA Diamond73.7094 / 17568119 / 175+5.70
LiveBench70.5620 / 5265.4030 / 52+5.16
MMLU Pro885 / 124thinking8435 / 124thinking+4
ARC-AGI-23.8048 / 581.3051 / 58+2.50
ARC-AGI25.5052 / 6523.8053 / 65+1.70
HLE7.10136 / 1495.52140 / 149+1.58

数学推理

Claude Sonnet 4.5 领先 2/5
评测项Claude Sonnet 4.5Claude Sonnet 4分差
FrontierMath - Tier 42.1056 / 80Normal (No Tools)072 / 80Normal (No Tools)+2.10
FrontierMath5.2038 / 604.1041 / 60+1.10
AIME20253796 / 1063895 / 106-1
IMO-ProofBench27.108 / 16thinking27.108 / 16thinking持平
IMO-ProofBench Advanced4.806 / 8thinking4.806 / 8thinking持平

编程与软件工程

Claude Sonnet 4.5 领先 3/3
评测项Claude Sonnet 4.5Claude Sonnet 4分差
LiveCodeBench5969 / 11848.5092 / 118+10.50
SWE-bench Verified823 / 103parallel_thinking + 使用工具80.209 / 103parallel_thinking + 使用工具+1.80
SWE-Bench Pro - Public43.6029 / 36thinking42.7030 / 36thinking+0.90

Agent能力评测

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
τ²-Bench - Telecom985 / 35thinking + 使用工具6529 / 35thinking + 使用工具+33
τ²-Bench7124 / 40normal + 使用工具5233 / 40normal + 使用工具+19

AI Agent - 工具使用

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
OSWorld-Verified61.4010 / 14thinking + 使用工具42.2012 / 14thinking + 使用工具+19.20
Terminal-Bench2725 / 35normal + 使用工具2626 / 35normal + 使用工具+1

OpenClaw智能体能力综合测评

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
Claw Bench88.1013 / 29Thinking (With Tools)77.8023 / 29Thinking (With Tools)+10.30
Pinch Bench88.204 / 37Thinking (With Tools)80.5022 / 37Thinking (With Tools)+7.70

多模态理解

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
MMMU77.8014 / 28thinking76.5016 / 28+1.30

常识推理

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
Simple Bench54.309 / 2745.5015 / 27thinking+8.80

指令跟随

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
IF Bench57.3019 / 27thinking + 使用工具5520 / 27thinking + 使用工具+2.30

生产力知识

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
GDPval-AA3915 / 20thinking3318 / 20thinking+6

长上下文能力

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
AA-LCR668 / 13thinking6510 / 13thinking+1

规格对比

字段Claude Sonnet 4.5Claude Sonnet 4
发布机构AnthropicAnthropic
发布时间2025-09-302025-05-23
模型类型聊天大模型推理大模型
架构稠密模型稠密模型
参数规模0.00.0
上下文长度1000K200K
最大输出6553664000

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Sonnet 4.5Claude Sonnet 4
文本输入3 美元/100 万tokens3 美元/ 100万tokens
文本输出15 美元/100 万tokens15 美元/100万tokens
缓存读取3.75 美元/100 万tokens3.75 美元/ 100万tokens
缓存写入0.3 美元/100 万tokens0.3 美元/ 100万tokens

小结

  • Claude Sonnet 4.5在以下类目领先:综合评估 (6/6)、数学推理 (2/5)、编程与软件工程 (3/3)、Agent能力评测 (2/2)、AI Agent - 工具使用 (2/2)、OpenClaw智能体能力综合测评 (2/2)、多模态理解 (1/1)、常识推理 (1/1)、指令跟随 (1/1)、生产力知识 (1/1)、长上下文能力 (1/1)

25 个共同 benchmark 上,Claude Sonnet 4.5 平均高出 5.83 分。

单项差距最大的 benchmark:τ²-Bench - Telecom — Claude Sonnet 4.5 98,Claude Sonnet 4 65(分差 +33)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。

Claude Sonnet 4.5 详情Claude Sonnet 4 详情·在工具里自定义对比