DataLearner 标志DataLearnerAI
最新AI资讯
大模型排行榜
大模型评测基准
大模型列表
大模型对比
资源中心
工具
语言中文
DataLearner 标志DataLearner AI

专注大模型评测、数据资源与实践教学的知识平台,持续更新可落地的 AI 能力图谱。

产品

  • 评测榜单
  • 模型对比
  • 数据资源

资源

  • 部署教程
  • 原创内容
  • 工具导航

关于

  • 关于我们
  • 隐私政策
  • 数据收集方法
  • 联系我们

© 2026 DataLearner AI. DataLearner 持续整合行业数据与案例,为科研、企业与开发者提供可靠的大模型情报与实践指南。

隐私政策服务条款
目录
目录
  1. 首页/
  2. 博客列表/
  3. 博客详情

Aider Benchmark:面向代码编辑的大模型评测基准全解析

2025/08/20 03:50:12
940 阅读
命令行助手大模型编程能力大模型评测大模型评测基准

Aider 是一个在终端里进行结对编程的开源工具。为评估不同大模型在“按照指令对代码进行实际可落地的编辑”上的能力,Aider 提出并维护了公开基准与排行榜,用于比较模型在无人工干预下完成代码修改任务的可靠性与成功率。该评测已被多家模型提供方在技术说明中引用,用作代码编辑与指令遵循能力的对照指标。

提出者

该基准由 Aider 项目提出与长期维护,作者为 Paul Gauthier;官方“LLM Leaderboards”页面标注最近一次更新时间为 2025-08-13。

方案设计

任务与数据

  • 核心基准为 “Aider polyglot benchmark”,从 Exercism 选取 6 门语言(C++、Go、Java、JavaScript、Python、Rust)的 225 道挑战题,要求模型在已有代码基础上完成指定改动与实现。

交互与编辑格式

  • 评测关注模型是否能按指定“编辑格式”返回可直接应用的补丁或完整文件,包括:whole(整文件替换)、diff、diff-fenced、udiff,以及在“architect 模式”下用于二段式管线的 editor-diff/editor-whole。不同模型在不同格式下的稳定性与效率存在差异。

计分与统计项

  • 主要指标:

    1. Percent completed correctly:成功完成任务的比例(通过单元测试等验证);
    2. Percent using correct edit format:在不违反指定编辑格式前提下完成任务的比例。
  • 榜单同时记录成本(按当时价格估算)与若干运行统计(如“malformed responses”次数)。

特点

  • 聚焦“能否把改动落到文件上”:不仅评代码正确性,也评“编辑格式合规率”,以反映模型在工程环境中对变更的可执行性。
  • 多语言、多题型:覆盖 6 门语言、225 题,较早期仅 Python 的版本更具代表性;旧版“Code editing leaderboard(Python 133 题)”已被更具挑战的多语言版本取代。
  • 可复现与公开:题目来源与评测脚本对外开放,便于复现与提交结果。
  • 被厂商侧引用:例如 OpenAI 在 GPT-4.1 公告中专门引用该基准的“polyglot diff”结果,用于展示代码编辑稳定性。

主流评测结果(截取官方榜单代表项)

以 Aider 官方“Polyglot Coding Leaderboard”最近更新(2025-08-13)为准,列出若干代表性条目(Percent correct、估算成本、主要编辑格式):

模型(配置)Percent correct估算成本主要编辑格式
o3-pro(high)84.9%$146.32diff
Gemini 2.5 Pro Preview 06-05(32k think)83.1%$49.88diff-fenced
o3(high)81.3%$21.23diff
Grok-4(high)79.6%$59.62diff
Gemini 2.5 Pro Preview 06-05(默认 think)79.1%$45.60diff-fenced

此外,榜单还展示了若干中小模型或不同设置下的结果,分数存在显著差异,例如 gemma-3-27b-it(4.9%)、gpt-4o-mini-2024-07-18(3.6%)。

结语

Aider benchmark 面向“代码编辑落地”的评测场景,强调“正确完成率 + 编辑格式合规率”。与以仓库级修复为目标的 SWE-bench 等评测互补,可用于比较不同大模型在实际工程改动中的稳定性和成本画像。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码
返回博客列表

相关博客

  • Claude Code 的独特体验:Claude Code 为什么这么好用?从设计细节看下一代 LLM Agent 的范式
  • Scale AI 发布 SWE-Bench Pro 评测:AI 软件工程代理的新基准
  • 大模型评测基准AIME 2024介绍
  • SWE-bench Verified:提升 AI 模型在软件工程任务评估中的可靠性
  • SWE-bench大模型评测基准介绍:测试大模型在真实软件工程任务中的能力
  • MATH vs. MATH-500:数学推理评测基准的对比与解析
  • PinchBench:OpenClaw AI 代理真实任务基准测试介绍
  • AIME 2026:基于2026年美国数学邀请赛的大模型数学能力评估基准

热门博客

  • 1Dirichlet Distribution(狄利克雷分布)与Dirichlet Process(狄利克雷过程)
  • 2回归模型中的交互项简介(Interactions in Regression)
  • 3贝塔分布(Beta Distribution)简介及其应用
  • 4矩母函数简介(Moment-generating function)
  • 5普通最小二乘法(Ordinary Least Squares,OLS)的详细推导过程
  • 6使用R语言进行K-means聚类并分析结果
  • 7深度学习技巧之Early Stopping(早停法)
  • 8手把手教你本地部署清华大学的ChatGLM-6B模型——Windows+6GB显卡本地部署