VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

[分享创造] 做了一个 LLM / Agent 评测基准浏览器,把数据构建和评分流程放在一起看

给 Agent 选 benchmark 时,我经常要在论文、仓库和数据集页面之间来回切换:它测的是什么能力?任务怎么来的? Agent 能看到哪些信息、调用什么工具?最后到底按什么判成功? 我做了一个 LLM Benchmark Costco ,目前整理了 610 个 LLM / Agent 评测基准 ,希望让这一步更方便: 按能力类别、年份、开放程度等条件筛选候选。

www.v2ex.com · 2026-09-07T12:41:51+00:00

爱意满满的作品展示区。 Advertisement V2EX › 分享创造 做了一个 LLM / Agent 评测基准浏览器,把数据构建和评分流程放在一起看 joe1chief · 1h 51m ago · 84 views 给 Agent 选 benchmark 时,我经常要在论文、仓库和数据集页面之间来回切换:它测的是什么能力?

任务怎么来的? Agent 能看到哪些信息、调用什么工具?

最后到底按什么判成功?我做了一个 LLM Benchmark Costco ,目前整理了 610 个 LLM / Agent 评测基准 ,希望让这一步更方便: 按能力类别、年份、开放程度等条件筛选候选。

查看中英介绍、论文与官方项目入口。用流程图分别看数据构建和运行评测,并展开分支、循环和阶段说明。

可以先从 AutomationBench 这个例子 试试,打开“构建流程 / Build Process”,看看跨应用任务、工具调用和终态评分是怎样连起来的。整理后的说明也区分了公开任务、本地成绩和官方私有榜单的范围。

直接使用 · GitHub 代码与反馈 网页无需注册。它用于检索基准和理解协议;真正复现时,仍应回到对应版本的原论文、数据和官方实现。

内容会有遗漏或理解偏差,欢迎指出具体条目和来源位置。想邀请正在做 LLM / Agent 评测的同学,拿一个手头的真实需求试一下: 你能否据此找到一个值得进一步复现的基准?

最缺哪一项信息?如果方便反馈,告诉我“评测任务 + 看了哪个条目 + 卡在哪一步”就很有帮助。

No Comments Yet LLM Agent benchmark

返回 AI 市场导读

来源:v2ex.com