爱意满满的作品展示区。 Advertisement V2EX › 分享创造 做了一个 LLM / Agent 评测基准浏览器,把数据构建和评分流程放在一起看 joe1chief · 1h 51m ago · 84 views 给 Agent 选 benchmark 时,我经常要在论文、仓库和数据集页面之间来回切换:它测的是什么能力?
任务怎么来的? Agent 能看到哪些信息、调用什么工具?
最后到底按什么判成功?我做了一个 LLM Benchmark Costco ,目前整理了 610 个 LLM / Agent 评测基准 ,希望让这一步更方便: 按能力类别、年份、开放程度等条件筛选候选。
查看中英介绍、论文与官方项目入口。用流程图分别看数据构建和运行评测,并展开分支、循环和阶段说明。
可以先从 AutomationBench 这个例子 试试,打开“构建流程 / Build Process”,看看跨应用任务、工具调用和终态评分是怎样连起来的。整理后的说明也区分了公开任务、本地成绩和官方私有榜单的范围。
直接使用 · GitHub 代码与反馈 网页无需注册。它用于检索基准和理解协议;真正复现时,仍应回到对应版本的原论文、数据和官方实现。
内容会有遗漏或理解偏差,欢迎指出具体条目和来源位置。想邀请正在做 LLM / Agent 评测的同学,拿一个手头的真实需求试一下: 你能否据此找到一个值得进一步复现的基准?
最缺哪一项信息?如果方便反馈,告诉我“评测任务 + 看了哪个条目 + 卡在哪一步”就很有帮助。
No Comments Yet LLM Agent benchmark