跳到主要内容

E-Bench – 腾讯混元等推出的智能体评测基准 运营中

E-Bench 是腾讯混元等推出的智能体评测基准,用于评测多步骤工具使用,覆盖真实产品场景。

E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准。它基于王者荣耀、QQ 音乐、腾讯会议构建全合成虚拟环境,包含 323 个状态变更任务和超 7.6 万条数据。通过信息鸿沟与工具鸿沟双不对称设计,评测模型主动搜集信息并编排多步工具调用,采用确定性数据库状态 diff 评分,结果稳定可复现。该基准面向 AI 智能体研究者与模型开发者,辅助识别高性价比模型并推动通用智能体评测标准建立。

E-Bench – 腾讯混元等推出的智能体评测基准 产品界面
月流量
0
产品收费
免费和付费
收录时间
2026-08-04
更新时间
2026-08-04

01E-Bench是什么

E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准,基于王者荣耀、QQ 音乐、腾讯会议三大真实产品为原型,构建全合成虚拟环境,包含 323 个状态变更任务、41 张数据库表及超 7.6 万条数据。通过信息鸿沟与工具鸿沟双不对称设计,迫使智能体主动搜集隐藏信息并编排多步工具调用,最终用确定性数据库状态 diff 评分,揭示当前 AI 智能体在真实产品场景中的能力边界。

02E-Bench的主要功能

全合成产品环境构建:基于图引导的数据库填充技术,生成无孤立记录、跨表一致的三大产品虚拟世界。
双鸿沟任务生成:出题模型拥有完整数据库访问权,被测模型仅能通过受限业务工具交互,制造信息与工具双重不对称。
确定性状态评测:用数据库操作前后的状态 diff 作为唯一评判标准,精确匹配才计通过,杜绝部分分与裁判方差。
成本性能联合分析:同步记录每任务 API 开销,绘制准确率与成本的帕累托前沿,评估模型性价比。
代码执行扩展:E-Bench-Code 版本开放 exec_code 工具,可剥离编排机制与信息获取两类难度。

03E-Bench的技术原理

图引导数据库填充:从关系型 schema 出发构建表级依赖图,按拓扑序填充根表与下游表,用强 LLM 作为受约束合成器,仅通过插入工具写入数据,下游表必须从当前库查询候选实体,最后用确定性脚本校验修复时间顺序、聚合计数等语义错误,确保环境完整自洽。
生成器-求解器不对称:出题 Agent 拥有 query_sql 与 exec_code 特权,能查看完整数据库并执行复杂计算;被测 Agent 仅能调用业务级工具,形成信息鸿沟(全局状态隐藏)与工具鸿沟(内部计算工具移除),迫使模型通过多步并行工具调用主动探索环境。
意图改写与规则替换:将数据库派生的具体值替换为产生它的规则,例如”把收藏里所有已下架的歌加进来”而非直接给出歌曲 ID,确保任务无法脱离环境交互独立完成。
交叉验证任务生成:每个任务经查看数据→确定目标→修改状态→总结意图的产品化循环生成,由三个不同强 Agent 模型交叉验证,至少两个复现一致才采纳,保证任务可解性与标注准确性。

04如何使用E-Bench

环境准备:从论文配套资源获取 E-Bench 全合成虚拟环境,加载覆盖王者荣耀、QQ 音乐、腾讯会议三大产品域的数据库模板与 323 个评测任务。
版本选择:根据研究目标选择基础版 E-Bench或 E-Bench-Code。
模型接入:将被测 LLM Agent 接入评测框架,配置其只能通过受限的领域工具(如搜索歌曲、创建会议、添加好友等)间接与环境交互,禁止直接查询底层数据库。
任务配置:设定每任务独立运行次数与全新数据库副本起始条件,开启 API 调用成本追踪以确保结果可复现。
执行评测:启动自动化评测,Agent 接收自然语言指令后通过多步工具调用与虚拟环境交互并修改状态,系统自动记录完整操作轨迹与 Token 消耗。
结果分析:评测结束后,系统基于确定性数据库状态 diff 输出 Pass@1 与 Pass³ 准确率,生成成本-性能联合分析报告,辅助评估模型性价比。

05E-Bench的核心优势

真实规模干扰充分:每个库填充至 7.6 万+行、60 万+数据单元,目标实体被大量近似记录环绕,模型无法靠环境稀疏蒙对。
环境任务解耦复用:一套自洽产品环境可支撑约上百个任务生成,边际成本极低,环境层可控、任务层可扩展。
评测稳定可复现:全合成环境不受线上服务演进影响,确定性 diff 评分消除语义裁判的主观偏差。
难度分层清晰:基础版考验多步编排与信息搜集,Code 版额外测试计算密集型任务的代码卸载能力。

06E-Bench的项目地址

arXiv技术论文:https://arxiv.org/pdf/2607.23722

07E-Bench的应用场景

AI 智能体能力评测:为 LLM Agent 提供标准化、可量化的多步工具使用能力评估,覆盖信息检索、状态变更、跨实体编排等核心维度。
模型选型与产品化决策:通过成本-性能帕累托图,帮助企业在准确率与 API 开销之间做出权衡,识别高性价比模型。
智能体训练数据合成:作为可控、可扩展的训练数据来源,用于持续提升 Agent 在多步工具调用与可靠性方面的能力。
代码增强 Agent 研究:E-Bench-Code 支持研究代码执行对不同类型任务(计算密集 vs 推理决策)的收益边界。
跨领域基准扩展:方法论可迁移至更多产品后端与 CLI 场景,推动通用智能体评测标准建立。

© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。

用户评价0

常见问题

关于当前内容的常见说明。

零基础小白,借助 AIEZZ,能不能快速上手各类 AI 工具?

完全可以。市面上绝大多数 AI 网页工具无需编程能力,也不用专业背景,操作简单易懂,输入需求就可以产出结果。AIEZZ(aiezz.com)聚合了大量新手友好 AI 工具,打开网页就能直接体验。

在 AIEZZ 挑选的 AI 工具,都需要花钱吗?

不少 AI 工具会开放免费基础能力或者试用额度,同时也有月订阅、按量计费的付费模式。建议优先试用免费版本,确认适配自己的工作流之后再付费。AIEZZ(aiezz.com)会标注每款工具的付费模式,方便快速甄别。

通过 AIEZZ 找到的 AI 工具,生成出来的内容,可以拿来做商业使用吗?

各个平台版权授权规则各不相同,商用之前务必仔细阅读平台许可、版权以及隐私协议。AIEZZ(aiezz.com)会整理工具商用权限提示,帮大家规避版权风险。

依托 AIEZZ,如何挑选真正适合自己的 AI 工具?

先理清自身任务、预算以及使用频次,再对比输出质量、中文适配、导出格式、协作能力,小范围测试之后再敲定。AIEZZ(aiezz.com)汇总各类工具的测评信息,便于横向对比筛选。

使用 AIEZZ 收录的 AI 工具,该怎样保护个人隐私?

尽量不要上传敏感身份信息、未公开商业资料,阅读平台的数据留存与训练规则,优先选择具备隐私管控的产品。AIEZZ(aiezz.com)会标注工具隐私相关提醒,降低信息泄露隐患。

经常用 AIEZZ 的各类 AI 工具,AI 会不会替代我的本职工作?

AI 擅长处理重复性事务,放大个人本身专业能力。不用盲目囤积大量工具,借助AIEZZ(aiezz.com)筛选合适应用,把 AI 融入现有工作流程,实现效率提升。