跳到主要内容

PAST-Bench 运营中

PAST-Bench 是普林斯顿大学王梦迪团队推出出的基准测试,用于检验个人 AI Agent 的递归自我改进能力。PAST-Bench通过对比有记忆与无记忆条件下的任务表现,判...

PAST-Bench 是普林斯顿大学王梦迪团队推出出的基准测试,用于检验个人 AI Agent 的递归自我改进能力。PAST-Bench通过对比有记忆与无记忆条件下的任务表现,判...

PAST-Bench 产品界面
月流量
0
产品收费
免费和付费
收录时间
2026-08-12
更新时间
2026-08-12

01PAST-Bench是什么

PAST-Bench 是普林斯顿大学王梦迪团队推出出的基准测试,用于检验个人 AI Agent 的递归自我改进能力。PAST-Bench通过对比有记忆与无记忆条件下的任务表现,判断 Agent 保存的跨会话经验是否真正改进了后续行为。PAST-Bench 涵盖记忆、流程复用、信息搜集、更新四类能力,共 26 个场景 204 个任务回合。

02PAST-Bench的主要功能

评估递归自我改进:检验个人 AI Agent 保存的跨会话经验(记忆、技能、任务历史)是否真正改进了后续行为。
隔离经验积累效果:区分”得分提升来自经验积累”还是”基础模型变强/Prompt 变化/任务难度”等其他因素。
四维能力诊断:覆盖记忆、流程复用、信息搜集、状态更新四大维度,定位 Agent 具体哪类能力有缺陷。
机制归因分析:不仅看最终得分,还追踪”存储→检索→应用”的完整路径,判断改进是否有真实路径支撑。

03PAST-Bench的技术原理

任务族序列设计:Agent 按顺序执行同一任务族的多轮会话。早期会话创造保存经验的机会,后期会话检验这些经验是否被正确使用。
匹配对照实验:为每轮后期会话设计对照版本,关闭持久化能力,其他条件完全一致。通过”有记忆得分 – 无记忆得分”得到自我进化差值 Δ。
机制证据追踪:运行时记录记忆写入、技能调用、会话检索、状态更新等遥测数据,计算 Mechanism-Evidence Score,验证改进是否遵循预期路径。
持久化产物审计:检查 Agent 实际保存的内容(记忆条目、技能文件、会话索引),分析其结构、时效性和可复用性。

04如何使用PAST-Bench

环境准备:从 GitHub 克隆 PAST-Bench 仓库并安装核心依赖及 Agent 适配器。
模型配置:在环境变量中配置所使用模型的 API Key。
沙箱构建:执行 past-bench build-image --kind sandbox 构建评估所需的 Docker 沙箱镜像。
快速验证:用 past-bench evolve 运行单个任务族并加上 --compare-no-persistence 参数做 Smoke Test。
完整评估:遍历全部 26 个任务族运行评估,每个任务族自动执行”有持久化”和”无持久化”两组对照实验。
结果分析:在 --trace-dir 目录下查看 sequence_comparison.json,获取 Δ 值和机制证据分数。
自定义接入:如需评估自有 Agent,在 agents/ 目录下实现适配器并确保支持 --compare-no-persistence 开关即可。

05PAST-Bench的核心优势

真正的归因能力:PAST-Bench 能精确区分改进来自经验积累是模型本身变强/Prompt 变化/任务变简”。
匹配对照实验设计:每个任务族都配有关闭持久化的对照版本,其他条件完全一致,实现有记忆与无记忆的直接因果对比。
机制级诊断:提出 Mechanism-Evidence Score,判断 Agent 是否答对,还追踪”存储→检索→应用”的完整路径,识别”碰巧答对”与”真正复用经验”的区别。
四维能力拆解:将模糊的自我改进拆分为记忆、流程复用、信息搜集、状态更新四类具体能力,精准定位短板。
诊断驱动改进:基于基准暴露的运行时故障,直接催生 Hermes+ 框架,证明其不仅是评估工具,更是 Agent 架构优化的诊断引擎。

06PAST-Bench的项目地址

GitHub仓库:https://github.com/Gen-Verse/PAST-Bench
arXiv技术论文:https://arxiv.org/pdf/2608.04003

07PAST-Bench的应用场景

学术研究:为 Agent 递归自我改进提供标准化、可复现的量化评估环境,支持不同架构的客观对比。
框架开发:通过四维能力拆解精准定位 Agent 框架短板,指导架构优化(如 Hermes+ 的诞生)。
模型选型:在固定框架下对比不同基座模型的跨会话经验复用表现,识别各模型的能力偏向。
持久化验证:测试不同记忆结构和检索策略的实际效果,避免”存了但找不到”或”存了但没用”的无效持久化。
产品迭代:区分新版本得分提升是来自”跨会话经验积累”还是”基础模型变强”,确保持久化功能真实产生价值。

© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。

用户评价0

常见问题

关于当前内容的常见说明。

零基础小白,借助 AIEZZ,能不能快速上手各类 AI 工具?

完全可以。市面上绝大多数 AI 网页工具无需编程能力,也不用专业背景,操作简单易懂,输入需求就可以产出结果。AIEZZ(aiezz.com)聚合了大量新手友好 AI 工具,打开网页就能直接体验。

在 AIEZZ 挑选的 AI 工具,都需要花钱吗?

不少 AI 工具会开放免费基础能力或者试用额度,同时也有月订阅、按量计费的付费模式。建议优先试用免费版本,确认适配自己的工作流之后再付费。AIEZZ(aiezz.com)会标注每款工具的付费模式,方便快速甄别。

通过 AIEZZ 找到的 AI 工具,生成出来的内容,可以拿来做商业使用吗?

各个平台版权授权规则各不相同,商用之前务必仔细阅读平台许可、版权以及隐私协议。AIEZZ(aiezz.com)会整理工具商用权限提示,帮大家规避版权风险。

依托 AIEZZ,如何挑选真正适合自己的 AI 工具?

先理清自身任务、预算以及使用频次,再对比输出质量、中文适配、导出格式、协作能力,小范围测试之后再敲定。AIEZZ(aiezz.com)汇总各类工具的测评信息,便于横向对比筛选。

使用 AIEZZ 收录的 AI 工具,该怎样保护个人隐私?

尽量不要上传敏感身份信息、未公开商业资料,阅读平台的数据留存与训练规则,优先选择具备隐私管控的产品。AIEZZ(aiezz.com)会标注工具隐私相关提醒,降低信息泄露隐患。

经常用 AIEZZ 的各类 AI 工具,AI 会不会替代我的本职工作?

AI 擅长处理重复性事务,放大个人本身专业能力。不用盲目囤积大量工具,借助AIEZZ(aiezz.com)筛选合适应用,把 AI 融入现有工作流程,实现效率提升。