跳到主要内容

模型评测

AIEZZ工具标签

正在浏览与“模型评测”相关的AI智能产品,共展示 5 个匹配结果。

2026 AI 小说写作软件最新评测:FeelFish 4.0AI编程FeelFish 4.0 是一款专业的小说写作软件,将 AI 大模型转化为懂项目的写作团队。它提供结构化的项目管理,涵盖章节、大纲、角色与设定,支持智能上下文以保持长篇创作的逻辑一致性。该工具支持自定义多智能体协作、桌面端与手机远程控制,并配备云盘同步与本地时光机确保稿件安全,旨在为网文、剧本等长篇创作者提供完整的人机协同工作流。00LMArenaAI工具箱LMArena 是由加州大学伯克利分校学术团队主导的社区驱动型人工智能模型评测平台,核心流程是让两个隐藏身份的模型回答同一问题,再由用户根据回答质量投票,投票后查看模型身份。平台依据投票结果和类似国际象棋的 Elo 积分机制生成动态排行榜,并覆盖文本、图像等任务。它适合人工智能研究者、开发者、技术爱好者及希望横向比较模型的普通用户,也提供开放数据集供研究使用。需要注意的是,榜单反映真实用户偏好和具体任务表现,不能替代针对业务需求、成本或稳定性的专项测试。048PAST-BenchAI智能体PAST-Bench 是普林斯顿大学王梦迪团队推出出的基准测试,用于检验个人 AI Agent 的递归自我改进能力。PAST-Bench通过对比有记忆与无记忆条件下的任务表现,判...00E-Bench – 腾讯混元等推出的智能体评测基准AI模型评测E-Bench 是腾讯混元团队联合清华大学 AIR、东南大学推出的多步骤工具使用评测基准。它基于王者荣耀、QQ 音乐、腾讯会议构建全合成虚拟环境,包含 323 个状态变更任务和超 7.6 万条数据。通过信息鸿沟与工具鸿沟双不对称设计,评测模型主动搜集信息并编排多步工具调用,采用确定性数据库状态 diff 评分,结果稳定可复现。该基准面向 AI 智能体研究者与模型开发者,辅助识别高性价比模型并推动通用智能体评测标准建立。00Gemini 3.7 FlashAI编程Gemini 3.7 Flash 是 Google DeepMind 推出的新一代主力 AI 模型。模型专为 Coding 与 Agent 工作流设计,在软件工程、网页开发和企业自动化等基准上大幅跃升...00

已显示当前标签下的全部工具