Agent 评测

把 Agent 的
“看起来完成”
变成有证据的完成。

我是Mask,来自字节跳动 AI数据与安全 团队,主导并设计10+ Agent 评测集,包括从问题定义、题目构造、Judge 设计到质量验证的完整链路。

EVALUATION LOOP
Evidence
over claims.
可追溯 · 可复现 · 可判定
01真实问题归因
02评测集构造
03证据化判卷
04质量回归
01 / FULL CASEBOOK

评测集详情

阅读方式向下浏览全部项目;每个专项从风险定义、评测机制、Judge 设计和方法沉淀四个方面展开。
HALLUCINATION

幻觉防御

状态与知识→事实核验→上下文忠实
TOOL RELIABILITY

工具可靠性

CLI 使用→调用真实性→降级与异步验收
SEARCH RESEARCH

搜索调研

目标拆解→检索过程→产物可信度
REUSABLE ASSETS

沉淀为可复用资产

十个专项最终形成一组可复用的评测基础设施,可继续服务模型准入、版本回归与能力诊断。

01

失效模式库

把幻觉、检索与工具执行问题拆成可复现、可归因的风险类型。

02

题目构造方法

从真实轨迹与失败案例提炼测试点,并生成可稳定回归的专项样本。

03

Judge 组件

组合 Claim 抽取、轨迹核验、事实检索、硬规则与多数票聚合。

04

质量门禁

通过人工抽检、人机一致率与异常样本复盘控制自动判分可信度。

05

准入与回归

以维度诊断支撑模型选型、版本比较和专项能力回归。