CACB Agent 能力基准 · 功能说明

身份、资格、硬边界与真实产物的确定性验证

先用与参赛者隔离的检查工具核对同一道任务有没有做对:产物是否来自合格的一次执行,功能和隐藏条件是否满足,有没有碰不允许修改的地方。检查通过后,才把这一份实际文件送去独立质量评审。

当前情况:已有独立检查任务产物和允许范围的工具;本轮未运行私有验证样本,不产生新的通过结果。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

漂亮的最终回答或公开测试通过,都不能证明真实文件满足全部要求;若候选还能改检查工具,结果也不可信。

举个实际例子

候选产物写得很漂亮,测试也像是过了,可它偷偷改了明确禁止触碰的目录。硬检查会直接把这一项判为不合格,不让它进入质量比较;后面的好评再高,也不能把越界洗成通过。

最后我会得到什么

对一份身份已核准的实际产物,得到能重复核对的通过或失败:哪个功能或禁止范围出了问题。客观通过只说明这道题的固定条件满足,质量仍需另看。

正常时

这次身份和题目输入一致,真实文件通过公开及隐藏的行为检查,也没有越过允许修改的范围时,交回客观通过结果;实现质量另行评审。

发现问题时

功能、隐藏条件、文件归属或允许范围有任何一项失败时,指出具体题目和原因;后续好评不能改变这一结果。

入口不可用或证据不足时

检查工具、题目输入或这次执行证据对不上时,暂停判定和正式质量评审,不猜一个通过结果。

从哪里开始

让负责 CACB 的 AI 核对某次尝试真正留下的代码或文件,判断任务是否做成。

需要准备什么

  • 要核对的某次尝试或隔离工作区

从开始到拿到结果

  1. 1

    先核身份和任务

    确保检查的是这次指定执行留下的文件,任务输入和允许修改范围与冻结题目一致。

  2. 2

    独立检查真实产物

    运行公开及隐藏的行为检查,核对禁止范围和完成状态,给每项可重放的通过或失败证据。

  3. 3

    再决定是否进入质量评审

    客观资格不成立就保留具体失败,不让之后的好评把失败改成通过。