CACB Agent 能力基准 · 功能说明

失败归因、机械/强审分车道与最终选择

比较没有完成时,先分清任务没做对、执行环境或身份出了问题,还是独立评审缺材料。客观检查说明题目和硬边界是否通过;Sol Max 的匿名评审说明实现质量怎样;最终选择只在同一套必需证据齐全时形成。

当前情况:已有分开报告任务失败、证据缺失和质量分歧的机制;完整报告链仍未闭合,不据不完整材料作比较结论。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

代码没做对、题目有缺陷、环境中断和身份说不清,不能统一算成能力差;缺少一份质量意见也不能先发半张榜。

举个实际例子

一组样本的文件和硬检查都齐了,偏偏少一份独立质量复核。我问“能不能先发排行榜”,答案仍是不行:已经核对好的结果会保留,缺的那份也清楚列出,但整组选择继续等待,不拿旧意见补位,也不先放出半张榜。

最后我会得到什么

现在可对具体一次尝试交回已知产物、失败类别、证据缺口和继续条件。只有完整同版样本与独立评审都齐全,才进一步形成正式报告和适用选择;目前不发布配置比较或排名。

正常时

方法口径冲突解除、同一套标准所需样本及客观与独立质量证据都齐全时,才形成相应比较判断。当前这些条件尚未全部满足。

发现问题时

题目、身份、客观结果或质量解释互相冲突时,按每个样本写出事实和阻碍,不用一个平均数盖过去。

入口不可用或证据不足时

任何必需样本或执行、检查、评审证据缺失时,只交回已知结果、未知项与补验条件,不发表受测配置的比较结论。

从哪里开始

在 CACB 项目的 AI 对话中问某次尝试为何没完成、现在能凭哪些结果判断。

需要准备什么

  • 要解释的某次尝试或失败现象

从开始到拿到结果

  1. 1

    逐次解释失败

    把任务本身失败、环境或执行身份问题、客观检查未过和质量意见分歧分开记录。

  2. 2

    只汇总同一代完整材料

    检查所需样本、客观结果、匿名评审和代表规则是否齐全且属于同一套标准。

  3. 3

    交回可用的判断

    证据齐全才形成对应比较;不齐时保留已有材料、准确列出待补项,不用旧意见填空。