CACB Agent 能力基准 · 功能说明

Sol Max 盲审与仲裁强审

客观检查通过后,还要有人独立看这份实现是否容易维护、失败时说得清楚、证据是否扎实。评审者只看单个匿名样本的完整题目、验收依据和实际文件,不知道作者是谁,也不看其他候选成绩;Sol Max 的质量判断仍是可追问的意见,不能改写客观通过条件。

当前情况:已有让独立评审只看单一样本及依据的实现;当前代码检查与完整评审仍有缺口,本轮没有新的质量判断。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

评审如果先看到作者、价格或别人的成绩,容易带着先入之见;只看最终回答又没有足够材料判断实现质量。

举个实际例子

两个实现都过了同一套硬检查,但一个只把表面结果凑出来,另一个把失败路径和后续维护也处理清楚。独立评审看不到作者和其他候选,只根据自己收到的任务、验收依据与文件指出具体差别;它能解释质量高低,却不能改写前面的客观通过结果。

最后我会得到什么

在样本先通过客观检查并完成一次真实匿名复核后,得到这份实现的质量判断、理由和对应题目与文件依据。它是可追问的意见,不能更改前面的客观结果;材料不足就保持未评。

正常时

客观检查先通过、匿名材料完整,指定的独立评审只看这一份题目与产物,质量理由都能回查时,才保存这份可质疑的意见。

发现问题时

作者身份泄露、评审材料串到别次任务、理由找不到题目或文件依据时,拒绝这份意见;已成立的客观检查结果仍保留。

入口不可用或证据不足时

样本尚不合格,或缺评审者身份、完整题目与产物时,明确显示质量意见待补,不用零分假装评审已经做过。

从哪里开始

对一次已通过客观检查的尝试,要求 CACB 再核对实现质量与维护性。

需要准备什么

  • 要复核的单份已通过样本(有多个时)

从开始到拿到结果

  1. 1

    只接收客观检查合格的单个样本

    把这一份题目、验收依据和实际文件组成完整评审材料,隐去作者和其他候选信息。

  2. 2

    独立判断六个质量方面

    评审者逐项给出结论与理由,引用题目和实际产物;不能只凭最终回答或空泛印象。

  3. 3

    保留意见的边界

    来源泄露、依据缺失或材料串到别次任务时拒绝这份评审;客观检查结果仍按原证据保留。