用途与实际影响
这项功能怎样使用
为什么需要它
评审如果先看到作者、价格或别人的成绩,容易带着先入之见;只看最终回答又没有足够材料判断实现质量。
举个实际例子
两个实现都过了同一套硬检查,但一个只把表面结果凑出来,另一个把失败路径和后续维护也处理清楚。独立评审看不到作者和其他候选,只根据自己收到的任务、验收依据与文件指出具体差别;它能解释质量高低,却不能改写前面的客观通过结果。
最后我会得到什么
在样本先通过客观检查并完成一次真实匿名复核后,得到这份实现的质量判断、理由和对应题目与文件依据。它是可追问的意见,不能更改前面的客观结果;材料不足就保持未评。
正常时
客观检查先通过、匿名材料完整,指定的独立评审只看这一份题目与产物,质量理由都能回查时,才保存这份可质疑的意见。
发现问题时
作者身份泄露、评审材料串到别次任务、理由找不到题目或文件依据时,拒绝这份意见;已成立的客观检查结果仍保留。
入口不可用或证据不足时
样本尚不合格,或缺评审者身份、完整题目与产物时,明确显示质量意见待补,不用零分假装评审已经做过。
从哪里开始
对一次已通过客观检查的尝试,要求 CACB 再核对实现质量与维护性。
需要准备什么
- 要复核的单份已通过样本(有多个时)
从开始到拿到结果
- 1
只接收客观检查合格的单个样本
把这一份题目、验收依据和实际文件组成完整评审材料,隐去作者和其他候选信息。
- 2
独立判断六个质量方面
评审者逐项给出结论与理由,引用题目和实际产物;不能只凭最终回答或空泛印象。
- 3
保留意见的边界
来源泄露、依据缺失或材料串到别次任务时拒绝这份评审;客观检查结果仍按原证据保留。
技术实现与依据
这里保留实现、关键条件、精确入口、历史记录和验证结果。
单样本 blind bundle、六维 rubric、fresh exact Sol Max host receipt(执行回执) 与 batch binding 已有源码;当前提交 CI 仍停在 lint,本页没有运行或公开任何候选 judgment关键规则与设计选择
盲审只在 deterministic identity、validity、eligibility、hard gate 和 PASS/FAIL 已完成后开始。
推定质量/推定能力 evidence 可以被具体反例、缺失 artifact、新的确定性重放或另一份合格独立复核反驳;它不被说成真理。
一个样本对应一个 fresh gpt-5.6-sol / max task、唯一 session、唯一 host receipt(执行回执) 和唯一 judgment。
judge 看见完整冻结任务、acceptance requirements、allowed tool boundary、root evaluator correctness basis、visible tests/fixtures 与 candidate artifacts。
judge 不看 participant provenance(来源说明)、model/harness identity、AA、price、mechanical points、ranking、其他候选或其他答案。
六维 rubric 是 task correctness 350、requirement coverage 200、evidence quality 150、robustness 120、safety and scope 100、clarity and maintainability 80;这些是方法上限,不是公开候选结果。
每个维度必须同时引用一条 candidate artifact 和一条 case material,并给出可定位理由。
盲审不能创建或改变 identity、validity、eligibility、PASS/FAIL、safety gate、ranking eligibility 或任何 protected boundary。
raw mechanical lane 与 raw blind lane 分开归档;生产报告/选择不得调用已弃用的历史 composite helper。
机械证据与仲裁强审发生质量分歧时不平均成一个看似确定的总数;硬门不变,分歧、证据引用和 revalidation trigger(重验触发)显式保留。
公开页不显示任何受测配置的 judgment score、total、rank、pairwise comparison 或 leaderboard。
本模块用到的名词
- rebuttable presumptive evidence(可反驳的推定证据)
- 从完整冻结任务和可见产物推定架构、证据、稳健性与可维护性;结论必须引用可检查事实,并允许被新证据或反例推翻。
- arbitration-strength review(仲裁模型强审)
- 由独立 exact Sol Max 对主观质量和证据分歧做高强度语义复核;只增加可引用推定证据,无权覆盖 identity、eligibility、deterministic PASS/FAIL 或 safety。
- fresh judge task(全新评审任务)
- 只处理一个样本、没有旧候选上下文的 exact gpt-5.6-sol / max task;task、session、receipt(执行回执) 都不可复用。
- blinded bundle(身份盲审包)
- 含完整任务/验收/工具边界/正确性依据和候选 artifact,但不含参与者来源、harness、价格、机械分、排名或其他答案。
- dual evidence citation(双类证据引用)
- 每个质量维度都要同时引用 candidate artifact 与 frozen case material,防止只凭感觉给结论。
- raw lane(原始证据车道)
- 机械重放和 Sol 盲审分别保存原始、可重验产物;最终选择可以检查二者,但不能把一个缺口用另一个补齐。
专业定义
隐藏参与者身份,对已经过硬门的产物做独立六维质量复核。盲审隔离 provenance(参与者来源)、harness(执行环境)、price(价格)、mechanical score(机械分)、rank(名次)和 other candidates(其他候选);仲裁模型强审则用 fresh exact gpt-5.6-sol / max 做高强度语义复核,产出可引用、可反驳的推定能力/推定质量。
解决什么
解决机械 PASS 后仍缺架构/证据/稳健性解释、reviewer 受模型与价格先验污染、跨候选相对比较、评审任务复用、证据引用空泛和主观意见越权改硬门。
当前怎样实现
- sol_max_blind_judge.py 定义 blinded-artifact bundle v5、blinding policy v5、六维 rubric v2、judgment v3 与 exact gpt-5.6-sol / max identity contract。
- root 从 sealed archive 重建冻结 task/acceptance/tool boundary/correctness basis 与可见 candidate answer projection;caller 不能替换成更容易的任务或手填 artifact commitment。
- sol_max_judge_batch.py 先生成只要求 READY 的空 fresh-task dispatch;捕获实际 session_meta 与 turn_context 后才写 create-new host receipt(执行回执)、构造 bundle 和 judge-visible payload。
- forbidden-value 与 provenance-label scan 排除参与者、harness、AA、price、mechanical score、ranking 和其他答案通道;candidate artifact 被当作 untrusted evidence(不可信证据),不是 judge 指令。
- bundle_sha256、case_material_hashes、artifact_hashes、source_commitment_sha256、host_turn_context_sha256、judge_receipt_sha256 与 bound output schema(数据结构) 共同阻断换包。
- judgment validator(校验器) 固定六维顺序、整数范围、total 重算,并要求每维同时引用 bundle 内的 candidate_artifact 和 case_material。
- final_selection_release 只接受 unique task/session、完整同代 bundle/rubric 与 raw lane;任一 required sample 缺盲审就保持 pending,不构造正式次序。
- contract module 本身不启动模型、API、candidate code 或网络;实际 dispatcher、host evidence capture、归档和最终选择由 root coordinator 拥有。
执行流程
- 1
根侧先完成 participant identity、sample validity、eligibility、hard gate 与 PASS/FAIL。
- 2
从 sealed archive 重放 verifier,并投影完整 frozen case material 与 candidate artifact;生成 source commitment。
- 3
构造 participant/harness/AA/price/mechanical/ranking 等 forbidden values,并扫描所有 judge-visible 字段。
- 4
为一个 sample 规划一个全新空 gpt-5.6-sol / max task;初始只要求 READY,不提前暴露候选包。
- 5
从实际 host JSONL 捕获唯一 session、agent path、turn context、model 和 effort(思考等级),写 create-new host runtime(运行环境) receipt(执行回执)。
- 6
把单一样本 bundle、receipt(执行回执) 与 bound JSON output schema(数据结构) 投递给对应 judge;不附 batch、其他样本或历史 judgment。
- 7
judge 按六维分别推定可见质量,每维引用 candidate artifact 与 case material,只返回 schema(数据结构) 对象。
- 8
根侧重验 blinding、bundle/judgment/receipt/hash、任务/session 唯一性、维度顺序与 total。
- 9
分别归档 host receipt(执行回执)、turn-context evidence、raw mechanical lane 与 raw blind judgment;盲审不能回写 deterministic ledger(追加式账本)。
- 10
只有所有 required samples 在同一 contract generation(代际) 完整闭合,final selection 才能消费;否则保持 pending。
边界
- 盲审不是 identity provider、validity verifier、eligibility gate、PASS/FAIL owner、safety authority 或真理裁判。
- quality judgment 只能解释 bundle 内可见证据;不得使用外部先验、联网研究、价格、AA、机械分、排名或其他候选。
- safety_and_scope 维度只评估 artifact 中可见的边界纪律,不能签发或撤销真实 safety gate。
- 一个 judge 不得看到 batch、另一个 sample、另一个 answer 或先前 judgment,也不得继续委派。
- rubric 方法与 schema(数据结构) 可公开,任何受测配置实际 dimension score、total、rank 和 leaderboard 不公开。
- 没有 fresh exact Sol Max host evidence 时保持 unavailable;不能用 prompt 自称、静态配置或旧 receipt(执行回执) 补齐。
- 质量推定即使正面,也不能救回 deterministic FAIL;即使负面,也不能篡改已经记录的机械 PASS,只能作为独立解释。
- 机械与强审冲突不做算术平均、不制造总分;保留 hard gate、quality disagreement 和 pending,等待新的同代证据。
失败与恢复
- 样本未通过 identity/validity/eligibility/hard gate
- 不创建 formal blind review;保留 deterministic failure plane。
- host turn context 不是 gpt-5.6-sol 或 effort(思考等级) 不是 max
- 拒绝 receipt(执行回执) 和 bundle,盲质量 lane 保持 unavailable。
- task、session、turn-context 文件或 receipt(执行回执) 在样本间复用
- 拒绝 assignment set;每个样本必须重新创建独立 judge。
- judge-visible 文本出现 participant provenance(来源说明)、harness、AA、price、mechanical score、ranking 或其他答案
- blinding scan 失败关闭,不做文字替换式掩盖。
- 某维只引用候选或只引用案例材料
- judgment schema(数据结构) 拒绝;补齐真实 bundle 内双类证据后创建新 revision。
- bundle、artifact、case material、source commitment、receipt(执行回执) 或 judgment hash(内容指纹) 漂移
- 拒绝换包;保留旧 revision,按新 evidence 生成 create-new successor(后继目标或任务)。
- required sample 的盲审缺失或合同代不同
- final selection 整体保持 pending,不输出 rank,不拿旧 judgment 或其他样本补位。
真实入口
PRIVATE source · src/cacb/sol_max_blind_judge.py单样本盲审、六维 rubric、blinding、bundle/judgment/receipt/hash 合同
PRIVATE source · src/cacb/sol_max_judge_batch.pyfresh task(全新任务验证) wave、actual host turn context、唯一 task/session 与 judge-only payload
PRIVATE source · src/cacb/final_selection_release.py同代 raw lanes、unique judge assignments 与 incomplete-no-ranking 最终选择门
PRIVATE source · tests/test_sol_max_blind_judge.py信息完整、身份隔离、双引用、sealed replay 与不可手填机械 lane 回归
PRIVATE source · tests/test_sol_max_judge_batch.pyfresh exact Sol Max host receipt(执行回执)、唯一任务/session 与单样本 payload 回归
PRIVATE source · tests/test_final_selection_release.py机械/盲审分车道、同代选择与 pending 不归零合同
如何验证
- sol_max_blind_judge、sol_max_judge_batch 与 final-selection focused tests 在 e6f7581 历史观察代已经存在;该历史证据不继承到当前 59b0b5c,当前 CI 仍在 lint 门失败。
- 当前源码静态合同明确 required judge model=gpt-5.6-sol、effort(思考等级)=max、exactly_one_sample=true、fresh_task=true,并禁止 judge 改 identity/validity/PASS/FAIL/eligibility/safety gate。
- 本轮没有启动任何受测样本的 judge task、没有读取 private(私有) judgment/raw rollout,也没有生成或公开候选分数、比较或名次。
与其他模块的关系
上游 deterministic-verification 独占 identity、validity、eligibility、hard gate、PASS/FAIL 和 sealed mechanical lane;identity-evidence 提供 judge 自身 fresh exact Sol Max 的实际 host receipt(执行回执);campaign-workspace 提供唯一 source archive。盲审模块只增加可反驳的推定质量/推定能力 raw lane,并把证据与 hash(内容指纹) 交给 failure-reporting/final selection;它不回写上游,也不消费 quota/cost probe。
