用途与实际影响
这项功能怎样使用
为什么需要它
代码没做对、题目有缺陷、环境中断和身份说不清,不能统一算成能力差;缺少一份质量意见也不能先发半张榜。
举个实际例子
一组样本的文件和硬检查都齐了,偏偏少一份独立质量复核。我问“能不能先发排行榜”,答案仍是不行:已经核对好的结果会保留,缺的那份也清楚列出,但整组选择继续等待,不拿旧意见补位,也不先放出半张榜。
最后我会得到什么
现在可对具体一次尝试交回已知产物、失败类别、证据缺口和继续条件。只有完整同版样本与独立评审都齐全,才进一步形成正式报告和适用选择;目前不发布配置比较或排名。
正常时
方法口径冲突解除、同一套标准所需样本及客观与独立质量证据都齐全时,才形成相应比较判断。当前这些条件尚未全部满足。
发现问题时
题目、身份、客观结果或质量解释互相冲突时,按每个样本写出事实和阻碍,不用一个平均数盖过去。
入口不可用或证据不足时
任何必需样本或执行、检查、评审证据缺失时,只交回已知结果、未知项与补验条件,不发表受测配置的比较结论。
从哪里开始
在 CACB 项目的 AI 对话中问某次尝试为何没完成、现在能凭哪些结果判断。
需要准备什么
- 要解释的某次尝试或失败现象
从开始到拿到结果
- 1
逐次解释失败
把任务本身失败、环境或执行身份问题、客观检查未过和质量意见分歧分开记录。
- 2
只汇总同一代完整材料
检查所需样本、客观结果、匿名评审和代表规则是否齐全且属于同一套标准。
- 3
交回可用的判断
证据齐全才形成对应比较;不齐时保留已有材料、准确列出待补项,不用旧意见填空。
技术实现与依据
这里保留实现、关键条件、精确入口、历史记录和验证结果。
失败语义、归档、机械 envelope、blind judgment 与 final-selection compatibility gate 已有源码;当前 CI lint 未闭合,完整报告链仍有已披露缺口关键规则与设计选择
基础设施问题不转成能力问题。
任务缺陷进入新版本,不回写旧结果。
当前官方能力、可用性、价格和可比外证与本地 Codex 测量分开保存,不用一条车道补另一条空白。
机械 score 只来自 deterministic sealed replay;Sol Max 强审只提供可反驳推定质量/推定能力,两条 raw lanes 互不补证。
机械与强审冲突不平均成总分:hard gate 和 PASS/FAIL 保持,quality disagreement、pending 与 revalidation trigger 显式保留。
final selection 只做同代兼容与代表选择,不发明分数;禁止 partial merge、best-of、旧 judgment 补位和 task/session 复用。
1 题/10 题额度费用探针的完成、失败、UI 观察和 cleanup 都不进入 formal report、score、ranking 或 routing correction。
先判断资格,再说明能力与经济性,最后才给精确范围内的路由建议;任何缺失证据都不归零。
先归档,后释放临时 workspace。
公开报告只含安全聚合与可复现元数据;本网页进一步排除所有候选分数、名次、比较表和 leaderboard。
本模块用到的名词
- failure plane(失败平面)
- 能力、任务、执行环境或证据问题所在的责任层。
- infra invalid(执行证据无效)
- 基础设施或身份链不满足,不能形成能力结论。
- schema-backed report(数据合同报告)
- 字段、状态和限制由机器合同约束的报告。
- mechanical evidence envelope(机械证据信封)
- 从封存任务、participant replay 和冻结 verifier 重算并 hash(内容指纹) 绑定的客观 lane;展示值不能由调用者手填。
- quality disagreement(质量分歧)
- deterministic hard gate 与仲裁强审关注面不同,或两份合格质量证据不一致;系统保留分歧,不算术平均、不偷改 PASS/FAIL。
- contract generation(合同代)
- bundle schema(数据结构)、blinding policy、rubric、judgment schema(数据结构)、mechanical basis 与选择规则的兼容组合;不同代不能混排。
- representative selection(代表选择)
- 按冻结政策从每个 treatment 的合格证据中选定唯一报告代表;不是挑最高分,也不删除未选审计证据。
专业定义
把能力、任务、执行环境、机械验证、Sol Max 仲裁强审和证据问题分开,先保存可重放 raw lanes,再验证同代兼容性。机械与强审冲突不平均:硬门保持,质量分歧或 pending 显式保留;公开页不展示候选分数、名次或排行榜。
解决什么
解决失败归因混乱、历史重写、证据丢失、报告口径漂移和私有内容外泄。
当前怎样实现
- failure state 在 campaign/evaluator/finalizer 间保持枚举语义。
- task_workspace_archive 保存代码、trace、receipt(执行回执) 与 validity reason。
- sol_max_blind_judge 从 sealed archive 重建 mechanical source commitment 与 envelope,且生产报告/选择禁用 deprecated compose_dual_score 历史 helper。
- sol_max_blind_judge 与 sol_max_judge_batch 分别验证 blind bundle/judgment 和 fresh exact Sol Max task/session/host receipt(执行回执)。
- final_selection_release 重验 source archive、mechanical envelope、blind judgment、bundle/rubric generation(代际)、unique assignments 与 representative policy;缺完整覆盖就 pending。
- config/first-report-policy.v1.json 把代表选择和额外有效样本的 audit-only(仅审计)保留写成显式兼容合同,不做 best-of。
- export / report schema(数据结构) 约束公开安全输出。
- 公开报告只解释产品与证据边界,不消费受测配置比较结果。
执行流程
- 1
核对精确模型、provider、version、harness 与官方证据观察日。
- 2
把当前能力、可用性、价格单位和外部可比性写入模型证据卡。
- 3
收集案例与终态。
- 4
从 sealed archive 重算 deterministic mechanical lane,验证 identity、validity、eligibility、hard gate 和 PASS/FAIL。
- 5
验证每个 eligible sample 的 fresh Sol Max host receipt(执行回执)、blind bundle、六维 judgment 和双类证据引用。
- 6
分别归档 raw mechanical envelope 与 raw blind judgment,不做 composite 平均。
- 7
判定 failure plane。
- 8
归档产物与 hash(内容指纹)。
- 9
核对 required samples 是否使用同一 bundle/rubric contract generation(代际)、unique task/session 和冻结代表规则;不完整就保持 final-selection pending。
- 10
把本地机械实测、可反驳推定质量、质量分歧、pending 和失败平面写入基准报告。
- 11
按资格、能力、经济性和适用范围生成综合判断报告。
- 12
应用 public(公开)/private(私有) 边界。
- 13
列出重验触发。
边界
- 网页不展示任何受测配置的 mechanical score、blind dimension score、total、rank、pairwise comparison、leaderboard 或数字比较。
- 私有 raw trace、prompt、holdout 和机器快照不公开。
- 官方说明、外部 benchmark 与本地 Codex 任务证据不得合并成一条来源;仅在身份、任务、环境和计量口径可比时建立关系。
- 能力结论、经济性和路由建议是不同层;缺价格、缺外证或缺本地测量时保留 Unknown(未验证),不填零、不混算。
- Sol Max 仲裁强审只能处理主观质量与证据分歧;不能覆盖 identity、eligibility、deterministic PASS/FAIL、hard safety gate 或 protected boundary。
- 机械与强审证据不得平均成一个掩盖冲突的总数;final selection 只消费合同允许的独立 raw lanes。
- 探针结果和 cleanup 状态不进入正式报告;它们只属于当场宿主观察。
- 报告建议不自动改变全局规则或能力路由。
失败与恢复
- 证据文件缺失或 hash(内容指纹) 不符
- 报告保持证据不足并保留 blocker。
- 官方能力、价格或外部证据已过期
- 只把对应模型证据卡字段降为 Unknown(未验证),按当前官方来源重查;不删除仍有效的本地任务证据。
- 官方价格与本地消耗口径不可比
- 分别保留单位、日期和条件,不换算、不混算,也不据此形成经济性结论。
- 机械 evidence envelope 无法从 sealed source 重算
- 机械 lane 关闭并记录 blocker;不接受自洽 hash(内容指纹) 或手填显示值。
- Sol Max judgment 缺 fresh host receipt(执行回执)、双类证据引用或 bundle binding
- 只关闭 blind lane,保留 deterministic 事实;required sample 因此使 final selection pending。
- 机械硬门与仲裁强审质量解释冲突
- hard gate 和 PASS/FAIL 保持;单列 quality disagreement、证据引用与重验触发,不平均、不覆盖。
- required samples 不齐、bundle/rubric 代不同或 judge task/session 复用
- 拒绝 final selection 次序,整代保持 pending。
- 额度/费用探针任务失败或 namespace 尚未清理
- 只保留临时诊断并执行 exact 第二阶段 cleanup;不写正式 report 或分数。
- 任务本身有缺陷
- 撤出受影响案例并创建新版本。
- 公开输出含私有 payload
- PUBLIC(公开) gate 阻断,不做界面隐藏式补救。
真实入口
PRIVATE source · src/cacb/task_workspace_archive.py执行归档与 hash(内容指纹)
PRIVATE source · src/cacb/export.py公开安全导出
PRIVATE source · src/cacb/sol_max_blind_judge.pysealed mechanical envelope、独立 blind judgment 与 deprecated composite 边界
PRIVATE source · src/cacb/final_selection_release.py同代 raw lanes、代表策略、unique assignments 与 incomplete-no-ranking 门
PRIVATE source · config/first-report-policy.v1.json每 treatment 代表、额外样本 audit-only 与非 best-of 选择合同
PRIVATE source · schemas/public-run-report.schema.json公开报告数据合同
PRIVATE source · docs/REPORTING_STANDARD.md失败、证据和限制写法
如何验证
- workspace archive、worker contract 与 public(公开) report schema(数据结构) 核心回归在 e6f7581 历史观察代曾通过;该证据不继承到当前 59b0b5c。
- 完整 report/finalization 历史路径仍有失败,页面保留 mixed。
- mechanical/blind/final-selection focused contracts 在 e6f7581 历史观察代已经存在;历史结果不继承到当前 59b0b5c,当前 CI 仍停在 lint。
- 网站内容没有复制任何私有报告正文或受测比较结果。
与其他模块的关系
消费 deterministic-verification 的 identity/eligibility/PASS/FAIL 与 mechanical raw lane,消费 blind-quality-review 的可反驳推定质量 raw judgment,并从 campaign/identity 模块重验 source archive、host receipt(执行回执) 和 unique task/session。final selection 只核对同代完整性与代表规则;quota/cost probe 永不进入。公开报告保留硬门、质量分歧、pending 和重验触发,但排除所有候选分数、名次与排行榜。
