用途与结果
最快了解这个项目
为什么需要它
AI 说代码修好了,可能只留下回答、半成品或上次运行的文件。CACB 用同一道可验收的工程题、彼此隔开的工作目录和真实产物,核对这次究竟由谁执行、做成什么、哪里失败。这样才能分清能力问题、题目问题和运行环境问题。
举个实际例子
假如我要检验 AI 会不会真修代码,而不是只会说“已经解决”:给它一个小项目、失败现象和明确目标,再检查它留下的代码、诊断说明和测试结果。本页会说明怎样让每次尝试拿到同一份输入、待在自己的目录里,以及缺哪项证据就必须写未完成;它不在网页上启动新评测,也不拿旧分数冒充当前排名。
最后我会得到什么
目前可以对已记录的一次有界样本交回实际文件、执行身份、检查结果和阻断原因,也能说明现有问题库与三条执行路线怎样工作。方法口径冲突且 CI 尚未完整通过,不能取得可采用的完整配置比较。只有同版样本、客观检查与独立质量复核都齐全后,才会分别形成模型证据卡、基准报告和综合判断报告。公开页不展示受测配置、分数或名次。
正常时
将来只有同版任务、实际产物、执行身份和独立检查都闭合,才可以比较;合格产物的质量意见另行保存,不能替它补发客观通过。
发现问题时
当前方法口径冲突和 CI 缺口仍阻断正式完整比较。即使某次文件看起来做成了,题目、身份、边界或质量证据有冲突时也分别指出,不拿一项替另一项作保证。
入口不可用或证据不足时
拿不到这次任务真实由谁执行、是否结束、文件是否可验,或缺少必需的独立评审时,只交已知事实、阻断原因和下一步,不把缺项算成零分。
从哪里开始
在负责 CACB 项目的 AI 对话中说想检验哪种工程能力、怎样才算做成,并先问现有题目和规则是否足以开跑。当前评分口径冲突、CI 尚未跑完,不能据此进行完整配置比较;公开网页不接收任务。
需要准备什么
- 要检验的工程任务或能力
- 本人在意的完成结果与禁止边界
从开始到拿到结果
- 1先把现实任务固定
明确什么算做成、哪些行为不能做,并固定题目、材料、隐藏检查和版本。现有方法口径冲突与 CI 缺口必须先解决,才谈得上正式比较。
- 2具备条件后隔离执行
每次尝试拿独立工作区,核对执行者实际身份与输入;中断优先沿原任务续,取消后还要确认停止。
- 3先查产物,再看质量
独立验收代码、行为和边界;合格样本才交匿名独立评审,评审意见不能改写客观检查。
- 4证据齐全才作判断
分别交身份卡、基准结果和有范围的综合判断;当前不能发布受测配置排名或分数。
从这些需求了解功能
从一个实际问题看它怎样处理、交回什么;当前能做到哪一步和仍有哪些限制,也写在对应说明中。
项目指标与相关入口查看规模、覆盖范围和关联能力
当前项目指标
- 当前可采用比较
- 0
- 连续案例
- 10
- 计划槽
- 24
- 冲突基数
- 8 ↔ 10
它负责
- 把真实工程问题整理成有明确输入、目标和边界的题,并固定版本,便于以后复查。
- 让每次尝试使用独立目录,保留实际执行者、任务、文件与停止状态的对应关系。
- 独立检查真实代码、行为和禁止修改范围;只有客观条件通过的产物才进入匿名质量复核。
- 让独立评审只看一份完整题目与产物,说明实现质量;评审意见不能改写客观检查。
- 把能力不足、题目缺陷、运行环境故障和证据不足分开报告。
- 原生、本机和云端执行分别核对身份、完成和清理;一种路线失败不伪装成另一种成功。
- 短探针只观察宿主显示的额度、费用与耗时,随后清理,不混入正式能力结果。
- 证据齐全且同版时才形成模型身份、真实任务结果和适用选择的三层报告;目前完整比较仍被已知缺口阻断。
它不负责
- 公开页不列出受测配置名单、实际分数、名次或比较结论,也不公开私有题目、隐藏检查和原始执行记录。
- 不拿速度、花费、工具次数或一段自称完成的回答替代真实文件验收。
- 匿名质量意见不能替代身份、客观正确性和允许范围的检查。
- 一题或十题额度费用探针不计入正式成绩;未核实的费用不能用于选择结论。
- 官方说明、外部评测和这台机器上的真实任务分开看;不同口径的数字不混成一个总分。
- 没有完整同版样本时不先排部分名次,也不借旧结果、别次文件或另一执行路线补空。
- 云端付费执行要核对每次实际授权;一次已配置或已预演不自动授权下一次调用。
- 评测不在后台自行运行,也不自动改写用户的模型、权限或现实选择。
产品思想与设计核心
先固定题,再看结果
参与者要看到相同的目标和允许范围;题目或验收改版就作为新一轮,不能边跑边改。
每次只算自己的产物
工作目录彼此隔开,旧文件、别人的成功和中断后的拼接不能替这次完成任务。
真实文件先过客观检查
先看程序行为、禁止范围和任务结束状态,答复说“完成了”不足以通过。
质量意见有自己的位置
客观条件通过后,才让独立评审解释这一份实现是否稳健、清楚、便于维护;它不能改写客观结果。
匿名也要给足材料
评审要看到完整题目、验收依据和实际文件,但看不到作者、其他候选及比较信号。
题目允许不同的好解法
隐藏检查验证行为和边界,不要求所有人照抄参考代码,也不把答案提前交给参与者。
一份证据对应一次执行
执行者、输入、工作目录、文件和结束状态必须互相对得上;旧回执不能借给新尝试。
先说明为什么失败
代码没做对、题目本身有缺陷、执行环境坏了或证据拿不到,是不同问题。
缺项保持未知
单次成功不能证明长期稳定,样本或检查未齐时不能用零分或猜测补齐。
外部资料与本机实测分开
官方能力、可用性和价格需要当前来源;本地任务只证明这次真实执行,两者不能互相填空。
三类结果分开交付
身份卡说明测的是谁,基准报告说明实际任务做成什么,综合判断才讨论在证据允许的范围内怎样选。当前完整报告尚未通过方法与 CI 门。
三条路线保留真实差异
原生、本机和云端可用同一任务目标,但它们的身份、结束和清理证据各自核对;失败不静默换路线。
探针不混进正式成绩
短探针先回答能否看到额度和费用,确有需要再用较长版本;观察完只清理它自己的临时内容。
每次付费和最终选择由人决定
云端付费执行逐次核对授权;报告不会自动改写模型设置、权限或用户决定。
外部 AI 是受测对象
理解、推理和代码执行来自已接入的 AI;CACB 自身负责题目、隔离、证据与验证。
项目怎样演化到现在
从单次测试,发展成可复现的评测台
从有固定答案的单题,发展到能保存连续任务、独立工作位置、实际执行者和结果依据的评测框架。
阶段依据
- 2026-08-08—08-13 · 从单次测试,发展成可复现的评测台
连续评测证据链
同一套验收开始比较不同执行路线
原生、本机和云端路线开始使用同一工程题与验收方式;各次运行仍保留自己的身份和产物,不互借成功。
阶段依据
- 2026-08-14 · 同一套验收开始比较不同执行路线
ce29323–bb14d37
从做没做成,扩展到盲审和证据兼容
增加单份匿名质量意见和独立的额度费用观察,并规定只有同版、完整证据才能选择;现有方法与 CI 缺口仍使完整比较不可采用。
阶段依据
- 2026-08-15—08-16 · 从做没做成,扩展到盲审和证据兼容
8a911fe–e6f7581
完整项目状态与证据边界
已确认事实
- 当前可采用的受测配置比较、分数或排名为 0。产品框架、10 个连续案例和 24 个计划槽已经存在,但 8-case 与 10-case 评分合同冲突、当前 CI lint 未闭合,所以现实选择必须等待方法与验证重新统一。
- PRIVATE(私有) main=59b0b5c9706e76b8abc2d910af484b9d13237009,工作树干净、远端引用 0/0;233 个跟踪文件中有 47 个 Python 核心模块、25 个 schema(数据结构)、59 个测试文件与 6 份报告/模板文件
- 当前核心用 10 个连续案例组成一次 episode,覆盖实现、诊断、连续性、证据和恢复;每次执行独立 workspace,WorkerHandle 同时绑定原始 task id 与 run id
- 同一任务合同显式覆盖 native_managed、local_async_job、cloud_api_async_job;三者共享冻结输入与 verifier,却分别绑定原生谱系、本地 job(任务记录)/GPU lease、云端 request/stream 和路线专属 cleanup
- 根侧 verifier 独占 identity、validity、eligibility、safety 与 PASS/FAIL;每个已合格样本再由 fresh exact gpt-5.6-sol / max 隐藏参与者身份,基于完整任务和候选产物做独立六维质量复核,形成可引用、可反驳的推定能力/推定质量
- 1 题短探针与 10 题全探针各使用固定临时 namespace 和第二阶段精确 cleanup;只帮助观察宿主 UI,永不进入 formal ledger(追加式账本)、score、ranking 或 report progress
- 现行 V11R1/C1–C10/24-slot 入口与仍写 8-case 的旧设计和评分合同相互冲突,因此历史分数、排名和比较当前不可采用;机械与强审冲突仍不平均,最新四个 CI job(任务记录) 也停在 lint 门
- Git Owner(Git 事实责任方) 回读 PRIVATE(私有) main=59b0b5c9706e76b8abc2d910af484b9d13237009,工作树干净,本地与远端引用 0/0。
- 当前源树包含 233 个跟踪文件,其中 47 个 Python 核心模块、25 个 schema(数据结构)、59 个 test_*.py 测试文件,以及 6 份报告/模板文件;数量不代表这些文件可原样公开。
- 最新提交要求 WorkerHandle 同时绑定原始 task id;即使 run id 相同,只要 task id 不同也会拒绝借用旧 handle。
- 当前 source-backed(源码可追溯)worker contract 明确定义 native_managed、local_async_job 与 cloud_api_async_job:共用冻结任务和终态语义,分别保留原生谱系、本地 Toolkit/AICLI + GPU lease、云端 provider request/stream 证据。
- 三类路线都要先过精确身份、workspace、工具策略、verifier、终态与清理门;native lineage 只对原生路线必需,本地与云端的 not_applicable 不构成能力缺口。
- 当前源码把盲质量复核定义为独立生命周期:每个已合格样本对应一个 fresh gpt-5.6-sol / max task、唯一 session、host turn-context receipt(执行回执)、单样本 bundle 和受约束 judgment;六维 rubric 合计 1000 个方法点,但本页不展示任何候选所得分。
- blind bundle(盲审包)只允许冻结任务、验收、工具边界、根侧 correctness basis(正确性依据)、可见 fixture/test 与候选 artifact;参与者身份、harness、AA、price、mechanical score、ranking 和其他候选答案在进入 judge 前失败关闭。
- config/probes 当前有 1 题短版和 10 题完整版两份固定提示词;每份都把执行与删除拆成两条消息,使用独立固定 namespace,不生成测量回执、不写账本,也不进入分数或排名。
- final_selection_release 当前要求机械证据、盲审证据、source commitment、host receipt(执行回执) 与 bundle/rubric generation(合同代)彼此兼容;部分覆盖只保留 pending,不得通过 best-of 或拼接不同尝试生成正式次序。
- 当前 V11R1 README 与 AGENTS 要求 24 个 canonical Codex slots、每次 C1–C10 全部终态;PRODUCT_DESIGN 仍写八案例,MODEL_EVIDENCE_SEMANTICS/ROUTING_DECISION_FRAMEWORK 仍固定 case_count=8 与八条 per_case_scores。REPORTING_STANDARD 已对齐 ordered ten-row、case_count=10、weight=0.1;其中 other eight 是除 C5/C7 两个联网例外以外的八个离线案例,legacy bridge 明确 unranked。当前设计/评分合同仍未完全统一。
- 原生任务、本地异步作业和云 API 异步作业分别保留请求、实际和宿主证明的身份。模型、思考等级、运行框架、提供方和传输绑定必须与冻结任务一致;配置存在不等于已经接入或形成有效样本。这里说明身份验证方法,不列受测配置名单。
- first-report sampling policy(首报采样规则)预先固定每种配置采用第一份有效样本,或按明定规则取中位代表。额外有效尝试保留供审查,不事后挑最高结果,也不拼接部分尝试;其他执行框架的补充结果保持独立范围。
- 当前提交最新四个 GitHub CI job(任务记录) 全部失败,失败门位于 lint;因此当前 commit 的完整测试结论保持 Unknown(证据不足)。
- PRIVATE(私有) 源保留冻结任务、私有验证与原始证据;公开页完整说明产品、提交、验证范围和明确缺口,但不复制受测配置或比较结果。
当前缺口
- 当前提交没有一份绿色 CI 或本轮完整本地回归,因此不能把旧提交的 focused/full 记录继承为当前可验证。
- 项目当前规则明确既有方法与评估有效性仍需复核;V11R1 的 C1–C10/24-slot 与旧 8-case 评分合同冲突未解决前,即使 CI 变绿,任何历史比较结论也不能作为公开选择依据。
- V11 Registry(登记清单) 的 orchestration collaboration 仍写 descendants_allowed=true,而 NATIVE_RUN_OPERATOR/PRODUCT_DESIGN 把正式 arm 定义为 direct-only、无后代;身份合同没有统一前,编排 slot 不能写成已合格。
- 本轮没有启动新的受测执行、没有调用云端接口、没有运行本地重型推理,也没有生成新的受测结果。
- 本轮没有为任何受测配置启动 fresh Sol Max 盲审、没有执行额度/费用探针,也没有形成新的 final-selection manifest(清单);页面只发布源码可证明的方法与边界。
- 源码中的路线、schema(数据结构) 和 synthetic(合成)验证只证明框架边界,不证明任一精确 provider/model/profile 当前可执行;正式接入仍需本机 preflight(预演)与宿主回执。
- 配置存在不等于授权存在:云端真实调用仍需逐 attempt 的明确付费授权;清理无法确认时不得立即提交替代任务。
- 私有 holdout、原始执行记录和隐藏失败正文不会进入网页,公开读者无法从本页复算私有结果。
- 单次执行即使验证通过,也只证明精确任务、精确配置和精确版本,不证明普遍能力。
来源与公开边界
源码位于 PRIVATE(私有)仓库,因此本页不提供仓库跳转。页面完整展示已经做成的评测产品、设计取舍、架构与当前验证边界;私有任务样本、隐藏答案、原始执行记录、机器快照和任何受测配置比较结果都不进入网页。
当前关键技术事实
- 当前能不能拿来选
- 当前可采用的受测配置比较、分数或排名为 0。产品框架、10 个连续案例和 24 个计划槽已经存在,但 8-case 与 10-case 评分合同冲突、当前 CI lint 未闭合,所以现实选择必须等待方法与验证重新统一。
- 当前源码与成品范围
- PRIVATE(私有) main=59b0b5c9706e76b8abc2d910af484b9d13237009,工作树干净、远端引用 0/0;233 个跟踪文件中有 47 个 Python 核心模块、25 个 schema(数据结构)、59 个测试文件与 6 份报告/模板文件
- 问题库与任务绑定
- 当前核心用 10 个连续案例组成一次 episode,覆盖实现、诊断、连续性、证据和恢复;每次执行独立 workspace,WorkerHandle 同时绑定原始 task id 与 run id
- 三类执行路线
- 同一任务合同显式覆盖 native_managed、local_async_job、cloud_api_async_job;三者共享冻结输入与 verifier,却分别绑定原生谱系、本地 job(任务记录)/GPU lease、云端 request/stream 和路线专属 cleanup
- 确定性硬门 + Sol Max 仲裁强审
- 根侧 verifier 独占 identity、validity、eligibility、safety 与 PASS/FAIL;每个已合格样本再由 fresh exact gpt-5.6-sol / max 隐藏参与者身份,基于完整任务和候选产物做独立六维质量复核,形成可引用、可反驳的推定能力/推定质量
- 选择与当前验证边界
- 现行 V11R1/C1–C10/24-slot 入口与仍写 8-case 的旧设计和评分合同相互冲突,因此历史分数、排名和比较当前不可采用;机械与强审冲突仍不平均,最新四个 CI job(任务记录) 也停在 lint 门
完整执行流程
- 1定义要检验的能力
先把现实需求写成能验收的任务,说明完整结果是什么、允许怎样做、哪些边界不能跨越。
- 2核对真实模型和可比较的外部资料
确认精确模型、提供方、版本、运行方式与当前可用条件;价格保留日期和单位,外部结果只有任务、环境与口径可比时才采用。
- 3把题目和验收固定在同一版
固定参与者能看到的材料、案例顺序、结果结构、独立隐藏检查与版本指纹;开始执行后不原地改题,也不把隐藏答案交给参与者。
- 4按要测的实际使用方式选路线
分别选择原生宿主管理、本机异步任务或云端API任务。新接法先核对身份与能力,做不产生比较结论的预演,证明同一验收器可以读取结果。
- 5每次尝试使用自己的空工作区
每个受测配置取得独立目录,全部输出留在本次范围内;跨目录或与别的尝试共享写入时停止,不借旧产物完成新题。
- 6把实际身份和输入对应起来
由宿主实际记录证明执行者,而非模型自报。原生路线保留父子关系;本地保留任务、配置、模型制品和显卡占用;云端保留提供方、配置、端点和请求,每条都绑定同一输入与允许工具。
- 7提交以后,按原任务查询
启动先核对绑定再返回任务编号;后续等待只读状态。一轮等待结束不等于底层任务超时,三条路线分别读取各自真实执行状态。
- 8在同一次尝试中完成连续案例
按固定顺序执行整组题,保留压缩、接续和最终状态;中断优先恢复同一个会话、任务和目录,不拼接不同尝试的半成品。
- 9取消也要确认真正停止
收到取消请求不算结束:原生任务要确认没有活跃后代,本地要确认进程与显卡占用释放,云端要确认流关闭和提供方终态。没有这份证据就保留清理未确认。
- 10独立检查真实产物
在参与者之外重跑规定检查,核对文件、行为、测试、身份、资格、范围和最终状态;给出客观通过或失败,隐藏验收材料不进入受测进程。
- 11合格产物再进入独立盲审
每份合格样本交给一个全新的Sol Max任务,核实真实模型与回合身份;它拿到完整题目、正确性依据和这一份产物,但不知道参与者是谁,也不看其他候选答案。
- 12质量判断逐项指回证据
分别评任务正确性、要求覆盖、证据质量、稳健性、安全与范围、清晰与可维护性;每项同时指向候选产物和题目依据。质量意见不能改写客观检查的结果。
- 13只想看额度或费用时,另做临时观察
一题短版先确认宿主界面能否观察额度、费用和耗时;确有需要再用十题全版。两者都在各自专用临时目录内,不进入正式样本、分数或名次。
- 14观察结束后单独清理本次目录
先核对界面与临时结果,再发独立清理指令,只移除这一份探针目录;目录原本已经存在就不覆盖,清理确认后才可复用相同入口。
- 15失败归因与两类评分分别复核
区分能力不足、题目问题、执行环境、证据缺失和盲审错误。机械结果从封存输入重算,盲审则重新核对评审材料、回执、判断和引用,不让两类证据互相补空白。
- 16样本齐全且同版,才进入最终选择
全部必需样本必须使用兼容的材料与评分规则,任务和会话不跨样本复用;客观检查和盲审证据都完整后才选择代表。部分集合继续等待,不先排一个临时总名次。
- 17先交两份独立事实报告
模型证据卡说明精确身份、官方条件与可比外证;基准报告说明本地真实任务、机械检查、盲审质量、测量和失败。缺项保持未知,不在两份报告间借证。
- 18再形成有适用范围的综合判断
综合判断报告按资格、能力、经济性和适用任务分别引用前两份交付;口径不能比较就并列说明,不混成一个貌似完整的数字。
- 19保全原始依据,再生成公开说明
源码归档、题目材料、执行记录、真实身份回执、机械结果、原始盲审和内容指纹一起保存。公开只说明方法、边界与适合公开的汇总,不展示受测配置分数或名次。
本页用到的名词
需要核对专业含义时,可以在这里查看它在 CACB Agent 能力基准 项目中的具体用法。
- Benchmark(能力基准)
- 用冻结任务和统一验证方法产生可复核证据;不是宣传性榜单。
- question bank(问题库)
- 定义任务目标、可见输入、允许行为、验收属性和隐藏检查的一组版本化案例。
- episode(评测回合)
- 在同一连续执行中按固定顺序完成整组案例,用来观察长程连续性。
- workspace(工作区)
- 一次执行唯一的隔离目录;参与者只能在这里产生候选产物。
- fixture(固定测试材料)
- 每个执行配置收到字节一致的公开输入,避免任务内容漂移。
- holdout(隐藏验证材料)
- 参与者不可见、只由验证器消费的检查数据,防止针对答案硬编码。
- verifier(验证器)
- 在参与者之外运行的确定性检查器,核对产物、范围、行为和终态。
- identity-blind judge(身份盲评审)
- 每个合格样本独占的 fresh Sol Max 质量复核任务;知道任务和证据,不知道参与者及比较上下文。
- rubric(评分量表)
- 六个固定质量维度及各自上限;它约束解释和证据引用,不授予身份、资格或硬门裁决权。
- quota/cost probe(额度/费用探针)
- 独立于正式基准的一题或十题固定任务,用于观察宿主额度、费用与耗时;完成后按第二条消息清理。
- final selection(最终选择)
- 核对机械 lane、盲审 lane、host receipt、bundle 与代表样本是否同代且完整;不是公开排行榜生成器。
- manifest(清单)
- 记录任务、版本、workspace、文件 hash 和执行约束的机器可读合同。
- receipt(回执)
- 证明某个动作、身份或终态真实发生,并绑定到本次执行。
- fail-closed(失败关闭)
- 证据不完整或身份不匹配时不生成能力结论,不靠猜测补齐。
- contamination(污染)
- 任务或隐藏验证内容被参与者事先看见,导致结果失去解释力。
系统里实际有什么
下面是当前产品组件,不是概念分类。每一项都对应真实文件、入口或验证链。
拥有案例、任务家族、可见输入、隐藏检查和版本边界。
JSON 合同 + Python 生成/加载器;任务改变进入新版本,不回写旧证据。
把问题库、episode、seed、fixture 和 verifier 固定成一次不可漂移的 campaign。
manifest(清单) 与逐文件 hash(内容指纹) 共同定义输入身份。
创建、验证、归档每次执行的唯一目录。
检查 cwd 祖先关系、任务 capsule、路径范围和归档完整性。
定义参与者可见任务、允许工具、终态和产物要求。
单一连续 episode;缺案例、pending 或 interrupted 不形成完整结果。
用一个显式类型承载三条真实执行路线,不抹平 transport 与生命周期差异。
native_managed、local_async_job、cloud_api_async_job 共用 envelope/handle/status/result 语义,各自扩展身份、提交、清理和失败证据。
测量宿主管理的原生 Codex task,包括单 worker 或已冻结的原生编排处理。
原生 transport;host 的 parent/spawn/child rollout 与 turn context 证明 lineage,终态需宿主确认且无活跃后代。
在精确本机模型制品必须进入测量时,通过 Toolkit/AICLI 与 Codex CLI(命令行工具) 运行任务。
job(任务记录) id 绑定 backend(模型后端)/profile/model/artifact/quantization/template/engine;LocalGpuBroker(本地 GPU 调度器) 串行 lease,终态需进程树、workspace 和 lease 清理回执。
在指定非原生 provider API 需要接受同一 Codex harness 验证时承载调用。
Responses transport 绑定 provider/profile/model/endpoint、request/stream 与 usage(真实用量) 事件;只发送 participant-public,隐藏 verifier 留在本地,并逐 attempt 核对付费授权。
证明新执行方式能接收同一任务、产出同一种可验 artifact,并提供可信宿主证据。
冻结身份和 capability map,做代表性 dry-run(预演),根侧重算 workspace/log/trace/artifact hash(内容指纹),再确认同一 verifier 无专用捷径即可读取。
把实际执行身份、任务、workspace、动作和终态绑定到同一回执。
host receipt(执行回执)、manifest(清单) hash(内容指纹) 与单次消费规则防止跨执行借证。
检查候选文件、隐藏属性、测试和范围变化。
验证器独立进程、硬超时、隐藏材料隔离和结果 hash(内容指纹)。
隐藏参与者身份,对每个已经通过身份、有效性、资格和硬门的单一样本做独立六维语义复核,形成可引用、可反驳的推定能力/推定质量。
一个 fresh gpt-5.6-sol / max task 对应一个 sample/task/session;judge 只收完整冻结任务、验收、工具边界、正确性依据和候选 artifact。
证明 judge 看见的材料、实际模型/effort(思考等级)、输出 schema(数据结构) 和 judgment 属于同一次单样本复核。
bundle、case/artifact manifest(清单)、source commitment、turn context、host receipt(执行回执)、task/session 与 judgment 都以 SHA-256 互相绑定;复用或漂移即拒绝。
用固定 1 题或 10 题离线任务帮助观察宿主 UI 中的额度、费用与耗时。
short/full 各有固定 namespace;执行阶段最多一次最小修正,第二条消息只精确删除对应目录,且不生成 ledger(追加式账本)/score/ranking 记录。
重放机械证据、验证独立盲审证据,并只从同一兼容代的完整集合中选择代表。
机械 envelope 不接受手填总数;生产选择禁用 legacy composite(旧复合)捷径,拒绝 partial、best-of、混代 bundle/rubric 或复用 task/session。
区分能力、任务、执行环境与证据问题。
不把 timeout(等待超时)、missing evidence、invalid harness 或未完成统一写成失败。
把证据包、案例、归档和说明约束成可重放格式。
25 个 schema(数据结构) 与报告模板;公开说明保留产品结构和验证事实,私有 payload、受测配置与比较结果不进入网页。
记录精确模型、提供方、版本、harness 与当前官方能力、可用性、价格和可比外证。
每条事实带官方来源、观察日期、单位、适用条件和可比性;缺项保持 Unknown(未验证)。
记录本地 Codex 冻结任务中的真实执行、产物、验证、消耗口径与失败平面。
只消费同一次 run 的本地证据,不用官方说明或外部结果填补本地未测项。
把资格、能力和经济性转成精确范围内的路由建议。
逐层引用前两份交付,不混算不同口径,不把缺失证据归零,也不自动改写全局路由。
为新执行配置准备 workspace、完成门和盲化审阅包。
准备、完成检查、证据包与代表选择分开,不由参与者 final answer 直接放行。
15 层证据分别证明什么
能证明:在给定观察日,精确模型、提供方、版本和 harness 的官方能力、可用条件、价格口径及外部证据可比性。
不能证明:不证明该配置在本地 Codex 冻结任务中真实做成了什么,也不填补本地未测项。
能证明:同一次冻结任务的身份、workspace、真实产物、验证、消耗口径与失败平面。
不能证明:不自动证明当前官方可用性、公开价格或其他 benchmark 与本地任务可比。
能证明:精确身份、资格、硬边界、终态和候选产物在冻结 verifier 下得到可重放 PASS/FAIL,机械 lane 可从 sealed archive 重算。
不能证明:可见产物的架构、证据表达、稳健性与可维护性已经得到独立质量复核。
能证明:一个 fresh exact Sol Max task 对单一样本按六维 rubric 给出候选+案例材料双引用的质量判断,并由 bundle/receipt/judgment hash(内容指纹) 绑定。
不能证明:参与者 identity、validity、eligibility、PASS/FAIL 或 safety gate;它也不是真理裁判。
能证明:固定 1 题或 10 题离线任务在独立 namespace 内执行,并可供当场观察宿主额度、费用、耗时和临时验证状态。
不能证明:正式样本、能力分、稳定成本、report progress、routing correction 或排名;清理前目录仍明确存在。
能证明:机械与盲审 raw lanes、host receipt(执行回执)、bundle/rubric generation(代际)、代表样本和完整覆盖满足同一兼容合同。
不能证明:网页可以公开候选分数、名次或排行榜,也不自动改写模型路由。
能证明:PRIVATE(私有) main 包含问题库、campaign、workspace、verifier、证据、归档和报告实现。
不能证明:当前所有执行路线都可用或任何受测配置已形成结论。
能证明:25 个 schema(数据结构) 约束任务、执行、证据、归档和报告字段。
不能证明:每个 producer 都已生成完全合格的实例。
能证明:当前源码把三类执行路线、共同生命周期和路线专属 identity/lineage/cleanup 字段写成可审计合同。
不能证明:某个精确模型、provider、profile 或 endpoint 已通过本机接入或能够立即启动。
能证明:一次精确 run 的提交、状态、artifact、终态与清理属于同一执行;本地还绑定 GPU lease,云端还绑定 request/stream。
不能证明:可以把回执借给另一条路线、另一个 task,或把配置存在当成下一次付费授权。
能证明:宿主预演已证明 identity、workspace、artifact、terminal 和同一 verifier 的兼容路径。
不能证明:正式 episode 已运行、产生了受测结论,或外部模型/通用智能属于 CACB 自研。
能证明:e6f7581 观察代的 11 个核心测试文件曾有 162 项通过。
不能证明:这些结果适用于当前 59b0b5c,或当前完整执行链已经闭合。
能证明:59b0b5c 的四个最新 job(任务记录) 都在 lint 门失败,当前提交没有绿色 CI。
不能证明:受测能力失败,或所有测试逻辑都错误。
能证明:项目可以保留冻结输入、hidden verifier、raw trace 和归档链。
不能证明:这些私有内容适合公开或应复制到网页。
能证明:观察时 PRIVATE(私有) main、HEAD、origin/main 和干净工作树一致。
不能证明:页面会随未来 commit 自动更新。
维护入口
python scripts/prepare_campaign.py --help准备问题库 campaign:从版本化问题库创建冻结 manifest(清单)、fixture 与验证目录。
python -m cacb.fast_model_flow --help快速准备执行:为一个或一批新执行配置生成独立 workspace 和完成门材料。
python scripts/verify_arm.py --help验证候选 workspace:在参与者之外运行确定性验证并生成结构化摘要。
python -m pytest -q tests/test_sol_max_blind_judge.py tests/test_sol_max_judge_batch.py tests/test_quota_cost_probe_prompts.py tests/test_final_selection_release.py盲审、探针与最终选择合同回归:验证单样本盲化、exact Sol Max host receipt(执行回执)、两阶段零账本探针和同代最终选择边界。
python -m pytest -q <11 focused test files>核心产品回归:验证问题库、campaign、workspace、worker contract、fast flow、接入、归档和公开 schema(数据结构)。
python -m pytest -q完整回归:检查所有历史和当前执行路线;当前存在已明确披露的未闭合项。
快照怎样更新
本页代表最后一次明确核对并发布的项目状态,不承诺后台实时同步。再次更新时会重新读取该项目当前事实、边界和验证结果;无法确认的内容继续明确标成网页快照边界,不用旧记录猜成当前状态。
