用途与实际影响
这项功能怎样使用
为什么需要它
题目太依赖作者记忆会变成猜谜;把隐藏答案直接给参与者又失去检验价值。问题库必须同时做到可完成和不可针对。
举个实际例子
我要比较两种 AI 能不能真修好同一个仓库。它们看到相同的代码、失败现象和目标,却看不到隐藏检查;最后只看程序行为是否修对,不要求两边写成同一种样子。
最后我会得到什么
得到一份可以重复使用的工程题:参与者会看到什么、要做成什么、哪些地方不能碰、怎样独立检查。题目标准不全时先修题,不进入正式评测。
正常时
题目给出做事所需信息,检查只看行为与边界,版本固定后可进入已收录问题库。
发现问题时
若答案只在出题者脑中、只能接受一种写法或结果无法复查,先修题。
入口不可用或证据不足时
缺题目输入、可运行检查或版本依据时,不创建正式评测。
从哪里开始
在 CACB 项目的 AI 对话中说明一个真实工程难题,请它先判断能否做成可复查的题。
需要准备什么
- 真实工程场景和想得到的产物
- 不能跨越的操作边界
从开始到拿到结果
- 1
系统核对并处理
固定参与者可见材料和独立检查,开跑后不原地改题或把隐藏答案交给执行者。
- 2
交付与接续
交回版本化题目与适用边界;标准不完整时先修题,不拿临时印象评分。
技术实现与依据
这里保留实现、关键条件、精确入口、历史记录和验证结果。
问题库、公开案例与版本化加载器有源码和核心回归;私有变体不进入网页关键规则与设计选择
先定义可观察行为,再选择验证方式。
可见任务必须能从 workspace 自行完成。
隐藏检查只验性质,不泄露答案。
任务变化创建新版本,不改写旧证据。
本模块用到的名词
- task family(任务家族)
- 一组共享现实能力但实现形式不同的案例。
- oracle(验收真值)
- 验证器用于判断属性是否满足的隐藏依据。
- provenance(来源)
- 说明任务灵感、许可、时间和改写关系。
专业定义
把工程实现、诊断、连续性、证据和恢复要求写成版本化案例;可见输入足够完成任务,隐藏检查只负责验收。
解决什么
解决临时出题、作者知识依赖、隐藏答案泄露、验证器过拟合和版本漂移。
当前怎样实现
- question_bank.py 管理案例身份、任务家族和版本。
- public_cases / public_cases_v2 提供公开安全案例结构。
- CASE_CATALOG 与 JSON schema(数据结构) 说明可见/隐藏边界。
- source lock 绑定公共设计来源与时间。
执行流程
- 1
提出现实能力问题。
- 2
设计可见 fixture 和目标。
- 3
定义实现无关的隐藏属性。
- 4
做污染与可完成性检查。
- 5
冻结版本、schema(数据结构) 和 hash(内容指纹)。
- 6
纳入 campaign 生成器。
边界
- 网页不公开私有变体、seed 或 oracle。
- 案例不是记忆题或平台私有约定题。
- 公开 anchor(活动锚点) 只说明设计,不等于正式私有案例。
失败与恢复
- 任务只有作者知道答案
- 移除或补齐可见上下文。
- 隐藏检查依赖固定代码形状
- 改为验证行为属性。
- 来源或许可不清楚
- 不进入可发布问题库。
真实入口
PRIVATE source · src/cacb/question_bank.py问题库与校准规则
PRIVATE source · config/question-bank.v1.json版本化产品合同
PRIVATE source · docs/CASE_CATALOG.md案例家族与边界
PRIVATE source · tests/test_question_bank_release.py问题库发布回归
如何验证
- question bank、public(公开) cases 与 release focused tests 在 e6f7581 历史观察代曾通过;该证据不继承到当前 59b0b5c。
- 私有 holdout 内容未读取到网页项目。
- 完整跨代问题库路径仍受完整回归缺口约束。
与其他模块的关系
向 campaign 模块提供冻结案例;deterministic verifier 消费隐藏验收属性并拥有 PASS/FAIL,blind-quality-review 只消费已过门样本的完整可见任务、正确性依据和候选 artifact。
