CACB Agent 能力基准 · 功能说明

现实任务如何变成可复现的问题库

我能反复用同一任务边界检验不同 Agent 执行方式,而不是每次临时出题、临时改验收。

当前情况:已有现实任务的问题库和版本化案例,并通过核心测试;本页不展开私有题目,也未启动新评测。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

题目太依赖作者记忆会变成猜谜;把隐藏答案直接给参与者又失去检验价值。问题库必须同时做到可完成和不可针对。

举个实际例子

我要比较两种 AI 能不能真修好同一个仓库。它们看到相同的代码、失败现象和目标,却看不到隐藏检查;最后只看程序行为是否修对,不要求两边写成同一种样子。

最后我会得到什么

得到一份可以重复使用的工程题:参与者会看到什么、要做成什么、哪些地方不能碰、怎样独立检查。题目标准不全时先修题,不进入正式评测。

正常时

题目给出做事所需信息,检查只看行为与边界,版本固定后可进入已收录问题库。

发现问题时

若答案只在出题者脑中、只能接受一种写法或结果无法复查,先修题。

入口不可用或证据不足时

缺题目输入、可运行检查或版本依据时,不创建正式评测。

从哪里开始

在 CACB 项目的 AI 对话中说明一个真实工程难题,请它先判断能否做成可复查的题。

需要准备什么

  • 真实工程场景和想得到的产物
  • 不能跨越的操作边界

从开始到拿到结果

  1. 1

    系统核对并处理

    固定参与者可见材料和独立检查,开跑后不原地改题或把隐藏答案交给执行者。

  2. 2

    交付与接续

    交回版本化题目与适用边界;标准不完整时先修题,不拿临时印象评分。