项目与实际用途

CACB Agent 能力基准

CACB 是一套 Agent 工程能力评测台:用同版真实任务、隔离的工作位置和实际文件,核对这次有没有做成、证据是否可信,再由独立评审解释合格产物的质量。原生、本机和云端执行各自保留身份与结束证据;材料齐全且口径一致时才可能形成身份卡、基准报告和适用选择。当前方法与评分基数仍有 8 对 10 的冲突,最新 CI 也停在 lint,因此没有可采用的完整配置比较、分数或名次。

项目状态
评测产品框架已形成;方法与评分有效性仍需复核,历史比较结论当前不可采用
快照边界
评测框架已经形成,但题目数量与评分规则尚未统一,自动检查也未全部通过。当前不能采用旧分数或名次比较配置;这里展示方法和证据,不启动新评测。
观察时间
复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与结果

最快了解这个项目

为什么需要它

AI 说代码修好了,可能只留下回答、半成品或上次运行的文件。CACB 用同一道可验收的工程题、彼此隔开的工作目录和真实产物,核对这次究竟由谁执行、做成什么、哪里失败。这样才能分清能力问题、题目问题和运行环境问题。

举个实际例子

假如我要检验 AI 会不会真修代码,而不是只会说“已经解决”:给它一个小项目、失败现象和明确目标,再检查它留下的代码、诊断说明和测试结果。本页会说明怎样让每次尝试拿到同一份输入、待在自己的目录里,以及缺哪项证据就必须写未完成;它不在网页上启动新评测,也不拿旧分数冒充当前排名。

最后我会得到什么

目前可以对已记录的一次有界样本交回实际文件、执行身份、检查结果和阻断原因,也能说明现有问题库与三条执行路线怎样工作。方法口径冲突且 CI 尚未完整通过,不能取得可采用的完整配置比较。只有同版样本、客观检查与独立质量复核都齐全后,才会分别形成模型证据卡、基准报告和综合判断报告。公开页不展示受测配置、分数或名次。

正常时

将来只有同版任务、实际产物、执行身份和独立检查都闭合,才可以比较;合格产物的质量意见另行保存,不能替它补发客观通过。

发现问题时

当前方法口径冲突和 CI 缺口仍阻断正式完整比较。即使某次文件看起来做成了,题目、身份、边界或质量证据有冲突时也分别指出,不拿一项替另一项作保证。

入口不可用或证据不足时

拿不到这次任务真实由谁执行、是否结束、文件是否可验,或缺少必需的独立评审时,只交已知事实、阻断原因和下一步,不把缺项算成零分。

从哪里开始

在负责 CACB 项目的 AI 对话中说想检验哪种工程能力、怎样才算做成,并先问现有题目和规则是否足以开跑。当前评分口径冲突、CI 尚未跑完,不能据此进行完整配置比较;公开网页不接收任务。

需要准备什么

  • 要检验的工程任务或能力
  • 本人在意的完成结果与禁止边界

从开始到拿到结果

  1. 1
    先把现实任务固定

    明确什么算做成、哪些行为不能做,并固定题目、材料、隐藏检查和版本。现有方法口径冲突与 CI 缺口必须先解决,才谈得上正式比较。

  2. 2
    具备条件后隔离执行

    每次尝试拿独立工作区,核对执行者实际身份与输入;中断优先沿原任务续,取消后还要确认停止。

  3. 3
    先查产物,再看质量

    独立验收代码、行为和边界;合格样本才交匿名独立评审,评审意见不能改写客观检查。

  4. 4
    证据齐全才作判断

    分别交身份卡、基准结果和有范围的综合判断;当前不能发布受测配置排名或分数。

从这些需求了解功能

从一个实际问题看它怎样处理、交回什么;当前能做到哪一步和仍有哪些限制,也写在对应说明中。

01问题库一套新的 Agent 执行方式,怎么做可复现验收?页面会说明怎样给它同一版本的任务和独立工作区,再由没有参与作答的固定验收检查真实文件与行为。查看使用步骤与完整说明02隔离执行怎样防止旧执行记录污染新结果每次使用全新工作区和执行身份,旧产物、旧回执和上次未完成状态都不能借给新结果。本地模型执行时,显卡怎样排队和释放?开始前确认没有别的任务占用,结束后确认进程、请求和显存都已经退场;释放情况说不清,就先不启动下一份样本。云端任务取消后,为什么不能立刻重跑?电脑上的进程停了还不代表云端请求已经结束;远端结果仍不明确时,页面会保留“清理未确认”,避免第二次提交变成重复执行。查看使用步骤与完整说明03原生编排一个根智能体怎样拆任务、派帮手并收口?页面展示根怎样先确定每个直接帮手的独立职责,再处理冲突、整合文件并完成总体验收;这份结果与单智能体执行分开看。查看使用步骤与完整说明04额度费用探针什么时候只试 1 题,什么时候再看 10 题?先用一个很小的任务确认宿主界面能否观察到额度、费用和耗时;确实需要更完整样本时才跑十题,两者都不产生正式分数。观察完额度和费用,临时文件怎么清?先保留那一小块临时目录供人核对,确认结束后只删这次探针自己的目录,不顺手清理项目或其他任务。查看使用步骤与完整说明05身份与证据换一种执行方式,还能沿用同一套验证吗?先看它能否接收同一任务、留下同一种可核对结果,再做一次代表性预演;真正兼容后才算接入。这次应该走原生、本地还是云端执行?先说明三条路线分别在测什么、结果由谁产生;选定后全程保留真实身份,某条路线失败也不会偷偷换成另一条。接入一种新的执行器前,要先证明什么?它必须能接收同一任务、留下可追溯的真实产物,并被同一个验收方法检查;做不到就只保留为候选,不进入正式样本。某个模型现在到底能不能在这条执行路线里用?先核对提供方、版本、执行方式和当前可用条件;若这些证据齐全,可形成身份与资格材料。真正做成工程任务仍要另看实际产物,当前完整配置比较尚未可用。查看使用步骤与完整说明06确定性验证任务明明回答“完成了”,为什么还是没有结果?逐项看它是否真的结束、产物是否存在、验收是否通过;少任何一层,页面都会把缺口说清楚,而不是相信完成总结。查看使用步骤与完整说明07Sol Max 盲审硬检查通过后,怎样再看工程质量?每份合格产物交给不知道参与者身份的独立强审,只看冻结任务、验收依据和候选文件,并要求每个判断都指回具体证据。盲审觉得质量很好,能不能把失败改成通过?不能。客观硬门继续决定样本有没有资格,盲审只解释已经合格产物的质量,两个结论不会互相篡改。查看使用步骤与完整说明08失败与选择这次失败是能力问题还是执行环境问题把产物错误、任务缺陷、身份/权限/工具故障和证据缺失分别归因,不把基础设施中断算成能力差。怎样保留失败样本供以后诊断执行结束后归档代码、过程回执和失败原因并核对完整性,再释放临时工作区。官方价格和本地实测成本为什么要分开?官方价目按日期、单位和适用条件记录,本地消耗按冻结任务真实测量;综合判断只在口径可比时讨论经济性。缺失外部证据能不能填 0?不能。页面会直接写“还不知道”,并说明这项缺口会挡住哪一层结论;未知既不等于零,也不能拿本地证据代填。硬证据齐了,但少一份独立质量复核,还能排总名次吗?不能。页面保留已经核对好的样本和明确缺口,但整组选择继续等待,不拿旧意见或别的样本补空位。查看使用步骤与完整说明
项目指标与相关入口查看规模、覆盖范围和关联能力

当前项目指标

当前可采用比较
0
连续案例
10
计划槽
24
冲突基数
8 ↔ 10

它负责

  • 把真实工程问题整理成有明确输入、目标和边界的题,并固定版本,便于以后复查。
  • 让每次尝试使用独立目录,保留实际执行者、任务、文件与停止状态的对应关系。
  • 独立检查真实代码、行为和禁止修改范围;只有客观条件通过的产物才进入匿名质量复核。
  • 让独立评审只看一份完整题目与产物,说明实现质量;评审意见不能改写客观检查。
  • 把能力不足、题目缺陷、运行环境故障和证据不足分开报告。
  • 原生、本机和云端执行分别核对身份、完成和清理;一种路线失败不伪装成另一种成功。
  • 短探针只观察宿主显示的额度、费用与耗时,随后清理,不混入正式能力结果。
  • 证据齐全且同版时才形成模型身份、真实任务结果和适用选择的三层报告;目前完整比较仍被已知缺口阻断。

它不负责

  • 公开页不列出受测配置名单、实际分数、名次或比较结论,也不公开私有题目、隐藏检查和原始执行记录。
  • 不拿速度、花费、工具次数或一段自称完成的回答替代真实文件验收。
  • 匿名质量意见不能替代身份、客观正确性和允许范围的检查。
  • 一题或十题额度费用探针不计入正式成绩;未核实的费用不能用于选择结论。
  • 官方说明、外部评测和这台机器上的真实任务分开看;不同口径的数字不混成一个总分。
  • 没有完整同版样本时不先排部分名次,也不借旧结果、别次文件或另一执行路线补空。
  • 云端付费执行要核对每次实际授权;一次已配置或已预演不自动授权下一次调用。
  • 评测不在后台自行运行,也不自动改写用户的模型、权限或现实选择。

产品思想与设计核心

01

先固定题,再看结果

参与者要看到相同的目标和允许范围;题目或验收改版就作为新一轮,不能边跑边改。

02

每次只算自己的产物

工作目录彼此隔开,旧文件、别人的成功和中断后的拼接不能替这次完成任务。

03

真实文件先过客观检查

先看程序行为、禁止范围和任务结束状态,答复说“完成了”不足以通过。

04

质量意见有自己的位置

客观条件通过后,才让独立评审解释这一份实现是否稳健、清楚、便于维护;它不能改写客观结果。

05

匿名也要给足材料

评审要看到完整题目、验收依据和实际文件,但看不到作者、其他候选及比较信号。

06

题目允许不同的好解法

隐藏检查验证行为和边界,不要求所有人照抄参考代码,也不把答案提前交给参与者。

07

一份证据对应一次执行

执行者、输入、工作目录、文件和结束状态必须互相对得上;旧回执不能借给新尝试。

08

先说明为什么失败

代码没做对、题目本身有缺陷、执行环境坏了或证据拿不到,是不同问题。

09

缺项保持未知

单次成功不能证明长期稳定,样本或检查未齐时不能用零分或猜测补齐。

10

外部资料与本机实测分开

官方能力、可用性和价格需要当前来源;本地任务只证明这次真实执行,两者不能互相填空。

11

三类结果分开交付

身份卡说明测的是谁,基准报告说明实际任务做成什么,综合判断才讨论在证据允许的范围内怎样选。当前完整报告尚未通过方法与 CI 门。

12

三条路线保留真实差异

原生、本机和云端可用同一任务目标,但它们的身份、结束和清理证据各自核对;失败不静默换路线。

13

探针不混进正式成绩

短探针先回答能否看到额度和费用,确有需要再用较长版本;观察完只清理它自己的临时内容。

14

每次付费和最终选择由人决定

云端付费执行逐次核对授权;报告不会自动改写模型设置、权限或用户决定。

15

外部 AI 是受测对象

理解、推理和代码执行来自已接入的 AI;CACB 自身负责题目、隔离、证据与验证。

项目怎样演化到现在

从单次测试,发展成可复现的评测台

从有固定答案的单题,发展到能保存连续任务、独立工作位置、实际执行者和结果依据的评测框架。

阶段依据
  • 2026-08-08—08-13 · 从单次测试,发展成可复现的评测台连续评测证据链

同一套验收开始比较不同执行路线

原生、本机和云端路线开始使用同一工程题与验收方式;各次运行仍保留自己的身份和产物,不互借成功。

阶段依据
  • 2026-08-14 · 同一套验收开始比较不同执行路线ce29323–bb14d37

从做没做成,扩展到盲审和证据兼容

增加单份匿名质量意见和独立的额度费用观察,并规定只有同版、完整证据才能选择;现有方法与 CI 缺口仍使完整比较不可采用。

阶段依据
  • 2026-08-15—08-16 · 从做没做成,扩展到盲审和证据兼容8a911fe–e6f7581