CACB Agent 能力基准 · 功能说明

Sol Max 根编排、角色专属交付与独立结果

同一道题可以区分一个 AI 独自完成,和它分配工作给直接助手后完成。比较时要看实际分工、冲突处理和最后整合,合作产物不能算成单独完成。

当前情况:已有分别评估单人完成与带协作者完成的设计和实现;本轮没有新的完整协作验收,不能把两者写成已合格成绩。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

如果助手继续找帮手、失败后任意换人,或把团队成果记在单个执行者名下,就无法解释真实能力和责任。

举个实际例子

我想知道“一个 AI 带几名直接帮手”和“一个 AI 独自做”会怎样不同。先核对两条路线是否都能用同一道题留下完整证据;条件具备后,再分别看帮手实际做了什么、根怎样解决冲突和验收。当前不能据此发布完整配置比较。

最后我会得到什么

具备运行条件并完成两条独立尝试后,才能分别看到独自完成与协作完成了什么、谁做了哪一步、哪里中断。当前完整比较仍受方法与 CI 缺口阻断。

正常时

当根任务、直接助手的身份与交付、冲突处理和最后验收都能回查时,协作样本才成立。

发现问题时

实际派发、助手身份或整合证据对不上时,这条协作尝试不能算通过。

入口不可用或证据不足时

需要的角色交付或整轮实际运行证据不齐时保留待验;单独执行路线另按自己的证据判断。

从哪里开始

在 CACB 项目的 AI 对话中说明要看单个根模型做题,还是看它调度直接子代理的协作结果。

需要准备什么

  • 同一道工程题或要检验的能力
  • 单独执行或协作路线的选择

从开始到拿到结果

  1. 1

    系统核对并处理

    按选定路线启动并记录真实父子关系,协作成果还需看分解、并发冲突和最终整合。

  2. 2

    交付与接续

    交回这一路线的实际产物和谱系;不能把子代理合作结果算作单模型独立完成。