用途与实际影响
这项功能怎样使用
为什么需要它
模型会变,CLI(命令行工具) 也会变;过去能运行某个任务不能成为永久能力保证。验证需要明确输入、独立检查器和对应运行身份。
举个实际例子
刚换了模型,先给它一个有固定答案的小任务,检查是否能按 JSON 输出。若需要评估工程任务,再运行选定的代码修复或数据工厂案例。
最后我会得到什么
得到这个模型在这一次固定小题或文件任务上的实际结果与检查结论;它不会因此变成永久最优模型,也不自动改默认选择。
正常时
任务产物和独立检查都对得上时,说明这一版本、这一案例通过。
发现问题时
答案看起来对但工具过程失败时,两种结果分开。
入口不可用或证据不足时
模型路线、资源或云端许可不足时不发起测试。
从哪里开始
在已接入 Toolkit 的主 AI 对话中明确说要验证哪项模型能力、使用哪个有界案例,并接受相应本地或云端调用。
需要准备什么
- 待验证模型与具体能力
- 固定案例和检查标准
- 可用额度或本地资源
从开始到拿到结果
- 1
按目的挑一件小测试
系统只选能回答本次疑问的固定案例,例如按指定格式输出或完成一项小工具任务。
- 2
运行受控案例
按既有权限和模型路线产生真实输出,由独立检查器核对。
- 3
保留有日期结论
交回这一版本、这一案例的结果和失败点;旧源码测试数量不能冒充模型能力分数。
技术实现与依据
这里保留实现、关键条件、精确入口、历史记录和验证结果。
工具已实现;本次未重跑模型基准关键规则与设计选择
probe 可选 instruction / json / context / vision,异步返回任务编号,不是每次调用的强制前置。
general_agent_v1 包含证据推理、代码修复和约束工作流规划,比较的是模型加执行环境。
只有需要新证据才运行;本网页刷新不制造昂贵模型任务。
本模块用到的名词
- 独立检查器
- 不让候选模型修改用于判分的程序。
- 版本绑定
- 结果只适用于记录的任务与执行身份。
专业定义
用一件可检查的事验证能力,避免只看模型名字
解决什么
基础设施失败和任务回答失败分开;没有有效入口时不生成貌似有分数的空跑报告。
当前怎样实现
- probe --backend <id> --case <case>;vision 需附件,云端还需 --cloud-allowed。支持 --force 明确新尝试。
- run_general_agent_benchmark.py --list 可只列案例;真实运行要求 --aicli-entry 或 LLM_TOOLKIT_AICLI_ENTRY,默认四 runner 串行,结果绑定 suite fingerprint、模型身份、CLI(命令行工具) 与沙箱。
- 数据工厂、fast-middle 和 local quality 各有独立题目/检查器;正确性先于同分耗时比较。旧日期报告只是历史证据,不据此自动替换本地默认。
执行流程
- 1
说明需要验证的能力
- 2
选择最小有界案例
- 3
在既有权限与 GPU 路线运行
- 4
由独立检查器核对产物
- 5
保存版本对应的结论
边界
- 370项历史和408项后续来源回归都不是模型benchmark(能力评测)分数。
- 本次没有新增云端或本地模型生成。
失败与恢复
- 受管 AICLI 入口缺失
- 创建输出和调用模型前失败,避免空跑报告。
真实入口
src/llm_backend_toolkit/cli.py有界探测入口
scripts/run_general_agent_benchmark.py通用代理案例运行
benchmarks/general_agent_v1三个案例与检查器
docs/fast-middle-agent.md注明日期的专项历史
如何验证
- probe和benchmark协议的历史离线检查保留对应日期;本轮没有发起新基准或云端调用,也不因为配置同步改变模型排名。
与其他模块的关系
给注册表与调用者提供证据,不替代主 AI 的任务选择。
