用途与实际影响
这项功能怎样使用
为什么需要它
同一个模型简称可能指向不同版本或服务;能回答一段话也不代表能在编程任务里实际使用工具。这里先查真实模型、数据去向和本次能力。
举个实际例子
我说:“让本地模型看这份说明,文件别发云端。”系统只试已选本地路线;本机不可用就告知原因,不悄悄交给外部服务。
最后我会得到什么
知道这次会用哪个具体模型、材料会留在本机还是出机、它目前能做哪些工作;真正回答或文件结果仍要等实际任务完成。
正常时
模型身份和本次要求一致时按这条路线执行,完成后交回真实结果。
发现问题时
模型版本换了或旧验证不适用时只标这一条需重查。
入口不可用或证据不足时
模型未登记、缺登录或云端未获准时先停,不自动改换。
从哪里开始
在已接入 Toolkit 的主 AI 对话中说明要用本地还是明确允许的云端模型,并说清结果用途。
需要准备什么
- 问题与材料
- 模型或数据去向限制
- 是否需要工具调用
从开始到拿到结果
- 1
核对所选模型的真实去向
系统查当前模型登记及本地服务状态,确认文件不会被送到未获准的云端。
- 2
区分聊天和实际做事
系统分开核对这个模型能回答文字、能否在现有编程工具里使用文件与工具。
- 3
按真实入口处理
交回实际模型身份与结果;本地不可用时报告原因,不自动换云或把历史通过当当前可用。
技术实现与依据
这里保留实现、关键条件、精确入口、历史记录和验证结果。
当前四模型目录与零写入诊断闭合;Live单列关键规则与设计选择
默认只解析注册表 default_backend,本地 direct 不等于已验收 Agent。
云端请求必须额外带 privacy.cloud_allowed=true;失败不自动 fallback(后备路线)。
35B 是显式交叉验证,不进入默认或兜底选择。
本模块用到的名词
- 没有 fallback
- 调用失败不自动换供应商、模型或数据去向。
- 精确证据
- 一次历史成功只属于对应模型、Profile、CLI(命令行工具) 和验证任务。
专业定义
明确用谁、数据去哪里,失败后由调用者决定
解决什么
配置错误、模型身份变化或路线缺验收时,拒绝该路线,其他独立路线按自己的事实判断。
当前怎样实现
- default_backends.json 使用 llm-backend-toolkit.backends.v1;LLM_TOOLKIT_BACKEND_REGISTRY 可指定机器注册表。alias、backend(模型后端)、adapter(执行适配器)、model、route(处理路线)、runner 和 AICLI Profile 分开。
- local-default/current(当前状态) hard-reasoning使用qwen3.8-27b:256k;后者是要求reasoning.mode=on的隐藏兼容入口。27B参数temperature=1、top_p=.95、top_k=20、min_p=0、presence_penalty=0、repeat_penalty=1、num_ctx=262144、num_predict=32768。
- 请求alias qwen-main-v1仍指向27B local-default;显式local-crosscheck-35b/qwen-crosscheck-35b选择qwen3.6-35b:256k。35B temperature=1、presence_penalty=1.5,其余top_p=.95/top_k20/min_p0/repeat1/262144/32768;不能从旧README中的qwen-main-v1模型标签和.6参数恢复当前事实。
- fast-middle-agent固定codex-spark-xhigh/gpt-5.3-codex-spark/xhigh,7月29日旧冻结题81/80步硬停、2/9仍是历史。cloud-qwen-flash使用qwen3.7-flash;cloud-deepseek-v4-flash保留兼容backend(模型后端) ID,但当前模型是deepseek-flash、支持图像,两者没有已激活Agent路线,不自动回退。
- 云端openai-chat只用HTTPS和调用进程环境中的密钥引用;privacy.cloud_allowed必须是真正布尔true,先于读取材料检查。拒绝重定向,凭据不改投;本地传输不继承HTTP代理或任意远程端点覆盖。requested、reported、independently verified模型分开,缺报告为null;无法精确匹配的direct答案不作成功缓存。
- 显式local-qwen3-6-35b-abliterated与local-qwen3-8-27b-abliterated分别使用同名:256k模型,均非fallback(后备路线),前者无视觉、后者有视觉;35B参数同普通35B,27B参数同普通27B。相应Codex Profile和配置摘要由当前backends给出,configured/unverified不意味着重新获得Live证明。
执行流程
- 1
解析请求和 alias
- 2
读注册表与本地/云端边界
- 3
Agent 路线匹配精确证据
- 4
调用指定 adapter(执行适配器) 或返回具体错误
边界
- 四模型的Codex配置允许按合同预检和有界使用,但不声明通用Live;三个旧CLI(命令行工具)路线仍待重验。35B是显式交叉选择,不参与默认或fallback(后备路线)。
- 云端 mock、凭据存在和真实模型回答各自独立。
失败与恢复
- billing_unavailable、限流或 GPU 占用
- 返回选项,调用方决定重试或接管。
- backend(模型后端) / Agent 证据不匹配
- 在调用前拒绝,不借其他模型回执。
真实入口
src/llm_backend_toolkit/default_backends.json可选择模型及证据
src/llm_backend_toolkit/backends.py解析与校验
docs/local-crosscheck-35b.md35B 的失败与边界
如何验证
- 9月18日18:23:11Z diagnose读取当前0.9.2与目录配置,network_performed=false、model_invoked=false;没有把8月或9月7日的元数据读数晋升为今天的运行时权重证明。
- 注册表与提供方测试包含完整 370 项回归。
与其他模块的关系
后续所有文本、媒体和 Agent 任务共用这次明确选择。
