能力入口 · 个人维护的能力入口
图像理解与精确 OCR(光学字符识别) 分工
让我对图片提出自然问题时,不必先猜该选哪个工具:只看场景就直接看原图,需要逐字准确就交给本机 LocalOCR,两种结果都要时让它们独立取证再合并。
场景、精确文字与混合请求有既有验收;当前页面保留少数字符错误和耗时边界,本次没有重新识别图片,关键文字仍回到原图核对。先看怎么用
你不需要记住 Skill 名,直接说需求就行
什么时候用
- 准确抄写图片里的小字、浅色字或关键数字
- 扫描 PDF、多页图片、表格、公式、印章、版面或坐标
- 既要描述场景又要准确复制文字
- 源像素必须留在本机处理
可以直接这样说
例如我说“描述这张照片,并准确抄下招牌”。系统会从同一原图形成场景观察,再独立运行 LocalOCR 读取招牌;答案把视觉观察、精确文字、识别状态和冲突分开。
最后会得到什么
我会得到与请求目标匹配的结果:场景说明、可回到原图核对的文字与坐标、确定性的人话状态摘要,以及没有被悄悄抹平的不确定或冲突。 多页扫描会逐页保留第一次识别,只对确有问题的页升级模型;中途停止时明确完成了哪些页,不能把部分文本当整批成功。
不适合这样用
- 只需要描述普通照片里的场景、物体、活动、颜色或纹理
- 把原生视觉当逐字正确证明
- 把 OCR(光学字符识别) 当场景描述模型
- 把空文本直接理解成没有文字
- 等待时间到就重复启动同一份识别任务
正常时
按请求分别交回场景观察、精确文字、必要坐标与识别状态,并标清每种结果来自哪里。
发现问题时
小字、浅色字、局部覆盖或两路结果冲突时,保留原结果和不确定处,回到原图的具体区域复核。
入口不可用或证据不足时
本地识别不可用时,精确文字仍算未完成;允许原生视觉时可继续场景说明,明确要求全部本地则不改走外部视觉。
从哪里开始
在当前 AI 对话提供图片、扫描 PDF 或明确的文件夹,说要抄准小字、读表格、批量识别或全部留在本机;普通看图描述直接由 AI 看原图。
需要准备什么
- 要看的原图、扫描页或有界批量,以及具体要读的文字、表格或区域
- 若要求本地处理、精确字符或结构坐标,直接说出这个要求
为什么需要这个能力
场景理解和字符级准确是两种不同任务。只用视觉可能看懂画面却抄错小字,只用 OCR(光学字符识别) 又可能得到文字却误解场景;把两者混成一个结论还会藏掉冲突和不确定。
从需求到结果
提供图片、扫描 PDF 或选定文件,并说清要理解场景、准确抄字,还是两者都要;是否必须全部本地也由你的真实要求决定。
只描述普通场景时直接看原图;需要小字、数字、表格、公式、坐标或扫描结构时使用本地文字识别。
既要场景又要精确文字时,两条路线分别读取同一原图,再把观察、文字和冲突一起说明,不能用一条结果悄悄覆盖另一条。
多页文件逐页检查,只对确有薄弱文字、表格或公式证据的页升级模型,保留第一次识别。需要结构化版面时明确选择对应路线,不用整批平均表现代替每页判断。
等待超时先查原任务;真正取消、执行期限结束或资源失效会停止当前处理,不偷偷换模型继续。只完成部分页面就明确交付已完成范围。
空文件或模型没输出不能证明没有文字;只有原图像素和覆盖检查支持的空白页,才能给出无文字结论。
明确全部本地时不把图片交给外部视觉。识别状态摘要帮助读结果,但原图、文字坐标与质量证据仍保留。
失败时会怎样恢复
识别还没等到最终结果
系统反应:等待结束不等于识别失败,也不马上重新提交。
恢复方式:沿同一次图片或文件任务查看最终状态,成功、部分完成与取消分别说明。
识别结果是空白
系统反应:暂时只能说还没有可靠文字,不能断言图片没有字。
恢复方式:核对原图能否打开、每页是否处理、结果质量及独立的无字证据;必要的另一种判断会单独标明来源。
看图结果与文字识别冲突
系统反应:两份观察分别保留,不让一边悄悄覆盖另一边。
恢复方式:回到同一原图的具体区域复核;仍看不清就保持未知。
用户要求全部本地处理
系统反应:不把源像素交给原生视觉或其他外部路线。
恢复方式:只运行本机 LocalOCR,并明确本次没有场景视觉解释。
本地显卡任务暂时无法运行
系统反应:停止新的重型识别,避免多个任务争用资源。
恢复方式:先修复原调度入口或等正在进行的任务结束,再沿已知任务和原文件继续。
本地识别服务当前没有响应
系统反应:说明这一刻运行入口不可用,不据此说能力永远坏了。
恢复方式:沿现有维护入口恢复后,用一份小输入重新核对真实识别;不创建第二套服务。
技术身份与验证证据
Skill · localocr · 成熟度 A(稳定)
这个 Skill 用到的名词
- OCR(光学字符识别)
- 从图片或扫描 PDF 中读取文字。
- Native vision(原生视觉)
- 直接看原图来理解场景、物体、环境、活动、颜色和纹理;它不是逐字正确证明。
- Outcome route(按结果分流)
- 先看用户要场景描述、精确文字还是两者,再选择原生视觉、LocalOCR 或两路独立执行。
- Evidence lane(证据通道)
- 视觉观察与 OCR(光学字符识别) 原始文字、坐标、置信度和状态各自保留来源;冲突时不互相覆盖。
- Display summary(人话状态摘要)
- API、TXT、Markdown 和 JSON 都能返回同一条确定性状态说明;它只投影文字块、覆盖、质量、置信度、自动升级和警告。
- Job(识别任务)
- 一次提交的稳定任务 ID;timeout(等待超时) 后用它继续查询,不重复创建。
- Objective sidecar(客观结果侧车)
- 记录输入 hash(内容指纹)、识别状态、完整性、结果是否足够以及输出文件。
- Structure(结构化版面)
- 保留表格、公式、段落、坐标等页面结构,而不只输出一串文字。
- 逐页升级
- 多页输入各自先OCR(光学字符识别),只升级有依据的薄弱或复杂页,并保存第一次文字与坐标;不是全批统一改成VL。
- 部分页检查点
- 只代表已完成的那些页,取消或失败后保留真实覆盖与终态,不能写成整批完成。
专业定义
处理图片时先看用户真正要什么:只描述场景就用原生视觉;要逐字、坐标、表格或本地处理就用 LocalOCR;既要看画面又要抄文字时,两条路线独立取证并分开呈现。
执行参考
下面保留 AI 和工具实际使用的参数、步骤与依赖。日常使用可以直接提出需求,不需要先手工准备这些协议。
输入
- 一张或多张图片、PDF 或明确文件夹
- 想要的结果:场景描述、精确文字或两者
- 是否要求全部本地处理,以及可选 engine、版面模式和输出格式
输出
- 场景请求的原生视觉观察
- 精确 OCR(光学字符识别) 文字、坐标、置信度、表格和版面结构
- API、TXT、Markdown 与 JSON 中确定性的 display_summary(人话状态摘要)
- 分开的视觉观察、精确文字、识别状态、不确定与冲突
- 多页任务已经完成页面的检查点、各页覆盖与未完成范围;部分页面有输出不等于整批成功
执行顺序
- 1
先按请求结果选择原生视觉、LocalOCR 或两路
- 2
只看场景时直接检查原图,不启动 LocalOCR
- 3
精确文字与结构请求走本机 OCR(光学字符识别)
- 4
混合请求让两条路线独立读取同一原图
- 5
按视觉观察、精确文字、识别状态和冲突合并答案
- 6
复用返回的 job(任务记录) 和 output,区分 deadline、broker(代理服务)、配置和识别失败
- 7
ocr_smart.ps1复用或启动127.0.0.1:18665;auto对每个页面先运行普通OCR(光学字符识别),只对有具体薄弱、表格或公式证据的页面升级VL,保留同页第一次结果。要结构化块、HTML表格和坐标时明确structure(结构化版面),不靠全批平均值选一路。
- 8
当前普通PP-OCRv6保留方向与文本行处理,平面截图关闭文档展平;模型Profile在localocr/model_profiles.json选择
- 9
OCR(光学字符识别)、VL和Structure(结构化版面)共享可终止温热worker;同模型复用、换模型重建。取消、执行期限或GPU租约丢失是当前任务的终态,停止worker,不再自动换另一模型继续。
操作边界
- 原生视觉负责场景理解,不是逐字正确证明
- LocalOCR 负责精确文字证据,不是场景描述模型
- 两路冲突时保留分歧并复核原图区域,不静默覆盖
- 明确要求全部本地时不把源像素交给原生视觉
- display_summary 只投影客观状态,不替代原始 OCR(光学字符识别) 或 objective sidecar(客观结果侧车文件)
- 不把 timeout(等待超时) 124 当 OCR(光学字符识别) 失败,不把空文本当否定结论
- GPU 由当前 PCConfig 兼容策略调度:一路 OCR(光学字符识别) 可与一路 ASR(自动语音识别) 并行,同类及 Ollama 互斥;普通冲突不创建持久排队任务
- health.active_jobs 是忙闲依据;字段缺失是Unknown(未验证)。400为输入/配置、409为已有任务、503为Broker(代理服务)/租约、504为执行期限;复用返回的准确job(任务记录)位置,不因外层124盲重试
- no_text_detected 需要完整执行/覆盖、足够质量、已验证的非空否定证据及原件/请求/模型/配置绑定;普通空TXT或cache_hit不是无文字证明
- 自动OCR(光学字符识别)→VL失败时保留的一次OCR(光学字符识别)只是部分证据;关键字仍需回到原图区域,独立视觉纠正另标原件hash(内容指纹)与rect,不能覆盖原始OCR(光学字符识别)
- 18666属于ChineseASR,不能作为OCR(光学字符识别)后备端口;端口冲突由机器事实入口核对
- 近乎纯色且完成像素/覆盖检查的空页可以有合格无文字证据;普通空TXT、损坏图片或模型没输出仍是Unknown(未验证)。
- 模型安装与升级走已验证candidate/current/previous发行,不在活动环境中原地拼依赖;版本配置与真实同输入验收分别核对。
依赖
- E:\Projects\Tools\LocalOCR
- WSL(Windows 的 Linux 子系统) Python
- PaddleOCR
- LocalGpuBroker(本地 GPU 调度器)
验证状态
源码、安装、供应检查、当前任务、新任务和真实使用分别列出;一层通过不自动提升另一层。
- Source(源码)
- 当前 .agents source e734251 中的唯一源码已核对
- Install(安装)
- canonical junction(目录联接) 已安装
- Transaction(供应事务)
- 供应事务检查通过;0 个坏事务
- Current task(当前任务)
- 本轮网站任务只核对来源提交、供应状态和公开展示,没有处理新的图片或启动 OCR(光学字符识别) 模型
- Fresh task(全新任务)
- 来源 Owner 已用实现盲自然请求分别验收场景只走视觉、精确文字走 OCR(光学字符识别)、混合请求分离两类证据
- End to end(端到端)
- 场景只用原生视觉、精确文字用 LocalOCR、混合请求分开视觉观察/精确文字/识别状态/冲突的三条用户路径已验
原三条自然请求验收保留其来源日期;9月17日Owner175项回归(174通过、1跳过)与9项真实OCR(光学字符识别)/结构/多页接受结果由项目页独立展示。存在少数字符替换及分层耗时,本页没有重跑图片或把模型通过说成逐字零错。
证据时间与来源
- Observed at(观察时间)
- Skill 供应、.agents 与 LocalOCR 远端 main 回读:2026-09-02 12:17(中国时间)
- Source commit(来源提交)
e734251081dc48bdd86765372ce225b3929ce9ae- Supply command(供应验证命令)
E:\.agents\tools\Test-PersonalSkillSupply.ps1 -RequireInstalled -NoExternalEvidence -Json- Evidence basis(证据来源)
- .agents source 31278a0 的 LocalOCR Skill、openai.yaml 与自治回归,LocalOCR PUBLIC(公开) main acc6d15 的 display_summary 实现/测试,以及来源 Owner 的三条实现盲用户路径;source、install、产品代码、历史真实 OCR(光学字符识别) 与本轮网站取证保持分层。
Canonical source(唯一维护源)
E:\.agents\skills\localocr\SKILL.md该路径是维护源;用户目录中的发现入口不是第二份源码。
