能力入口 · 个人维护的能力入口

图像理解与精确 OCR(光学字符识别) 分工

让我对图片提出自然问题时,不必先猜该选哪个工具:只看场景就直接看原图,需要逐字准确就交给本机 LocalOCR,两种结果都要时让它们独立取证再合并。

场景、精确文字与混合请求有既有验收;当前页面保留少数字符错误和耗时边界,本次没有重新识别图片,关键文字仍回到原图核对。

先看怎么用

你不需要记住 Skill 名,直接说需求就行

什么时候用

  • 准确抄写图片里的小字、浅色字或关键数字
  • 扫描 PDF、多页图片、表格、公式、印章、版面或坐标
  • 既要描述场景又要准确复制文字
  • 源像素必须留在本机处理

可以直接这样说

例如我说“描述这张照片,并准确抄下招牌”。系统会从同一原图形成场景观察,再独立运行 LocalOCR 读取招牌;答案把视觉观察、精确文字、识别状态和冲突分开。

最后会得到什么

我会得到与请求目标匹配的结果:场景说明、可回到原图核对的文字与坐标、确定性的人话状态摘要,以及没有被悄悄抹平的不确定或冲突。 多页扫描会逐页保留第一次识别,只对确有问题的页升级模型;中途停止时明确完成了哪些页,不能把部分文本当整批成功。

不适合这样用

  • 只需要描述普通照片里的场景、物体、活动、颜色或纹理
  • 把原生视觉当逐字正确证明
  • 把 OCR(光学字符识别) 当场景描述模型
  • 把空文本直接理解成没有文字
  • 等待时间到就重复启动同一份识别任务

正常时

按请求分别交回场景观察、精确文字、必要坐标与识别状态,并标清每种结果来自哪里。

发现问题时

小字、浅色字、局部覆盖或两路结果冲突时,保留原结果和不确定处,回到原图的具体区域复核。

入口不可用或证据不足时

本地识别不可用时,精确文字仍算未完成;允许原生视觉时可继续场景说明,明确要求全部本地则不改走外部视觉。

从哪里开始

在当前 AI 对话提供图片、扫描 PDF 或明确的文件夹,说要抄准小字、读表格、批量识别或全部留在本机;普通看图描述直接由 AI 看原图。

需要准备什么

  • 要看的原图、扫描页或有界批量,以及具体要读的文字、表格或区域
  • 若要求本地处理、精确字符或结构坐标,直接说出这个要求

为什么需要这个能力

场景理解和字符级准确是两种不同任务。只用视觉可能看懂画面却抄错小字,只用 OCR(光学字符识别) 又可能得到文字却误解场景;把两者混成一个结论还会藏掉冲突和不确定。

从需求到结果

1

提供图片、扫描 PDF 或选定文件,并说清要理解场景、准确抄字,还是两者都要;是否必须全部本地也由你的真实要求决定。

2

只描述普通场景时直接看原图;需要小字、数字、表格、公式、坐标或扫描结构时使用本地文字识别。

3

既要场景又要精确文字时,两条路线分别读取同一原图,再把观察、文字和冲突一起说明,不能用一条结果悄悄覆盖另一条。

4

多页文件逐页检查,只对确有薄弱文字、表格或公式证据的页升级模型,保留第一次识别。需要结构化版面时明确选择对应路线,不用整批平均表现代替每页判断。

5

等待超时先查原任务;真正取消、执行期限结束或资源失效会停止当前处理,不偷偷换模型继续。只完成部分页面就明确交付已完成范围。

6

空文件或模型没输出不能证明没有文字;只有原图像素和覆盖检查支持的空白页,才能给出无文字结论。

7

明确全部本地时不把图片交给外部视觉。识别状态摘要帮助读结果,但原图、文字坐标与质量证据仍保留。

失败时会怎样恢复

识别还没等到最终结果

系统反应:等待结束不等于识别失败,也不马上重新提交。

恢复方式:沿同一次图片或文件任务查看最终状态,成功、部分完成与取消分别说明。

识别结果是空白

系统反应:暂时只能说还没有可靠文字,不能断言图片没有字。

恢复方式:核对原图能否打开、每页是否处理、结果质量及独立的无字证据;必要的另一种判断会单独标明来源。

看图结果与文字识别冲突

系统反应:两份观察分别保留,不让一边悄悄覆盖另一边。

恢复方式:回到同一原图的具体区域复核;仍看不清就保持未知。

用户要求全部本地处理

系统反应:不把源像素交给原生视觉或其他外部路线。

恢复方式:只运行本机 LocalOCR,并明确本次没有场景视觉解释。

本地显卡任务暂时无法运行

系统反应:停止新的重型识别,避免多个任务争用资源。

恢复方式:先修复原调度入口或等正在进行的任务结束,再沿已知任务和原文件继续。

本地识别服务当前没有响应

系统反应:说明这一刻运行入口不可用,不据此说能力永远坏了。

恢复方式:沿现有维护入口恢复后,用一份小输入重新核对真实识别;不创建第二套服务。

返回 Skills(能力)