从截图和扫描页取出文字,保留行列、坐标与没看清的地方

LocalOCR

LocalOCR 把截图、拍照页和扫描文件里的文字变成可检索、可复制的结果;需要表格、公式或版面关系时,也保留行列、阅读顺序和位置。普通截图先用文字识别,复杂版面再用专门模型。它不会替你解读合同含义,也不会因为输出为空就断言原图没有字。

项目状态
本地提字、文档结构解析与可复核结果已经实现
快照边界
识别结果能回原图核对,但不保证逐字正确。已有文字的数字文档先直接读取;需要显卡的识别方式若无法运行,会说明原因,不暗中改用另一种方式。空白结果和未处理完的页面仍保留不确定性。
观察时间
复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

合成采购表原图,六列五行商品,标题编号为 PO-2026-0712
合成输入 · 不是私人订单先看图示与结果

项目原有的 900×600 合成采购表,包含标题、六列表格、五条商品和合计;展示图与 9 月 3 日推理原件解码像素一致,未用新合成测试替换这份历史证据。

查看画廊与说明

用途与结果

最快了解这个项目

为什么需要它

直接复制不了的文字需要识别,但只得到一大段文本常常丢掉金额所在列、脚注位置或多栏阅读顺序。这个工具把文字和原页面位置一起交回,并指出哪些页没处理完、哪些字还需要回看。

举个实际例子

“把这几张扫描表格里的文字提出来,保留每一行对应的金额;看不清的地方标出来。”先处理实际扫描页,返回文字和位置;若文件本来就有可提取文本,则先用原生文档读取,不多跑一遍OCR(光学字符识别)。

最后我会得到什么

拿到可复制的文字和可对照原图的位置说明;选择表格或公式时还会保留它们的关系。工具会说明处理了哪些页、哪些字不确定,关键数字仍要回原图核对。需要程序处理时也有结构化结果文件。

正常时

处理完成时返回实际输出文件、按页文字、识别方式和质量说明;需要结构时保留表格、公式或区域信息,便于继续使用并对照原图。

发现问题时

字小、低对比、布局复杂或首轮结果不足时,自动模式可以在本机增强;仍读不清、只完成部分或模型失败就说明具体问题,初步文字与正式完成结果分开。

入口不可用或证据不足时

原件打不开、环境不可用、端口不是本服务或显卡资源冲突时,返回明确原因和现有任务位置,不输出假结果,不擅自上传云端,也不反复创建同一任务。

从哪里开始

把图片、扫描 PDF 或文件夹拖到本机 LocalOCR 的 start.bat;在已接入 LocalOCR 的 AI 对话中也可指定原件和结果要求,由 ocr_smart.ps1 接住有界识别。

需要准备什么

  • 本次明确的图片、扫描 PDF 或文件夹
  • 只提文字,还是保留表格、公式、区域
  • 目录是否递归及关键字段

从开始到拿到结果

  1. 1
    先判断是否真的需要识字

    系统检查输入是否已经有可直接读取的文字;只有图片或扫描部分才交给本地文字识别。

  2. 2
    按内容选择识别

    普通图片先提字,复杂页面或明确结构需求使用相应本地路线,显式选择优先。

  3. 3
    拿到内容和状态

    交回文字、结构文件、页码位置及覆盖和质量说明;超时先查原任务。

  4. 4
    对照原件使用

    关键姓名、数字、公式和表格关系回看原图;识别不清或模型不可用时保留缺口,不把空结果判成无字。

从这些需求了解功能

从一个实际问题看它怎样处理、交回什么;当前能做到哪一步和仍有哪些限制,也写在对应说明中。

01输入与识别路线把这张截图里的文字复制出来,文件留在本机。直接指定原图和本地处理要求,普通提字先走轻量路线;返回原始文字与识别状态,不自动上传,也不为一个截图扫描整个目录。这份多栏文档很复杂,但我想明确使用某个模型。显式模型选择优先于自动路线;引擎与模型不匹配时直接说明,不静默改成另一个模型冒充完成。查看使用步骤与完整说明02表格与版面把采购表读成表格,保留型号、数量和金额对应关系。明确选择结构解析,保留行列、文字行、阅读顺序和区域位置;输出后按原图核对对应关系,不只交回一长串文字,也不直接宣称生成了 Excel。查看使用步骤与完整说明03结果与复核这个空结果到底是没有字,还是没读出来?分别查看页面是否真的处理了、是否整页覆盖和模型有没有可靠地检测到文字;证据不够就说无法判断。分数很高,可这个浅色型号看起来不对。定位原图上那一小块重新核对;更正另列,原始识别保留,高平均分不代替关键字符。查看使用步骤与完整说明04任务与复用刚才窗口等超时了,这份扫描件还在处理吗?先查返回的任务标识和活跃任务;正在跑就继续查或明确取消,已完成且结果有效就复用,不因窗口超时盲目重交。查看使用步骤与完整说明05运行与资源识别卡住了,但别把其他本地模型一起停掉。先定位本次任务,再使用精确取消或执行期限回收它自己的推理进程;资源冲突与服务问题分别说明,不结束未知程序。查看使用步骤与完整说明06安装与恢复换电脑后,要怎样恢复这套本地文字识别?先核对可用的程序、模型文件和旧版恢复材料,在独立环境试样例后才切换;全离线新机还要额外准备安装材料。查看使用步骤与完整说明

不同页面,使用不同识别方式

不用根据文件名猜模型。先看页面真实内容和需要的结果,自动升级也只处理问题页。

01
截图、平面扫描和普通表单

普通提字:PP-OCRv6_medium

把文字行和位置交回来,适合截图、平面扫描和表单。

默认不做可能拉坏清晰页面的形变矫正;模型支持不等于全部增强已开启。

02
公式、多栏、复杂表格和复杂PDF

复杂文档:PaddleOCR-VL-1.6

帮助处理多栏、公式等普通提字不足的页面;自动路线只加强问题页。

文件名不决定升级,高模型置信度也不能替代关键文字回看。

03
明确要表格HTML、版面块、印章或区域

明确要结构:PP-StructureV3+PP-OCRv5

把表格、文字顺序和页面区域分开保留,方便按原图核对。

结构块存在不说明每个单元格都读对;结果仍绑定实际输入和页数。

04
Word、Excel或有文字层的PDF

已有文字层时先直接读取文档

先取得 Word、Excel 或数字 PDF 本来就有的文字,只把其中的扫描图片交给识别。

文档理解与专业判断仍由对应任务承担。

项目指标与相关入口查看规模、覆盖范围和关联能力

当前项目指标

识别路线
3 条
正式输出
TXT · MD · JSON
9 月 17 日普通回归
174 通过 · 1 跳过
9 月 17 日合成验收
9 案例 · 3 路线

它负责

  • 接收本次指定图片、PDF 或文件夹,规范路径并明确递归范围,保留输入与输出的对应关系。
  • 提供日常提字、困难文档增强和显式结构解析三条本地路线,保留实际模型与选择原因。
  • 交回可读、可复制、可编程处理且可对照原图的文字与结构,不抹掉模型原始分歧。
  • 把执行、覆盖、质量、空结果和失败分开描述,并用一条人话摘要帮助先看懂状态。
  • 在相同请求下复验并复用结果,提供指定任务查询、取消、超时和资源冲突处理。
  • 维护当前依赖、模型配置与本机启动方式,使环境损坏或换机时有明确重建入口。

它不负责

  • 不负责整库查找、照片归类、文书事实判断或后续成品排版;原件查找回到“个人材料查找”,照片视频回到“个人媒体整理与恢复”,文书产出交给“文书和材料制作”与相应文档工具。
  • 不自动生成可编辑 Word、Excel 或可搜索 PDF;不会把识别出的文字当成原件真实性、印章真伪或公式正确性的证明。
  • 不公开接收文件、不提供公网识别 API、不自动上传私人输入,也不引入身份识别或无人值守全库扫描。
  • 不因平均分高、缓存命中或测试通过,就承诺任何输入逐字准确;重要字段保留人工复核入口。

产品思想与设计核心

01

先按任务选工具,不让每张图都跑重模型

只想知道照片里有什么时,直接看图通常足够;需要逐字文字、批量处理、表格、坐标或全本地执行时才用 LocalOCR。已经有文字层的数字文档先走原生读取,避免把清楚的文字重新变成有误差的图片识别。

02

普通页面先轻量读,困难页再加强

按页面实际内容决定是否提高识别强度,只处理看不清的问题页;本人明确指定模型时保留该选择。要表格结构须另说清,不会被自动路线暗中替换。

03

保留原始识别,不把顺口的改写当成读到了

原始文字、页码、坐标和分数是复核依据。AI 看原图后若发现某个浅色小字有误,应把更正与具体区域单独说明,不能覆盖原始 OCR(光学字符识别) 或声称引擎自动读对;无法判断就保留未知。

04

一份结果要同时说清做完没、读全没、可信到哪

任务完成、页面覆盖、结果质量和有没有检测到文字是不同问题。空文本可能是图片无字,也可能是模型没读出来;只有相应独立证据成立才给出没有文字的窄结论。

05

重复请求先看旧结果,等待超时先找原任务

同一文件和要求只有在旧结果完整且对应当前版本时才复用。窗口等待超时不表示后台已停;先查原任务再决定等、取消或重新处理。

06

识别任务不能把电脑一直占住

需要显卡时使用现有资源协调;超时、取消或资源冲突只处理本次识别,不为了排队额外建立一套长期后台任务。

07

升级先验独立版本

新版先在旁边试真实样例,再决定是否切换;旧版须仍能实际打开和识别,只有目录或一次健康响应不能证明可回退。

它读哪些文件,交回什么

只读取这次明确选中的图片、扫描 PDF 或文件夹;每个结果都能回到对应原件和页面,不会后台扫描私人目录。

01
截图和普通图片

PNG、JPG/JPEG、WebP、BMP、TIF/TIFF 中的文字像素,包括界面文字、纸张照片和中英文混排内容。

文字块、位置、顺序和识别分数;纯粹描述景物或颜色时可以直接看图,不必启动文字识别。

02
指定的 PDF 文件

先核对实际页数,再逐页把扫描部分转成可识别的图;已有可读文字的 PDF 优先直接读取。

按页交回文字和版面位置,关键数字仍要对照同一原页。

03
明确选定的文件夹

只处理支持的图片和 PDF,按请求决定是否递归子目录;每个文件分别选择识别路线,共享整次请求的期限。

逐文件输出与对应身份,不把一个目录变成长期资料库或持续同步任务。

04
表格、公式和版面明确的材料

只有明确要求保留行列、公式或区域时才选结构解析。

交回可读表格和结构化文件;识别到印章不等于证明真伪,公式文字也不等于推导正确。

“全部处理留在本机”是可明确提出的要求。若同时需要场景理解和逐字抄写,AI 可以在获准的处理范围内分别看原图与读取 OCR(光学字符识别) 证据,再分开说明观察、文字、状态和冲突;LocalOCR 本身不调用外部视觉模型。

项目怎样演化到现在

从能识别,到能看见任务怎样执行

从拖入一张图取得文字,发展到能查看任务进度、服务是否忙,以及复杂页面需要怎样加强;出错不只剩一个空窗口。

阶段依据
  • 2026-07-12—2026-07-29 · 从能识别,到能看见任务怎样执行c8fa63a—ad5cad4

从有文字,到知道是否读全读对

开始分开说明处理完没有、页是否齐全和文字是否可信;表格、页码和位置也一起保留,不拿整齐排版代替内容正确。

阶段依据
  • 2026-08-17—2026-08-27 · 从有文字,到知道是否读全读对8191be3—9c49193

从一次输出,到逐页复核和可回滚升级

重复识别先核对可复用结果,升级环境先试独立候选并保留旧版;重要字段仍可逐页回看,完整离线新机恢复另需材料。

阶段依据
  • 2026-09-01—2026-09-17 · 从一次输出,到逐页复核和可回滚升级acc6d15—3a4bf13