LLM Backend Toolkit · 功能说明

图片、文字识别与录音

将选中的图片或录音转成这次任务需要的内容,再交所选模型使用。

当前情况:图片和录音的专项处理接入已有测试;这份输入能否准确识别,仍以对应工具的实际结果判断。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

看懂一张图和精确读出表格不是同一件事;同时启动 OCR(光学字符识别) 与大模型还可能争用一张显卡。这里明确分工并串行释放资源。

举个实际例子

这是一张扫描表格,数字必须准确。先交 LocalOCR 读字,再由模型归纳;如果只是解释照片内容,可选择原生视觉。指定录音则交 ChineseASR 转写。

最后我会得到什么

照片解释、扫描表格的文字或录音转写各拿自己的原结果,再由模型整理本次答案。数字和人名若识别不确定,会连同来源和疑点一起交回。

正常时

选中的图片或录音得到对应专项结果,随后用于本次任务。

发现问题时

识别不清时标出具体字段和需要回原件核对的地方,不猜关键数字。

入口不可用或证据不足时

所需识别入口、视觉能力或显卡暂不可用时停这一阶段,不偷换另一种处理方式。

从哪里开始

在已接入 Toolkit 的主 AI 对话中交给指定图片、扫描件或录音,并说清是解释内容还是精确提取。

需要准备什么

  • 明确的媒体文件
  • 精度和本地处理要求
  • 希望得到文字、转写或归纳

从开始到拿到结果

  1. 1

    根据需要的准确程度选路线

    系统区分“解释照片”“读准扫描表格”和“转写录音”,把文件交给真正能处理那类材料的入口。

  2. 2

    先调用合适专项

    精确文字交 LocalOCR,中文录音交 ChineseASR,场景理解才选原生视觉;重型显卡工作按实际资格协调。

  3. 3

    再整理结果

    交回专项原结果和模型归纳,保留识别不确定性;适配器存在不证明任意私人材料准确。