ChineseASR · 功能说明

快速初稿、双模型核对和专门对齐,分别选什么

我按用途选路线:对电脑说话打字用 Qwen3-ASR-1.7B;先快速看录音内容用 SenseVoiceSmall;要核对重要文字用 Qwen 与 SenseVoice 两路。明确要求更强的本地对照时可选 FireRedASR2-LLM 加 Qwen,Fun-ASR 是可明确选择的另一中文路线;多人录音的分段可用 Paraformer,确认文案配时间用 Qwen3-ForcedAligner。普通录音不会因安装新模型而自动改路线或上传云端。

当前情况:已有快速初稿、双模型核对和明确选择的其他路线;Whisper目前只有登记,不能直接转写,也不会自动成为后备。

项目快照核对于 ;具体测试保留各自日期,页面不实时探测运行状态。

复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与实际影响

这项功能怎样使用

为什么需要它

不同用途需要不同速度和复核强度;装了新模型不等于它该接管日常任务。固定当前默认和实际执行身份,才能知道这次结果是怎样来的。

举个实际例子

“先快速知道这段语音讲什么;需要正式引用的部分再严谨核对。”第一轮用 SenseVoiceSmall 出初稿;复核时用 Qwen3-ASR-1.7B 主识别、SenseVoice 对照,把分歧连到原音。若我只要给确认过的旁白标词语秒数,则改用对齐入口,不重新识别文案。

最后我会得到什么

每次交回实际使用的模型、初稿或双路文字、需要回听的差异与时间位置;对齐任务另给逐词秒数。Whisper Large V3 目前只有登记,不能直接执行,也不是失败后的自动备选;云端专业识别须另行明确选择并满足本次上传条件。

正常时

所选本地模型、文件和运行条件都可用时,按这次用途执行,并在结果中写明实际用了哪一套;双路复核会保留两份结果和差异。

发现问题时

Qwen 主识别失败而 SenseVoice 有结果时,只交暂定文字和失败原因,不能称为两路已经核对;重要词句仍要回听。

入口不可用或证据不足时

所选权重或运行环境缺失时只暂停对应路线。Whisper 当前不能直接转写,不会用相近模型顶替,也不会自行下载、换默认或上传。

从哪里开始

说明是快速初稿、重要录音复核、说话打字还是已有文案对齐。

需要准备什么

  • 音频或实时场景
  • 所需复核强度和时间线
  • 云端时的单次上传选择

从开始到拿到结果

  1. 1

    先说要做什么

    听写、快速初稿、严谨核对、多人分段和已知文案对齐的输入与输出不同;先按真实请求选择路线。

  2. 2

    公开实际模型选择

    听写用 Qwen;快速初稿用 SenseVoice;默认严格文件转写用 Qwen 与 SenseVoice。FireRed 加 Qwen、Fun-ASR 与 Paraformer 仅在相应用途明确选择且依赖可用时运行。

  3. 3

    交回文字、时间与疑点

    结果记录实际模型和完成层级。双路有分歧就给回听位置;对齐只给确认文案在声音中的词语时间,不证明文案本身正确。