说话打字、录音转文字,以及给旁白找准时间

ChineseASR

ChineseASR 处理三类事情:对着电脑说话,把文字输入正在编辑的地方;把会议、微信语音等已有录音变成可以阅读和回听核对的文字;给已经确认的旁白文案标出每个词在声音里的时间,方便视频对齐画面。日常输入强调响应速度,重要录音保留两套识别结果和疑点;需要区分发言人时另加时间线与匿名分组,不把声音相似当成身份。

项目状态
听写、质量复核和文案对齐已实现;个人体验另验
快照边界
本地识别和文案对齐已有实现;Whisper仍是配置占位。关键名字、数字和承诺需要回听;云端上传须单独授权,真实个人听写体验与各模型实测按技术层分别说明。
观察时间
复制 AI 续作说明带着这个项目,交给 AI 接着做

写下接下来想做什么。这里会把你的目标、本页事实和来源整理在一起,复制给 Astra 或 Gemini 后,就不用重新介绍项目了。

整理续作说明

只在当前网页整理,不会发起 AI 任务。

用途与结果

最快了解这个项目

为什么需要它

录音里有用的信息很难快速查找,手动听写又慢;名字、金额和一句否定词错了,还可能改变整段意思。日常说话打字不需要等两套模型,而要核对的重要录音需要保留原声音、分歧和位置。这个项目把这些需求分开,避免所有声音都走同一条又慢又难解释的流程。

举个实际例子

“把这段会议录音整理成文字,标出金额、日期和两套识别不一致的地方,让我能点回去听。”交回的是可读转写、疑点位置和原音频关联,不是一份不说明依据的润色稿。只是想说话打字时,按 Win+H 打开单个听写面板即可。

最后我会得到什么

说话打字时,文字进入当前可编辑应用,不自动发送。处理文件时,得到转写正文、已有时间位置、两路结果和需要回听的疑点;长任务保留已完成片段。已有文案对齐时,只得到每个词的起止时间与覆盖结果,不重复配音,也不把对齐成功说成文字本身正确。

正常时

说话打字会在焦点仍正确时把文字放进当前应用;处理录音则交回可读文字和实际得到的时间位置。重要录音另列两路识别差异和要回听的地方。

发现问题时

只有部分片段完成、两路不一致或一条识别路线失败时,保留可用结果并标明暂定与复核点,不冒充整段正确。

入口不可用或证据不足时

麦克风、音频、模型或运行环境不可用时说明停在哪一步,沿原任务或固定安装入口接续;不反复重传同一录音,也不自动上传云端。

从哪里开始

说话打字从 Win+H 小窗开始;已有录音交给 ChineseASR 文件任务入口;已有文案的逐词时间另走对齐入口。

需要准备什么

  • 听写时当前要输入的位置
  • 文件任务的录音与快看或重要复核的目的
  • 逐词对齐时已确认的文案和对应音频

从开始到拿到结果

  1. 1
    先选用途

    直接听写处理当前一句;已有文件成为可查任务;文案对齐只找词语时间,不重新配音。

  2. 2
    核对输入和运行条件

    确认文件或麦克风、实际模型及本地环境;重要录音用两路结果对照,长录音保存已完成片段。

  3. 3
    正文与疑点一起交付

    给转写、时间位置及关键数字、否定句等回听处;匿名说话人不自动变成真实身份。

  4. 4
    从原任务继续

    模型或环境不可用时保留成果和错误;专业云入口只在本次明确选择并获准上传后使用。

从这些需求了解功能

从一个实际问题看它怎样处理、交回什么;当前能做到哪一步和仍有哪些限制,也写在对应说明中。

01说话打字我想直接对电脑说话,把这段话打进当前文档。打开单个听写面板,用Qwen识别;可以开始、暂停和取消尚未输入的片段。不会自动发送,已经输入的内容也不会被取消键倒退删除。查看使用步骤与完整说明02入口与任务把这条微信语音转成文字,先给我能快速读的初稿。按明确语音文件使用快速路线;需要更严谨核对时再走双模型,不把单路初稿说成已复核。查看使用步骤与完整说明03模型与用途这次更看重核对准确性,告诉我用了哪两个模型。默认文件路线为Qwen3-ASR与SenseVoice,分别保留结果和分歧;选择更重模型时明确使用哪条路线,不悄悄替换。查看使用步骤与完整说明04安装与恢复准备换识别模型,先比较;新版本不好就回到旧版。模型和环境先作为候选验证,再明确切换;旧工件与可用环境保留,下载完成不能代替质量验收。查看使用步骤与完整说明05长音频与批量这场会议很长,中断了别从头重跑。连续时间位置与已完成片段保留,恢复只处理未完成部分;文件夹任务逐项报告结果,不用某一文件成功掩盖其他失败。查看使用步骤与完整说明06疑点与回听把金额、日期和两份结果说法不同的位置挑出来,让我回听。保留未经擅自改写的识别结果和相应声音位置,人工确认才能解决关键分歧;高置信度不等于听审完成。查看使用步骤与完整说明07发言人与时间这段讨论大概有几种声音,各自说了什么?给匿名分组和时间线;同一声音的归属可以后续修正,但不会仅凭聚类自动认定真实姓名。查看使用步骤与完整说明08运行与边界这段录音只在本机处理,不要上传。使用满足条件的本地路线;资源或依赖不足时如实停止,不静默上传或换成未授权模型。查看使用步骤与完整说明09文案与音频对齐旁白已经录好,文案也确认了,帮我找出每个词的时间。只运行强制对齐,返回词和起止时间;输入变化、覆盖不足或超时保留上一份成功输出,不重新配音。查看使用步骤与完整说明

按这次声音任务选路线

先看要打字、快速看内容、核对重要录音,还是给现成文案找时间。括号内是当前配置的模型身份;它们各有用途,不是效果排行榜,本页没有重新加载全部模型作实测。

01
对电脑说话直接打字

本地单模型听写(Qwen3-ASR-1.7B)

尽快把一句话放进当前输入位置。

焦点变了会停下;不自动润色或发送。

02
先快速知道录音讲什么

快速本地初稿(SenseVoiceSmall)

先取得一份可阅读的文字。

只有一路结果,不等于重要内容已复核。

03
会议或重要录音需要核对

两路本地识别(Qwen3-ASR-1.7B 与 SenseVoiceSmall)

交回两份结果、分歧与回听位置。

两路相同也要回听关键姓名、金额和否定句。

04
明确要更强的本地对照

另选 FireRedASR2-LLM 与 Qwen 对照

保留这次额外路线自己的识别结果。

要明确选择且依赖可用;不会自动接管日常路线。

05
明确比较另一中文模型

可选 Fun-ASR-Nano-2512

取得该模型独立的转写用于这次比较。

安装或模型名不会自行改变默认路线。

06
找句子时间并区分不同声音

时间与匿名发言分组(Paraformer,必要时加 CAM++ 线索)

得到句子位置和不同声音的匿名分组。

说话人编号不是已确认人名,归属可撤回。

07
已有旁白和确认文案,只需词语秒数

已知文案对齐(Qwen3-ForcedAligner-0.6B)

返回词语在录音中的起止时间。

不重新配音或核对文案真假;单段当前不超过五分钟。

08
本地不足,考虑一次云端识别

独立云候选(Qwen Audio 3.0 ASR Flash)

在明确用途和这次上传授权下取得云结果。

录音更长或两路有分歧,都不会自动授权上传。

09
想用 Whisper Large V3

目前只是登记的配置

明确告知现在无法直接运行。

它不是本地失败后的自动备用。

项目指标与相关入口查看规模、覆盖范围和关联能力

当前项目指标

登记 / 可执行
6 / 5
9 月 17 日来源回归
482 项 · 1 跳过
历史长音频分段
4/4

它负责

  • 让本人用一个小面板说话打字,能暂停、取消,并在输入框变动时停止自动输入。
  • 把指定的短语音、长录音或文件夹变成可查询进度的转写任务。
  • 按用途提供快速初稿、重要录音双路核对、可选额外本地模型与现成文案逐词对齐。
  • 保留长录音已完成片段,中断后沿同一录音和设置续作,不因等待结束重复开任务。
  • 把正文、原始识别、时间位置、疑点和恢复状态一同交付,重要内容能回到原音复核。
  • 多人录音先用匿名声音组表示发言,真实身份另取证且允许撤回。
  • 分开维护依赖和模型工件的安装恢复;模型更新先比较同一材料,不因下载完成而换默认路线。
  • 普通录音留在本地;明确选择云端时逐次核对上传授权,运行时协调显卡占用。

它不负责

  • 转写帮助阅读和回听,不证明录音真实、说话人身份或争议事实。
  • 关键姓名、数字、否定和承诺仍要听原音;两路文字相同也可能一起错。
  • 匿名“说话人1”不会自动变成某个真实人的名字。
  • 源码、离线依赖或模型登记存在,不代表模型文件已经备份、在当前机器装好或真实录音已经验收。
  • 普通录音、文件夹批量或录音较长,都不会自动上传云端。
  • 公开页不放私人录音、转写正文、声音特征、模型权重或密钥。
  • 当前主目标是中文听写、录音复核和文案对齐,不把它描述成通用语音助手或音频剪辑工具。

产品思想与设计核心

01

本人控制文字落点

听写只向当时选中的输入位置送文字,不自动润色或发送;焦点改变就停,已经输入的字由本人检查修改。

02

换默认模型先比真实错误

同一份参考声音要比较错字、关键内容、静音乱出字、复核负担和耗时;候选在小样本更好,不等于对所有录音更准。

03

原音频比顺畅文字更可靠

转写主要帮助找回和回听;流畅、相似或模型一致都不替代关键句的原音核听。

04

分歧留给人复核

数字、否定和关键意思有疑点时标出相应声音,不用第三份模型意见或自动润色盖掉原结果。

05

正文和证据一起交

结果同时说明用了哪份音频、哪里有时间位置、哪些部分暂定,以及失败后从哪里继续。

06

长录音能从中断处接上

只复用与这份原音和当前设置一致的已完成片段,仍要检查整段时间有无漏掉。

07

安装变化不偷偷改默认路线

额外模型要明确选择;真正切换默认前保存原设置和回退点,不覆盖后来独立发生的配置变化。

08

离线恢复要提前备齐

依赖安装材料和模型文件分别保全;断网后缺哪一层就说哪一层,目录或回执存在不代表真实可用。

09

云端只在这次明确获准时使用

普通任务本地优先。重要录音或存疑质量复核要明确选择用途并获得这次上传许可,长度与批量不产生许可。

10

不同声音不等于真实身份

匿名发言组、声音线索和现实归属分别说明;相互冲突时保留理由和可撤销的不确定性。

11

部分成功也要诚实交付

已完成片段、暂定文字、失败位置与无法运行是不同状态,空白不自动证明原音没说话。

12

位置、完整与字词正确分开

文案对齐只给词语时间,文件完整只说明材料未丢;两者都不验证文案逐字正确。

项目怎样演化到现在

先让已有录音变成可追溯的文字

先形成本地单文件、双模型核对、批量和长录音续作,再补齐离线环境准备与有界任务观察;重要录音的云端增强须明确选择和上传许可,识别为空也不能当成没有说话。

阶段依据
  • 2026-07-06 · 本地转写、双模型、异步任务、长音频续作和离线依赖形成;模型权重单独保全。a280a54–ad37f35
  • 2026-07-08—07-25 · 资源协调与有界任务观察。89d0cd2–282989a
  • 2026-07-29—08-02 · FireRed本地路线及独立授权的云端候选。c788100–eeb41d0
  • 2026-08-09—08-17 · 空文本按执行、覆盖与质量分开解释。a2c0b2b–b596098
  • 2026-08-21 · 批量复用已加载模型,同时保留逐文件失败边界。07516fa

把日常说话打字与文件复核分开

日常输入采用单Qwen减少等待,文件保持可复核路线;匿名声音分组与可撤销归属单独处理,不把声音特征当身份证明。

阶段依据
  • 2026-08-24 · 匿名声音、可撤销本人线索和来源上下文分开,单声道歧义不强认身份。fe11e0c–cfcc7a7
  • 2026-08-27—08-28 · 任务、缓存与说话人证据回读形成更明确的失败边界。7bd1dd4–8792432
  • 2026-08-30—08-31 · 读取证据时再次核对目标音频,变化则停止,避免证据错配。70e3255

能回听问题,也能安全换模型

长录音按片段保留进度,疑点对应原声音;候选先比较再激活,旧版本可回退。听写统一为一个小面板,并给准备、识别和恢复设置实际期限。

阶段依据
  • 2026-09-17 · 当前候选已保留模型生命周期与质量维护的来源描述;未提供独立阶段提交编号,真实模型与听写验收仍按技术层各自证据。

已有旁白不必再识别或重新配音

给视频等调用方提供独立对齐:输入确认文案和已有音频,返回词级时间,复用ASR(自动语音识别)模型管理;对齐仍不证明文案逐字正确。

阶段依据
  • 2026-09-18 · 已有旁白不必再识别或重新配音ed060fa · 已知文案对齐入口