能力入口 · 个人维护的能力入口

中文录音转写与说话人证据

把已有录音变成可核对文字,或直接说话输入Windows;已有文案和旁白还可以只找词语的时间位置。Qwen 负责桌面与默认主转写,SenseVoice 用于快速初稿和第二份对照,现有时间对齐模型负责把已知文案放到音频上的准确位置,不把模型分组说成真实身份。

主要模型链有来源任务的真实音频证据;本次没有读私人录音、开麦克风或启动模型。转写准确、时间覆盖与本人声音归属在具体录音中分别核对。

先看怎么用

你不需要记住 Skill 名,直接说需求就行

什么时候用

  • 需要中文录音全文,或能回听定位的文字
  • 需要区分录音中不同的匿名声音
  • 需要判断某个精确片段是否支持本人说话
  • 重要录音需要两份独立转写与原音频复核
  • 普通转写有影响理解的疑点,且选定录音已明确授权云质量复核
  • 已有文稿和对应音频,只需词语时间用于配音或字幕
  • 需要在本机应用实时中文听写,或排查 Win+H

可以直接这样说

“这段会议先给我初稿,金额和承诺听不准的地方标出来,让我能回听。”按需要选择SenseVoice初稿或Qwen+SenseVoice双路核对;只有该入口真实提供时才附时间位置。录音很长就沿同一任务分段接续,不重复提交。

最后会得到什么

我会得到可搜索的转写和风险提示;只有所选方法真实提供时才有时间位置,需要时再附说话人证据。原录音始终是最高证据,识别不确定的地方不会被写成确定事实。已有文稿只对时则返回词语位置,不重新生成正文,也不声称稿件逐字真实;桌面听写只处理当前麦克风会话,最后由本人发送,不建立录音档案。

不适合这样用

  • 扫描整个音频库
  • 把模型分出的声音组直接当作真实人数或姓名
  • 把自动转写当作逐字准确的证明
  • 等待超时后重复提交同一录音任务

正常时

音频可读且所选处理方式可用时,交回转写或对时结果;只有实际支持时才附时间位置和说话人范围。

发现问题时

音质差、只有部分内容或说话人证据不足时,保留可用结果,标出听不清、分歧与覆盖缺口。

入口不可用或证据不足时

本地模型、显卡调度或任务入口不可用时,保留原文件与原任务并说明缺口,不重复提交,也不未经授权改走云端。

从哪里开始

在当前 AI 对话给出一段已选录音或视频音轨,说明是转写、核对关键话、找时间,还是判断谁说了话。电脑实时听写则从现有 Win+H 输入入口开始。

需要准备什么

  • 处理文件时给出具名音频或视频音轨,以及要得到文字、时间或说话人证据的目的;实时听写只需当前麦克风会话
  • 已有稿件仅对时时提供稿件;要求云复核时另明确精确录音与上传许可

为什么需要这个能力

长录音不能像文档一样搜索,自动识别还可能听错人名、把同一个人分成多人,或把不同人合并。

先看初稿,或认真核对重要录音

先知道录音大意;重要的人名和承诺要核准。

选中一份录音或视频音轨,并说明要快速看内容,还是要对关键话语做更仔细的本地核对。

快速初稿可用 SenseVoice;普通认真转写由 Qwen3-ASR-1.7B 识别,并让 SenseVoice 独立对照。明确要另一条高质量本地路线时,用 FireRedASR2-LLM 与 Qwen 对照。AI 会保留两份结果不一致和需要回听的地方。

你会得到可阅读或搜索的文字,以及关键分歧、听不清的片段和实际覆盖范围;只有所选处理方式能给时间时才附时间。

等待读回同一份任务,不因等待时间到就重做。两套模型意见一致也不证明逐字正确,人名、金额和承诺仍以原录音核对。

找录音里一句话的时间

那句关于改期的话从几分几秒开始?

一份已经选中的原录音和几句能识别那段话的内容线索。

AI 先查看这份原录音已有的时间结果;有未完任务就沿原任务继续。确实没有时间且允许补处理时,只对这一份录音用本地 Paraformer 补句级时间。

你会拿到起止时间、相关文字和时间精度,同时知道哪些内容仍未覆盖。

明确只读时只报告时间缺口;不会为定位一句话上传录音或处理整个目录。时间位置也不能单独证明文字和说话人都正确。

已有文案,只需给字幕找时间

稿子已经定了,帮我把每句话对到录音上。

对应音频和已确认的文字稿;不需要再说一遍全文转写需求。

AI 用现有 Qwen 对齐能力寻找稿中词语在音频里的起止位置;录音太长时按实际内容分段处理。

你会得到可用于字幕或画面的词语时间,以及对齐是否可靠的说明。

把稿子对到时间不等于重新核实稿子逐字正确,也不会生成配音。稿子与声音不合时先指出冲突。

区分声音,或核对本人说过哪几句

这里有几个人说话?哪些句子能确认是我说的?

点名一份录音和要核对的时间范围;已有本人独立样本由现有项目提供。

AI 先利用仍适用于这份原录音的证据,把不同声音暂时分组;要判断本人时,再按实际说话句段和独立样本比较,并结合已知声道与对话关系。

你会看到哪些句段支持是本人、支持不是本人或仍无法判断,以及实际测过的时间范围。

声音分组不是实名或确定人数,一句话不能替同组其余句子作证;不会从这份待判断录音现场建立本人样本。

明确允许后做云端复核

这段重要录音也用云端复核一下,保留和本地结果的分歧。

点名录音、复核目的,并明确允许这份内容上传;录音重要与允许上传是两个决定。

AI 沿现有云端转写路线处理这份录音,把云端与本地结果分别保存和比较,必要时回听原音频。

你会得到云端实际处理结果、与本地不一致的地方和仍需本人或原音频核实的关键内容。

云端处理成功不证明人名、逐字文字或说话人正确;云端给的大段时间也不能冒充精确句子时间。失败不改写本地证据。

直接对电脑说话打字

我想在当前输入框里用中文听写。

当前麦克风和目标输入位置;这条路线不需要先选一份录音文件。

桌面听写使用独立的 Qwen 本地路径,本人可以暂停,最后是否发送由本人控制。

你会在实际输入位置看到识别出的文字;入口故障时得到明确的停步原因。

不会为了普通听写等待另一模型、自动上传、润色或建立录音档案;文件转写与桌面听写的故障分开处理。

失败时会怎样恢复

只是想知道选中录音里一句话的时间

系统反应:先使用这份录音已有的时间结果,不重新转写整段。

恢复方式:原识别还在进行就继续那次;确需补时间且获准时,仅为选中录音用本地 Paraformer 处理,只读请求则说明缺口。

云端转写成功,但关键人名或句意有冲突

系统反应:分别保留云端与本地文字,不把服务成功当逐字准确。

恢复方式:回到确切录音和冲突片段核听;仍听不清时保留文字或说话人的不确定性。

等待转写的时间到了

系统反应:这只表示当前等待结束,不等于录音处理失败。

恢复方式:继续查看同一项录音任务,不能盲目提交第二份。

返回了空白文字

系统反应:不能据此断言录音没有人说话。

恢复方式:检查音频能否读取、选取的时间段与处理质量;仍不清楚就说明无法判断。

区分说话人的证据不足

系统反应:保持不同声音的临时分组与未知句段,不强行给人命名。

恢复方式:需要时只选声音清晰、时间可靠且与本人样本独立的句段再核对。

云路线失败

系统反应:不能伪装成本地成功或反过来。

恢复方式:分别报告本地与云证据,原音频始终是最高事实。

现有稿件与声音不符,或录音太长

系统反应:时间对齐不能证明稿件逐字正确,也不会擅自改走云端。

恢复方式:先核对这份音频与稿件,再按真实内容分段对齐;仍无法对应就交回缺口。

返回 Skills(能力)