能力入口 · 个人维护的能力入口
中文录音转写与说话人证据
把已有录音变成可核对文字,或直接说话输入Windows;已有文案和旁白还可以只找词语的时间位置。Qwen 负责桌面与默认主转写,SenseVoice 用于快速初稿和第二份对照,现有时间对齐模型负责把已知文案放到音频上的准确位置,不把模型分组说成真实身份。
主要模型链有来源任务的真实音频证据;本次没有读私人录音、开麦克风或启动模型。转写准确、时间覆盖与本人声音归属在具体录音中分别核对。先看怎么用
你不需要记住 Skill 名,直接说需求就行
什么时候用
- 需要中文录音全文,或能回听定位的文字
- 需要区分录音中不同的匿名声音
- 需要判断某个精确片段是否支持本人说话
- 重要录音需要两份独立转写与原音频复核
- 普通转写有影响理解的疑点,且选定录音已明确授权云质量复核
- 已有文稿和对应音频,只需词语时间用于配音或字幕
- 需要在本机应用实时中文听写,或排查 Win+H
可以直接这样说
“这段会议先给我初稿,金额和承诺听不准的地方标出来,让我能回听。”按需要选择SenseVoice初稿或Qwen+SenseVoice双路核对;只有该入口真实提供时才附时间位置。录音很长就沿同一任务分段接续,不重复提交。
最后会得到什么
我会得到可搜索的转写和风险提示;只有所选方法真实提供时才有时间位置,需要时再附说话人证据。原录音始终是最高证据,识别不确定的地方不会被写成确定事实。已有文稿只对时则返回词语位置,不重新生成正文,也不声称稿件逐字真实;桌面听写只处理当前麦克风会话,最后由本人发送,不建立录音档案。
不适合这样用
- 扫描整个音频库
- 把模型分出的声音组直接当作真实人数或姓名
- 把自动转写当作逐字准确的证明
- 等待超时后重复提交同一录音任务
正常时
音频可读且所选处理方式可用时,交回转写或对时结果;只有实际支持时才附时间位置和说话人范围。
发现问题时
音质差、只有部分内容或说话人证据不足时,保留可用结果,标出听不清、分歧与覆盖缺口。
入口不可用或证据不足时
本地模型、显卡调度或任务入口不可用时,保留原文件与原任务并说明缺口,不重复提交,也不未经授权改走云端。
从哪里开始
在当前 AI 对话给出一段已选录音或视频音轨,说明是转写、核对关键话、找时间,还是判断谁说了话。电脑实时听写则从现有 Win+H 输入入口开始。
需要准备什么
- 处理文件时给出具名音频或视频音轨,以及要得到文字、时间或说话人证据的目的;实时听写只需当前麦克风会话
- 已有稿件仅对时时提供稿件;要求云复核时另明确精确录音与上传许可
为什么需要这个能力
长录音不能像文档一样搜索,自动识别还可能听错人名、把同一个人分成多人,或把不同人合并。
先看初稿,或认真核对重要录音
先知道录音大意;重要的人名和承诺要核准。
选中一份录音或视频音轨,并说明要快速看内容,还是要对关键话语做更仔细的本地核对。
快速初稿可用 SenseVoice;普通认真转写由 Qwen3-ASR-1.7B 识别,并让 SenseVoice 独立对照。明确要另一条高质量本地路线时,用 FireRedASR2-LLM 与 Qwen 对照。AI 会保留两份结果不一致和需要回听的地方。
你会得到可阅读或搜索的文字,以及关键分歧、听不清的片段和实际覆盖范围;只有所选处理方式能给时间时才附时间。
等待读回同一份任务,不因等待时间到就重做。两套模型意见一致也不证明逐字正确,人名、金额和承诺仍以原录音核对。
找录音里一句话的时间
那句关于改期的话从几分几秒开始?
一份已经选中的原录音和几句能识别那段话的内容线索。
AI 先查看这份原录音已有的时间结果;有未完任务就沿原任务继续。确实没有时间且允许补处理时,只对这一份录音用本地 Paraformer 补句级时间。
你会拿到起止时间、相关文字和时间精度,同时知道哪些内容仍未覆盖。
明确只读时只报告时间缺口;不会为定位一句话上传录音或处理整个目录。时间位置也不能单独证明文字和说话人都正确。
已有文案,只需给字幕找时间
稿子已经定了,帮我把每句话对到录音上。
对应音频和已确认的文字稿;不需要再说一遍全文转写需求。
AI 用现有 Qwen 对齐能力寻找稿中词语在音频里的起止位置;录音太长时按实际内容分段处理。
你会得到可用于字幕或画面的词语时间,以及对齐是否可靠的说明。
把稿子对到时间不等于重新核实稿子逐字正确,也不会生成配音。稿子与声音不合时先指出冲突。
区分声音,或核对本人说过哪几句
这里有几个人说话?哪些句子能确认是我说的?
点名一份录音和要核对的时间范围;已有本人独立样本由现有项目提供。
AI 先利用仍适用于这份原录音的证据,把不同声音暂时分组;要判断本人时,再按实际说话句段和独立样本比较,并结合已知声道与对话关系。
你会看到哪些句段支持是本人、支持不是本人或仍无法判断,以及实际测过的时间范围。
声音分组不是实名或确定人数,一句话不能替同组其余句子作证;不会从这份待判断录音现场建立本人样本。
明确允许后做云端复核
这段重要录音也用云端复核一下,保留和本地结果的分歧。
点名录音、复核目的,并明确允许这份内容上传;录音重要与允许上传是两个决定。
AI 沿现有云端转写路线处理这份录音,把云端与本地结果分别保存和比较,必要时回听原音频。
你会得到云端实际处理结果、与本地不一致的地方和仍需本人或原音频核实的关键内容。
云端处理成功不证明人名、逐字文字或说话人正确;云端给的大段时间也不能冒充精确句子时间。失败不改写本地证据。
直接对电脑说话打字
我想在当前输入框里用中文听写。
当前麦克风和目标输入位置;这条路线不需要先选一份录音文件。
桌面听写使用独立的 Qwen 本地路径,本人可以暂停,最后是否发送由本人控制。
你会在实际输入位置看到识别出的文字;入口故障时得到明确的停步原因。
不会为了普通听写等待另一模型、自动上传、润色或建立录音档案;文件转写与桌面听写的故障分开处理。
失败时会怎样恢复
只是想知道选中录音里一句话的时间
系统反应:先使用这份录音已有的时间结果,不重新转写整段。
恢复方式:原识别还在进行就继续那次;确需补时间且获准时,仅为选中录音用本地 Paraformer 处理,只读请求则说明缺口。
云端转写成功,但关键人名或句意有冲突
系统反应:分别保留云端与本地文字,不把服务成功当逐字准确。
恢复方式:回到确切录音和冲突片段核听;仍听不清时保留文字或说话人的不确定性。
等待转写的时间到了
系统反应:这只表示当前等待结束,不等于录音处理失败。
恢复方式:继续查看同一项录音任务,不能盲目提交第二份。
返回了空白文字
系统反应:不能据此断言录音没有人说话。
恢复方式:检查音频能否读取、选取的时间段与处理质量;仍不清楚就说明无法判断。
区分说话人的证据不足
系统反应:保持不同声音的临时分组与未知句段,不强行给人命名。
恢复方式:需要时只选声音清晰、时间可靠且与本人样本独立的句段再核对。
云路线失败
系统反应:不能伪装成本地成功或反过来。
恢复方式:分别报告本地与云证据,原音频始终是最高事实。
现有稿件与声音不符,或录音太长
系统反应:时间对齐不能证明稿件逐字正确,也不会擅自改走云端。
恢复方式:先核对这份音频与稿件,再按真实内容分段对齐;仍无法对应就交回缺口。
技术身份与验证证据
Skill · chinese-asr · 成熟度 A(稳定)
这个 Skill 用到的名词
- Transcript readback(既有转写回读)
- 按已核验录音hash(内容指纹)读取已存本地/云结果与依赖制品,保留句级或分块时间、质量与覆盖;不启动服务、模型或原音频。
- Quality review(转写质量复核)
- 同一阿里云入口的授权用途,使用-QualityReview与-CloudUploadAuthorized;它不冒充重要证据,也不要求先跑完两条本地专业链。
- ASR(自动语音识别)
- 把音频中的中文语音转换成可搜索文本;只有所选模式真实支持时才附时间信息。
- Speaker cluster(匿名说话人簇)
- 模型把相似声音分组的匿名标签,不等于真实人数或姓名。
- person:self(本人候选)
- 只判断精确句段是否支持用户本人说话,结果可反驳,不是法律身份。
- Held-out attribution(留出样本归属)
- 用未参与声纹建档的句段比较,避免拿同源样本自证。
- Objective sidecar(客观结果侧车)
- 记录输入 hash(内容指纹)、引擎、job(任务记录)、状态和输出路径的结构化证据,不替代转写正文。
- Strict / long-strict(严格 / 长音频模式)
- 普通录音和长录音的正式处理路线,分别控制分段、时间戳和恢复。
- Align-only(只对时)
- 输入已有文稿和音频,返回词级时间而不重新识别;lexical_truth_verified=false明确说明稿件真假未由此验证。
专业定义
三种请求分开处理:直接说话打字,用Qwen3-ASR-1.7B;先快看录音内容,可用SenseVoiceSmall初稿;重要词句要核对时,默认让Qwen与SenseVoice分别识别并保留分歧。已经有录音和确认文案,只需配字幕或画面时可用Qwen强制对齐器找词语时间,不重新识别或配音。完整模型分工在ChineseASR项目中,云端另按精确上传授权。
执行参考
下面保留 AI 和工具实际使用的参数、步骤与依赖。日常使用可以直接提出需求,不需要先手工准备这些协议。
输入
- 一个具名音频或视频音轨
- 模式、时间范围和必要的说话人证据边界
- 云路线需要明确双开关授权
输出
- 转写文本;所选模式支持时附时间戳,需要时附匿名 cluster
- objective sidecar(客观结果侧车文件) 与 job(任务记录) 状态
- 本人归属的精确句段、覆盖范围和不确定性
- 已存时间结果的实际时间、timestamp_granularity、质量、覆盖与原件/artifact绑定
- 同一云入口明确的 important_evidence 或 quality_review purpose、分块范围和保存结果
- align-only返回绑定音频/稿件的词级时间与质量,不产生第二份ASR(自动语音识别)正文,lexical_truth_verified=false
- 桌面听写只处理这次麦克风会话,明确手动发送、暂停与实际目标应用,不建立录音档案
执行顺序
- 1
查找某段录音时间时先用 transcript-readback 或媒体库 locate-audio,核对已存结果与当前原件 hash(内容指纹)
- 2
已返回定位缺口且允许补时,只对选中录音走本地 quick + paraformer,复用同一 job(任务记录);导航不要求云上传或重跑目录
- 3
普通录音走 strict
- 4
长录音走 long-strict
- 5
说话人先聚类再对精确句段做 held-out attribution(留出样本归属)
- 6
重要录音按授权进入唯一云路线
- 7
以原音频为权威复核结果
- 8
现行 strict 默认 Qwen3-ASR 主引擎加 SenseVoice 交叉检查;quick 可选 SenseVoice 或明确的 Fun-ASR-Nano,具体默认仍读 configs/models.yaml
- 9
需要句级时间和匿名说话人时明确 quick/paraformer;重要录音本地交叉证据用 long-strict、fireredasr2-llm 与 qwen3-asr-1.7b,300秒逻辑分块和1秒重叠,FireRed内部片段最多35秒
- 10
重要录音的授权云转写与本地双引擎证据分开;job(任务记录)、manifest(清单) 和每个 chunk 的 evidence_status 均 verified 才说明本地引擎链完整,不保证逐字准确
- 11
已知稿对时明确使用Qwen强制对齐入口,校验UTF-8稿件和实际音频hash(内容指纹);单片≤300秒,长内容沿源项目要求按场景分割,不复用另一段的时间。
- 12
严格或高质量双引擎输出要读差异与人工复核材料;两个模型一致也不是逐字正确证明。桌面听写沿独立现有入口,不为普通听写调用云或额外LLM。
操作边界
- 原音频始终高于转写
- 云失败不能伪装成本地成功
- 其他说话人保持匿名
- 空文本和超时不能自动解释为没有内容
- 云请求必须在 -Important 与 -QualityReview 中选择一个,并有 -CloudUploadAuthorized;质量复核不是重要证据,也不额外要求两条本地引擎先失败
- 已明确的精确云授权跨续作与后代持续有效;不按任意录音数量或反复本地失败自加门
- 复用 qwen-audio-3.0-asr-flash 及现有 SecretRef;不创建公网文件 URL、不切 Provider、不让云模型成为普通默认
- 云块时间只能帮助定位大段,不等于句级时间、说话人归属或逐字正确;API 成功也不证明人名与文字正确
- media.objective-result.v1 将执行、覆盖、质量与结果分开;只有绑定原音频、请求、模型和完整区间的有效否定证据,才能声称 no_speech_detected;空文本仍可能是无法转写或 indeterminate(无法判断)
- 本人声音按精确句段做留出样本比较并结合已知声道、对话角色与语境;一条句段不能代表整个匿名簇,语音向量与内部得分不回传
依赖
- E:\Projects\Tools\ChineseASR
- 模型 registry(登记清单)
- LocalGpuBroker(本地 GPU 调度器)
- 本地私有 person:self profile
验证状态
源码、安装、供应检查、当前任务、新任务和真实使用分别列出;一层通过不自动提升另一层。
- Source(源码)
- 当前 .agents source e734251 中的唯一源码已核对
- Install(安装)
- canonical junction(目录联接) 已安装
- Transaction(供应事务)
- 供应事务检查通过;0 个坏事务
- Current task(当前任务)
- 本轮宿主回执未知
- Fresh task(全新任务)
- 新任务回执未知
- End to end(端到端)
- 主要模型链有历史真实证据;当前时间戳复用与质量复核不因 Skill 存在就冒充本轮录音 E2E(端到端验证)
来源9月17日482项回归(1项跳过)以及已知稿对齐/高质量链/听写的分层证据由ChineseASR项目保留;本次只读规范Skill与已发布源码,没有读私人录音、开麦克风、启动权重或发云请求。
证据时间与来源
- Observed at(观察时间)
- 供应链现场:2026-09-24 12:56(中国时间);项目场景按各项记录
- Source commit(来源提交)
e734251081dc48bdd86765372ce225b3929ce9ae- Supply command(供应验证命令)
E:\.agents\tools\Test-PersonalSkillSupply.ps1 -RequireInstalled -NoExternalEvidence -Json- Evidence basis(证据来源)
- .agents E171 release 1aa0b0a、当前 Personal Skill supply(个人能力供应链),以及本页明确标注的既有项目/Provider(固定服务入口)证据;source/install/transaction 通过不冒充 current(当前状态)/fresh/E2E
Canonical source(唯一维护源)
E:\.agents\skills\chinese-asr\SKILL.md该路径是维护源;用户目录中的发现入口不是第二份源码。
