能力入口 · 个人维护的能力入口
具名媒体中的本人判断
在确实需要判断“照片里是不是我、录音里有没有我的声音”时给出有位置和覆盖范围的可反驳证据,同时阻止大范围扫脸、扫声纹或识别其他人。
照片适配已有8项测试,语音复用ChineseASR句段证据;Skill仍缺独立语音回归。本次没有比较真实照片或录音,判断始终限定实际测试位置。先看怎么用
你不需要记住 Skill 名,直接说需求就行
什么时候用
- 判断本人是否出现在一张明确照片中
- 指出照片中疑似本人的人脸位置
- 判断一段选定录音或视频音轨中的精确片段是否支持本人说话
- 只处理一个文件或很短的明确列表
可以直接这样说
例如我指定一张合照问“这里面有没有我”。它只检查这张图,返回疑似本人的脸部位置、质量和不确定性。
最后会得到什么
我会得到针对具名文件、可以回到原位置核对的结论;证据不足就返回未知,不识别其他人的身份。
不适合这样用
- 扫描相册、目录或整个媒体库
- 识别或命名其他人
- 建立人脸或声纹库
- 把相似度当法律身份
- 凭一小段声音就把同一组所有话都算作本人说的
正常时
指定媒体、本人模板和质量足够时,返回脸部位置或声音时间段。
发现问题时
画面与声音证据冲突、质量低或覆盖不足时分别报告,仍不能判断的部分保持未知。
入口不可用或证据不足时
本人模板、识别模型或具名文件不可用时停止判断,不临时建库、不扩展扫描,也不识别他人。
从哪里开始
在当前 AI 对话点名一张照片或一段录音,问本人是否出现在画面或声音中;视频语音只检查其音轨,画面要另选少量静帧。
需要准备什么
- 一份明确文件,或已从媒体检索选中的少量图片;音视频一次处理一份
- 要判断画面还是声音,以及已有的真实时间或场景线索
为什么需要这个能力
仅凭一句“看起来像”无法复核,批量扫描整套媒体又会扩大范围。判断本人还必须区分画面证据和声音证据。
从需求到结果
明确选一张照片、一个录音或很短的文件列表,说明是否需要判断本人出现;不扫描相册、目录或整个声音库。
照片返回疑似本人的人脸位置与质量;录音返回有依据的精确时间段和覆盖,未检查句段不能借同一声音分组自动归给本人。
复用仍有效且绑定当前原件的证据;模板缺失、质量低、遮挡或声音太短时说明未知,不从未知目标现场建库自证。
照片与声音分别报告,冲突不强行合并。没检测到人脸不等于本人不存在,结果也不是法律身份认证,不识别其他人的姓名。
失败时会怎样恢复
照片里没检测到脸,或语音太短
系统反应:保持无法判断,不写成本人一定不在。
恢复方式:换更清楚的原件或精确片段,再对选中的少量文件核对。
本人参考样本缺失、已更换或与待判断文件同源
系统反应:停止这次本人归属判断,不能靠同一文件自我证明。
恢复方式:只用独立、仍有效的本人参考样本重新比较,不从这份待判断文件现场建档。
视觉和语音结论冲突
系统反应:分别报告,不合并成一个身份结论。
恢复方式:保留各自原件、框、时间段和覆盖缺口。
技术身份与验证证据
Skill · media-person-self · 成熟度 B(可用,但依赖环境或仍有证据缺口)
这个 Skill 用到的名词
- person:self(本人候选)
- 只回答用户是否出现在这个具名媒体中,不识别其他人。
- Face box(人脸框)
- 照片中检测到的人脸位置,用来说明哪个可见人物是本人候选。
- Voice profile(本人声纹档案)
- 本地、可撤销的本人语音模板;删除或替换后未来判断随之变化。
- Coverage(证据覆盖)
- 实际比较了哪些脸或哪些音频时间段,未覆盖内容不能自动归属。
- Rebuttable(可反驳)
- 结果只是当前模型与证据支持的判断,用户或更好证据可以推翻。
专业定义
需要判断一张指定照片里的人是不是我,或一段指定录音、视频音轨里有没有我的声音时,它只比较这几个明确文件,分别给出图像框或语音时间段和不确定性;不会扫描媒体库,也不会识别其他人。
执行参考
下面保留 AI 和工具实际使用的参数、步骤与依赖。日常使用可以直接提出需求,不需要先手工准备这些协议。
输入
- 一个具名媒体或很短的显式列表
- 私有可撤销 face template 或 held-out voice profile
- 语音需要精确时间戳句段和最小已绑定上下文
输出
- 图像的 present、not detected、no face 或 unknown(未验证)
- face index、bounding box 或精确音频时间段
- self、other、unknown(未验证) 的覆盖范围和一句可反驳依据
执行顺序
- 1
照片使用固定 YuNet 检测和 SFace 比较,按官方未调阈值与唯一可撤销本人模板形成候选框
- 2
录音或视频先运行 ChineseASR 的 speaker-evidence-readback,只对具名原件核hash(内容指纹),不加载模型或返回转写
- 3
已有当前有效证据只回答列出的精确时间区间,并保留覆盖缺口
- 4
没有有效证据才交给 ChineseASR,使用Paraformer时间戳、匿名簇和每簇最多两条清晰句段的held-out(留出样本)证据
- 5
结合已有声道、对话角色与语境,逐句输出self/other/unknown;一条比较不能替未测句段作证
- 6
视觉与语音独立报告;视频只检查音轨,除非另行选定少量静帧
操作边界
- 不暴露模板向量、声纹或内部相似度
- 不命名其他人
- 不复制或修改源媒体
- 不从文件名、时间接近或目录推断身份
- 删除或替换 profile 会改变未来判断
- 图片仅接受最多20张明确文件并逐一处理,音频/视频一次一个;不跟随目录、通配符或相册
- inferred_self_not_detected只表示已比较人脸未命中;no_face_detected、解码失败、遮挡或模糊不能证明本人不存在
依赖
- 本地 YuNet 与 SFace
- 私有 person:self face template
- ChineseASR 的 Paraformer、时间戳和 held-out voice profile
验证状态
源码、安装、供应检查、当前任务、新任务和真实使用分别列出;一层通过不自动提升另一层。
- Source(源码)
- 当前 .agents source e734251 中的唯一源码已核对
- Install(安装)
- canonical junction(目录联接) 已安装
- Transaction(供应事务)
- 供应事务检查通过;0 个坏事务
- Current task(当前任务)
- 本轮宿主回执未知
- Fresh task(全新任务)
- 新任务回执未知
- End to end(端到端)
- 照片路径已验;并发候选不计入
照片 adapter(执行适配器) 8 项测试通过;语音链复用中文 ASR(自动语音识别) 的既有句段证据能力,Skill 自身仍缺少一组独立语音回归。
证据时间与来源
- Observed at(观察时间)
- 供应链现场:2026-09-24 12:56(中国时间);项目场景按各项记录
- Source commit(来源提交)
e734251081dc48bdd86765372ce225b3929ce9ae- Supply command(供应验证命令)
E:\.agents\tools\Test-PersonalSkillSupply.ps1 -RequireInstalled -NoExternalEvidence -Json- Evidence basis(证据来源)
- .agents E171 release 1aa0b0a、当前 Personal Skill supply(个人能力供应链),以及本页明确标注的既有项目/Provider(固定服务入口)证据;source/install/transaction 通过不冒充 current(当前状态)/fresh/E2E
Canonical source(唯一维护源)
E:\.agents\skills\media-person-self\SKILL.md该路径是维护源;用户目录中的发现入口不是第二份源码。
