开启 3 天免费试用
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。


要可靠地用 AI 转写音频,先确认录制和处理获得许可,保存不可变母带,再生成带时间、说话人和低置信标记的草稿。必须对照音频校正文稿后再做摘要,并从校正版生成字幕 cue,最后检查准确、同步、完整、位置与可读性。
顺序不能颠倒。错误转写生成的流畅摘要会隐藏原错,时间准确的字幕也可能错误表达讲话。NIST 指出生成式 AI 可能虚构内容,风险控制需要记录与人工监督。[4]把每个阶段视为一次有输入、输出、审阅者和验收规则的转换。
关键要点
- 上传前确认同意、权限、目的和保留期。
- 保存只读母带,只在受控副本上处理。
- 保留时间码、说话人和低置信标记。
- 校正转写后才允许生成摘要。
- 字幕必须从校正文稿创建。
- 在实际播放器中从头到尾审阅成品。
若任务是从会议中提取负责人和期限,请使用会议行动项流程。本文适用于获准处理的访谈、讲座、演示、播客和录制演讲。
确认是谁录制了音频、谁在说话、谁拥有它、为什么要处理它、哪项服务会接收它,以及谁可以访问输出。同意和告知的要求因司法管辖区、情境、雇佣关系、平台和录制方式而异。能下载文件不等于有权转写或发布。
处理前回答:
只使用所需的最少音频。如果某一段超出了获批的目的,就从工作副本中删除,同时按适用的档案政策保留母带。只在受控的衍生文件中删去不必要的标识信息;绝不要假装编辑过的副本就是原件。
本文是质量流程,而非法律结论。当录音法规、同意、合同权利、职场监控或敏感个人数据存在不确定性时,在处理之前咨询当地的合格专业人士。
原样保存收到的文件,并给它稳定的 ID。记录其来源、录制日期、时长、格式、语言、已知的说话人、许可依据、负责人和访问限制。限制写入权限,以防意外被替换。
建立一份工作副本,用于降噪、声道分离、音量标准化或格式转换。记录每次转换。处理可提升可懂度,但过度滤波可能削掉辅音、改变停顿,或让重叠的说话人听起来像轮流发言。
自动化前先听几段样本:轻声说话、大声说话、人名、数字、交叉对话、音乐和最嘈杂的部分。记下产品名称、专业术语、地名和缩写等词汇。小型术语表能帮助模型,但不授权它猜测。
在自然分界处拆分长录音,并保留连续的时间偏移。每段标明起始时间,只在必要时重叠,以免切断词语。保留分段 ID,让更正可以追溯到母带。
要求结构化的结果,包含分段 ID、开始时间、结束时间、说话人标签、文字、语言,以及置信度或不确定性说明。如果工具不提供数值置信度,就要求使用 [unclear 00:12:41] 这类明确标记,而不是一个看似合理的补全。
在身份核实之前,使用中性的说话人标签:Speaker 1、Speaker 2,或从上下文确认的角色。仅凭声音相似不足以识别身份。当重叠讲话和非语音信息影响含义时,要把它们保留下来。
一种有用的草稿结构是:
| 字段 | 示例用途 | 要避免的失误 |
|---|---|---|
| 分段 ID | 稳定的更正引用 | 丢失来源位置 |
| 开始/结束 | 导航和字幕时间 | 编造或漂移的时间码 |
| 说话人 | 跟踪发言轮次 | 凭声音猜测身份 |
| 逐字文本 | 主要转写内容 | 过早地转述 |
| 不确定性 | 人工复核队列 | 自信地填补听不清的音频 |
| 声音说明 | 有意义的非语音音频 | 漏掉警告或反应 |
转写时不要做摘要。当转写的目的需要忠实记录时,保留口头重复或说错后重来的内容。对于可读版转写稿,明确写出清理规则;如果日后可能出现争议,就保留一份逐字层。
复核每一个低置信度的分段,然后抽查那些据称高置信度的部分。人名、数字、否定、单位、日期、URL、缩写、说话人切换和被引用的陈述值得全面复核,因为一个小错误就可能让含义反转。
戴耳机;必要时放慢播放但不改变音调。把每处更正与上下文和母带对照,而不只与模型的备选对照。确实听不清的讲话要标出,不要猜测。
保留一份更正日志,记录分段 ID、原文字、新文字、原因、复核人和时间。典型的原因包括听错的词、说话人分界、影响含义的标点、时间码漂移或非语音标签。如果某项修改依赖的是外部知识而不是可听到的证据,就把它标为编辑注释。
更正之后,检查:
此时才把某个转写版本指定为可用于后续工作的版本。
提供已批准的转写稿和一份摘要约定:受众、目的、必需的章节、最大篇幅、允许的推断和引用格式。要求每个重要观点都引用分段 ID 或时间范围。告诉模型,当转写稿不支持某个答案时要明确说明。
使用文档摘要检查清单检查范围和遗漏。音频还增加了说话人归属和时间对齐,因此要核实摘要没有把不同说话人的观点合并,也没有把一个问题变成一项决定。
把以下内容分开:
要求进行一轮矛盾检查:找出摘要在哪些地方加强了确定性、删去了限定条件、把陈述归错了说话人,或忽略了更正标记。打开对应音频分段,由人决定。
如摘要将用于报告,就在笔记转报告的证据图中保留已批准的转写稿 ID 和分段引用。
字幕文件是有时间的提示单元(cue),而不是按固定字符数切开的段落。W3C 的 WebVTT 规范定义了一种为媒体提供提示单元和时间的文本轨道格式。[2] 从校正后的转写分段生成提示单元,然后根据讲话和画面情境调整边界。
每个提示单元都应:
在制作同语言字幕时,除非获批的编辑规范另有要求,否则不要翻译、简化或删减。这些是独立的转换,需要独立的审核。按照可用的权利处理歌词和其他受版权保护的材料;不要以为转写就授予了重新发布的权利。
在生产流程中,验证提示单元语法、递增时间戳、重叠规则、编码和文件命名。让字幕文件与确切的媒体和转写版本保持关联。
WCAG 关于预录内容的指引要求为同步媒体中的预录音频提供字幕,除非该媒体本身就是文字的替代品并已明确标注。[1] 附上未经检查的机器转写稿,并不满足无障碍要求。
开启字幕,完整审阅最终的媒体。检查字幕质量项目中常用的四个维度:
| 维度 | QA 问题 |
|---|---|
| 准确性 | 文字、说话人和有意义的声音是否一致? |
| 同步性 | 提示单元是否随相关音频出现和消失? |
| 完整性 | 所有必要的讲话和声音是否都得到呈现? |
| 位置/可读性 | 观众能否在不错过重要画面的情况下读完字幕? |
FCC 的字幕指引把准确性、同步性、完整性和位置作为美国电视字幕的质量维度加以讨论。[3] 把这些维度当作有用的 QA 视角,而不是对每个国家、平台或媒体类型法律义务的普遍说明。
在实际播放器和目标屏幕尺寸上测试。留意被截断的行、不受支持的字符、被控件遮住的提示单元、与画面内嵌标签的冲突,以及在密集讲话时的快速切换。请一位没有编辑过转写稿的审阅者观看有代表性的片段;对于重要的发布,借助无障碍方面的专业知识。
用稳定 ID 把母带音频、处理过的工作副本、已批准的转写稿、摘要、字幕文件、审核日志和发布版本绑定在一起。分别记录语言和语言区域;混合语言的录音可能需要分段级的语言标签。
定义一条更正途径。观众或说话人应能报告某个时间戳和问题。当某项更正被接受时,确定哪些衍生材料受到影响。修正转写稿不会自动更新已导出的摘要或字幕文件。
对于已发布的媒体,写明谁可以替换字幕、缓存的播放器是否必须刷新,以及如何告知这项更正。只保留许可和档案政策允许的内容。
如果你是在规划录制而不是处理录音,视频脚本与分镜流程可以在制作之前就把旁白、说话人和有意义的声音分开,从而减少之后字幕中的歧义。
从摘要中提取每一个人名、数字、日期、引语、决定和因果陈述。把它对应到已批准的转写分段,播放该段,并检查足够的前后音频,以还原其中的限定条件。对于无法仅凭录音证明的外部主张,使用 AI 回答事实核查方法。
对于模型可能漏掉的声音,转写稿不能作为唯一证据。如果音频不清楚而该主张又很重要,就把它标为未解决,或请一位获授权的参与者澄清。
不能。拥有文件并不能证明已获同意、拥有版权、符合保密要求、具备职场授权或处理合法。针对相关的司法管辖区和情境,确认录音和处理的依据。
不可以。先对照音频校正。否则,一个转写错误可能变成一条自信的摘要要点,之后也很难追溯。
按照你的编辑标准,使用带时间戳的不确定标记,例如 [unclear] 或 [inaudible]。不要为了通顺而猜一个看似合理的词。
不满足。它们需要在文字、说话人、声音、时间、完整性、位置、可读性和播放器表现方面接受审核。无障碍义务也取决于内容和司法管辖区。
转写稿是音频的文字记录。字幕是同步的文字提示单元,用于在媒体播放时传达讲话和有意义的声音。两者不能机械地相互替代。
翻译是另一项独立的转换。从校正后的源语言转写稿开始,保留提示单元和说话人的含义,自然地本地化,并请合格的审阅者同时检查语言和时间。
先使用中性标签,通过获授权的背景信息核实身份,并一致地标注切换。当观众无法从画面判断说话人时,在字幕中加入说话人标识。
只保留政策所要求的母带、已批准的衍生文件、来源信息、许可证据和更正记录。按照批准的时间表删除临时上传和不必要的敏感副本。
延伸阅读
免责声明:录音、同意、隐私、雇佣、版权和可访问性要求会因地区与场景不同。本文仅提供一般工作流信息,不构成法律建议。请向合格的当地专业人士确认适用要求。
来源:
Sources checked 2026 年 8 月 24 日。
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。