课程字幕整理成笔记
- 任务
- 一节网课附带 SRT 字幕,想要不带序号和时间码的文字。
- 结果
- 每段字幕变成一行或一个段落,段内换行已合并,可以直接粘贴进文档。
- 复核
- 分段跟随字幕段落而不是句子;标点完全来自原字幕。
字幕提稿
从 SRT / VTT 字幕提取纯文字:去掉时间码、序号、样式标签和 YouTube 自动字幕的滚动重复,复制或下载 UTF-8 TXT。
只清理格式,不进行转写、翻译、摘要或内容改写
字幕轨道
已载入一段示例 SRT;可以直接转换,也可以粘贴自己的字幕。
结果校样
有些工具只给你一个按钮。 我们更想把时间、格式和边界都说清楚。 LOCAL FIRST:字幕文本不会离开浏览器。 说话人:校时不只可以整体平移,还能校正逐渐累积的漂移。
输出保持 UTF-8 编码;WebVTT 的毫秒分隔符为句点,SRT 为逗号。
方法与边界
字幕中的换行可能只是画面宽度需要,时间码和序号也不属于正文。工具把同一 cue 的多行合并,按选择移除标签与说话人前缀,再保留字幕段落的阅读节奏。
去重只比较相邻两段字幕:完全相同的一段会被合并;如果一段开头重复了上一段的最后一行(YouTube 自动字幕的滚动写法),只保留新出现的那一行。不会跨段删除相同句子,也不会推断语义近似。
解析字幕段 → 清理标签 → 可选去掉相邻重复与滚动重叠 → 合并段内换行 → 可选去说话人前缀 → 输出 UTF-8 TXT。
场景速查
每个例子都给出任务、可得到的结果和仍需人工核对的边界,方便直接对照自己的文件。
常见问题
拖入或粘贴 .srt 文件即可,时间码和序号本来就不会进入结果;点“下载 TXT”保存为 UTF-8 文本。
可以处理它的 .vtt 文件:逐字时间标签会被移除,开启“合并连续重复句”后滚动重复只保留一次。工具不会从 YouTube 下载字幕,需要你先拿到 .vtt 文件。
不能。这个工具处理已有的 SRT 或 VTT 文本字幕,不上传音视频,也不做语音识别。
同一句话在文章不同位置重复可能有意义。只处理相邻两段之间的完全重复和滚动重叠,能减少误删。
同一字幕段内的换行会合并为空格;不同字幕段可选择逐行排列或在段落间留空行。