跳到主要内容
独立实测·部分用成实测日期 2026-07-29

按逐字稿剪视频

不会剪时间线,能不能像删文字一样剪掉口误?

在 Rescript 官方仓库 exact commit 的本地构建中,一段 30.77 秒自制英文样片通过逐字稿标记了 3 个填充词和 6 个 false-start 词,形成 4 段 cut ranges,并导出 27.64 秒 MP4。项目恢复和缓存后断网复导成功,但全新离线转写失败,导出内容仍必须人工复听。

原片
30.77s

1280×720 / 30fps

标记删词
9

4 cut ranges

导出成片
27.64s

观察到 ≤5.1s

文件体积
2.237×

相对原文件

独立实测·部分用成EXACT-COMMIT 本地构建 · 63fa992线上 GitHub Pages 未实测

同一份样片:从 30.77 秒逐字稿到 27.6 秒编辑状态

左图是 Whisper Base 转写完成后的原始状态;右图是一键标记 3 个填充词、再手动选中 6 个 false-start 词后的界面。两图证明编辑状态和 cut ranges 已发生变化,不单独证明每个词已从声音中完整消失。

删词前:原始逐字稿原始状态
Rescript exact-commit 本地构建完成原始英文样片转写,显示 30.8 秒时间线和 Remove fillers 3
30.77 秒自制样片完成 Whisper Base 转写;界面显示可删除的逐词稿与 3 个填充词。
标记后界面:4 处剪切标记后界面
Rescript 本地编辑状态,3 个填充词和 6 个 false-start 词已标记,时间线显示 4 段剪切区间和 27.6 秒时长
界面共标记 9 个词并形成 4 段 cut ranges;这证明编辑状态发生变化,不单独证明每个词已从音频中完整消失。

使用同一个 Whisper Base 对导出文件再次转写时,3 个位置仍被识别为 “Ah”,并且 “Actually” 仍出现。前后由同一个模型判断,结果不独立,不能据此证明导出音频变差、自动删词失败或转写准确率;它只说明导出后必须人工复听删词位置。

界面标记删词
9

4 段 cut ranges

导出成片时长
27.64s

原片 30.77s

导出文件体积
2.237×

相对原文件

02 / 这次到底跑通了什么

把可确认的结果和仍需确认的结果分开

截图、媒体参数和恢复测试可以证明流程走到了哪里;它们不能替代你对成片的逐处复听。

01

逐字稿删词路径跑通

界面识别出 Remove fillers (3)。一键标记 3 个填充词后,再手动选中 6 个 false-start 词,共形成 9 个删词标记和 4 段 cut ranges,编辑状态时长变为 27.6 秒。

02

MP4 导出可解码,但文件更大

观察到导出在 5.1 秒内完成。成片为 27.64 秒、1280×720、30fps 的 H.264/AAC MP4,可完整解码且未见可见水印;文件为 10,338,087 bytes,是原文件的 2.237 倍。

03

当前项目可恢复,缓存后可断网复导

刷新页面后项目仍在;模型与项目已缓存时,断网复导在 2.452 秒完成。但全新离线转写失败,因此不能写成“第一次打开就能完全离线使用”。

测试版本边界

本次只测试从官方仓库 commit 63fa992272d69e4fc3cf6a5ce49ca658cbafde89 构建的本地版本。没有在 GitHub Pages 线上版本上传素材或执行任务。 线上 GitHub Pages 未实测;不能把本地结果直接视为线上版本结果。

03 / 成片证据

导出了什么,也看导出改变了什么

本次 MP4 可完整解码、未见可见水印,但音频被重新编码为 AAC 22050 Hz mono,文件体积变成原文件的 2.237 倍。

Rescript exact-commit 本地构建显示视频导出完成
导出完成观察到导出在 5.1 秒内完成;随后对本地文件做了媒体参数与完整解码检查。
Rescript 导出的 1280×720 视频画面,没有观察到可见水印
导出成片画面这一帧只用于证明本次 MP4 存在可解码画面且未见可见水印,不代表全部时间点、格式或版本。

04 / 必须人工复听

同模型复转写只是一条人工复听警告

使用同一个 Whisper Base 对导出文件再次转写时,3 个位置仍被识别为 “Ah”,并且 “Actually” 仍出现。前后由同一个模型判断,结果不独立,不能据此证明导出音频变差、自动删词失败或转写准确率;它只说明导出后必须人工复听删词位置。

导出文件用同一个 Whisper Base 再次转写,仍出现 Ah 和 Actually 的识别结果
同模型复转写警告这是人工复听提醒,不是独立音质或删词准确率证据。

不要把这张图解读为“自动删词失败”,也不要解读为“自动删词准确”。前后都由 Whisper Base 判断,因此只能把它当作需要人工复听的风险信号。

05 / 适不适合你

先按自己的任务条件判断

这次结果支持一个很窄的使用场景,不支持把它泛化为所有语言、时长和交付要求。

可以先试

  • 有一段较短、无敏感内容的英文讲解、播客或采访,想先用逐字稿定位口误和停顿。
  • 可以使用最新版 Chrome 或 Edge、等待首次模型下载,并在导出后逐处人工复听。
  • 接受输出可能重新编码、文件变大,并会保留原素材做对照。

这次结果还不适合

  • 第一次断网打开就必须完成转写,或不能预先下载约 200 MB / 600 MB 模型及辅助模型。
  • 需要已经验证的中文、多人长视频、精确无损音频或批量生产路径。
  • 不能接受人工复听,或必须把自动填充词删除当作无需检查的最终结果。

06 / 宣传里容易被忽略的限制

这些结论现在不能扩大

01

只测试 30.77 秒自制英文样片;没有测试中文、长视频、多人对话、复杂背景声或真实会议。

02

缓存后断网复导成功不等于首次完全离线,也不等于已经完成媒体网络请求审计。

03

未见可见水印只适用于这一次导出;没有验证所有格式、设置或未来版本。

04

导出音频为 AAC 22050 Hz mono,文件体积为原文件 2.237 倍;没有完成独立听感、音质或同步精度测量。

05

README 写明 MIT,但 exact-commit checkout 中没有 LICENSE 文件;同时使用标记为 GPL-2.0-or-later 的 @ffmpeg/core-mt,整体许可边界仍需确认。

07 / 最低成本尝试

用非敏感短片做一次最小测试

不要先上传会议、客户或未公开素材。用一段可以删除的 20–30 秒自制短片,主动说一个填充词和一句可删除的 false start。

  1. 01

    记录实际 commit 或线上版本、浏览器、模型名、首次下载时间和网络状态。

  2. 02

    只删一个填充词和一句 false start,确认界面产生对应 cut ranges。

  3. 03

    导出后从头播放,重点复听每个删词位置;不要用同一个转写模型代替人工复听。

  4. 04

    对比时长、分辨率、音频参数、文件大小、同步、水印和项目刷新恢复;任一关键项不可接受就停止。

公开线上版本还没有经过这次独立实测

如果你仍要尝试,只用自己制作、可以删除的非敏感短片;先完成上面的最小测试,不要从会议、客户或未公开素材开始。

打开 Rescript 公开页面

08 / 原始资料

回到仓库、固定 commit 和公开发布页

产品方表述、BitShovel 的本地实测与仍未确认的事项已分开书写。点击可回到原始页面自行复核。

不会剪时间线,能不能像删文字一样剪掉口误? — BitShovel