语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。
预计阅读时间: 8 分钟
本网站上的每一页——包括这一页——都经过了提取、转录、总结、翻译成七种语言,并由同一个自动化管道用克隆语音朗读。这一页是解释该工具本身的工具。
阅读完后你将理解
- 该工具将视频课程转变成什么,以及为什么这很有用
- 从原始视频到完成页面,材料经过的八个阶段
- 塑造其构建方式的设计原则
该工具实际做什么
Learning Companion 接收一个仅以一种语言存在、位于登录后、只能观看的视频课程——并将其转变为你可以阅读、搜索、翻译、聆听和用你选择的语言学习的内容。它是一条装配线,将一个人在视频上的讲话转变为持久的、多语言的、易于访问的学习资源。
你给它一个课程。它会返回给你每节课的清晰书面学习笔记、理解测验、整个课程翻译成德语、法语、荷兰语、印地语、普通话和克林贡语,以及用听起来像人类的语音进行的朗读音轨,该音轨在每个单词被说出时突出显示它。然后它将所有这些发布为一个快速的静态网站。
管道,逐阶段
把它想象成一条工厂流水线。材料从一端进入时是原始的,从另一端离开时是完成的。每个工作站做一项工作,并将其结果交给下一个。
第 1 阶段——摄入:获取原始材料
源课程位于托管学习平台上,其中课程要么是流媒体视频,要么是书面页面。该工具登录、发现课程并提取源。它直接下载底层视频流,或在课程是文本优先的情况下抓取书面课程文本。
第 2 阶段——转录:将语音转换为文本
每个视频的音频被输入到在图形卡上本地运行的语音识别模型。它生成带时间戳的转录:不仅是说了什么,还有何时说的。每个短语都固定在时间线上的一个时刻。这些时间稍后很重要,当单词与音频对齐时。
第 3 阶段——总结:提炼课程
原始转录是忠实的,但读起来很累人。语言模型将每个转录重写为结构化的学习笔记:关键思想,用清晰的散文表达,按照你实际想要复习的方式组织。这是语音墙和值得保留的笔记集之间的区别。
第 4 阶段——测验:检查理解
从相同的材料,该工具为每节课生成一个简短的理解测验,准备导出到闪卡应用中。问题测试课程中的思想,并被写成独立存在,没有回到讲者或视频的参考。
第 5 阶段——翻译:向世界开放
每一段文本——笔记、测验、页面元素以及课程和课程标题——都由语言模型翻译成每种支持的语言。翻译分层进行,因此品牌名称保持完整,而描述性文本适应,缺失的翻译优雅地回退到英语,而不是留下空白。克林贡语等低资源语言会获得额外的坚定指示,因此模型不会悄悄地漂回英语。
第 6 阶段——语音:使其可听
这是人们觉得不寻常的部分。语音克隆模型为每种语言的每节课生成朗读音轨,用一致的听起来像人类的语音。除了音频,它还生成一个时间文件,因此当语音说话时,匹配的单词在页面上亮起——一种学习的卡拉 OK。克林贡语是例外:它没有神经语音,所以其音频是从录制的克林贡语声音库中拼接而成的。尽力而为,本质上有点机械。
第 7 阶段——发布:组装网站
所有这些都被呈现为一个简洁、快速的网站:每种语言一套页面、共享的样式和脚本、将课程联系在一起的目录,以及轻量级、尊重隐私的使用分析。没有数据库,运行时也没有服务器端代码——只是静态文件,加载速度快,可以在几乎任何地方托管。
第 8 阶段——存储和发送:保留主文件,仅发送产品
在幕后,该工具保留三层文件。主文件——转录、无损音频和源笔记——永远不会离开构建机器。临时层保存可以随时重新生成的工作文件。完成的网站是唯一被部署的东西。当构建准备好时,只有发布的网站被交给托管基础设施并上线。有价值的原始材料留在家里。
为什么这样构建
几个原则塑造了设计:
- 每个阶段做一件事。 转录中的失败不会破坏翻译,任何单个工作站都可以重新运行而无需重建整个课程。
- 优先选择本地、优先选择无损、优先选择免费。 繁重的工作——语音识别和语音合成——在本地图形卡上运行。音频主文件保持无损。翻译使用最具成本效益的模型,保持忠实。
- 没有任何东西会悄悄地半途而废。 新鲜度检查意味着课程只在音频实际是最新的时才发送音频,因此课程可以部分翻译后上线,而不会假装完成。
- 产品与源可分离。 学习者看到的是一个清晰的静态网站。制作它的转录和主文件保持私密。
简而言之
你看过一次视频。该工具看了它、写下来、解释了它、就它对你进行了测验、用七种方式翻译了它、用语音读回给你——然后以完全相同的方式构建了你现在正在阅读的这一页。
No flashcards for this lesson.