中小企业AI素养
← 所有课程
课程 04中小企业AI素养

探索吧!

摘要音频

语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。

学习笔记

100%可解释的下一词生成器

发送短信

很久以前,我和朋友们会玩这样一个游戏:拿起手机,只用推荐的下一个词来给朋友编辑短信。也许你也这么玩过。

这里有一个基于少量内容"训练"的模拟器。试试看吧!

嘿 有人知道怎么修复这个构建吗

我觉得 |

我们 我

↻ 重新开始

我们曾把这个游戏称为"自我机器人"。我们知道它是根据个人使用习惯推荐词语的,而且能在个性化推荐中看到自己的语言风格。

当时,我们很乐意把它当作科技魔法一笑置之。但那时我们可能没意识到背后的算法竟如此简单。

如果你想和我一起动手做一个,请继续阅读 :)

"训练"你的模型

让我们用几条短信来训练模型。只需要统计词语之间的连接关系。逐条信息进行处理。

\+ 添加第一条信息

转移矩阵

添加上方信息开始构建矩阵。

这张完整的词语连接图称为频率表。对每行进行归一化处理后,就能得到下一个词的概率分布。

根据已有内容选择下一个词的过程称为采样。现代语言模型(如Claude)也使用同样的术语来描述这个过程。

开始采样

使用基于5条短信构建的相同矩阵,现在你可以玩一个更有依据的版本了。我们会显示概率分布。

↻ 重新开始

高亮显示的行是你当前的上下文。从可选词语中选择一个继续。

百年技术

"这是真正的技术吗?"问得好,读者朋友。

马尔可夫在1906年发表了这个构想。一个世纪后的2010年,这类n-gram模型驱动着手机上的下一词预测功能(SwiftKey,后来是苹果的QuickType)。2015年左右,神经网络——先是RNN,然后是2017年的transformer——开始用学习函数替代查表法,剩下的故事... 就是我们正在见证的现在。

抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
导出到 Anki (.tsv) ↓
知识检测 6 题