摘要音频
语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。
学习笔记
100%可解释的下一词生成器
发送短信
很久以前,我和朋友们会玩这样一个游戏:拿起手机,只用推荐的下一个词来给朋友编辑短信。也许你也这么玩过。
这里有一个基于少量内容"训练"的模拟器。试试看吧!
嘿 有人知道怎么修复这个构建吗
我觉得 |
我们 我
↻ 重新开始
我们曾把这个游戏称为"自我机器人"。我们知道它是根据个人使用习惯推荐词语的,而且能在个性化推荐中看到自己的语言风格。
当时,我们很乐意把它当作科技魔法一笑置之。但那时我们可能没意识到背后的算法竟如此简单。
如果你想和我一起动手做一个,请继续阅读 :)
"训练"你的模型
让我们用几条短信来训练模型。只需要统计词语之间的连接关系。逐条信息进行处理。
\+ 添加第一条信息
转移矩阵
添加上方信息开始构建矩阵。
这张完整的词语连接图称为频率表。对每行进行归一化处理后,就能得到下一个词的概率分布。
根据已有内容选择下一个词的过程称为采样。现代语言模型(如Claude)也使用同样的术语来描述这个过程。
开始采样
使用基于5条短信构建的相同矩阵,现在你可以玩一个更有依据的版本了。我们会显示概率分布。
↻ 重新开始
高亮显示的行是你当前的上下文。从可选词语中选择一个继续。
百年技术
"这是真正的技术吗?"问得好,读者朋友。
马尔可夫在1906年发表了这个构想。一个世纪后的2010年,这类n-gram模型驱动着手机上的下一词预测功能(SwiftKey,后来是苹果的QuickType)。2015年左右,神经网络——先是RNN,然后是2017年的transformer——开始用学习函数替代查表法,剩下的故事... 就是我们正在见证的现在。
抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 6 题