什么是频率表（frequency table）？	频率表是单词之间连接的完整映射，显示了一个单词后面跟随另一个单词的次数。
如何将频率表转换为概率分布？	将频率表的每一行进行归一化处理，就可以得到下一个单词的概率分布。
什么是采样（sampling）？	采样是根据当前上下文选择下一个单词的过程，使用概率分布来指导选择。
温度（temperature）参数在语言模型中的作用是什么？	温度参数控制采样的随机性程度，从"聚焦"到"随机"调整模型的输出多样性。
Top-k和Top-p采样策略有什么区别？	Top-k只保留最可能的k个单词；Top-p保留概率和达到某个阈值（如90%）的最小单词集合，能根据模型的确定性自适应调整。
马尔可夫链和大型语言模型（LLM）在计算下一个单词概率时的主要区别是什么？	马尔可夫链查表一行数据；LLM通过数十亿参数的前向传播（包括注意力、嵌入、前馈层等）来计算概率分布。
马尔可夫链相比LLM的优势是什么？	马尔可夫链具有100%的可解释性，因为它只是简单地统计单词之间的连接。
LLM相比马尔可夫链的优势是什么？	LLM能处理更长的上下文，具有更强的能力，但牺牲了可解释性。
马尔可夫在哪一年发表了这个想法？	1906年。
现代手机的下一词预测功能（如SwiftKey和QuickType）最初使用的是什么技术？	n-gram模型，这是基于马尔可夫链的方法，在2010年左右被采用。
