LLM:Transformer 架构中Q/K/V计算步骤示例
用假的小数字(比如 2 维向量)手算一遍 \(QK^\top\) → softmax → 乘 V,把矩阵乘法也摊开。
用假的小数字(比如 2 维向量)手算一遍 \(QK^\top\) → softmax → 乘 V,把矩阵乘法也摊开。
用假的小数字(比如 2 维向量)手算一遍 \(QK^\top\) → softmax → 乘 V,把矩阵乘法也摊开。
Transformer 架构中的查询(Query)/键(Key)/值(Value)是语议和数学层面上的向量表述。
Query(Q,查询):我想找什么?我提的问题?
Key(K,键):我有什么,标签、索引、目录等。
Value(V,值):真正要给出去的内容。
注意力机制 = 带着问题(Q)去对标签(K),再按相关程度拿走内容(V)。
每个词都同时扮演「提问者 / 可被搜到的条目 / 信息载体」三种角色。
提示词(Prompt) 是用户输入给大语言模型(LLM)的一段文本,用于引导模型生成预期的回答或完成特定任务。可以将其类比为“给AI的指令”,它的设计和质量直接影响模型的输出效果。
AI 大模型的关键术语:提示词、Token、上下文长度、模型幻觉。
LLM(Large Language Model):大语言模型。
OpenAI在2022年11月30日发布了基于GPT模型的聊天机器人ChatGPT,进入到2023年是大语言模型爆发的元年。
注:读书笔记,参考自《LangChain 入门指南:构建高可复用、可扩展的LLM应用程序》