大模型的核心技术叫注意力机制。简单说,模型在读一段文字时,会给每个词分配不同的“关注程度”。
比如“他吃了一个苹果,因为很甜”这句话。当模型处理到“很甜”时,注意力机制会让它回头看一眼,发现“很甜”最可能指的是“苹果”而不是“他”。于是模型给“苹果”分配一个很高的注意力分数,给“他”分配一个很低的分数。这样模型就知道:甜的是苹果,不是人。
在技术实现上,注意力机制会为每个词计算出三个向量:查询(Query)、键(Key)、值(Value)。查询可以理解为“我想找什么”,键可以理解为“我是什么”,两者的匹配程度决定了注意力分数的高低。值则携带了词本身的语义信息,根据注意力分数加权求和后,得到最终的输出。
多头注意力是这项技术的增强版。模型会同时做多组注意力计算(比如32组),每组学习不同的关注模式。有的头专门关注主语和谓语的关系,有的头关注代词指向的名词,有的头关注相邻的两个词。最后把32个头的结果拼在一起,模型就能同时从多个角度理解一句话。