Attention

本文来自于我和 GPT-6 聊天的总结。

本文只解释结构:输入从哪里来,模块如何连接,哪些位置能够互相读取,以及推理时保存什么数据。例如模型里的数据通路,以及 GPU 上的计算和缓存组织。

覆盖范围以 Transformer 和大语言模型为主,同时补充经典序列模型、视觉、语音和图数据中常见的 Attention 结构。

正文