这是一份深入解析 Transformer 架构 与 SVM(支持向量机) 之间形式等价关系的专业教程。本教程将带你系统理解最新研究如何将注意力层的优化几何与硬边界 SVM 问题建立关联,并揭示注意力机制自动筛选最优 token 的底层数学原理。
1. 背景与动机
自经典论文《Attention is All You Need》发表以来,Transformer 架构已成为自然语言处理(NLP)领域的核心基石。其关键组件——注意力层,接收一组输入 token X,并通过以下公式计算

评估 token 之间的相关性,其中 (K, Q) 为可训练的 key-query 参数,从而有效捕获长距离依赖关系。
然而,注意力机制为何能智能地筛选出重要 token?其优化过程是否有更严谨的数学解释?一篇来自宾夕法尼亚大学、加州大学河滨分校的论文《Transformers as Support Vector Machines》 给出了明确答案:该研究在自注意力的优化几何与 hard-margin SVM 问题之间建立了形式等价,通过 token 对的外积线性约束,将最优输入 token 与非最优 token 清晰分离。

论文链接:https://arxiv.org/pdf/2308.16898.pdf
