待验证50% 置信事实精确时间
嵌入层的作用是将 token 映射为向量,注意力机制计算 token 之间的关联,Softmax 将分数转化为概率
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
已验证Transformer架构的自注意力机制核心计算公式为 Attention(Q,K,V) = softmax(QKᵀ/√d_k)V,softmax函数将所有位置的注意力分数归一化为总和为1的概率分布71% 相似已验证自注意力权重通过Softmax函数归一化,权重总和恒为171% 相似已验证自注意力机制允许模型在处理每个Token时同时看到输入序列中所有其他Token的信息,注意力矩阵计算复杂度为O(n²)68% 相似待验证Transformer架构中的自注意力(Self-Attention)层通过Softmax函数对所有位置的相关性分数进行归一化,当序列长度从几千Token膨胀到数万Token时,每个位置分配到的注意力权重被大幅稀释67% 相似待验证注意力层作为信息路由器在不同序列位置间聚合上下文,其键值是从提示中其他token动态派生的短期记忆表示67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/911631API
curl https://kongchang.com/api/v1/knowledge/claims/911631MCP
get_claim(id=911631)