待验证50% 置信事实时间未知
Pure Transformer architectures see inference costs grow quadratically with sequence length
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
已验证Transformer架构的自注意力机制在处理长序列时面临二次方复杂度的计算开销,上下文长度翻倍则计算量增长四倍75% 相似待验证Transformer的KV Cache随序列长度呈二次方增长,导致长上下文推理对GPU显存的非线性消耗69% 相似待验证标准Transformer的单次前向传播等价于固定深度的计算图,其表达能力受限于TC^0复杂度类,但通过多步推理可接近图灵完备的计算能力67% 相似待验证研究表明(Dettmers et al., 2022),Transformer模型中特定隐藏维度会在所有token和层中持续出现异常大激活值,模型超过6.7B参数时现象更显著64% 相似待验证在神经网络推理中Softmax、LayerNorm等对数值范围敏感的操作极易因FP16有限的指数位引发上溢或下溢,误差在Transformer多层堆叠中累积放大60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/56400API
curl https://kongchang.com/api/v1/knowledge/claims/56400MCP
get_claim(id=56400)