共 1 篇相关文章
SiliconLLM项目从零构建CPU原生LLM架构,融合选择性SSM、三值量化(1.58-bit)LUT MLP与细粒度MoE,围绕L3缓存带宽悬崖协同优化。实测三值内核较fp32加速4-5倍,探索消费级CPU本地推理的可行路径。