共 130 篇相关文章

Perplexity Max用户发现月度信用额度从40,000点骤降至10,000点,且未收到任何官方通知。本文解析额度缩水原因、对Agent功能用户的实际影响,以及应对AI订阅服务权益变动的实用建议。

按下回车到屏幕出现第一个字,LLM内部究竟发生了什么?本文系统拆解自回归生成机制、KV缓存加速原理,以及温度、Top-k、Top-p等解码策略,帮助开发者真正理解并掌控大语言模型推理过程。

Reddit开发者ALX-CODE分享LingBot-Video 1.3B选择性FP8量化方案,在RTX 5080上实测采样速度提升约22%(4.65s→3.65s)。本文解析混合精度量化策略、开源资源及ComfyUI适配思路。

Unsloth针对Qwen3.6系列发布NVFP4量化版本,采用W4A4真4bit张量核心运算,相比NVIDIA官方实现最高2.5倍推理加速,MMLU-Pro等多项基准测试精度持平甚至超越BF16全精度,本地部署效率大幅提升。
SGLang集成DSpark:置信度驱动推测解码如何破解高并发失效难题
SGLang正式集成DSpark,通过置信度驱动的变长验证机制解决推测解码在高并发批次下加速失效的核心痛点。支持Qwen3与DeepSeek-V4,B300硬件实测生成速度达383.7 tok/s,全批次范围性能领先MTP与常规推理方案。

MELTing Point论文首次以真实用户场景评测手机端大语言模型性能,覆盖iPhone、三星、Pixel等设备,测试TinyLlama、Mistral-7B等模型,揭示GPU推理优势、47度高温警告与prefill-decode分离方案,为边缘侧AI落地提供方法论参考。

SiliconLLM项目从零构建CPU原生LLM架构,融合选择性SSM、三值量化(1.58-bit)LUT MLP与细粒度MoE,围绕L3缓存带宽悬崖协同优化。实测三值内核较fp32加速4-5倍,探索消费级CPU本地推理的可行路径。

ostris发布Krea 2 Turbo Style Reference LoRA,支持单图或多图风格提取,让AI图像生成实现精准风格迁移。适用于品牌视觉、系列创作等场景,开源免费可本地部署。
PUBG Ally深度解析:NVIDIA ACE如何打造真正能协作的AI队友
KRAFTON联合NVIDIA ACE技术,为《PUBG》打造新一代AI队友PUBG Ally。集成语音识别、大语言模型与实时决策能力,实现自然语言交互与战场协同,探索游戏AI从NPC到"可协同游玩角色"(CPC)的全新进化路径。

OpenAI一次性发布GPT-5.6 Sol、Terra、Luna三款模型,覆盖旗舰推理到轻量快速全场景。本文详解三款模型的定位、性能差异、定价策略,以及多智能体协作推理、政府安全审查等行业背后的深层信号。

Grok 4.5正式发布,每任务仅需0.49美元,比同类产品便宜九成;Anthropic凭Claude Code占据AI编码市场50%份额;SambaNova完成10亿美元融资;算力租赁52%临界线引发行业重估。一文读懂AI市场最新格局变化。

OpenAI旗舰模型GPT-5.6三线并进:Sol、Kara、Luna分层推出;字节CGN 5.0 Pro与Meta Muse推动图像生成走向可控工作流;AI编程代理曝出供应链新风险。一文读懂本轮AI进展与安全隐患。

腾讯混元Hy3正式发布,295B参数MoE架构,激活仅21B,支持256K超长上下文。幻觉率从12.5%降至5.4%,MRCR得分近乎翻倍,内置MTP与EAGLE投机解码,SGLang Day-0即可部署。本文深度拆解其四大核心亮点与Agent-first定位。

DeepSeek投机解码算法(DSpark)已正式合并至vLLM主干代码,原生支持Qwen3、Gemma等主流开源模型。测试显示单用户Token生成速率提升接近150倍,整体吞吐量提升约40%-50%,是开源大模型推理加速的重要里程碑。

RTX 3060 12GB显卡能跑Krea 2吗?实测1-2分钟生成1080P图像,Krea2 Turbo FP8量化技术让消费级显卡也能高效AI绘图。本文解析技术原理、工作流配置及LoRA/ControlNet生态展望。

OpenAI发布GPT-5.6系列预览版,推出So、Terra、Luna三档定位模型。实测显示三款模型在长程智能体任务上全部满分,价格对标GPT-5.5降幅高达50%。本文详解性能评测数据、定价策略与选型建议。

OpenAI推出GPT-5.6模型家族,网络安全能力成最大亮点。本文深度解析GPT-5.6的差异化定位、双刃剑效应与企业级市场布局,理性评估官方宣传背后的实际价值。

腾讯正式开源混元3(Hunyuan V3),295B MoE架构、21B激活参数,官方宣称超越DeepSeek-V4-Pro。支持FP8量化、vLLM/SGLang部署,但256K上下文与不支持多模态成为核心短板。本文深度解析其架构特性、横向对比与实际部署方案。