共 77 篇相关文章

深入解析策略梯度算法的进化链条:REINFORCE的高方差问题、Actor-Critic的基线修复、TRPO的信任域约束、PPO的裁剪优化,到GRPO的组内基线创新。用问题-修复的因果逻辑串联整条强化学习策略梯度发展脉络。

详解如何在8GB显存的消费级GPU上完成LLM后训练,涵盖SFT监督微调、DPO直接偏好优化、GRPO组相对策略优化三种方法,借助LoRA量化等技术实现低资源大模型微调。

深入分析为什么监督微调(SFT)无法解决编码Agent的JSON格式错误问题,以及GRPO(群组相对策略优化)如何通过二元奖励信号和推理权重同步机制,直接针对输出正确性训练,实现从"几乎正确"到"完全正确"的跨越。

一文梳理人工智能、机器学习、深度学习、大模型、生成式AI之间的关系与发展脉络。从深蓝到ChatGPT,理解Transformer架构如何催生大语言模型,以及普通人如何切入AI应用开发。

实测Qwen3.8-27B在24GB M4 Pro Mac mini上的运行表现,详解GPU显存上限调整、KV缓存量化、关闭思考模式三个关键设置,附IQ4_XS与Q4_K_M量化对比数据,帮助你在有限内存中稳定运行27B稠密模型。

从表格Q-learning到DQN再到Rainbow,详解值函数强化学习算法的演进逻辑。通过失败驱动的视角,理解Double DQN、优先经验回放、对决网络、多步回报、C51等六项关键改进如何逐步修补前代算法的痛点,最终汇聚为Rainbow。

Sam Altman宣布OpenAI暂停强化学习训练,称模型能力增长极其迅速已超越安全对齐进度。本文深度解读这一决定背后的技术原因、行业影响及AI安全治理启示。

深度实测Meta开源Muse Glimmer 30B模型,详解其智能体能力、编程表现、性能评分及本地部署方案。对比Qwen 3.6 27B,解析工具调用、MCP集成、多步骤规划等核心优势,附RTX 3090等硬件配置推荐。

深度评测Qwen3 27B开源模型的推理能力与过度思考问题。分析27B参数规模的性能优势、过度思考的原因与代价,并提供关闭思考模式、分场景配置等实用优化建议。

一条推文引发热议:DeepSeek是否已落后于Anthropic、OpenAI、月之暗面等对手?本文深度分析大模型竞赛格局变化,解读DeepSeek现状与各家AI公司的竞争态势。

千问3.8 27B模型本地部署实测,4bit量化塞进24GB显卡,SGLang推理框架避坑指南,编程、长程任务、剧本拆解全面测试,SWE-bench Pro分数超越Claude Opus,个人可用的本地长程编程模型首次成为现实。

Z.ai发布GLM-5.3大模型,通过大规模后训练扩展在同一底座上实现编程能力跃迁,在智能体编程任务上达到开源SOTA水平,并在漏洞发现与网络防御领域展现涌现能力。深度解析其技术路线与行业意义。

系统梳理强化学习从Q-learning到PPO算法的完整演进路径,以超级马里奥为实战案例,涵盖价值方法、策略梯度与近端策略优化原理,附开源代码与人机对战交互体验。

深度解析GLM-5.3模型的前沿编码能力与涌现网络安全能力,探讨其在软件工程、漏洞发现、安全审计等领域的应用潜力,以及社区对安全治理与滥用风险的讨论。

中国大模型集体登顶OpenRouter周使用量排行榜,DeepSeek、Qwen、Kimi等开源模型凭借极致性价比和技术突破赢得全球开发者青睐,深度解析霸榜背后的原因与行业启示。

Soup CLI是一款开源命令行工具,通过逐层流式加载技术,让仅有4GB显存的笔记本显卡也能微调Llama-3.1-8B等80亿参数大模型。本文详解其技术原理、实测数据与使用方法。

DeepSeek V4 Flash在Ollama Cloud上频繁出现推理死循环(Doom Loop),模型无法正确调用工具并陷入重复输出。本文分析死循环成因,探讨思考块与工具调用的冲突机制,并提供实用的检测与规避方案。

深入解析AI大模型领域六大核心议题:开源与闭源模型之争、推理吞吐量与精度权衡、基准测试刷榜问题、蒸馏与强化学习路径、奖励黑客防御策略,以及动态量化技术如何通过软件优化释放硬件潜力。

系统梳理强化学习入门路径,涵盖Sutton&Barto经典教材、David Silver课程、OpenAI Spinning Up等核心资源推荐,帮助有深度学习基础的学习者从RL基础理论进阶到RLHF实践。

Unsloth正式支持AMD GPU平台,覆盖RDNA 3-4、Strix Halo及MI300等全线硬件,在500+模型上实现2倍训练加速和70%显存节省,支持强化学习、vLLM权重共享,兼容Windows/Linux/WSL三大系统。