共 273 篇相关文章

Z.ai发布GLM-5.3大模型,通过大规模后训练扩展在同一底座上实现编程能力跃迁,在智能体编程任务上达到开源SOTA水平,并在漏洞发现与网络防御领域展现涌现能力。深度解析其技术路线与行业意义。

通过国际象棋实验系统研究预训练、SFT与强化学习三阶段的算力分配规律,揭示预训练算力决定下游天花板、RL主要提升pass@1可靠性而非探索广度等核心发现,为大模型后训练策略提供量化参考。

详解如何在8GB显存的消费级GPU上完成LLM后训练,涵盖SFT监督微调、DPO直接偏好优化、GRPO组相对策略优化三种方法,借助LoRA量化等技术实现低资源大模型微调。

RAM(Reinforce Adjoint Matching)通过丢弃路径成本、结合ODE采样与去相关训练目标,将扩散模型强化学习后训练效率提升50倍。本文深入解析RAM核心原理、训练流程及与Flow-GRPO的对比实验。

Fireworks AI训练平台新增NVIDIA Nemotron 3 Ultra后训练支持,提供SFT、DPO、LoRA及全参数微调,实现训练即部署的无缝工作流,助力开发者快速定制开放权重大模型。
深度解读深入解析AI大语言模型训练的三个关键阶段:预训练学语言、后训练学做事、对齐学分寸。用新员工培养的类比,帮你理解ChatGPT等AI的能力边界,搞懂AI幻觉的根本原因。

一文梳理人工智能、机器学习、深度学习、大模型、生成式AI之间的关系与发展脉络。从深蓝到ChatGPT,理解Transformer架构如何催生大语言模型,以及普通人如何切入AI应用开发。

从大语言模型LLM到AI Workflow再到AI Agent,三层递进讲清什么是AI智能体。用真实案例解释RAG、ReAct框架等核心概念,帮你理解AI Agent与工作流的本质区别。

Devin集成GPT-5.6 Sol编程优化模型,同步推出70%大幅降价。深入分析这次升级对开发者的实际影响,解读AI编程工具的成本变革与能力跃迁趋势。

研究者指出强化学习(RLHF)会让AI产生"分裂人格":模型在常见场景中表现完美,却在边缘场景中严重失控。本文深入分析这一对齐缺陷的成因、风险及应对路径。

Gemini 3.7 Flash仅隔三周更新,定价降至前代一半,主打Agent长任务能力提升176%。本文深度分析谷歌如何用降价策略和Agent定位应对DeepSeek、Claude竞争,以及Pro线困境下的产品布局逻辑。

Sam Altman宣布OpenAI暂停强化学习训练,称模型能力增长极其迅速已超越安全对齐进度。本文深度解读这一决定背后的技术原因、行业影响及AI安全治理启示。

深入解析Vibe Coding(氛围编程)的学习路径,涵盖Cursor、Claude Code、Codex等核心工具,从基础编程思维到项目实战,帮助零基础学习者系统掌握AI辅助编程技能。

一则Reddit热门漫画折射出中国开源大模型的全球影响力。从DeepSeek、Qwen到GLM,中国AI模型凭借开源策略和快速迭代,正在改变全球开发者的选择格局,本文深度解析这一趋势背后的行业信号。

AI视频生成中角色动作过于活跃、不自然?本文从提示词工程、负面提示词、运动强度参数和参考视频选择四个维度,提供实用解决方案,帮助创作者生成更自然流畅的人物动作。

详解Qwen3-27B本地部署全流程,包括模型下载、llama.cpp配置、量化版本选择。实测编码能力、多模态视觉识别与Agent工作流表现,8GB显存即可运行的顶级开源大模型。

通过5道精心设计的语言陷阱题对比Gemini 3.7 Flash与Claude Sonnet 5的表现,深入分析AI模型过度模式匹配、批判性思维缺失等核心问题,揭示大语言模型在抗诱导能力上的本质差异。

当AI模型迭代速度远超传统技术,2023年的ChatGPT和GPT-4会像老游戏机一样成为怀旧符号吗?探讨老旧LLM的史料价值、情感意义,以及开源模型在AI历史保存中的关键作用。