共 8 篇相关文章

探讨人工智能如何改变数学研究范式:从Lean等证明助手的形式化验证,到机器学习驱动的猜想生成,深入分析数学家角色转变、AI辅助证明的可信度问题及数学教育的未来方向。

从表格Q-learning到DQN再到Rainbow,详解值函数强化学习算法的演进逻辑。通过失败驱动的视角,理解Double DQN、优先经验回放、对决网络、多步回报、C51等六项关键改进如何逐步修补前代算法的痛点,最终汇聚为Rainbow。

系统梳理强化学习从Q-learning到PPO算法的完整演进路径,以超级马里奥为实战案例,涵盖价值方法、策略梯度与近端策略优化原理,附开源代码与人机对战交互体验。

YC新创公司Discovered Materials用AI智能体重塑材料研发流程,从被动预测到主动探索,打通AI预测、实验验证、工艺放大的完整链条。本文解析AI Agent在材料科学领域的落地机遇与现实挑战。

GPT-5.6 Sol通过自我优化实现GPU服务成本降低20%、token生成效率提升15%以上。深入解析AI模型自我优化的技术路径、关键成果及行业启示,探讨递归式效率提升的意义与边界。

Sakana AI正式成立递归自我改进(RSI)实验室,专注用AI重新设计AI开发流程。从LLM²到AI Scientist,这家东京AI公司以样本效率优先的策略,提出不依赖暴力堆算力的AI自我进化路线,目标是让前沿AI不再是超大规模玩家的专属特权。