共 12 篇相关文章

TimeThink 是一个用于激发时序大模型组合式推理能力的合成框架,通过确定性生成可验证的问答数据与 RLVR 训练策略,仅用合成数据即在真实基准上超越强基线,为医疗等高风险场景的可解释时序推理提供新思路。

arXiv 新论文提出广义智能体迭代(GAI)框架,将经典迭代策略改进(GPI)与递归自我改进(RSI)统一为同一学习范式,用两个关键维度区分系统类型,为分析和设计自我改进 AI 提供形式化基础。

Fireworks Lab 与 Genspark 合作开发强化学习算法,在前沿级基础设施上运行 100+ 实验,通过轨迹审查捕捉模型刷分行为。本文解析 RL 奖励工程与反 reward hacking 的工程实践。
教程攻略详解量化交易系统的多轮迭代过程,涵盖多用户隔离、审计日志、策略分析、交易经验系统、AI Agent自动决策及LLM网关设计,展示如何将交易系统从玩具推向生产级。
前沿研究深度解析Cursor如何在Fireworks上训练Composer 2模型,涵盖异步流水线架构、MoE模型数值精度挑战、Router Replay技术、全球分布式GPU集群协同等核心技术方案,揭示AI编程工具从应用公司迈向基础模型公司的关键路径。
前沿研究深度解析Cursor如何通过分布式强化学习训练Composer 2模型,涵盖异步流水线设计、MoE数值对齐、全球权重同步、在线离线RL协同等核心技术细节,揭示AI编程工具从应用到基础模型的转型路径。
行业洞察Cursor自研Composer 2.5模型通过大规模强化学习后训练,以1/10成本实现与Claude Opus 4.7、GPT 5.5比肩的编码能力。本文深度解析其文本反馈强化学习、合成数据生成等核心技术创新及Benchmark实测数据。
行业洞察Cursor发布Composer 2.5,基于开源模型Kimi K2.5实现与Claude 4.7 Opus持平的编程能力,成本仅为十分之一。深度解析三大技术突破、AI自主学会逆向工程的安全隐患,以及与SpaceX AI百万H100算力合作的战略布局。
深度解读深度解析DeepSeek V3.2与V3.2 Special两款新模型,详解DSA稀疏注意力机制如何加速长文本处理、强化学习计算量达预训练10%、1800种环境的Agent任务合成流水线,附实测体验与GPT-5、Gemini 3.0 Pro对比。
深度解读阿里开源推理模型QwQ-32B仅用32B参数,在多项基准测试中媲美甚至超越DeepSeek R1满血版(671B)。本文深度解析其两阶段强化学习训练策略、性能对比数据,以及强化学习带来的能力涌现现象,揭示小参数模型以小博大的核心秘密。
深度解读深入解析强化学习(RL)、自我博弈(Self-Play)和验证机如何协同驱动大语言模型推理能力进化,帮助AI从模仿人类逻辑的SFT阶段跃迁到具备自主深度推理的System 2思维模式。
科技前沿Google DeepMind宣布与CCP Games合作,围绕EVE Online展开AI研究。这款拥有复杂经济系统和万人同服的太空沙盒游戏,将成为多智能体系统和强化学习的全新试验场,研究成果或将超越游戏领域。