共 97 篇相关文章

PhysMent 是一个基于 MuJoCo 仿真器的交互式基准测试,通过施力、观测、推进时间等工具调用评测大语言模型的物理推理能力。研究发现模型在定性任务表现尚可,但定量多步实验任务准确率骤降,瓶颈在于流程性工具使用而非物理知识本身。

TimeThink 是一个用于激发时序大模型组合式推理能力的合成框架,通过确定性生成可验证的问答数据与 RLVR 训练策略,仅用合成数据即在真实基准上超越强基线,为医疗等高风险场景的可解释时序推理提供新思路。

arXiv最新研究通过Vibe Patenting测试平台,评估LLM评审员在专利撰写这类专业任务中的可靠性。研究发现评审反馈能让低成本智能体逼近高端模型,但AI评审与人类专利律师的一致性强烈依赖具体指标。

UkisAI 开源 Swift-Qwen3.8-27B,通过定位并惩罚"过度思考"token,配合在线策略蒸馏,实现思考token削减58%、推理速度提升1.95倍,准确率损失控制在1%以内。本文详解其技术路径与基准测试数据。

开发者从苹果代码中发现,Siri背后的AI模型可能支持切换,未来或接入Claude、ChatGPT等第三方大模型。本文解析这一发现的技术含义、苹果的AI战略考量及其对行业的影响。

arXiv 最新论文提出上下文增强知识图谱推理框架,通过"先修复后强化"策略提升大模型多跳问答能力。在胃轻瘫与糖尿病知识图谱上,基于 Qwen3-14B 验证 CG 监督优于纯 KG 监督,修复后单跳准确率达 100%。

arXiv新论文用率失真理论揭示大语言模型事实幻觉的第二个来源:有限记忆下的压缩失真。文章解析覆盖—压缩模型、误差下界公式及其对检索增强、弃答等实践的启示。

arXiv新论文提出弱监督+LLM标注精炼框架,从强迫流离失所与FCV人道主义文档中自动提取数据集引用。在1706段黄金基准上达到88.2%段落级准确率,为标注数据稀缺场景提供可复制方案。

arXiv 新论文 R2VC 提出模块化事实核查架构,通过检索、推理、验证、校准四环节,在 FEVER 基准上让 8B 模型准确率提升 13.74%,同时显著改善置信度可靠性与可弃权机制。

Hacker News 热议:AI模型Claude Fable 5.1据称破解了有370年历史的Cyphral Distich密码。本文梳理事件并分析AI在古密码破译中的能力、局限与需谨慎看待的关键点。

如何在不额外消耗大量显存的前提下检测本地大模型的幻觉?本文基于1.5B到120B模型的实测经验,解析置信度、自洽性、轻量校验等低开销检测思路,为本地LLM部署者提供实用参考。

TeleChat 是一个开源 Telegram AI 聊天机器人,集成 GPT-5、DALL·E、Groq、Gemini 2.5 与 Claude 4.1 API,支持联网搜索,可在 Zeabur、fly.io、Replit 部署,已获 1242 Star。

Hacker News热议命题《LLMs are real, AI is fake》引发思辨:为何说大语言模型真实可验证,而'人工智能'更像营销话术?本文解析术语精确性的重要性及其对从业者的启示。
OpenAI 官方 GPT-5.6 提示词指南深度解读:从手动挡到自动挡的范…
深度解读 OpenAI 官方 GPT-5.6 Sol 提示词指南:精简优先、结果导向、自主权边界、工具路由、推理强度调节等核心变化,帮助开发者快速适配新一代模型。
深度解读深入解析AI幻觉的三大根因:训练目标缺陷、曝光偏差与概率生成机制,详解事实性幻觉与忠实性幻觉的分类体系,并提供RAG检索增强、评估层验证等务实应对框架。
教程攻略详细图文教程教你通过VMware虚拟机、Ubuntu系统、宝塔面板和Docker,从零完成Dify本地部署。涵盖环境准备、常见报错解决方案及部署后的进阶学习路线,适合新手快速上手。
深度解读从零开始理解AI智能体(AI Agent)的核心概念,详解感知、决策、执行三大能力,对比传统程序与智能体的本质区别,深入剖析LLM、工具调用、记忆系统和RAG四大技术组件及完整工作流程。
产品体验Meta发布Llama 3.3 70B开源模型,仅70B参数却媲美405B性能。经过13道逻辑推理、数学计算、编程题全面测试,通过12题表现惊艳,重塑开源模型格局。