共 3 篇相关文章

跨站提示注入正成为Web智能体最棘手的安全威胁。本文深度解析Prismata项目的"限制式防御"思路——通过上下文隔离、权限边界与可信度分级,将提示注入的破坏范围控制在沙箱之内,为AI智能体安全防护提供新范式。

OSWorld 2.0基准测试发布,包含108个长流程真实计算机任务,人类完成中位时间1.6小时。测试显示Claude Opus最高完成率仅20.6%,AI在长流程状态保持、错误自检方面存在严重缺陷,短任务高准确率的泡沫被彻底戳破。

AI智能体因缺乏持久记忆而反复犯错?上下文图谱(Context Graphs)通过图结构存储决策、因果关系与执行结果,让智能体在不修改模型权重的前提下积累经验、复用历史决策,探索智能体记忆机制的新路径。