共 15 篇相关文章
LLM安全基准测试:现状、挑战与实践指南
大语言模型安全评估为何难以建立统一基准?本文深入解析LLM安全基准测试的核心挑战,涵盖越狱防御、提示注入、红队测试等关键维度,为开发者提供切实可行的安全评估策略。

独立研究揭示LLM越狱并非欺骗或规则破解,而是上下文诱导的激活漂移导致模型内部状态被重塑。通过开源模型实验验证,RLHF对齐可能只是脆弱的上下文依赖状态,真正漏洞深植于Transformer架构之中。

一个反常规的AI项目让所有用户共享同一份记忆,引发隐私安全与集体智慧的激烈讨论。本文深入分析共享记忆AI的设计理念、技术风险与未来可能的混合架构方向。

深度解析Reddit上一则伪装成LLM鲁棒性研究的提示注入攻击帖子,揭示其社会工程学手法,并提供从业者应对间接提示注入的安全防护建议。

深入解析Cloudflare Wallets如何为AI代理提供可编程钱包能力,通过规则驱动的支付授权机制解决代理式互联网中的信任与效率难题,探讨其技术架构、应用场景及行业影响。

深入解析企业大语言模型(LLM)治理难题,对比Portkey、Orq.ai、LangSmith、Azure、AWS Bedrock等主流工具的真实能力边界,揭示路由控制与组织治理的本质分野,提供可落地的企业LLM治理策略建议。

深度剖析一种针对Gemini大模型的越狱技术——观察者与共谋技术,分析其利用上下文语境操纵和推理链不一致性绕过AI安全对齐机制的核心原理,以及对AI安全防御的启示。

从零学习LangChain框架,掌握Python环境配置、API Key安全管理、ChatModel调用与token机制,快速构建属于你自己的AI大模型应用。

Sysdig捕获首个完全自主的LLM攻击智能体JadePuffer:利用Langflow漏洞入侵服务器,31秒完成自适应攻击,自动横向渗透、加密数据库并留下勒索信。本文深度复盘攻击链,解析AI智能体武器化的核心威胁与防御思路。

跨站提示注入正成为Web智能体最棘手的安全威胁。本文深度解析Prismata项目的"限制式防御"思路——通过上下文隔离、权限边界与可信度分级,将提示注入的破坏范围控制在沙箱之内,为AI智能体安全防护提供新范式。

AI监管法规加速落地,合规瓶颈已从"存文档"转向"生成可信对抗测试证据"。本文深度解析TRAIGA、NIST RMF、ISO 42001等框架的证据要求,提供构建审计级持续红队测试体系的核心方法论。

Hacker News上一则关于Anthropic对用户执行"提示注入"的帖子引发AI社区热议。本文深度解析提示注入的技术本质、系统提示的行业惯例,以及AI厂商在产品控制与用户知情权之间如何寻求平衡。
AI热点风向标·06月25日早间版:AI Agent替代人力创业
06月25日早间版 AI热门话题深度讨论,5个热点
行业洞察GitHub对Bug Bounty计划进行重大更新,提升漏洞报告质量标准、明确共享责任边界并调整低风险漏洞奖励机制。本文深度解读三大核心变化及其对安全研究社区的影响。
深度解读深度解读伯克利CS294-196课程智能体AI安全讲座,涵盖提示注入攻击、间接注入、AgentPoison后门攻击等核心威胁,以及纵深防御、最小权限、运行时护栏等防御策略,为AI安全从业者提供系统性实战框架。