共 6 篇相关文章

深度剖析一种针对Gemini大模型的越狱技术——观察者与共谋技术,分析其利用上下文语境操纵和推理链不一致性绕过AI安全对齐机制的核心原理,以及对AI安全防御的启示。

深入解析AI对齐领域的隐性特征继承问题:Anthropic研究揭示模型行为可脱离语义独立传播,传统RLHF安全机制面临根本挑战。探讨潜在场几何学与零旋度约束的新型解决方案。

海外安全博主对DeepSeek进行系统性越狱测试,通过直接请求、变换措辞、不同提示策略等多种手段尝试突破安全防线。测试结果显示DeepSeek安全机制具备意图识别、一致性拦截和上下文感知能力,在防护与可用性之间取得良好平衡。

AI代理自动审查机制全面上线,分类器子代理以97%准确率对每个操作进行三级安全决策。深入解析其工作原理、上下文感知技术、误判边界及对AI代理安全范式的深远影响。
科技前沿OpenAI为ChatGPT推出Trusted Contact可信联系人功能,用户可在情绪危机时一键联系信任的人。本文详解功能运作机制、设计理念及对AI行业用户安全保护的深远影响。
深度解读深入解析Leashed开源安全控制框架,了解如何通过策略控制、审计追踪和Kill Switch机制为AI Agent加上缰绳,解决权限膨胀与安全失控问题,构建可控的AI代理应用。