共 5 篇相关文章
科技前沿Anthropic正式公开HackerOne漏洞赏金计划,任何安全研究者均可提交Claude模型漏洞报告并获得奖励。本文解读这一转变对AI安全行业的深远影响,以及白帽黑客如何参与AI安全防护。

OpenAI被曝悄然解散灾难性风险团队,继超级对齐团队之后再次引发AI安全争议。深度解析商业化竞速与安全责任的结构性矛盾,探讨AI行业自律与外部监管的治理困境。

当AI公司成长为掌握社会基础设施的超级实体时,公众信任将如何演变?从盖茨疫苗阴谋论到Anthropic的安全叙事,深度解析AI行业面临的信任危机与阴谋论风险,探讨透明度与治理的破局之道。
博科圣地滥用前沿AI:恐怖组织的技术武器化与治理困境
尼日利亚恐怖组织博科圣地正系统性利用AI工具进行宣传自动化、多语言招募与运营协调。本文深度解析恐怖组织滥用生成式AI的具体方式、技术社区争论焦点,以及开源模型带来的AI治理困境与攻防军备竞赛。

海外安全博主对DeepSeek进行系统性越狱测试,通过直接请求、变换措辞、不同提示策略等多种手段尝试突破安全防线。测试结果显示DeepSeek安全机制具备意图识别、一致性拦截和上下文感知能力,在防护与可用性之间取得良好平衡。