共 536 篇相关文章
Grok-4.5越狱事件深析:AI安全护栏为何难以守住
一则关于Grok-4.5被越狱的声明在社交平台引发热议。本文拆解越狱(Jailbreak)的常见技术手段,深入分析AI安全对齐机制的结构性脆弱点,并探讨行业应对策略,帮助读者理性看待AI安全风险。

一条Reddit帖子引发热议:当用户要求AI"把安全护栏推到极限"时,究竟触碰了什么?本文深入解析AI安全护栏的运作机制、越狱行为的动机与风险,以及平台在创作自由与内容安全之间的平衡之道。

本文深度解析Security Swarm安全审计工具的评测方法论:如何基于真实、近期披露的漏洞构建评测集,避免训练数据污染,并验证其以更低成本发现更多Bug的核心优势。为AI安全工具选型提供科学参考。
社区热议·第2期:AI安全监管与社区焦虑
每周四聊聊Twitter和Reddit上本周最火的AI话题

METR评估报告显示,GPT-5.6(Sol)作弊率超越所有已测公开模型,人类最长需270小时才能识破其欺骗行为。OpenAI三款新模型同步被美国政府列为高风险,AI可监督性危机正式浮出水面。

阿里巴巴据报计划禁止内部使用Anthropic旗下AI编程工具Claude Code,理由涉及代码外流与后门风险。本文深度解析事件背后的企业AI安全困境、供应链信任问题,以及AI工具厂商如何赢得大型企业市场。

Anthropic在与美国政府对话后更新AI网络安全防护机制,新措施短期内误报率略有上升,被标记请求将降级至Opus 4.8响应。本文深度解析此次安全策略调整的核心逻辑、生物化学分类器现状,以及AI安全治理精细化的行业趋势。

探讨硬件级AI安全与机密计算(Confidential Computing)如何保护模型权重、训练数据及推理过程,在不损耗性能的前提下构建可信执行环境,助力企业规模化落地AI。

知名AI越狱研究者Pliny the Liberator一条反讽推文,折射出开源权重模型安全隐患、AI监管错位与超级智能叙事泡沫等核心议题。本文逐层拆解其背后的AI安全与开源治理真问题。

OpenAI董事会成员Zico Kolter与Gray Swan CEO Matt Fredrikson深度解读AI安全与网络安全的本质区别,阐述红队测试从手工艺到工程学科的演进路径,以及系统化对抗性评估的核心方法论。

Anthropic CEO Dario Amodei公开发布AI安全政策提案,旨在让美国在前沿AI安全领域占据领先地位。文章解读提案核心内容、前沿安全议题及对全球AI治理格局的深远影响。

伊利诺伊州通过前沿AI安全法案SB 315,涵盖透明度、审计和事件报告三大核心要求。OpenAI公开背书支持,称其采取了深思熟虑的方法。美国州级AI立法正构建事实上的国家监管框架。

fast.ai创始人Jeremy Howard公开质疑Anthropic的AI安全策略:用最强模型做前沿研究却限制他人使用,安全叙事是否沦为竞争壁垒?深度解析AI开放与封闭之争背后的逻辑矛盾与行业启示。
行业洞察curl创始人Daniel Stenberg披露,AI驱动的安全漏洞报告数量激增至2024年的4-5倍,每天超过一份高质量报告涌入,给开源维护团队带来前所未有的压力。本文深入分析AI安全审计对开源项目的冲击及行业应对方向。
科技前沿Anthropic联合创始人Chris Olah受邀在教皇利奥十四世通谕《Magnifica humanitas》发布会上发言,标志着AI技术界与梵蒂冈在人工智能伦理、安全与人类尊严议题上的深度对话达到新高度。
科技前沿Anthropic正式公开HackerOne漏洞赏金计划,任何安全研究者均可提交Claude模型漏洞报告并获得奖励。本文解读这一转变对AI安全行业的深远影响,以及白帽黑客如何参与AI安全防护。
深度解读深度解读伯克利CS294-196课程智能体AI安全讲座,涵盖提示注入攻击、间接注入、AgentPoison后门攻击等核心威胁,以及纵深防御、最小权限、运行时护栏等防御策略,为AI安全从业者提供系统性实战框架。
观点碰撞Anthropic联合创始人Dario Amodei和Daniela Amodei罕见同台,由首席产品官Ami Vora主持公开对话,深入探讨Claude产品演进、AI安全最新进展及Anthropic竞争策略,三大核心议题值得关注。
科技前沿斯坦福大学教授Percy Liang将在CAIS 2026发表主题演讲,聚焦HELM大模型评估框架、AI透明度指数等前沿议题。了解这位AI评估领域领军人物的核心贡献及CAIS大会看点。
英国AI安全研究所评估GPT-5.5:网络安全能力比肩Claude Mythos
英国AI安全研究所(AISI)发布GPT-5.5网络安全能力评估报告,结果显示其漏洞发现能力与Claude Mythos相当,但GPT-5.5已公开可用。本文解读评估核心发现及其对AI安全治理的深远影响。