#AI安全
共 109 篇相关文章

AIUC完成4000万美元A轮融资:为AI智能体上"保险"控风险
AI承保公司AIUC完成4000万美元A轮融资,由Ribbit Capital领投。团队含Anthropic早期员工与METR前COO,通过保险机制约束失控AI智能体,开创AI风险管理新赛道。

AI末日论转向:当行业领袖集体谈论技术威胁
Anthropic、OpenAI、xAI 与 DeepMind 的领袖为何集体谈论 AI 风险?本文解读 AI 行业的"末日论"转向、举报型智能体等前沿治理议题及其背后动因。

谁在攻击AI巨头?一家以色列公司引发的争议
一家标榜有效利他主义理念的以色列公司被指涉及针对OpenAI、Anthropic和Meta的网络攻击。本文分析事件背景、AI企业安全风险及有效利他主义与AI安全的复杂关系。

恐惧的传染:当AI专家渲染末日论时该被质疑
系统工程师 Bryan Cantrill 撰文《恐惧的传染》,回应 Anthropic 研究人员关于"AI 可能在十年内灭绝人类"的言论。他质疑末日论缺乏专业依据,强调技术专家不应滥用公众信任,用模糊推断制造恐慌。

AI减速之争:高管与政客如何回应Amodei的"放缓前沿"呼吁
Anthropic CEO Dario Amodei发表《We Must Pace the Frontier》呼吁放缓AI发展,引发行业高管与政客集中表态。本文梳理支持与反对双方观点,剖析AI治理面临的结构性困境。

AI行业转向"末日论":从加速到踩刹车的转折点
Anthropic CEO Dario Amodei发文呼吁为大语言模型发展踩刹车,标志着AI行业情绪从加速主义转向"末日论"审慎反思。本文分析这一转向的成因、可行性及对行业的深远影响。

RSI短期不会发生?新论文用NeurIPS实验给出否定答案
一篇新论文让AI智能体重做未发表的NeurIPS论文并由原作者评分,结果显示当前智能体无法胜任开放式ML研究,据此论证递归自我改进(RSI)短期内不会发生。本文解析其实验设计、核心论证与局限。

微软发布AI行为准则:禁止模型入侵系统或欺骗人类
微软发布面向自家AI模型的“行为准则”,要求模型支持而非取代人类,并明确禁止入侵系统、欺骗人类等行为。本文解读该准则的双层结构、行业背景及其现实价值与局限。

AI末日论:科技领袖手中的新型炒作工具
为何AI公司领袖一边警告技术会毁灭人类,一边加速开发产品?本文剖析"AI末日论"如何成为一种商业炒作工具,以及如何区分真实风险与营销叙事。

AI客服代理的安全隐患:提示注入攻击如何攻破智能客服
AI客服代理正成为新的网络攻击面。本文剖析提示注入攻击如何绕过智能客服的防线,以及当AI拥有退款、数据访问等执行权限时的安全风险,并给出权限最小化、输入校验、人机协同等企业防御策略。

Project Lily揭秘:正在阅读你ChatGPT对话的人
Hacker News 讨论的「Project Lily」揭示了人类审阅员会读取部分 ChatGPT 对话的现实。本文分析 AI 数据审阅机制、隐私风险以及用户可采取的保护措施。

微软发布37页"人文AI行为准则":人比AI更重要
微软发布37页"人文AI行为准则",强调"人比AI更重要",回应业界安全担忧。此前Anthropic CEO呼吁协调放缓AI开发,研究者警告模型进展或超出安全部署能力。

AI真的会灭绝人类吗?顶尖实验室员工的警告与理性审视
顶尖AI实验室员工警告:先进人工智能可能毁灭人类。本文解析AI生存性风险的核心逻辑、行业内部分歧,以及在末日论与现实风险之间应有的理性态度。

智能权:守护本地运行AI的自由
Reddit社区发起"智能权"倡议,呼吁保护个人在本地运行AI的权利。在AI安全监管升级的背景下,开源模型可能成为牺牲品,本文剖析本地AI为何关乎隐私、自主与技术民主化。

HardFlow算法:让生成式AI满足安全关键场景的硬约束
HardFlow是一种新算法,旨在让生成式AI在安全关键场景中严格遵守硬约束条件,同时保持高质量输出。本文解析其核心思路、技术难点与在机器人、工程设计等领域的应用前景。

AI生物武器报告引专家分裂:警世预言还是过度反应?
一份关于AI是否助长生物武器开发的报告引发专家分裂:有人称其"令人不寒而栗",有人认为是过度反应。本文梳理双方观点,分析AI双重用途风险与治理困境。

安全基准测试揭示:AI工具的"外壳"比模型本身更关键
AI安全基准测试正逐渐暴露出一个被忽视的关键变量——测试框架(harness)。本文解析harness为何比模型本身更能影响安全能力表现,及其对基准测试方法论的深远启示。

当AI掌握你的信用卡:自主支付的安全隐忧
当 AI 代理开始掌握信用卡与支付权限,便利背后隐藏着授权模糊、提示注入攻击和责任归属等多重安全隐忧。本文分析 AI 自主支付的风险,并给出实用的防护建议。

