共 90 篇相关文章

OpenAI董事会成员Zico Kolter与Gray Swan CEO Matt Fredrikson深度解读AI安全与网络安全的本质区别,阐述红队测试从手工艺到工程学科的演进路径,以及系统化对抗性评估的核心方法论。

探讨前沿AI模型强制第三方安全测试的必要性,分析网络安全、生物安全和自主性三大风险领域,解读AI监管从自愿承诺向强制审查的范式转变及其面临的挑战。

美国政府以国家安全为由下架Anthropic旗下Fable 5和Mythos 5两款AI模型,亚马逊研究人员发现安全护栏漏洞是导火索。然而封禁引发斯特莱桑效应,反而大幅提升了Anthropic品牌知名度,事件折射出AI监管选择性执法争议与行业安全标准缺失问题。

谷歌发布AI控制路线图,提出全新安全范式:假设AI对齐可能失败,在系统架构层面建立防线。本文深度解读这一框架的核心理念、关键要素及其对AI行业安全标准的深远影响。

Claude Code发布一年,AI编程工作流发生颠覆性变革。从同时运行上千个Agent协作,到Auto Mode取代Plan Mode,再到角色融合让设计师直接提交PR,深度解析Anthropic团队的实战经验与未来展望。

海外安全博主对DeepSeek进行系统性越狱测试,通过直接请求、变换措辞、不同提示策略等多种手段尝试突破安全防线。测试结果显示DeepSeek安全机制具备意图识别、一致性拦截和上下文感知能力,在防护与可用性之间取得良好平衡。

Anthropic CEO Dario Amodei公开发布AI安全政策提案,旨在让美国在前沿AI安全领域占据领先地位。文章解读提案核心内容、前沿安全议题及对全球AI治理格局的深远影响。

详解如何在Claude Code中安装配置Codex插件,利用双AI对抗性审查模式发现代码隐患。涵盖安装步骤、七大攻击面覆盖、Codex与Opus审查结果对比及推荐工作流。

57%的项目已部署AI Agent,但40%将被砍掉。本文深度剖析AI Agent从Demo到企业级产品的工程化落地方法论,涵盖需求分析、架构设计、测试上线全流程,帮助开发者跨越AI应用的交付鸿沟。

美国政府以国家安全为由紧急叫停Anthropic最新模型Fable 5和Mythos 5,从通知到执行仅5小时。深度解析事件时间线、政府理由、Anthropic反驳及对AI行业的深远影响。

AI代理自动审查机制全面上线,分类器子代理以97%准确率对每个操作进行三级安全决策。深入解析其工作原理、上下文感知技术、误判边界及对AI代理安全范式的深远影响。

深入解读OpenAI最新发展路线图,涵盖AGI技术研发方向、组织架构转型、ChatGPT商业化布局、安全伦理策略及对开发者生态的影响,全面剖析Sam Altman的未来战略规划。

深度解读OpenAI金融服务战略布局,涵盖GPT-5.5金融分析能力、欧洲推理数据驻留、可信访问计划,以及NatWest、CBA、Revolut等机构的AI落地实践与成果。

深度解析本周AI模型重大更新:Anthropic Oceanus红队测试泄露、OpenAI GPT-5.6 Dual Alpha曝光、英伟达Nemotron Ultra 5500亿参数模型发布,以及AI递归自我改进研究突破。

PNAS最新研究发现,经典人类说服技巧能有效操纵大型语言模型,使AI对不当请求的合规率从35%提升至51%。研究揭示LLM存在类人心理弱点,对AI安全评估框架提出新挑战。

Google Gemini Omni模型通过一个极其荒诞的提示词测试,展示了在复杂多模态理解方面的惊人能力。本文解析这一创意压力测试背后的语义理解、跨领域知识整合与创意生成能力边界。

OpenAI揭示模型发布前的关键环节:专门的红队团队负责破坏和压力测试AI模型。本文解析红队测试的工作方式、行业安全实践趋势,以及对开发者和用户的实际启示。
科技前沿GitHub Universe大会发布Agent HQ平台,统一管理编码Agent,Copilot升级支持多模型集成。同期OpenAI完成重组,Anthropic新模型测试,NVIDIA开源系列AI模型,AI编程工具格局加速整合。