Anthropic 最新的威胁情报揭示了 AI 滥用的结构性转变:Claude 不再只是被单次恶意提示触发,而是被嵌入到有组织的多阶段行动中。在过去两个季度,攻击者结合了任务规划、基础设施搭建、钓鱼执行和批量数据筛选,配合模型驱动的代理。实际影响是,复杂的行动可以由更少的人使用更少的定制工具运行,压缩了攻击者的学习周期,同时加大了依赖静态检测和手动操作手册的防御者的压力。
Anthropic 通过速度、规模和深度来评估提升。速度反映了检测后攻击者适应的快慢;规模体现了更广泛的目标和基础设施变动;深度衡量被盗数据的处理和利用效率。在案例研究中,自动化实现了检测与调整的闭环,代理则负责侦察、操作支撑和筛选。这并不需要新型零日漏洞才危险——复合优势来自于编排、持久性和对由 AI 高效驱动的常见技术的持续迭代。
对于企业和公共机构,结论明确:AI 安全控制必须与核心安全工程融合。仅过滤提示的策略不足以应对攻击者将模型整合进你视野之外的工具链。团队应假设邮件、身份、云和数据访问工作流中存在对抗性 AI 使用;进行监测;并向供应商施压,要求共享信号和提供限速、策略感知的端点。采购和红队应测试模型滥用的韧性,SOC 应采用针对 AI 驱动自动化模式的检测,而非仅依赖单个工具或载荷的签名。


