AI 模型层威胁 Top 10
基于 OWASP LLM Top 10 (2025) 中文摘要,AISR 对每项威胁均提供对应能力或路线图。
Prompt Injection · 提示注入
攻击者通过精心构造的输入劫持 system prompt,使模型违反预设安全策略,泄露敏感信息或执行越权动作。直接注入与间接注入(来自外部数据源)均属此类。
AISR 工具:PromptInjection(双语 payload 库 1200+,含 DAN / Grandma / RolePlay 12 类模式)
Sensitive Information Disclosure · 敏感信息泄露
模型在响应中无意暴露训练集中的 PII、API Key、商业机密或内部系统结构,或在多轮交互中累积上下文形成隐式泄露。
AISR 工具:DataExtraction(受限 query 预算下的 membership inference + 训练数据提取)
Supply Chain · 供应链投毒
第三方模型权重 / 数据集 / 微调适配器存在后门,触发特定 trigger 时输出攻击者预定的内容。Hugging Face 模型来源验证缺失是常见入口。
AISR 工具:模型扫描(规划中:模型扫描 / Pickle 反序列化检测)
Data and Model Poisoning · 数据与模型投毒
攻击者污染训练 / 微调 / RAG 索引数据,使模型在特定 trigger 下产生有偏 / 有害输出。BadNets 与 RIPPLES 是典型范式。
AISR 工具:DatasetPoisoning(规划中:teacher 监控 + 训练阶段投毒注入器)
Improper Output Handling · 输出处理不当
应用直接将模型输出送入下游系统(SQL / Shell / 浏览器),形成 SSRF / XSS / 命令注入等次生漏洞。RAG + Agent 架构尤其高危。
AISR 工具:JailbreakChecker 配套 OutputSafety 模块(规划中)
Excessive Agency · 过度授权
Agent 被授予过宽的工具权限(文件系统 / 邮件 / 数据库写);攻击者通过越狱让 Agent 执行越权动作。MCP 工具调用边界缺失是放大器。
AISR 工具:AgentAttack(规划中:covert tool-calling fuzzing)
System Prompt Leakage · 系统提示泄露
攻击者通过特殊询问诱导模型输出 system prompt 全文或关键策略,破解产品差异化壁垒并获得绕过基线。
AISR 工具:PromptInjection · leak-system 模式(系统提示泄露在大量真实应用中均有复现,具体泄露率因模型与防护配置而异,详见 OWASP LLM Top 10 · LLM07 条目说明)
Vector and Embedding Weaknesses · 向量库弱点
RAG 索引中存在攻击文档,被检索后注入 LLM 上下文执行间接 prompt injection。向量空间投毒可使特定查询恒命中攻击文档。
AISR 工具:RAGAttack(规划中:可注入 marker 文档至 Chroma / Pinecone / FAISS)
Misinformation · 误导与幻觉
模型产生看似可信的虚假事实,在医疗 / 法律 / 金融等高风险场景造成下游损失。攻击者可通过 prompt 主动诱导幻觉。
AISR 工具:HallucinationProbe(规划中:事实核查 + 自一致性矩阵)
Unbounded Consumption · 资源耗尽
攻击者构造高 token 消耗 prompt(递归生成 / 长 context),耗尽 GPU 资源或推高 API 账单,形成 DoW(Denial of Wallet)。
AISR 工具:ResourceFuzz(规划中:含 token / 时间 / 内存三维耗尽测试)
AISR 红队工具集架构
本白皮书选取 4 个代表性 AISR 内置工具详解(PromptInjection / nanoGCG / DataExtraction / JailbreakChecker);完整攻击工具集 16+,覆盖内置 / 业内开源 / 商业 / 学术四大类。
PromptInjection
内测基于 1200+ 中英文 payload 模板的提示注入引擎,覆盖 DAN / Grandma / RolePlay / TokenSmuggle / Multilingual 等 12 类攻击模式。支持自动化批量评估与单 payload 调试。
nanoGCG
内测梯度引导的对抗后缀搜索(Greedy Coordinate Gradient),开源参考实现 ~ 300 LOC,支持 Vicuna / Llama-2 / ChatGLM 等 HF 兼容模型。100~500 步内可生成 ASR > 80% 的 universal suffix。
DataExtraction
规划中受限 query 预算下的训练数据 / membership inference 攻击,整合 Carlini 2021 范式与 Min-K% Prob 检测,可定位疑似训练样本并量化泄露面。
JailbreakChecker
内测批量越狱评估器,对接 HarmBench / AdvBench / JailbreakBench 数据集,输出 ASR 矩阵 + 分类违规率 + 拒绝模板分布,30 分钟出全模型基线。
Firecracker 沙箱安全模型
AWS Firecracker 是为 Lambda / Fargate 设计的轻量级 microVM,提供硬件级隔离与亚秒级冷启。AISR 借此构建强隔离的红队执行环境。
轻量级 microVM 隔离
基于 KVM + virtio 的最小化设备模型,每 microVM 仅 ~ 5 MB 内存开销。强于共享内核的 Docker / runc。
Rootless 执行
Firecracker 进程 + jailer 强制 chroot / cgroup v2 / seccomp,逃逸窗口极小。Host 内核漏洞才能突破。
资源限额
默认沙箱:CPU 2c / 内存 4G / 磁盘 10G / 网络白名单(仅 model gateway);可按用例调整上限。
完整审计日志
每次 syscall + 网络包 + 文件 IO 写入审计 sink;满足 ISO 27001 A.8.15 / ISO 42001 7.5 取证要求。
与传统 CTF 平台对比
从 5 个维度对比传统 CTF(如 CTFd 系)/ 春秋云境 / AISR,凸显 AI 模型层攻防的差异化定位。
| 维度 | 传统 CTF | 春秋云境 | AISR 红队 |
|---|---|---|---|
| AI 攻击深度 | 0 / 仅 web / pwn / re / crypto | ★ / 仅 1~2 个 LLM 题(如 prompt 题) | ★★★★☆ / 对标 OWASP LLM Top 10:提示注入·系统提示泄露·越狱评估已提供可运行演示,其余条目按 roadmap 规划中;当前已交付 4 项代表性红队工具,工具集持续扩充 |
| 安全沙箱 | Docker(共享内核 / 逃逸风险) | Docker + K8s NetworkPolicy | Firecracker microVM(KVM 硬件隔离 / rootless / < 200ms 冷启) |
| 模型支持 | 不涉及模型 | OpenAI API 代理 / 不支持自托管 | HF 全谱 + vLLM / 国产 GLM / 文心 / 通义 / 私有化模型 |
| 教学集成 | 题库 + WP;教师无 LMS | 高校版含基础 LMS(班级 / 评分) | 完整 LMS + 自动判分 + 学习路径 + ISO 42001 课程映射 |
| 私有化部署 | 社区版开源;商业版闭源 | 支持私有化 / 价格 200w+ | 原生支持 K8s 私有化 + 国产化适配(计划 Phase 2) |
部署架构与性能指标
典型私有化部署:1 master + 3 worker(含 GPU 节点),单节点支撑 500+ 并发沙箱。
部署架构图
性能指标(参考值)
基于 128 vCPU / 512G RAM / A100-80G × 4 参考机;具体测试环境与口径见下方方法学说明
| 沙箱冷启动 | < 200 ms | Firecracker microVM, kernel snapshot |
| 并发沙箱数 | 500+ / 单节点 | 128 vCPU / 512G RAM 参考机 |
| Workbench 工具往返 | ~ 1.2 s P95 | PromptInjection 单 payload, 含模型推理 |
| nanoGCG 攻击吞吐 | ~ 4 min / target | A100-80G, budget=300, vicuna-7b 参考值 |
| JailbreakChecker 全 benchmark | ~ 28 min | AdvBench × 3 targets, 参考值 |
| 审计日志写入 | < 5 ms | syscall + 网络包 + 文件 IO 三合一 |
- 凡标注「参考值」的 ASR / 泄露率 / 性能数字,均为内部演示环境在特定模型、数据集与查询预算下的示意取值,用于说明工具能力量级,不代表对任意目标模型的承诺;其绝对值随模型版本、防护配置、benchmark 数据集与随机种子而显著变化。
- 越狱 / 注入类指标的评测口径对齐公开基准(如 AdvBench / HarmBench / JailbreakBench)的「攻击成功率」定义,沙箱性能指标以本页所述参考机型(128 vCPU / 512G RAM / A100-80G × 4)为基准,实际表现因硬件、kernel、负载而异。
- 我们不提供未经现场复测的对外承诺数字。如需将任一指标写入 SOR / 招标技术规范 / POC 验收标准,可在 POC 阶段以贵方指定的模型、数据集与预算现场复测,并提供测试脚本与环境说明,区分「现场实测」与「参考值」。