跳到主要内容
合规备案
RED TEAM WHITEPAPER · v1.0

AISR 红队能力 · 合规备案视角面向企业红队 / 高校教学 / 合规验证的 AI 模型层攻防方法论

面向金融与政企合规场景:以下红队能力为 GB/T 45654、EU AI Act 等框架的安全评估提供可落地的证据与方法论支撑(以下为红队能力示例)。

CHAPTER 01

AI 模型层威胁 Top 10

基于 OWASP LLM Top 10 (2025) 中文摘要,AISR 对每项威胁均提供对应能力或路线图。

LLM01

Prompt Injection · 提示注入

攻击者通过精心构造的输入劫持 system prompt,使模型违反预设安全策略,泄露敏感信息或执行越权动作。直接注入与间接注入(来自外部数据源)均属此类。

AISR 工具:PromptInjection(双语 payload 库 1200+,含 DAN / Grandma / RolePlay 12 类模式)

LLM02

Sensitive Information Disclosure · 敏感信息泄露

模型在响应中无意暴露训练集中的 PII、API Key、商业机密或内部系统结构,或在多轮交互中累积上下文形成隐式泄露。

AISR 工具:DataExtraction(受限 query 预算下的 membership inference + 训练数据提取)

LLM03

Supply Chain · 供应链投毒

第三方模型权重 / 数据集 / 微调适配器存在后门,触发特定 trigger 时输出攻击者预定的内容。Hugging Face 模型来源验证缺失是常见入口。

AISR 工具:模型扫描(规划中:模型扫描 / Pickle 反序列化检测)

LLM04

Data and Model Poisoning · 数据与模型投毒

攻击者污染训练 / 微调 / RAG 索引数据,使模型在特定 trigger 下产生有偏 / 有害输出。BadNets 与 RIPPLES 是典型范式。

AISR 工具:DatasetPoisoning(规划中:teacher 监控 + 训练阶段投毒注入器)

LLM05

Improper Output Handling · 输出处理不当

应用直接将模型输出送入下游系统(SQL / Shell / 浏览器),形成 SSRF / XSS / 命令注入等次生漏洞。RAG + Agent 架构尤其高危。

AISR 工具:JailbreakChecker 配套 OutputSafety 模块(规划中)

LLM06

Excessive Agency · 过度授权

Agent 被授予过宽的工具权限(文件系统 / 邮件 / 数据库写);攻击者通过越狱让 Agent 执行越权动作。MCP 工具调用边界缺失是放大器。

AISR 工具:AgentAttack(规划中:covert tool-calling fuzzing)

LLM07

System Prompt Leakage · 系统提示泄露

攻击者通过特殊询问诱导模型输出 system prompt 全文或关键策略,破解产品差异化壁垒并获得绕过基线。

AISR 工具:PromptInjection · leak-system 模式(系统提示泄露在大量真实应用中均有复现,具体泄露率因模型与防护配置而异,详见 OWASP LLM Top 10 · LLM07 条目说明)

LLM08

Vector and Embedding Weaknesses · 向量库弱点

RAG 索引中存在攻击文档,被检索后注入 LLM 上下文执行间接 prompt injection。向量空间投毒可使特定查询恒命中攻击文档。

AISR 工具:RAGAttack(规划中:可注入 marker 文档至 Chroma / Pinecone / FAISS)

LLM09

Misinformation · 误导与幻觉

模型产生看似可信的虚假事实,在医疗 / 法律 / 金融等高风险场景造成下游损失。攻击者可通过 prompt 主动诱导幻觉。

AISR 工具:HallucinationProbe(规划中:事实核查 + 自一致性矩阵)

LLM10

Unbounded Consumption · 资源耗尽

攻击者构造高 token 消耗 prompt(递归生成 / 长 context),耗尽 GPU 资源或推高 API 账单,形成 DoW(Denial of Wallet)。

AISR 工具:ResourceFuzz(规划中:含 token / 时间 / 内存三维耗尽测试)

CHAPTER 02

AISR 红队工具集架构

本白皮书选取 4 个代表性 AISR 内置工具详解(PromptInjection / nanoGCG / DataExtraction / JailbreakChecker);完整攻击工具集 16+,覆盖内置 / 业内开源 / 商业 / 学术四大类。

PromptInjection

内测

基于 1200+ 中英文 payload 模板的提示注入引擎,覆盖 DAN / Grandma / RolePlay / TokenSmuggle / Multilingual 等 12 类攻击模式。支持自动化批量评估与单 payload 调试。

$ aisr promptinjection --target gpt-4o-mini --mode dan --payloads ./payloads.jsonl
> [42/1200] PASSED payload=#dan-grandma-002 → 模型输出含违规内容(参考值 ASR=34.7%)
> [report] saved to /artifacts/promptinjection-2026-04-29.html

nanoGCG

内测

梯度引导的对抗后缀搜索(Greedy Coordinate Gradient),开源参考实现 ~ 300 LOC,支持 Vicuna / Llama-2 / ChatGLM 等 HF 兼容模型。100~500 步内可生成 ASR > 80% 的 universal suffix。

$ aisr nanogcg --model vicuna-7b --target "Sure, here's how to" --budget 300
> step 142 / 300 loss=1.847 best_suffix="!!! describing.\ + similarlyNow ..."
> ASR on 50 harmful behaviors: 87.3% (参考值)

DataExtraction

规划中

受限 query 预算下的训练数据 / membership inference 攻击,整合 Carlini 2021 范式与 Min-K% Prob 检测,可定位疑似训练样本并量化泄露面。

$ aisr dataextraction --target llama-2-7b --queries 5000 --canary-probe
> hit-rate: 12 canary samples leaked / 100 (参考值)
> top-1 leaked: canary-token-7f3a · <脱敏姓名> · <证件号 ***>(示例为合成数据,非真实泄露)

JailbreakChecker

内测

批量越狱评估器,对接 HarmBench / AdvBench / JailbreakBench 数据集,输出 ASR 矩阵 + 分类违规率 + 拒绝模板分布,30 分钟出全模型基线。

$ aisr jailbreak --benchmark advbench --targets gpt-4o,claude-3-5,glm-4
> [matrix] gpt-4o ASR=12.4% / claude-3-5 ASR=8.1% / glm-4 ASR=21.7% (参考值)
> [verdict] glm-4 在 chemistry / weapons 类拒答率 < 行业基线
CHAPTER 03

Firecracker 沙箱安全模型

AWS Firecracker 是为 Lambda / Fargate 设计的轻量级 microVM,提供硬件级隔离与亚秒级冷启。AISR 借此构建强隔离的红队执行环境。

轻量级 microVM 隔离

基于 KVM + virtio 的最小化设备模型,每 microVM 仅 ~ 5 MB 内存开销。强于共享内核的 Docker / runc。

Rootless 执行

Firecracker 进程 + jailer 强制 chroot / cgroup v2 / seccomp,逃逸窗口极小。Host 内核漏洞才能突破。

资源限额

默认沙箱:CPU 2c / 内存 4G / 磁盘 10G / 网络白名单(仅 model gateway);可按用例调整上限。

完整审计日志

每次 syscall + 网络包 + 文件 IO 写入审计 sink;满足 ISO 27001 A.8.15 / ISO 42001 7.5 取证要求。

CHAPTER 04

与传统 CTF 平台对比

从 5 个维度对比传统 CTF(如 CTFd 系)/ 春秋云境 / AISR,凸显 AI 模型层攻防的差异化定位。

维度传统 CTF春秋云境AISR 红队
AI 攻击深度0 / 仅 web / pwn / re / crypto★ / 仅 1~2 个 LLM 题(如 prompt 题)★★★★☆ / 对标 OWASP LLM Top 10:提示注入·系统提示泄露·越狱评估已提供可运行演示,其余条目按 roadmap 规划中;当前已交付 4 项代表性红队工具,工具集持续扩充
安全沙箱Docker(共享内核 / 逃逸风险)Docker + K8s NetworkPolicyFirecracker microVM(KVM 硬件隔离 / rootless / < 200ms 冷启)
模型支持不涉及模型OpenAI API 代理 / 不支持自托管HF 全谱 + vLLM / 国产 GLM / 文心 / 通义 / 私有化模型
教学集成题库 + WP;教师无 LMS高校版含基础 LMS(班级 / 评分)完整 LMS + 自动判分 + 学习路径 + ISO 42001 课程映射
私有化部署社区版开源;商业版闭源支持私有化 / 价格 200w+原生支持 K8s 私有化 + 国产化适配(计划 Phase 2)
CHAPTER 05

部署架构与性能指标

典型私有化部署:1 master + 3 worker(含 GPU 节点),单节点支撑 500+ 并发沙箱。

部署架构图

用户 / 学员浏览器Edge GatewayNext.js + tRPCJWT / RBACWebSocketWorkbench任务编排沙箱池调度审计 / 评分Sandbox Pool · Firecracker microVM × NmicroVM #1CPU 2c · MEM 4G · NET allowlistaudit · syscall · netcapmicroVM #2CPU 2c · MEM 4G · NET allowlistaudit · syscall · netcapmicroVM #3CPU 2c · MEM 4G · NET allowlistaudit · syscall · netcap模型容器(GPU 共享池:vLLM / HF Transformers / 国产模型)

性能指标(参考值)

基于 128 vCPU / 512G RAM / A100-80G × 4 参考机;具体测试环境与口径见下方方法学说明

沙箱冷启动< 200 msFirecracker microVM, kernel snapshot
并发沙箱数500+ / 单节点128 vCPU / 512G RAM 参考机
Workbench 工具往返~ 1.2 s P95PromptInjection 单 payload, 含模型推理
nanoGCG 攻击吞吐~ 4 min / targetA100-80G, budget=300, vicuna-7b 参考值
JailbreakChecker 全 benchmark~ 28 minAdvBench × 3 targets, 参考值
审计日志写入< 5 mssyscall + 网络包 + 文件 IO 三合一

预约一对一红队 demo

30 分钟在线演示:nanoGCG 实时攻击 + Firecracker 沙箱审计 + JailbreakChecker 矩阵报告。

方法学与数据口径说明
  • 凡标注「参考值」的 ASR / 泄露率 / 性能数字,均为内部演示环境在特定模型、数据集与查询预算下的示意取值,用于说明工具能力量级,不代表对任意目标模型的承诺;其绝对值随模型版本、防护配置、benchmark 数据集与随机种子而显著变化。
  • 越狱 / 注入类指标的评测口径对齐公开基准(如 AdvBench / HarmBench / JailbreakBench)的「攻击成功率」定义,沙箱性能指标以本页所述参考机型(128 vCPU / 512G RAM / A100-80G × 4)为基准,实际表现因硬件、kernel、负载而异。
  • 我们不提供未经现场复测的对外承诺数字。如需将任一指标写入 SOR / 招标技术规范 / POC 验收标准,可在 POC 阶段以贵方指定的模型、数据集与预算现场复测,并提供测试脚本与环境说明,区分「现场实测」与「参考值」。
本白皮书部分指标为参考值,实际性能因硬件 / 模型 / 数据集而异 · © 2026 AI Security Range