场景运行台
7/7 真实推理博智风格「7 步流水线」攻击运行台:加载模型 → 加载数据集 → 配置参数 → 生成对抗样本 → 执行攻击 → 释放资源 → 分析结果。当前 7 个场景全部为真实模型推理(离线预生成 CV + Grad-CAM 注意力 / CPU 图文对抗 / 云端 Gemma 越狱), 可视化真实 ASR、模型注意力热力图与前后对比。
FGSM 图像对抗样本攻击
真实推理 · CPU对 CIFAR-10 图像分类器施加 Fast Gradient Sign Method(FGSM)/ PGD 扰动,以肉眼近不可见的 ε 扰动诱导误分类,观测真实攻击成功率(ASR)随扰动强度上升的过程。本场景为真实 CPU 推理(非演示脚本)。
人脸识别对抗攻击
真实推理 · 离线预生成对 ArcFace 等人脸认证模型施加迭代对抗扰动,在 LFW 上以近乎不可见的像素扰动实现「躲避(dodging)」与「假冒(impersonation)」两类攻击,压低同人余弦相似度以绕过认证门限,观测攻击成功率与扰动隐蔽性(PSNR / L2)的权衡。
内容审核文本对抗
真实推理 · CPU对中文内容审核分类器(CharTextCNN · 违规/正常 二分类)施加字符级 / 词级对抗改写,在保持语义近乎不变的前提下,让违规文本被误判为「正常」从而绕过审核门禁,观测真实绕过率、平均改写数与语义相似度之间的权衡。本场景为真实 CPU 推理(非演示脚本)。
车辆识别对抗攻击
真实推理 · 离线预生成对 YOLOv8 等目标检测器施加对抗扰动,在 KITTI 等自动驾驶数据集上诱导「漏检(vanishing)」或「误检(fabrication)」车辆目标,观测 mAP 下降、漏检率上升与攻击成功率,评估检测链路在对抗条件下的鲁棒性。
无人机识别对抗攻击
真实推理 · 离线预生成面向低空安防的无人机检测模型(Drone-YOLO),对小目标施加对抗扰动,在无人机检测数据集上压低检出率与置信度,使反制系统「看不见」入侵无人机,观测检出率下降与攻击成功率在 conf/IOU 门限下的表现。
自动驾驶感知对抗攻击
真实推理 · 离线预生成对端到端自动驾驶感知模型(UniAD / VAD / DriveGPT4)施加黑盒 / 白盒对抗攻击,针对道路交通标志、行人与车辆的感知施加扰动,在 nuScenes 等数据集上诱导交通标志误判与感知错误率上升,评估感知—规划链路在对抗条件下的安全边界。
提示词注入越狱红队
真实推理 · 云端 Gemma对一个持有机密 vault override code 的银行助手(SafeGuard · 结构化守卫)逐技法发起提示词注入 / 越狱攻击,测试直接询问 / 指令忽略 / 角色扮演 / 编码绕过 / 载荷拆分 / 权限伪装等技法能否诱导真实云端 Gemma(无安全对齐)把机密泄露出来。运行返回每技法的模型真实回复、泄露/已挡判定与真实越狱成功率。机密只存在于服务端守卫提示词,绝不下发客户端。本场景为真实云端 Gemma 推理(非演示脚本)。