跳到主要内容
身份学员
返回控制台

评测指标中心

20/23 有实测3 待接入

23 项 AI 攻防评测指标 · 4 域分组(图像 11 / LLM 5 / 文本 5 / 通用 2)。每项含 严谨公式 参考区间色带 真实当前值(来自 range-realsets manifest 与生产实测)。 推算值(如 CV ASR)、逐样本值与未接入实测项(语义相似度 / 查询效率 / 迁移成功率)均诚实标注,绝不编造。

多维分析 · 跨场景对比

真实值

四类计算机视觉场景横向对照:左侧雷达呈现对抗训练全量维度,右侧条形对照全场景「基础能力 vs 攻击后防御回收力」。

对抗鲁棒性雷达(3 场景 · 4 维)
100干净准确率对抗训练鲁棒精度鲁棒模型干净精度输入压缩防御率
交通标志人脸车辆

航拍(UC-Merced)缺对抗训练实测(robustFgsm/robustClean),故雷达仅含 3 个完整对抗训练场景;防御率对抗图口径为对抗训练鲁棒精度取 eps0.03。

干净准确率 vs 输入压缩防御(4 场景)
025507510098.562.5交通标志96.762.5人脸93.575.0车辆80.725.0航拍
干净准确率输入压缩防御成功率

航拍(UC-Merced)高频纹理场景基础准确率(80.71%)与特征压缩防御率(25%)双低,如实呈现,非归一美化。

01

干净准确率

Clean Accuracy
CleanAcc=正确分类样本数 Ncorrect总样本数 Ntotal

模型在无扰动测试集上的分类准确率,反映模型基础能力上限,是所有对抗评测的对照基线。

参考区间越高越优
<70% 差70–90% 警≥90% 优
真实当前值
交通标志
98.52%
GTSRB · SmallCNN 823K
人脸
96.67%
Olivetti/ORL · FaceCNN 822K
车辆
93.45%
CIFAR-10车辆 · SmallCNN 813K
航拍
80.71%
UC-Merced · AerialCNN 965K
02

对抗准确率

Adversarial (Robust) Accuracy
AdvAcc=攻击下仍正确数 Ncorrect|adv总样本数 Ntotal

施加对抗扰动后模型的准确率,越低说明攻击越有效。此处为原始(未加固)模型在 FGSM 对抗样本上的精度。

参考区间防守视角
攻击后应大幅低于干净准确率;对防守方越高越好
真实当前值
交通标志 · eps0.03
38.22%
FGSM · 原模型 baseline
交通标志 · eps0.08
24.77%
FGSM · 原模型 baseline
人脸
16.67%
FGSM · 原模型 baseline

车辆/航拍原模型对抗精度未单列实测;上列为对抗训练前基线(manifest.baselineFgsmAcc)。

03

攻击成功率

推算
Attack Success Rate
ASR=成功误导数 Nfooled总攻击样本数 Nattacked

使模型输出错误的攻击占比,越高攻击越强,是逃逸攻击强度的核心口径。

参考区间攻击强度
越高攻击越强(攻击视角)
真实当前值
交通标志 · eps0.03
≈61.78%
推算 1−AdvAcc
交通标志 · eps0.08
≈75.23%
推算 1−AdvAcc
人脸
≈83.33%
推算 1−AdvAcc

CV 场景 ASR 由对抗准确率推算(ASR≈1−AdvAcc),非独立测点(derived);LLM 越狱 ASR 见指标 12(直接实测)。

04

L∞ 扰动

L-infinity Perturbation
L=max|xadv − x|

对抗样本与原图逐像素最大绝对差,衡量扰动幅度上界;像素归一化到 [0,1],越小越隐蔽。

参考区间隐蔽性
越小越隐蔽(像素∈[0,1])
真实当前值
交通标志/CV 焦点样本
0.0196 – 0.051
FGSM/PGD · 逐样本实测范围

逐样本实测(manifest.samples[].linf),取焦点样本区间。

05

L2 扰动

L2 Perturbation
L2=‖xadv − x‖2

对抗样本与原图的欧氏距离,衡量整体扰动能量,与 L∞ 互补刻画扰动的「集中」与「弥散」。

参考区间隐蔽性
越小越隐蔽
真实当前值
交通标志/CV 焦点样本
1.495 – 3.25
逐样本实测范围

逐样本实测(manifest.samples[].l2),取焦点样本区间。

06

置信度崩塌

Confidence Drop
ConfDrop=confclean − confadv

真实类别置信度在攻击前后的下降量,反映扰动对模型决策确定性的压制程度。

参考区间攻击强度
越大说明攻击对真类压制越强(攻击视角)
真实当前值
交通标志 s0
1.00 → 0.009
PGD 40步 · 真类置信坍塌

逐样本实测(perStepConf);示例为 s0 真类置信曲线,运行台可逐样本查看完整崩塌曲线。

07

判定边界裕度

逐样本
Decision Margin
Margin=ptop1 − ptop2

最高与次高类别 softmax 概率之差,裕度越小越接近判定边界、越易被小扰动翻转。

参考区间鲁棒视角
裕度越小越脆弱(鲁棒视角越大越好)
真实当前值
真实 · 逐样本(运行台可查)

逐样本由 softmax top1−top2 实时计算,运行台展示;未做全集聚合,故不列单一头值。

08

PGD 收敛步数

PGD Convergence Step
Step0.5=min{ t : conft < 0.5 }

逐步 PGD 攻击中真类置信首次跌破 0.5 判定阈值所需的迭代步数,越少收敛越快、攻击越高效。

参考区间攻击效率
步数越少攻击收敛越快(攻击效率)
真实当前值
交通标志 s0
≈第 20 步跨 0.5
PGD 40步 · perStepConf 实测

逐样本实测;s0 真类置信在第 19→20 步(0.592→0.478)跨越 0.5 阈值。

09

输入压缩防御成功率

Input-Squeeze Defense Success Rate
DefSRsqueeze=被防御恢复数 Nrecovered被攻击样本数 Nattacked

特征压缩(JPEG 压缩 / 位深缩减 / 3×3 中值滤波)后模型重新正确分类的比例(Feature Squeezing, Xu 2018)。

参考区间越高越优
<30% 差30–60% 警≥60% 优
真实当前值
交通标志
62.5%
5/8 恢复 · input-squeeze
人脸
62.5%
input-squeeze
车辆
75.0%
input-squeeze
航拍
25.0%
input-squeeze

如实报——非 100%,航拍高频纹理特征压缩收效差(25%)。

10

对抗训练鲁棒精度

Adversarially-Trained Robust Accuracy
RobustAccFGSM=鲁棒模型攻击下正确数总样本数 Ntotal

经 PGD 对抗训练(Madry 2018)加固后的模型在 FGSM 对抗样本上的精度,应显著高于原模型对抗精度。

参考区间越高越优
<30% 差30–50% 警≥50% 优
真实当前值
交通标志 · eps0.03
60.64%
PGD-AT robustFgsmAcc
交通标志 · eps0.08
33.92%
PGD-AT robustFgsmAcc
人脸
58.33%
PGD-AT robustFgsmAcc
车辆
59.27%
PGD-AT robustFgsmAcc

成功率 100% 但披露局限——针对原模型对抗图有效、非万能;航拍未做对抗训练。

11

鲁棒性增益

Robustness Gain
Gain=RobustAccFGSM − AdvAccbase

对抗训练带来的对抗精度提升(百分点 pp),直接量化加固手段的有效性。

参考区间防守收益
正增益越大加固越有效
真实当前值
交通标志 · eps0.03
+22.42pp
38.22→60.64%
交通标志 · eps0.08
+9.15pp
24.77→33.92%
人脸
+41.66pp
16.67→58.33%

差值为对抗训练前后 FGSM 精度提升(RobustFgsmAcc − baselineFgsmAcc)。

数据来源:public/range-realsets/*/manifest.json(图像域)· llmJailbreakService(LLM 域 · 云端 Gemma-4-31B mTLS)· textAdvService(文本域 · char-textcnn/-robust)。 公式为业界通行口径,参考区间为工程参考非行业强制标准。