干净准确率
模型在无扰动测试集上的分类准确率,反映模型基础能力上限,是所有对抗评测的对照基线。
23 项 AI 攻防评测指标 · 4 域分组(图像 11 / LLM 5 / 文本 5 / 通用 2)。每项含 严谨公式、 参考区间色带 与 真实当前值(来自 range-realsets manifest 与生产实测)。 推算值(如 CV ASR)、逐样本值与未接入实测项(语义相似度 / 查询效率 / 迁移成功率)均诚实标注,绝不编造。
四类计算机视觉场景横向对照:左侧雷达呈现对抗训练全量维度,右侧条形对照全场景「基础能力 vs 攻击后防御回收力」。
航拍(UC-Merced)缺对抗训练实测(robustFgsm/robustClean),故雷达仅含 3 个完整对抗训练场景;防御率对抗图口径为对抗训练鲁棒精度取 eps0.03。
航拍(UC-Merced)高频纹理场景基础准确率(80.71%)与特征压缩防御率(25%)双低,如实呈现,非归一美化。
模型在无扰动测试集上的分类准确率,反映模型基础能力上限,是所有对抗评测的对照基线。
施加对抗扰动后模型的准确率,越低说明攻击越有效。此处为原始(未加固)模型在 FGSM 对抗样本上的精度。
车辆/航拍原模型对抗精度未单列实测;上列为对抗训练前基线(manifest.baselineFgsmAcc)。
使模型输出错误的攻击占比,越高攻击越强,是逃逸攻击强度的核心口径。
CV 场景 ASR 由对抗准确率推算(ASR≈1−AdvAcc),非独立测点(derived);LLM 越狱 ASR 见指标 12(直接实测)。
对抗样本与原图逐像素最大绝对差,衡量扰动幅度上界;像素归一化到 [0,1],越小越隐蔽。
逐样本实测(manifest.samples[].linf),取焦点样本区间。
对抗样本与原图的欧氏距离,衡量整体扰动能量,与 L∞ 互补刻画扰动的「集中」与「弥散」。
逐样本实测(manifest.samples[].l2),取焦点样本区间。
真实类别置信度在攻击前后的下降量,反映扰动对模型决策确定性的压制程度。
逐样本实测(perStepConf);示例为 s0 真类置信曲线,运行台可逐样本查看完整崩塌曲线。
最高与次高类别 softmax 概率之差,裕度越小越接近判定边界、越易被小扰动翻转。
逐样本由 softmax top1−top2 实时计算,运行台展示;未做全集聚合,故不列单一头值。
逐步 PGD 攻击中真类置信首次跌破 0.5 判定阈值所需的迭代步数,越少收敛越快、攻击越高效。
逐样本实测;s0 真类置信在第 19→20 步(0.592→0.478)跨越 0.5 阈值。
特征压缩(JPEG 压缩 / 位深缩减 / 3×3 中值滤波)后模型重新正确分类的比例(Feature Squeezing, Xu 2018)。
如实报——非 100%,航拍高频纹理特征压缩收效差(25%)。
经 PGD 对抗训练(Madry 2018)加固后的模型在 FGSM 对抗样本上的精度,应显著高于原模型对抗精度。
成功率 100% 但披露局限——针对原模型对抗图有效、非万能;航拍未做对抗训练。
对抗训练带来的对抗精度提升(百分点 pp),直接量化加固手段的有效性。
差值为对抗训练前后 FGSM 精度提升(RobustFgsmAcc − baselineFgsmAcc)。