跳到主要内容
身份学员
场景库

提示词注入越狱红队

LLM · 提示词注入越狱真实推理 · 云端 Gemma
待运行00:00

运行配置

目标模型
数据集
攻击方法
守卫模式
180
64180256

真实调用参数:限制模型每次回复的 token 上限,直接传给云端 Gemma

0.2
00.21

真实调用参数:越低越确定(默认 0.2,与已验证的真实差异一致),越高越发散

真实红队使用内置的 7 类技法(1 无害对照 + 6 攻击),逐技法真实推理;成功率仅计攻击技法

资源限额

CPU云端 GPU内存托管超时120s

真实推理:本次运行对真实云端 Gemma(无安全对齐,mTLS)逐技法发起提示词注入 / 越狱攻击, 返回每技法模型真实回复、泄露/已挡判定与真实越狱成功率。机密只存服务端守卫提示词,绝不下发。

加载模型1 / 7
攻击成功
待运行
攻击失败
待运行
平均耗时
待运行
ASR
0.0%
峰值 0.0%
当前 ASR
0.0%step 0
Peak
0.0%
等待数据流...
0.000.250.500.751.00013253850
[xterm] 终端加载中...

结果画廊

演示数据
运行结束后展示对抗三联图 / 终态 ASR / 产物
点击右上「开始运行」