这项检测怎么跑
LLM 越狱检测会用诊断、编码和角色扮演提示词,看中转站会不会泄漏身份或策略。这是泄漏测试,不是让模型去做真正有害的事。
01探测
发送询问身份和策略的诊断探针。
02检查
再用编码和中间件角色扮演换路径试一次。
03判定
身份、策略或隐藏规则出现,就记为泄漏。
- 结果怎么看
- 这是泄漏测试,不是让模型去做有害的事。通过只说明这些探针没套出来,不代表所有越狱路径都关上了。
- 什么时候该跑这一项
- 做完身份检测后,如果还想知道包装层会不会被说动,再跑这一项。
最近报告
包含这项检测的公开报告。
常见问题
LMSpeed 的 LLM 越狱检测是做什么的?
这是受控的泄漏测试。它看身份和策略会不会漏,不是让模型去做不受限的有害行为。
这和提示词提取有什么不同?
提示词提取针对隐藏系统文本。这项检测针对越狱路径上的身份和策略泄漏。
通过了就说明模型不能越狱吗?
不能。只说明这些探针没有套出身份或策略。其他越狱路径仍可能存在。
