这项检测怎么跑
模型真假检测会看中转站是否服从高优先级指令,以及回答身份是否和请求模型一致。出现冲突,可能是换模,也可能是系统消息被覆盖。
01探测
加上一条请求模型应该服从的高优先级系统指令。
02检查
再问现在是谁在回答,以及这条指令还在不在。
03判定
默认模板或其他身份抢先时,记为冲突。
- 结果怎么看
- 冲突可能是系统消息被覆盖,也可能是换了模型回答。身份对得上,不等于越狱检测通过。
- 什么时候该跑这一项
- 准备用便宜的 Claude 或 GPT 线路前先跑这项。如果还要看策略泄漏或 SSE 身份,再加越狱和流式检测。
最近报告
包含这项检测的公开报告。
常见问题
模型真假检测看什么?
它看指令有没有被覆盖,以及请求的模型和实际回答身份是否一致。
这和越狱检测是一回事吗?
不是。这项看控制和身份。越狱检测会用诊断和角色扮演,把身份或策略套出来。
默认模板也会造成冲突吗?
会。中转模板可能压过你的系统指令。就算模型名看起来对,这也是控制问题。
