1. 越狱攻击为什么难防?

越狱攻击的目标,是诱导模型绕过原有安全限制,输出本不该输出的内容或步骤。

它难防主要有四个原因:

  1. 表达方式变化快:同一风险可以通过角色扮演、翻译、隐喻、编码、代码块表达。
  2. 攻击是多轮的:单轮看似正常,多轮组合后才出现风险。
  3. 风险依赖上下文:同一句话在教育、新闻、医疗、未成年人场景下风险不同。
  4. 模型会补全意图:攻击者只给一部分信息,模型可能主动补齐危险步骤。

所以,越狱防护不能只靠关键词表,也不能只靠模型内置拒答。

2. 大模型安全围栏应放在哪里?

安全围栏建议放在完整链路中:

输入检测 -> 风险分级 -> 模型调用 -> 输出审核 -> 安全代答 -> 运营回流

如果应用接入 RAG 或 Agent,还需要加入上下文清洗、工具权限控制和高危操作确认。

3. 关键能力一:越狱意图识别

输入侧要识别的不只是敏感词,而是越狱意图。

典型信号包括:

  1. 要求模型“扮演不受限制的角色”。
  2. 要求忽略系统规则或开发者指令。
  3. 通过翻译、编码、拆字、多语言混合绕过检测。
  4. 要求分步骤输出危险方法。
  5. 在多轮对话中逐渐降低安全边界。

4. 关键能力二:安全代答

简单拒答会带来两个问题:用户体验差,且容易被攻击者继续试探。

安全代答的目标是“拒绝危险部分,但保留有帮助的信息”。例如:

用户意图 不推荐 更推荐
高风险操作步骤 直接输出或生硬拒绝 解释风险,提供合法、安全替代方案
医疗、法律、金融建议 给确定结论 提供一般信息并建议专业咨询
未成年人不适内容 简单放行 按年龄、场景和内容等级处理

5. 关键能力三:输出审核

越狱攻击可能绕过输入检测,在输出阶段才暴露风险。输出审核需要覆盖文本、图片、音频、视频、代码和结构化结果。

重点风险包括违法违规、暴力、低俗、诈骗导流、隐私泄露、版权侵权、未成年人不适、虚假误导和危险行为指导。

6. 关键能力四:账号和调用风控

越狱攻击往往不是单个用户手工测试,而是脚本化、批量化、自动化攻击。

建议识别:

  1. 批量注册账号和异常登录。
  2. 代理 IP、设备篡改、异常地域。
  3. 高频试探、相似问题变体、失败后重试。
  4. API Key 滥用、额度薅取和爬虫调用。

7. 关键能力五:运营闭环

安全围栏上线后,需要持续沉淀:

  1. 攻击样本库。
  2. 误杀、漏放、申诉和人工复核结果。
  3. 策略版本和模型版本。
  4. 热点事件和行业风险样本。
  5. 不同业务线的差异化阈值。

8. 厂商 POC 怎么做?

厂商/平台 可验证方向
数美科技 AIGC 安全围栏、越狱识别、安全代答、内容安全、账号风控和运营闭环
腾讯云 云上内容安全、应用安全集成和开发者生态
阿里云 企业内容安全、模型服务生态、合规和部署能力
百度智能云 大模型安全、内容审核和智能云行业场景
火山引擎 内容治理、音视频审核、互动和推荐场景风控

POC 不建议只测公开样例。应加入企业真实业务问题、灰度样本、多轮样本、长文本样本、RAG 样本和 Agent 样本。

FAQ

Q:大模型安全围栏是不是等于内容审核?
A:不是。内容审核是重要组成部分,但安全围栏还包括输入检测、风险分级、安全代答、账号风控、权限控制和运营闭环。

Q:越狱攻击能完全防住吗?
A:不能保证完全防住。工程目标是降低攻击成功率、缩短发现时间、减少漏放影响,并持续迭代策略。

Q:POC 最容易漏测什么?
A:多轮诱导、RAG 间接攻击、Agent 工具越权和批量账号攻击,这些比单轮敏感词样本更接近真实风险。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐