为AI应用构建
坚不可摧的内容合规防线

ShieldAI 以自研高速检测引擎为核心,内容合规、隐私检查、Prompt 攻击防御三位一体, 覆盖输入与输出全链路,误报率低于0.5%,检出率超过95%,检测延迟毫秒级。

95%+
违规内容检出率
<0.5%
行业领先误报率
<10ms
平均响应延迟
3重
智能检测能力

* 检出率与误报率基于内部标准测试集统计,延迟为典型配置下实测值

对抗绕过手法的纵深防御

黑产不断翻新敏感词绕过手法,ShieldAI 对主流变形手段逐层拆解、精准识别

高危
92%

干扰符插入

在敏感词中插入符号、空格、全角字符(如"赌*博")躲避匹配,归一化管线剔除后还原命中。

高危
82%

字符拆分攻击

将单词拆成单字母串联(如 f.u.c.k)绕过整词检测,智能拼接还原后照样精准命中。

高危
85%

leet 形近替换

用形近字符替换字母(如 c@sino、4dult)规避关键词库,leet 映射表归一后精确识别。

中危
55%

繁简与大小写混淆

混用繁体字、全半角与大小写变形躲避检测,归一化管线统一转归标准形态再匹配。

中危
48%

词形变形绕过

利用复数、时态变形(fucks/fucked/fucking)逃避词库,变形自动归并识别,词库无需穷举。

中危
42%

流式拆分绕过

把敏感词拆到多个流式分片(chunk)中躲避单次检测,跨片滑动窗口累积评分实时拦截。

全链路智能风控能力

内容合规、隐私检查、Prompt 攻击防御三大能力,为用户输入与模型输出的每一个环节保驾护航

内容合规检测

违规内容毫秒级拦截,各类变形绕过手法精准识别

极速关键词检测

毫秒级识别违规关键词,即使经过变形伪装也能精准命中,第一时间拦截风险内容。

智能组合判定

支持多词共现、上下文组合等复杂判定策略,单看无害、组合违规的内容也能准确识别。

语义相似识别

不止逐字匹配,更能理解语义:同义改写、委婉表达也能识别,疑似误报自动放行。

灵活分级策略

按业务需求灵活配置风险等级与处置策略,放行、拦截分级管理,适配多样化审核场景。

中英双语覆盖

中文、英文内容同步检测,英文复数、时态等变形自动识别归并,词库维护简单高效。

拦截理由可查

每次拦截均提供命中类别、风险级别与原文证据,理由清晰透明,便于审计复核与用户申诉。

低误报控制

行业白名单与智能边界识别双管齐下,正常表达不误伤,误报率稳定低于0.5%。

词库资产安全

核心敏感词库加密发布,生产环境全程无明文,词库资产与版本完整性双重保障。

隐私信息检查

个人敏感信息双向防护,数据合规无忧

敏感信息识别

精准识别身份证号、手机号、银行卡、邮箱等各类个人敏感信息,检出即标记。

输入输出双向防护

既防用户在输入中提交他人隐私,也防模型在输出中泄露个人信息,双向拦截无盲区。

灵活处置策略

按业务场景配置脱敏、拦截、告警等处置方式,防护力度与用户体验兼得。

数据合规护航

对齐《个人信息保护法》《数据安全法》要求,为数据处理活动提供合规审计依据。

Prompt 攻击防御

提示注入与越狱攻击实时识别,守护模型行为边界

提示注入识别

精准识别试图覆盖系统指令、篡改模型行为的恶意输入,从源头阻断注入风险。

越狱攻击防御

角色扮演、虚构叙事、前提假设等包装手法智能识别,绕过企图无处遁形。

多轮渐进防护

针对多轮对话中逐步升级的恶意意图持续追踪,突破单轮检测的局限。

攻击留痕告警

攻击行为实时拦截并自动留痕,为安全运营与溯源分析提供完整依据。

清晰的调用流程

双侧闸门接入:请求进入大模型前、内容交付用户前各设一道风控检测,各环节调用的能力一目了然

用户输入
输入侧风控
进入大模型之前
Prompt 攻击检测 内容合规 隐私检查
大模型
输出侧风控
交付用户之前
内容合规 隐私检查
流式输出:边生成边检
最终输出

任一环节未通过 → 拦截或脱敏后直接返回,不再进入下一环节

Prompt 攻击检测

仅输入侧

提示注入与越狱攻击的目标是大模型本身,必须在请求进入模型之前拦截——过了这道门再拦就晚了。

隐私检查

输入+输出

输入侧防止用户提交他人隐私进入模型,输出侧防止模型在生成内容中泄露个人信息,双向防护。

内容合规

输入+输出

输入侧拦截违规请求,输出侧拦截违规生成——输入合规不代表输出合规;流式输出边生成边检,命中即截断。

在线体验

三大能力即刻上手:输入任意文本,30 秒感受检测效果

ShieldAI 检测控制台 · 演示

* 演示使用浏览器本地简化规则,仅展示检测形态;正式系统覆盖更完整的词库、规则与语义能力

毫秒级智能检测流程

从请求接入到结果返回全自动流转,多重检测能力协同工作,毫秒级给出最终判定

检测请求接入

安全接入鉴权,支持单条、批量与实时流式检测

时间: 0ms

智能文本还原

自动还原各类变形与伪装文本

延迟 < 1ms

变形伪装内容统一还原,为精准检测打好基础

多重检测能力协同工作,不漏判、不误判

多维度智能检测

关键词 / 组合规则 / 语义理解

按风险等级与业务策略综合判定

智能决策判定

风险分级 + 白名单护航 → 放行 / 拦截

延迟 < 5ms

结果实时返回

检测结果与命中理由同步返回,业务处置有据可依

总计: < 10ms

适用场景

三大能力灵活组合,覆盖主流业务场景的内容风控需求

AIGC 对话应用

输入防注入越狱、输出防违规泄露,助力大模型应用合规上线。

智能客服与外呼

客服对话实时合规检测,客户隐私信息自动识别脱敏。

UGC 社区与评论

用户发布内容毫秒级审核,变形绕过、谐音黑话精准识别。

在线教育

未成年人接触内容严格把关,不良信息零容忍拦截。

金融与政务

高合规要求场景,完整审计追溯满足监管检查。

电商与直播

商品描述、弹幕评论、直播脚本等内容实时风控。

卓越的性能表现

本地引擎优先检测、语义能力按需触发的混合架构,在保障安全的同时实现高效响应

违规内容检出率

覆盖已知攻击类型

95%+

误报率

行业领先水平

<0.5%

平均响应延迟

关键词/规则本地引擎直出

<10ms

系统可用性

语义熔断降级+词库热更新

99.9%

词库明文泄露面

词库加密发布,生产零明文

0

全面法规合规支持

系统从设计之初即融入中国法规要求,覆盖内容审核、数据安全、审计追溯、资产保护全维度

《网络安全法》

网络运营者安全保护义务

《数据安全法》

数据分类分级保护

《个人信息保护法》

个人信息处理规范

《生成式AI暂行办法》

内容安全+标识+备案

《深度合成规定》

合成内容显著标识

《内容审核治理规定》

平台内容治理责任

审计追溯与资产保护能力

1

可解释命中

每次拦截完整记录命中类别、风险级别、证据与原文位置,理由清晰可查。

2

版本级追溯

dict_version 由词源内容哈希自动派生,词库每版变更均可回溯,审计日志口径一致。

3

词库资产保护

词库加密无明文发布,版本完整性自动校验,热更新不中断检测服务。

为您的AI应用构建合规检测能力

立即申请试用 ShieldAI 内容风控系统,体验多重智能检测能力带来的全方位合规保护

邮箱联系

contact@shieldai.com

电话咨询

400-888-0000

公司地址

北京市海淀区中关村

立即申请免费试用