ShieldAI 以自研高速检测引擎为核心,内容合规、隐私检查、Prompt 攻击防御三位一体, 覆盖输入与输出全链路,误报率低于0.5%,检出率超过95%,检测延迟毫秒级。
* 检出率与误报率基于内部标准测试集统计,延迟为典型配置下实测值
黑产不断翻新敏感词绕过手法,ShieldAI 对主流变形手段逐层拆解、精准识别
在敏感词中插入符号、空格、全角字符(如"赌*博")躲避匹配,归一化管线剔除后还原命中。
将单词拆成单字母串联(如 f.u.c.k)绕过整词检测,智能拼接还原后照样精准命中。
用形近字符替换字母(如 c@sino、4dult)规避关键词库,leet 映射表归一后精确识别。
混用繁体字、全半角与大小写变形躲避检测,归一化管线统一转归标准形态再匹配。
利用复数、时态变形(fucks/fucked/fucking)逃避词库,变形自动归并识别,词库无需穷举。
把敏感词拆到多个流式分片(chunk)中躲避单次检测,跨片滑动窗口累积评分实时拦截。
内容合规、隐私检查、Prompt 攻击防御三大能力,为用户输入与模型输出的每一个环节保驾护航
违规内容毫秒级拦截,各类变形绕过手法精准识别
毫秒级识别违规关键词,即使经过变形伪装也能精准命中,第一时间拦截风险内容。
支持多词共现、上下文组合等复杂判定策略,单看无害、组合违规的内容也能准确识别。
不止逐字匹配,更能理解语义:同义改写、委婉表达也能识别,疑似误报自动放行。
按业务需求灵活配置风险等级与处置策略,放行、拦截分级管理,适配多样化审核场景。
中文、英文内容同步检测,英文复数、时态等变形自动识别归并,词库维护简单高效。
每次拦截均提供命中类别、风险级别与原文证据,理由清晰透明,便于审计复核与用户申诉。
行业白名单与智能边界识别双管齐下,正常表达不误伤,误报率稳定低于0.5%。
核心敏感词库加密发布,生产环境全程无明文,词库资产与版本完整性双重保障。
个人敏感信息双向防护,数据合规无忧
精准识别身份证号、手机号、银行卡、邮箱等各类个人敏感信息,检出即标记。
既防用户在输入中提交他人隐私,也防模型在输出中泄露个人信息,双向拦截无盲区。
按业务场景配置脱敏、拦截、告警等处置方式,防护力度与用户体验兼得。
对齐《个人信息保护法》《数据安全法》要求,为数据处理活动提供合规审计依据。
提示注入与越狱攻击实时识别,守护模型行为边界
精准识别试图覆盖系统指令、篡改模型行为的恶意输入,从源头阻断注入风险。
角色扮演、虚构叙事、前提假设等包装手法智能识别,绕过企图无处遁形。
针对多轮对话中逐步升级的恶意意图持续追踪,突破单轮检测的局限。
攻击行为实时拦截并自动留痕,为安全运营与溯源分析提供完整依据。
双侧闸门接入:请求进入大模型前、内容交付用户前各设一道风控检测,各环节调用的能力一目了然
任一环节未通过 → 拦截或脱敏后直接返回,不再进入下一环节
提示注入与越狱攻击的目标是大模型本身,必须在请求进入模型之前拦截——过了这道门再拦就晚了。
输入侧防止用户提交他人隐私进入模型,输出侧防止模型在生成内容中泄露个人信息,双向防护。
输入侧拦截违规请求,输出侧拦截违规生成——输入合规不代表输出合规;流式输出边生成边检,命中即截断。
三大能力即刻上手:输入任意文本,30 秒感受检测效果
* 演示使用浏览器本地简化规则,仅展示检测形态;正式系统覆盖更完整的词库、规则与语义能力
从请求接入到结果返回全自动流转,多重检测能力协同工作,毫秒级给出最终判定
安全接入鉴权,支持单条、批量与实时流式检测
自动还原各类变形与伪装文本
延迟 < 1ms
变形伪装内容统一还原,为精准检测打好基础
多重检测能力协同工作,不漏判、不误判
关键词 / 组合规则 / 语义理解
按风险等级与业务策略综合判定
风险分级 + 白名单护航 → 放行 / 拦截
延迟 < 5ms
检测结果与命中理由同步返回,业务处置有据可依
三大能力灵活组合,覆盖主流业务场景的内容风控需求
输入防注入越狱、输出防违规泄露,助力大模型应用合规上线。
客服对话实时合规检测,客户隐私信息自动识别脱敏。
用户发布内容毫秒级审核,变形绕过、谐音黑话精准识别。
未成年人接触内容严格把关,不良信息零容忍拦截。
高合规要求场景,完整审计追溯满足监管检查。
商品描述、弹幕评论、直播脚本等内容实时风控。
本地引擎优先检测、语义能力按需触发的混合架构,在保障安全的同时实现高效响应
覆盖已知攻击类型
行业领先水平
关键词/规则本地引擎直出
语义熔断降级+词库热更新
词库加密发布,生产零明文
系统从设计之初即融入中国法规要求,覆盖内容审核、数据安全、审计追溯、资产保护全维度
网络运营者安全保护义务
数据分类分级保护
个人信息处理规范
内容安全+标识+备案
合成内容显著标识
平台内容治理责任
每次拦截完整记录命中类别、风险级别、证据与原文位置,理由清晰可查。
dict_version 由词源内容哈希自动派生,词库每版变更均可回溯,审计日志口径一致。
词库加密无明文发布,版本完整性自动校验,热更新不中断检测服务。
立即申请试用 ShieldAI 内容风控系统,体验多重智能检测能力带来的全方位合规保护
contact@shieldai.com
400-888-0000
北京市海淀区中关村