AI 代理推理式入侵检测系统,支持隔离阻断与人工审核,防止提示词注入与恶意指令执行。
说明:
## 核心用法
hopeIDS 是一款面向 AI Agent 生态的推理型入侵检测系统(IDS),通过实时扫描入站消息识别潜在威胁。系统采用三级处置策略:**ALLOW**(正常放行)、**WARN**(注入安全警告后继续处理)、**BLOCK**(严格模式下完全阻断)。配置层面支持全局默认策略与精细化按代理(per-agent)覆盖,可针对不同业务场景(如公开扫描器 vs 核心主代理)设定差异化风险阈值。
关键工作流:`Message → autoScan() → 风险评分 → 决策分支`。阻断时生成仅含元数据的隔离记录,并通过 Telegram Bot 向管理员推送可操作的审核告警(`/approve`、`/reject`、`/trust` 命令),实现最小权限原则下的人工介入。
## 显著优点
1. **零内容残留设计**:阻断消息不进入代理记忆系统(jasper-recall),隔离记录剔除原始内容,仅保存哈希与模式匹配摘要,降低数据泄露与对抗样本复现风险。
2. **人机协同闭环**:Telegram 告警基于结构化元数据拼接,无 LLM 参与生成,避免告警链路本身成为攻击面;审核命令影响未来行为,不复活已阻断消息,语义清晰。
3. **弹性策略架构**:支持 `strictMode` 开关、0-1 连续风险阈值、按代理独立配置,兼顾高敏感场景的偏执防御与常规场景的可用性平衡。
## 潜在局限
– **检测能力边界**:依赖正则与关键词模式匹配(如 `ignore.*instructions`),对语义变形、编码绕过、多模态隐写等高级对抗样本覆盖有限,尚未披露是否集成 LLM-as-Judge 或 embedding 相似度检测。
– **运维复杂度**:Telegram Chat ID、风险阈值、代理映射需手动维护 JSON 配置,缺乏可视化策略编排界面;`trustOwners` 等白名单机制若配置不当易引入特权绕过。
– **生态锁定**:与 OpenClaw 框架深度耦合,独立部署或迁移至其他 Agent 平台需适配成本。
## 适合人群
– 运营多租户/多角色 AI Agent 的中高阶开发者
– 对提示词安全(Prompt Security)有合规要求的 B2B SaaS 团队
– 已采用 OpenClaw 生态并需要开箱即用隔离方案的技术组织
## 常规风险
| 风险类别 | 说明 |
|———|——|
| 误报导致业务中断 | 高敏感阈值下正常指令被阻断,需建立 `/approve` 快速申诉与再教育流程 |
| 审核延迟 DoS | Telegram 告警依赖外部 Bot 链路,网络抖动或速率限制可能导致阻断消息堆积 |
| 配置漂移 | 多代理阈值分散在 JSON 中,版本迭代时易出现策略不一致 |
| 元数据推断攻击 | 隔离记录虽无原始内容,但 `patterns` 与 `intent` 标签可能泄露系统检测规则,需限制记录访问权限 |









