ai-security-assistant(AI 安全评估辅助)

August 19, 2026 · View on GitHub

📦 仓库地址:https://github.com/SongYuhui14/ai-security-assistant

演示

DeepSeek Harness / Claude 技能(Skill):辅助开展大模型应用(LLM App)与 AI 系统的安全评估、合规核查、风险分析与学习工作。

crypto-evaluation-assistant(密评)同源:同一套"标准框架 + 检查清单 + 判定工作流 + 报告"方法论,迁移到 AI 安全领域。

给谁用(受众)

  • 大模型备案 / 合规人员:生成式 AI 上线前安全评估与备案,需要标准框架与报告方法
  • AI 安全工程师 / 渗透测试员:系统化评估框架 + 攻击测试思路(注入/越狱/RAG/Agent)
  • AI 应用开发者:客服、Agent、知识库问答产品上线前自查
  • 密评 / 等保从业者:密评方法论迁移到 AI 安全,"密评 + AI"复合能力
  • 安全学习者 / 备考者:术语、框架、考点入门

解决什么问题

  • 上线前评估:按 OWASP LLM Top 10 2025 + 国内法规生成检查清单逐项核查
  • 风险识别:提示词注入、越狱、系统提示词泄露、Agent 工具劫持、RAG 知识库投毒等
  • 量化判定calc_risk.py 风险打分,红线问题直接判"不通过"
  • 报告产出:标准报告模板(含证据、风险等级、整改建议)
  • 攻击测试:13 个攻击案例库作测试样本参考
  • 备考学习:术语表、易错点、考点

特色

  • 📋 标准对照:国内法规(生成式AI服务管理办法等)↔ OWASP LLM Top 10 (2025) 映射
  • 🔍 六大数据域:提示词安全、输出安全、数据安全、Agent 安全、供应链安全、合规管理
  • 🎯 三维度判定:合规性 / 正确性 / 有效性(与密评同构)
  • 🚨 红线问题清单:系统提示词泄露、无注入过滤、Agent 权限失控等
  • 📚 学习模式:AI 安全备考辅助、考点总结、易错点

安装(DeepSeek Harness / Claude Code)

  1. 把本目录放到技能目录,例如:
    • DeepSeek Harness:~/.ohdsh/skills/
    • Claude Code:~/.claude/skills/
  2. 新会话中,任务匹配技能描述时自动触发。

使用示例

  • "帮我按 OWASP LLM Top 10 评估这个聊天机器人应用"
  • "这个 AI 客服的提示词注入防护怎么测?"
  • "写一份大模型安全评估报告的框架"
  • "Agent 系统工具调用权限怎么核查?"
  • "LLM01 和 LLM07 有什么区别?"(学习模式)

目录结构

ai-security-assistant/
├── SKILL.md                     # 技能主文件(frontmatter + 指令)
├── README.md                    # 本文件
├── evals/                       # 评测机制(规划中)
├── scripts/                     # 零依赖 Python 工具
│   ├── gen_checklist.py         # 按评估场景生成检查清单
│   └── calc_risk.py             # 风险得分计算与结论判定
└── references/
    ├── authoritative-sources.md # 权威资源导航(网信办/信通院/OWASP/NIST)
    ├── standards-map.md         # 标准对照表(国内法规 ↔ OWASP LLM Top 10)
    ├── checklist.md             # 通用 AI 安全评估检查清单
    ├── checklist/
    │   ├── llm-app.md           # LLM 应用评估清单
    │   ├── agent.md             # Agent 系统评估清单
    │   └── rag.md               # RAG 系统评估清单
    ├── attack-cases.md          # 攻击案例与整改库(13 案例)
    ├── report-template.md       # 评估报告模板
    └── glossary.md              # 术语表(含易混淆概念)

依据标准

  • OWASP Top 10 for LLM Applications (2025)
  • 《生成式人工智能服务管理暂行办法》
  • 《大模型服务与应用安全评测技术规范》
  • 《互联网信息服务深度合成管理规定》

具体评估项编号、判定规则以标准官方文本为准,本技能提供框架与工作流。

相关作品

许可

MIT