AI 快讯
编译自 marktechpost #模型安全#红队测试#NVIDIA
NVIDIA garak 教程:构建完整的大模型红队防御工作流,含自定义探针与检测器
本文详解 NVIDIA garak 框架,教你如何设置、发现插件、运行扫描、分析安全评分与攻击成功率,并创建自定义探针和检测器,最终导出 AVID 格式漏洞报告。读完可掌握 LLM 红队测试的完整流程。
一句话看懂
NVIDIA garak 是一个开源的大模型红队测试框架,本文手把手教你搭建从扫描、分析到自定义探针的完整防御工作流。
详细发生了什么
NVIDIA garak 是一个专为 LLM 设计的红队测试框架,支持自动化探测、检测和报告生成。教程从安装 garak 开始,通过 --list_probes 等命令查看可用插件,然后用 test.Repeat 做快速干运行验证环境。接着扫描真实模型(如 Hugging Face 上的 gpt2),使用 DAN 11.0 等探针进行多探针评估,生成 JSONL 格式报告。
报告分析阶段,教程展示了如何用 pandas 计算安全分数(safe_%)和攻击成功率(ASR_%),并用条形图可视化各探针-检测器组合的脆弱性。随后,教程指导创建自定义探针 HelloProbe(固定提示词)和自定义检测器 ContainsHello(检测输出是否包含 “hello”),最后将结果导出为 AVID 格式,便于结构化漏洞管理。
中文圈视角
garak 对中文开发者有直接价值:
- 国产模型可用:garak 支持 Hugging Face 模型,因此可以测试 Qwen、Yi、ChatGLM 等中文开源模型。但需注意,部分探针(如 DAN 11.0)针对英文越狱设计,中文场景可能需要自定义探针。
- 平替方案:国内类似工具有 ModelScope 的“模型安全评测”组件,但功能不如 garak 完善。garak 的插件体系更灵活,适合深度定制。
- 合规需求:随着《生成式人工智能服务管理暂行办法》实施,企业需要定期进行安全测试。garak 的 AVID 导出功能可直接用于合规报告。
- 盲点:中文圈对 LLM 红队测试的讨论多集中在越狱提示词,而 garak 提供的系统化框架(探针-检测器-报告)尚未被广泛采用。
几条值得记住的细节
- garak 支持多种目标类型:
test.Repeat(无需 API key)、Hugging Face 模型、OpenAI 等 API。 - 自定义探针只需继承
Probe类,定义prompts列表和primary_detector。 - 自定义检测器可继承
StringDetector,在__init__中传入关键词列表。 - 报告以 JSONL 格式存储,可用
garak.report.Report解析,或手动解析。 - AVID 导出格式兼容主流漏洞管理平台,便于追踪修复。
一句话总结
如果你想系统化测试大模型安全性,garak 是开源首选,本教程让你从零搭建完整工作流。