Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

PPVDH:探究开源白盒安全审计的产品形态

2026-08-31, 杭州

自从大约是Claude 4.5系列出来之后,大家意识到Agent可以做安全代码审计,那个时候已经有了一些早先的尝试;而今年Mythos发布以来,大家突然意识到网络安全能力是可以且方便涌现的,“日穿”和CTF的Flag一样是极其容易验证的事情,而LLM恰恰擅长这类事情。

因此,到了今年上半年,一方面模型厂加大投入训练网络安全能力,另一方面Mythos也在带动下游完善自己作为企业甲方开展漏洞排查的Harness。我所见最早是安恒的VulnPlus,然后Cf蹬了半年Mythos发表获奖感言,现在,Google也发布了他们的AVDH。经过这小半年的探索,应该可以说VDH会成为非常行之有效的产品形态。如果让我选一个这样的产品形态命名的话,按DARKNAVY的公众号文章叫“漏洞洞察系统”可能会更加合适?

所以我主要依据Cf的技术博客以及他们的SKILLS,借助K3和大肥鱼之力,vibe出了一个参考性质的VDH产品:PPVDH。https://github.com/chengongpp/ppvdh

PPVDH目前处在一个已经能用的水平,后续会不断优化沙箱、上下文、专家矩阵等。

为什么是VDH

AI时代下,产品思维需要一种逆转。如果从做AI产品的角度出发,仅仅带着workflow/agent的视角去推,则无法完美拟合到安全的流程;但如果还沉浸在旧时代的安全产品分类,“我要搞个AI威胁建模,搞个AI代码审计”,其实反而限制了AI的能力,因为你首先需要肘赢给够足够信息的/goal的通用agent,而你按传统的安全产品去设计的话,AI会少拿少关联很多信息,结果就是肘不赢。我强烈建议安全产品经理直接把旧平台整个扔了,让通用agent对着自己想解决的痛点问题/goal一下,再把旧平台的“强项”功能一点一点加回来

VDH实际上就是组织维度的“代审”思维进化出来的产品。但我不想管这东西叫AI代码审计平台,因为它本质上是AI对“找出所有漏洞”这个目标的/goal,用“代码审计”思考就限制了自己的想象力。只是目前测下来,我们可以特化加强静态分析-简单验证这一个通路,得到较好的效果,于是结论就是VDH:输入源码和物料、给出基础环境和工具、设定探究方向、最后直接对结果收菜。

VDH的流程

结合Cf和Google的博客,VDH的大致流程是:多角度威胁建模-选取专家上下文-专家进行漏洞挖掘-重整探索结果-正反两面验证-给出最终报告。

多角度威胁建模

业务属性、接口、鉴权机制等各种都可以做。事实上这也意味着VDH完全把原先一些厂家卖的威胁建模平台(需要你自己勾选业务属性,他会去库里面比对)也吞掉了。总的威胁建模理解有利于后续的agent挑薄弱点下手。

选取专家上下文

理解威胁建模之后我们需要让agent自主决策,选取N个专家subagent。每个专家专注自己负责的漏洞类型。至于专家矩阵要做得多么细致,要不要iteration per file,都是需要视特定场景去调的。

专家进行漏洞挖掘

专家自己去trace,你可能可以给CodeQL、rg、ast-grep等好用的工具。

重整探索结果

探索结果需要做严格的schema校验,方便梳理去重。

正反两面验证

正面验证就是让AI重新走一遍路径看看到底通不通;反面验证就是直接challenge这条链路,如果在静态推理都经不起推敲,就可以滤掉了。当然,如果你用的AI比较笨,可能需要避免它把本应注意的点洗掉。

给出报告

报告就没啥好说了,报告要有对应的格式,从Markdown到PDF是一方面,此外你可能还需要做数据飞轮,那特调过的jsonl,针对项目本身的理解等,也都是需要的。

后续可能优化的方向?

覆盖率。基于规则的接口/切面枚举。逐渐把传统工具当中能做到100%覆盖又不引入过多噪声的特性拿回来。

其他思考

产品轻松肘赢/goal没问题,但之后效果要从80分到90分,护城河就在于专家上下文怎么构建,细粒度怎么做,哪些tool可以加快速度,怎么造环境让验证更高效,诸如此类。再有就是对自由运行边界的容忍,走固定流程?还是动态编排?还是做agent swarm?怎么在不影响性能的前提下防止逃逸?所以真做起来又有很多地方需要完善。但市场可能等不到你的完善,基模的infosec能力这半年迅速提高,低垂的漏洞很快会被蹬完。

一个恐怖的点在于,构建一个VDH的成本太低,你让小鲸鱼对着cf和google关于VDH的博客直接抄一个,他都能抄出80分的水平,而agent RSI做好了它还能自己进化到90分,那么 企业为了90分提到95分,还花大价钱采购,真的值得吗? 这就变成很严峻的问题。就像之前说的,目前FDE吃了人类学习速度姑且大于agent RSI速度的优势,哪天continuous learning真出来了,FDE全部完蛋。但是万一continuous learning出不来呢?风口之上能赚一笔是一笔。