中国经济导报、中国发展网讯 记者鲍筱兰 8月5日,在全球AI安全能力最严苛的公开竞技场中,由上海头部 AI 研究机构联合 deepsec 团队打造的 AI 安全系统 DoGNAVY,在全球公开 AI 网络安全能力评测基准测试 CyberGym 中取得 90.8% 的成绩,位列公开榜单第三、开源模型路线第一,这是国产方案首次跻身该榜单前三甲。
真实漏洞的“极限考场”,CyberGym被誉为AI安全能力的“铁人赛场”。它不设模拟环境,不提供标准答案,而是直接还原了188个真实开源项目中曾存在、后被修复的1,507个历史漏洞。参赛AI仅能获得原始代码与一段简短描述,须在无任何补丁参考、无外部知识库辅助的条件下,自主完成漏洞定位、原理理解与可验证利用的全流程。
DoGNAVY最终成功通过1,369项,验证率超九成。榜单前十强云集全球顶尖AI巨头:微软MDASH以92.0%居首,其背后正是2025年美国国防部DARPA AIxCC大赛400万美元冠军团队;谷歌斥资320亿美元收购的Wiz携手Google DeepMind打造的Atlas以90.9%位列次席;OpenAI GPT-5.5-Cyber、Anthropic Claude Mythos Preview等紧随其后。
然而,与竞争对手普遍采用多款顶级闭源模型“集团作战”的策略截然不同,DoGNAVY仅依托一款国产开源模型——智谱于今年6月开源的GLM-5.2,该模型可通过公开渠道自由下载与部署。从Agent基础设施到安全分析工作流,整套系统全部由国内团队独立完成,不依赖任何境外闭源能力。
让AI学会“安全研究员式思考”,DoGNAVY的真正突破,不在于模型参数的大小,而在于将顶尖安全研究员的认知经验系统化为AI可执行的决策逻辑。
CyberGym的难度核心在于“模糊探索”:AI要在有限信息下判断攻击面、选择验证路径、处理失败并反复纠偏——这正是人类安全专家在无数次真实攻防中磨砺出的核心能力。DoGNAVY团队将这种工作方式拆解为Agent工作流,使AI学会在代码丛林中“像专家一样嗅探、假设、试错与收敛”。
同时,团队构建了严格的自研沙箱隔离环境,杜绝AI评测中逃逸或访问外部信息的可能。为确保成绩纯粹反映系统真实能力,评测期间关闭跨任务记忆,每项任务均从独立环境冷启动,并在启动前清理历史PoC、补丁及一切可能泄露答案的材料。这一做法,在近期OpenAI与Anthropic相继披露AI自主逃出沙箱事件后,尤显前瞻与必要。
全栈国产:从模型到方法论的安全底座。DoGNAVY的“国产”二字,远不止于模型权重的归属。它实现了从基础模型、Agent运行框架到安全攻防工作流的全技术栈自主可控。国产开源模型(智谱GLM-5.2) 提供智能底座;上海头部AI研究机构 承担Agent运行环境、轨迹诊断与安全隔离能力;deepsec@DARKNAVY 注入长期服务行业巨头所沉淀的一线真实攻防经验与成熟安全工作流。
三者深度融合,形成一套可自主部署、可验证、可持续演进的国产技术体系。在安全这一关键领域,这意味着核心能力真正掌握在自己手中,而非寄望于外部黑盒。
榜单之外:真实战场已先行。CyberGym评估的仅是DoGNAVY的漏洞验证能力。而在榜单之外,其支撑技术体系早已投入实战检验。deepsec@DARKNAVY已在多家行业头部企业的真实业务中开展安全分析,并完成微软Edge浏览器漏洞链、无人机复杂软硬件系统等高难度目标的分析验证;AgentDoG 1.5面向真实Agent部署场景,提供执行轨迹精准诊断、低成本训练与在线防护能力。此次在CyberGym中被验证的核心能力,将逐步与平台衔接,进入更多真实业务场景。
让顶尖安全能力不再属于少数,DoGNAVY下一步将与deepsec声纳计划协同,面向更多创新组织开放能力,汇聚模型、AI研究、安全与产业各方力量,让顶尖的AI安全攻防能力,不再只属于少数区域和机构,而是能被更广泛的创新者获得、使用并共同建设。
这正是deepsec声纳计划所倡议的初心,让更多中国创新拥有AI安全力量。从开源模型到自主工作流,从实验室榜单到一线真实战场,DoGNAVY迈出的一步,是中国AI安全走向纵深的一个注脚。而这条真实漏洞验证的新路径,正由本土团队一步步跑通、跑稳、跑远。

京公网安备 11010202009593号
| 新闻信息服务许可证编号:10120230001
| 新闻监督电话:010-63691558