POLARIS · AUTOPEN 渗透测试模式 · 0.1.0-PREVIEW.1
Polaris
AutoPen
Polaris(北极星)是面向安全自动化的 AI 工作平台,AutoPen 为其渗透测试模式。用户用自然语言说明目标和测试意图,系统完成意图澄清、攻击面发现、测试路径规划、漏洞检测、低影响验证、证据核验、报告生成和修复复测。后续规划 AutoCTF 模式。
问题与定位
§ 01渗透测试最费时间的部分,往往不是运行工具,而是持续理解目标、判断线索和选择路径。
传统流程依赖安全人员在多个命令行工具、浏览器、代理、表格和报告模板之间来回切换。一旦测试持续数小时或涉及多个资产,工具输出、人工判断、审批决定和漏洞证据很容易脱节。
Polaris 的 AutoPen 模式把这些环节放进同一套可持续运行的工作流中。用户用自然语言说明目标和测试意图,系统完成意图澄清、攻击面发现、测试路径规划、漏洞检测、低影响验证、证据核验、报告生成和修复复测。多名中文专业智能体分工协作,关键动作由确定性安全规则和人工审批控制,工具在独立微虚拟机中运行,全部过程都能暂停、恢复、追溯和审计。
它面向需要持续验证资产风险的安全团队、研发安全团队和独立安全研究人员。它的目标不是替安全人员做最终决定,而是接管重复、耗时且容易丢失上下文的工作,让测试者把精力放在高价值判断上。
# 自然语言指令启动 › 扫描 target.com,关注 Web 和 API ## 意图优化智能体 正在澄清测试意图: 目标、深度、禁止动作、报告受众。 关键信息不足 → 提出澄清问题 [用户确认] → 内部任务边界已生成 ## 资产发现智能体 · 事件驱动 $ subfinder -d target.com -silent sub1.target.com api.target.com ## 增量事实 → 立即触发下游 asset.port.discovered(partial=true) 443/tcp → 唤醒服务探测智能体 ## 检测与证据关联 CVE-2021-28169 — Jetty 请求走私 api.target.com:8080 · CVSS 5.9 ## 安全护栏 · 高危审批 SSH 弱口令验证 → require_approval [批准执行] / [拒绝] / [要求修改]
桌面端与 CLI双入口
§ 02 · DUAL ENTRY不是浏览器里的 Web 平台,是桌面应用。
Polaris 的主交付形态是 Windows 桌面应用。桌面端用于创建任务、查看实时状态、处理审批、检查证据、浏览任务图谱和导出报告;CLI 复用同一套核心服务与安全协议,适合无头运行、脚本化测试和持续集成场景。
桌面壳采用 Tauri 2。React 与 TypeScript 负责界面,独立 Go 核心服务负责任务、智能体、策略、证据、记忆、审计和报告,独立工具执行器负责高权限工具调用。各进程通过受访问控制的 Windows Named Pipe 和版本化 JSON-RPC 通信,不依赖 localhost HTTP,也不向局域网暴露管理接口。
产品默认使用简体中文。导航、按钮、任务阶段、状态、风险等级、审批说明、图谱节点和智能体名称均以中文显示。模型官方名称、CLI、MCP、WSL2、JSON、SARIF 等确有互操作意义的标识可以保留,同时提供清晰的中文说明。
四层权限边界
Tauri 2 桌面壳 ├── React + TypeScript 界面 ├── Intent UI / 审批 / 图谱 / 报告 │ Named Pipe + JSON-RPC ▼ Go 核心服务 (Sidecar) ├── 编排内核 / 记忆中枢 ├── 安全护栏 / 审批 / 证据 ├── 任务图谱 / 审计 / 报告 ├── SQLite + WAL │ 结构化 ToolJob ▼ 工具执行器 (Go Runner) ├── 工具清单 / 参数校验 ├── CubeSandbox 控制面 │ wslc 隔离 ▼ WSL2/KVM 工具微虚拟机 └── Subfinder / Nmap / Nuclei ...
自然语言任务与意图优化
§ 03 · INTENT REFINEMENT用户说一句话,系统先澄清意图,不静默猜测。
用户可以输入域名、IP、CIDR、资产标签或一段自然语言指令。意图优化智能体会从中提取目标、测试深度、禁止动作、报告受众和成功标准。如果关键信息不足,它会先提出澄清问题,不会静默猜测。
原始输入、优化结果、差异、确认版本和摘要都会保存,只有用户确认后的版本才能创建任务。Polaris 不提供可以由用户自行填写和伪造的"授权项目"功能,也不要求用户在界面选择内部任务边界或填写预算。
用户确认明确目标后,核心服务会自动生成不可编辑、带版本和签名的内部任务边界,并应用固定的并发、时长、输出、重试和模型用量上限。它是一道执行限制,不被包装成外部授权证明。后续任何关键目标变更都会产生新的意图版本并重新校验,不能用一句追加提示临时扩大目标,也不能复用旧审批去执行已经变化的动作。
-
✓
意图提取 — 从自然语言中提取目标、深度、禁止动作、报告受众和成功标准。
-
✓
澄清优先 — 关键信息不足时先提问,不静默猜测。
-
✓
版本化确认 — 原始输入、优化结果、差异和确认版本全部保存,只有确认后才能创建任务。
-
✓
内部任务边界 — 核心服务自动生成不可编辑、带版本和签名的执行限制,不是用户自填的授权证明。
-
✓
变更重新校验 — 关键目标变更产生新意图版本,不能用追加提示扩大目标或复用旧审批。
-
✗
不提供伪造授权 — 不提供用户可自行填写和伪造的"授权项目"功能。
九阶段测试流程
§ 04 · 9 STAGES · 5 MACROPolaris 内部采用九阶段生命周期,覆盖一次正式渗透测试从开始到关闭的全过程。阶段 3 至 6 是事件驱动的:局部事实一出现即可触发下游工作,不需要等待整个上游阶段结束。桌面端将九个内部阶段聚合为五个用户阶段呈现。
意图澄清与提示词优化
把自然语言整理成用户可以检查和确认的任务意图。关键字段缺失时先提问,不静默猜测。
约束固化
根据已确认目标生成内部任务边界,固定排除项、工具权限和资源上限。带版本和签名。
资产发现
收集域名、子域名、IP、DNS、WHOIS 和资产归属信息。构建初始资产边界。
攻击面画像
识别端口、协议、服务、版本、技术栈、路径和资产关系。识别可访问服务。
假设生成与路径规划
根据已知事实提出可以验证的测试假设,并按价值、风险和成本排序。将事实转化为可验证假设。
检测与证据关联
把规则命中、CVE、配置问题和独立证据关联起来,区分线索与有效发现。
受控验证
对高价值候选进行最小影响验证,高风险动作必须先通过人工审批。
报告与修复计划
整理证据、风险、审批记录、修复建议和责任视图。生成五种格式报告。
复测、关闭与知识反馈
验证修复结果,记录差异,关闭问题,并把经过治理的知识用于后续任务。
桌面端聚合为五个用户阶段 ↓
事件驱动多智能体
§ 05 · EVENT-DRIVEN资产发现还在扫描时发现 443/tcp,立即唤醒服务探测智能体。
Polaris 注册九个业务智能体,桌面端显示十个角色画像:九个业务智能体加一个"守界"安全治理投影。守界不是第十个模型智能体,不领取普通工具工作项,也不能批准动作,它把确定性安全护栏的阻断、暂停、终止和恢复原因转换为用户能理解的桌面角色视图。
这些智能体通过持久化事件和任务黑板协作,而不是互相复制整段对话、凭据或原始命令。每条事件都携带来源、版本、因果关系、去重标识和证据引用。
例如,资产发现智能体仍在继续扫描其他端口时,只要解析器发现 443/tcp,系统就会立刻保存这条增量事实并唤醒服务探测智能体。服务识别结果又可以继续触发漏洞检测,不需要等待整轮资产发现结束。重复事件不会生成重复工作项,异常事件扇出会触发背压或熔断。
十角色画像 · 九业务智能体
北辰
任务理解与调度 · 拆解 · 交接
巡界
资产发现 · 边界校验 · 去重
识微
服务 · 协议 · 版本识别
探隙
漏洞检测 · 候选整理 · 误报控制
验锋
经审批的最小影响受控验证
回证
修复复测 · 差异比较 · 状态关闭
明鉴
证据完整性 · 冲突 · 可信度核验
慎行
风险解释 · 审批请求 · 状态追踪
纪实
已核验事实生成增量与最终报告
守界
安全治理投影 · 非业务智能体 · 展示护栏判定
实时任务图谱
§ 06 · LIVE MISSION GRAPH用户和智能体共同使用的实时事实视图,不是临时拼成的展示树。
实时任务图谱由核心服务根据持久化事件确定性生成,不依赖前端临时拼接,也不会用动画假装系统正在执行。用户点击任意资产、关系或智能体动作,可以查看它由什么事件产生、为什么触发、谁负责执行、经过了哪项策略、是否要求审批、使用了哪个工具版本、产生了什么证据,以及下一步交给了谁。
图谱支持快照、序号增量、邻域、路径和因果解释查询。桌面应用重启或暂时断开后,可以从已经持久化的事件序号继续补齐。大规模任务会按域名、网段、服务族和状态聚合,避免把全部节点同时塞给用户或模型。
四层逻辑视图
端口 · 服务 · 技术栈 · 漏洞
逻辑检查点 · 证据
策略决定 · 审批 · 工具作业
验证记录 · 报告 · 复测状态
资产与漏洞工作台
§ 07 · WORKBENCH工具命中不会直接变成漏洞,结论必须带来源和证据。
Polaris 自动维护目标、子域名、IP、端口、服务、技术指纹、接口、漏洞、验证结果和修复状态之间的关系。资产工作台可以查看当前攻击面,也可以比较同一目标在不同任务中的变化,例如新增子域名、端口变化、服务版本变化和已关闭漏洞重新出现。
漏洞工作台不会把所有扫描命中都标成漏洞。每条记录按实际状态流转,每条正式发现至少包含目标资产、来源工具、工具版本、模板或规则版本、时间、原始证据位置、证据哈希、置信度、复现条件、审批记录和人工复核状态。
多个工具或智能体对同一问题产生的重复结果会被归并,但不会通过覆盖丢失来源。存在冲突时,系统保留双方证据并等待进一步验证。
漏洞状态流转
每条正式发现包含:目标资产、来源工具、工具版本、模板/规则版本、时间、原始证据位置、证据哈希、置信度、复现条件、审批记录和人工复核状态。
冲突处理:多工具对同一问题的重复结果归并但保留来源;存在冲突时保留双方证据并等待进一步验证,不会通过覆盖丢失来源。
证据驱动回溯
§ 08 · BACKTRACKING保存断点,尝试方法一,失败后回到断点再尝试方法二。
真实渗透测试很少沿一条直线完成。某个版本判断可能错误,某条利用路径可能不适用,也可能因为风险过高而被拒绝。Polaris 使用假设图、候选分支和逻辑检查点管理这些变化。
开始一个分支前,系统会保存当前已知事实、候选列表、资源消耗、证据版本和副作用声明。方法失败后,失败原因、工具输出和已发生的真实影响都会保留,系统只恢复内部的逻辑前沿,再评估下一条仍满足条件的路径。它不会假装目标系统已经被自动回滚。
分支会根据证据强度、信息增益、风险、成本、重复度和剩余资源排序。低风险且互不依赖的路径可以并行,高风险路径默认串行,并且每条路径都要生成新的动作摘要和审批。审计中断、工具状态未知或副作用无法确认时,任务会进入等待恢复状态,而不是自动尝试下一项高风险动作。
分支搜索示意
假设 H1 ├─ 分支 A: 方法一 │ └─ running → evidence_refutes → failed │ └─ 保留预算、证据、ToolJob │ 真实副作用声明 │ ├─ 检查点 C1 │ └─ 恢复逻辑 frontier │ 不回滚目标系统 │ └─ 分支 B: 方法二 └─ Safety/Approval → running → confirmed └─ Finding + Evidence + trace # 副作用分类 # none / reversible / compensatable # irreversible / unknown # unknown/irreversible → 不自动切换
用户外部工具与受控执行
§ 09 · EXTERNAL TOOLS0.1.0 不内置固定数量的渗透工具,用户从本机明确选择可执行文件。
用户在桌面"工具与环境"页面选择本机工具。核心服务加密保存绝对路径,对桌面和智能体只公开显示名称、可执行文件名、路径摘要、中文能力标签、固定参数模板、启用状态和配置版本。
智能体不能直接提交任意路径,只能发现并使用用户已启用的工具档案。参数必须是数组,不支持 cmd /c、PowerShell 或字符串拼接命令。执行仍应用超时、输出上限、取消和进程清理。
验收对象不是"内置了多少工具",而是"智能体是否可用":能发现用户配置的工具、能根据能力标签提出调用、核心服务能拒绝直接路径和字符串命令、执行有时间和输出上限、停止后没有遗留进程、结果能形成结构化摘要或证据引用。
智能体发现与调用流程
用户选择本机可执行文件
→ 核心服务加密保存路径与参数模板
→ 智能体发现已启用工具档案
→ 根据能力标签提出调用请求
→ 核心服务拒绝直接路径 / 字符串命令
→ 执行器有界执行:超时 · 输出上限 · 取消
→ 进程清理:停止 / 失败 / 超时无遗留
→ 结果形成结构化摘要或证据引用
安全护栏与人工审批
§ 10 · SAFETY + APPROVAL模型、智能体、记忆和外部工具都不能自行决定权限。
安全护栏使用确定性代码统一检查内部任务边界、工具能力、风险、并发、速率、敏感数据、凭据、异常行为和任务状态。信息收集、低风险端口探测和审核后的非破坏性规则检测可以按产品策略自动执行。利用验证、凭据相关测试、可能改变目标状态或产生明显负载的动作,会在执行前暂停,并向用户展示目标、工具版本、完整参数摘要、风险说明、触发证据、可能影响和批准有效期。
审批令牌一次有效,并绑定具体任务、资产、动作、参数、策略版本和到期时间。目标、参数、工具版本或任务状态发生变化后,原批准自动失效。用户可以批准、拒绝、要求修改计划或直接终止任务,不会遇到"允许智能体继续执行全部操作"这类模糊授权。
系统同时提供暂停、终止、速率限制、异常熔断和全局停止开关。安全护栏不可用时,新执行默认关闭。
-
✓
确定性安全护栏 — 独立于全部 LLM,统一执行 Scope、Policy、Approval、Budget、Capability 和 Kill Switch 判定。
-
✓
一次性审批令牌 — 绑定任务、资产、动作、参数、策略版本和到期时间,变化后自动失效。
-
✓
分级执行 — 信息收集和低风险检测可自动执行;利用验证和凭据测试必须先通过人工审批。
-
✓
行为监控 — 目标漂移、重复失败、异常扇出、资源突增、跨任务读取等行为触发拒绝、暂停或终止。
-
✓
全局停止开关 — 支持暂停、终止、速率限制、并发限制和异常熔断。护栏不可用时新执行 fail closed。
-
✓
全量审计 — 所有 Agent 决策、工具调用、审批、拒绝和状态变迁均可关联到证据链。
-
✗
不越权执行 — Agent 拒绝未授权目标、超出范围的解析结果和第三方/CDN 资产。
-
✗
不外发敏感数据 — 凭据、Cookie、Token、客户数据或未脱敏的扫描输出不会发送给未被授权的外部模型。
-
✗
不提供攻击路径 — 不提供面向未授权攻击、数据窃取、持久化控制或破坏目标系统的执行路径。
多模型接入管理
§ 11 · MODEL GATEWAY桌面界面、工具、技能和外部 MCP 都不能直接持有模型密钥。
Polaris 把模型能力集中到统一的模型接入管理中。用户可以为总控、意图优化、报告摘要等不同职责配置不同模型,也可以选择完全不使用大模型,转而使用确定性流程完成基础澄清与任务执行。
远程模型默认关闭。启用前,界面会说明厂商、端点、可能发送的数据类型、脱敏规则和数据保留提示,并要求用户明确同意。API Key 通过 Windows DPAPI 或受保护凭据存储加密,界面只显示掩码、指纹和健康状态。
发送给远程模型的内容经过最小化、来源标记和脱敏,Cookie、Token、原始证据、未净化工具输出和跨任务敏感记忆不会进入模型请求。大模型只负责整理意图、提出结构化建议、解释决策和起草报告。内部任务边界、风险判定、审批、工具参数、停止开关和最终证据等级由确定性代码决定。
预设模型接入
Ollama
本地运行
Anthropic
Claude
OpenAI
GPT
DeepSeek
深度求索
豆包
字节跳动
Kimi
月之暗面
阶跃星辰
StepFun
Agnes AI
自定义
OpenAI 兼容接口
用户自定义端点 · 可完全不使用大模型,转而使用确定性流程
报告与修复复测
§ 12 · REPORT + RETEST从任务开始就持续积累报告素材,不需要结束后再人工拼接。
报告智能体只读取经过净化和核验的结构化事实,并在任务达到结束条件后生成正式版本。同一任务可以生成面向安全团队、研发团队和管理层的不同视图。安全人员看到复现条件、请求响应、工具版本和证据链;研发人员看到受影响组件、修复建议、优先级和复测条件;管理者看到风险分布、变化趋势、处置状态和需要决策的问题。
所有高风险发现都可以从报告反向追踪到具体资产、触发事实、责任智能体、动作提案、策略决定、人工审批、工具作业和原始证据。报告支持脱敏,导出行为本身也进入审计。
修复完成后,复测智能体会依据原始条件重新验证,并对比资产、服务、证据和风险状态的变化。问题通过复测后进入已关闭状态;仍可复现、证据不足或环境变化的情况会保留原因和下一步建议。系统还可通过 Webhook、工单、CI/CD 和 GitHub Actions 接入研发流程,形成持续验证闭环。
五种报告格式
三视角报告:
安全团队 — 复现条件、请求响应、工具版本、证据链
研发团队 — 受影响组件、修复建议、优先级、复测条件
管理层 — 风险分布、变化趋势、处置状态、决策事项
产品差异
§ 13 · DIFFERENTIATIONPolaris 的差异不在于接入了多少模型,也不靠堆叠两百种未经审核的工具。它把以下能力放进同一条可验证链路:
桌面与 CLI 共用安全核心
既满足可视化操作,也适合无头自动化。同一套 Go 核心服务与安全协议驱动两种入口。
事件驱动多智能体
增量发现可以立即触发下游工作,角色之间保留完整因果关系,不是屏障式串行。
实时任务图谱
用户和智能体基于同一份已持久化事实理解攻击面和执行状态,不是临时拼成的展示树。
证据优先
工具命中不会直接变成正式漏洞,结论必须带来源、版本、证据和复现条件。
安全控制独立于模型
内部任务边界、审批、工具参数、停止开关和审计由确定性代码执行,模型不能覆盖。
工具环境与用户环境分离
精选工具包运行在 CubeSandbox 受控微虚拟机中,不继承用户日常环境和敏感凭据。
路径失败后可以安全换路
保留失败证据和真实副作用,只恢复内部逻辑状态,不假装目标系统已被回滚。
知识可以复用,也可以撤销
跨任务知识带来源、可信状态、有效期和冲突信息,过期或被撤销的记忆不能驱动执行。
从发现走到复测关闭
资产、漏洞、审批、证据、报告和修复结果处在同一工作流中。最终交付的是一条可以回放的渗透测试记录:用户可以知道目标如何被理解,哪个智能体根据什么事实提出下一步,安全规则为何允许或拒绝,工具在什么隔离环境中运行,谁批准了高风险动作,哪份证据支撑漏洞结论,以及修复后问题是否真正关闭。
互动演示
§ 14 · 模拟以上为桌面端前端模拟演示,包含对话式任务启动、实时任务图谱、授权 Scope 管理、多智能体协作状态与审批流程。所有交互均在浏览器本地完成,不涉及真实网络扫描或漏洞利用。0.1.0-preview.1 预览版开发完成,不代表最终版本。 试试输入"扫描 target.com"。
多版本路线图
§ 15 · ROADMAP以下版本按能力依赖排序,不给出固定日期。预览反馈可以调整同一版本内部优先级,但不能跳过安全门槛。1.0 不以工具数量作为门槛,而以每个"声明支持"的工具或服务是否真正满足其兼容和安全契约作为门槛。
预览版已完成
桌面端与 CLI 双入口、九业务智能体、用户外部工具受控执行、五类报告导出、桌面生产构建通过。安装器打包与冒烟测试为剩余项。
预览维护线推进中
修复安装、启动、退出、卸载和数据目录问题;增加反馈入口、诊断包和隐私说明;收敛外部工具配置体验;修复界面、DPI 和可访问性问题。
外部工具与受控连接预览
常见工具兼容适配档案、参数模板和结果解析;本地工具安全网关;受控远程工具服务;满足复合浏览器作业契约的参考浏览器服务;Burp/HAR 被动证据。
九智能体协作 Beta
完整九阶段内部生命周期,桌面聚合为五个用户阶段;增量事实触发下游工作;事件推送、去重、背压、资源争抢和并发上限;桌面图谱展示责任智能体和证据。
证据、回溯与闭环 Beta
深化资产、服务、漏洞、证据、审批和修复状态工作台;假设图、分支排序和证据驱动换路;方法失败后保留预算和证据,只恢复内部逻辑前沿;记忆中枢完善。
Windows 隔离与高风险执行 Beta
AppContainer 一次性身份和受保护任务目录;Job Object 进程树和资源清理;WFP 默认拒绝网络租约和精确目标放行;高风险动作的一次性、限时、参数绑定审批。
模型、技能与知识治理 Beta
受信模型目录、能力协商、角色路由和失败回退;九业务智能体中文提示词审核和回归评测;技能触发和工具依赖;知识包上传、信任根、净化和撤销;提示注入回归。
正式候选版
正式签名安装包和回滚;干净设备、多 DPI、不同权限和离线安装矩阵;数据迁移和卸载残留清理;性能、长任务、崩溃和断电测试;专项安全测试。
稳定版
桌面端和 CLI 共用稳定核心服务;九阶段流程和十角色桌面视图一致;高风险动作只在正式 Windows 隔离边界和精确审批后执行;所有受支持外部工具具备固定适配、校验、有界输出和证据;安装、更新、回滚和卸载达到稳定版门槛。
团队与持续验证
可选团队协作和远端同步,本地核心仍可独立运行;工单、Webhook、持续集成和定期复测;组织和项目风险管理;团队报告与修复时效视图。
适配生态
用户可安装的签名适配档案、技能和知识包;第三方工具兼容市场只分发适配、规则和元数据,不捆绑第三方二进制;受控本地/远程工具服务目录。
Polaris 多模式平台
AutoCTF 模式:面向竞赛、训练或授权挑战环境,使用独立策略、智能体和工具能力;内部包含网络安全、数据安全、Web、密码、逆向、二进制、取证和综合题方向。其他模式通过稳定平台接口复用核心能力,不允许直接复用 AutoPen 权限。