Anthropic 三级访问架构:前沿 AI 网络能力"分级放行"的战略逻辑、商业实验与治理挑战

来源:爱集微 #三级访问架构# #前沿AI安全治理#
1002

导语

当地时间 2026 年 10 月 6 日(周二),Anthropic 宣布将其"网络安全验证计划"(Cyber Verification Program,CVP)扩展为三级访问架构:合格的安全专业人员将获得先进网络能力与削减拦截分类器的访问权限,安全团队可按工作性质申请相应层级。彭博社、SecurityWeek 等多家媒体当日及次日跟进报道。

这意味着:区域医院的信息安全团队、市政公用事业的防御人员、开源软件维护者,乃至有漏洞报告记录的个人研究者,都可以申请一款"防护被削弱的"前沿 AI 模型来扫漏洞、做逆向;而极少数被授权测试电网、飞控、银行间清算网络的组织,则可以在与美国政府的联合深度审核下,使用几乎不被拦截的顶级模型。一道横亘在"前沿能力"与"防御刚需"之间的闸门,正从"全开或全关"变成"逐级放行"。

这道闸门为何要分级?依据是什么?谁来把关?本文依据已核验素材,从六个层面进行拆解。

一、案例背景:安全基因与 CVP 的起源迭代

Anthropic 的三级访问架构并非凭空出现,它根植于这家公司的治理框架,也脱胎于过去六个月两条并行运行的前身程序。

制度层面的"安全基因"。 Anthropic 自愿采用"负责任扩展政策"(RSP)——管理先进 AI 灾难性风险的框架,随模型能力升级持续修订;2026 年 7 月更新版继续发展风险报告、自动化 AI 研究能力、模型安全与外部审查等领域。"能力越强、管控越细"是其扩展逻辑的底层规则。

程序层面的"双轨前身"。 过去六个月,Anthropic 以双轨制提供可信访问:Project Glasswing 向保护最关键软件的一批组织提供 Claude Mythos 访问;原版 CVP 向经审核安全团队提供 Claude Opus 与 Sonnet 模型的削减防护版本。本次扩展即将两者整合为统一的三级架构。Glasswing 于 2026 年 4 月 7 日启动,初期约 50 家软件与基础设施组织加入;6 月新增约 150 家,覆盖电力、水务、医疗、通信、硬件等行业所在的 15 个以上国家,参与者用 Mythos Preview 扫描软件、查找漏洞。

预告与兑现。 Claude Opus 5.5 发布时,官方即预告:因其网络能力极强,将施以与 Fable 5.1 同级的网络安全防护,多数网络安全任务回退至 Opus 4.8;并预告"未来数周内扩展 CVP,设立三级递进的可信访问,包括 Claude Mythos 模型的访问"。10 月 6 日的新公告正是对这一预告的兑现。

背景注脚:2026 年 9 月 18 日,Anthropic 与埃森哲宣布未来五年各投入至少 10 亿美元(合计至少 20 亿美元)共建驻场独立 AI 评估能力,由埃森哲旗下 Faculty 牵头,评估员驻场执行红队测试、对齐评估与防护测试;消息公布后埃森哲股价盘后上涨 7%。

二、事件全景:三级访问架构逐级拆解

新公告的核心,是把原来"有或没有"的二元准入,重构为Defense Access(防御访问)、Red Team Access(红队访问)、Specialized Access(专门访问)三级递进体系。

Defense Access(防御访问):宽口径的防御层。 覆盖安全运营中心(SOC)、事件响应、恶意软件逆向工程、漏洞分析与验证等场景。面向对象宽泛:企业/高校/政府/非营利安全团队,各类关键基础设施运营方(区域医院、市政公用事业),小型安全公司,开源维护者,以及有漏洞报告记录的个人研究者;申请数天内响应。这是门槛最低、覆盖最广的一层,实质是把"削防护的前沿模型"从大型安全公司下沉到个体研究者。

Red Team Access(红队访问):加码授权的进攻层。 在防御用途之上增加授权渗透测试与红队作业,仅限组织申请——内部红队、政府红队、安全与渗透测试公司,且只能测试获授权目标。即便审核通过,对可能造成物理伤害或大规模中断的行为(部署勒索软件、破坏物理系统、测试高风险安全系统)仍保留实时拦截。审核需数周,期间先按 Defense Access 服务。

Specialized Access(专门访问):极少数机构的"安全关键系统"层。 拦截最少,保留给极少数经授权测试安全关键系统的组织——示例包括飞控操作系统、电网、电信网络、银行间转账(interbank transfer)基础设施与政府行政网络,即"一旦出错可能危及生命或扰乱市场"的系统。Anthropic 目前正与美国政府合作对每家申请组织深度审核;现有 Glasswing 成员针对当前模型无需重新审批即可转入该层级。

贯穿三级的是合规与平台约束。 参与组织须接受数据留存以便监控滥用;今秋推出的企业级前沿防护(EFS)允许合格组织在自控云基础设施中保存监控数据,上线前持 Fable 5.1 / Mythos 5.1 零留存资格者可零留存使用 CVP。CVP 可经 Claude Platform、Google Cloud Vertex AI、Microsoft Foundry 使用,Amazon Bedrock 需 EFS 资格。

维度

Defense Access (防御访问)

Red Team Access (红队访问)

Specialized Access (专门访问)

层级定位

宽口径防御层

授权进攻层

安全关键系统层

核心用途

SOC 、事件响应、恶意软件逆向、漏洞分析与验证

防御用途  +  授权渗透测试与红队作业

测试电网、飞控、电信、银行间清算、政府网络等安全关键系统

面向对象

企业 / 高校 / 政府 / 非营利安全团队;关键基础设施运营方(区域医院、市政公用事业);小型安全公司;开源维护者;有漏洞报告记录的个人研究者

仅限组织 :内部红队、政府红队、安全与渗透测试公司

极少数获授权组织,与美国政府联合深度审核

拦截水平

高(测试中拦截  46/50 )

中低(对勒索软件、物理破坏、高风险安全系统仍实时拦截)

最少

审核强度/时长

数天响应

数周(审核期间按  Defense  服务)

最严,美国政府参与逐家审核

准入范围

最宽

窄

极窄


三、基准解读:CyScenarioBench 的 34/50 与零拦截

分级依据来自内部基准 CyScenarioBench——衡量模型在现实约束下规划并执行多阶段网络行动的能力。Anthropic 以之评估 Claude Opus 5.5 在各访问层级防护下的表现,测试设计为每层级 10 项挑战 × 5 次尝试 = 50 次试验。

三种配置下的结果呈现了清晰的梯度:

无 CVP 访问:全部 50 次试验在首个提示即被拦截,零完成。Defense Access:拦截 46/50,仅完成 4 项。Red Team Access:零拦截,完成 34/50(约 68%),与无防护状态 67.6% 的成功率基本等效。官方称该结果代表 Specialized Access 的表现。

配置

拦截次数( /50 )

完成次数( /50 )

完成率

无  CVP  访问(全部拦截)

50

0

0%

Defense Access

46

4

8%

Red Team Access

0

34

68%

(参考:无防护状态)

—

—

67.6%

这组数据有三层技术含义。其一:分级拦截是真实的"硬刻度"。 从"首提示全拦截"到"防御层拦截 92%"再到"红队层零拦截",说明拦截分类器按层级被实质性削减,而非宣传性表述。其二:红队层能力"接近无防护"。 34/50 与无防护 67.6% 基本等效,意味着被授权组织获得的是几乎不打折的前沿进攻性研究能力——这正是该层级仅限组织申请、审核数周、且保留对勒索软件等场景实时拦截的原因。其三:防御层是刻意的"窄门"。 50 次只放行 4 次,开放的是"资格",收紧的是"能力边界"。

但必须写清一个限定:这套结果系 Anthropic 公司自跑基准,不构成独立评估,也不能证明有害请求无法绕过管控。 CyberSecurityNews、SecureBulletin、XCademia 等多家媒体转述时均明确标注了这一方法论限定。"34/50、零拦截"是 Anthropic 自测的分级效果,其拦截体系在真实对抗环境(如越狱、提示注入)下的稳健性尚无第三方验证。这也解释了 Anthropic 为何同期大力推进外部评估布局(如与埃森哲的驻场评估合作)——自证与他证的缺口,正是第三方评估业务的生长点。

政企协作是本次架构的另一根支柱:Specialized Access 由 Anthropic 与美国政府合作对每家申请组织深度审核。这实际上把"谁有资格接近最危险能力"的裁量权部分让渡给国家机器,形成"企业自审 + 政府复核"的双层把关——在商业 AI 公司的访问治理史上较为罕见。

与基准同期披露的还有 Project Glasswing 的"成绩单",它是三级架构商业价值的最直接佐证:合作伙伴在 2026 年 4–7 月发现至少 129,000 个经验证漏洞;Anthropic 开源扫描在 2026 年 4–10 月另发现 5,500 个;其中 33,000 余个评为高危/严重。官方强调,因数据来自部分伙伴问卷,实际影响"可能至少高 5 倍";且不到半数伙伴披露补丁数量——发现数不等于修复数。

指标

数值

统计口径

合作伙伴发现的经验证漏洞

≥129,000  个

2026  年  4–7  月, Glasswing  伙伴

Anthropic  开源扫描发现

5,500  个

2026  年  4–10  月

其中高危 / 严重级别

33,000+  个

—

官方估计的实际影响

至少高  5  倍

数据来自部分伙伴问卷,官方自称为下限

补丁披露率

不到半数伙伴披露

发现数  ≠  修复数


四、模型矩阵与商业逻辑:谁在为哪个层级买单

三级架构的能力底座是统一的模型矩阵。官方明确:三个层级均包含 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 及未来新模型的访问。三级之间的差异不在"用什么模型",而在"模型带着多厚的防护"——同一个 Opus 5.5,在防御层拦截 46/50,在红队层零拦截。

理解这套矩阵需区分"公众轨道"与"验证轨道"。面向公众的通用模型(Opus 5.5、Fable 5.1、Sonnet 5.5)默认保守网络防护,拦截多数网络任务;普通用户的代码审查、修补、自有源码漏洞发现与告警分诊不受影响,但被拦截的网络任务多数会透明回退到 Opus 4.8。Opus 5.5 被官方称为迄今网络能力最强的模型,网络能力在内部评估中满足或超过 Mythos 5.1;防护机制从两阶段升级为三阶段(内部激活探针 → 轻量分类器 → 独立 LLM 分类器);官方未见其"能开发新型攻击能力"的迹象。对齐维度,官方披露 Opus 5.5 试图绕过边界的频率比 Opus 5 / Mythos 5.1 低约 85%,每次尝试均为低严重度并自我报告。

商业逻辑上,三级架构构建了一个"验证强度随风险递增"的客户分层漏斗:Defense Access 以"数天响应"对接海量防御组织;Red Team Access 仅限组织、审核数周;Specialized Access 面向极少数组织并由美国政府参与逐家审核。SecurityAffairs 评论称"这大约是当前商业 AI 访问中管控最严格的形态",框架本质是"访问与风险等级匹配"。

Glasswing 的漏洞发现数据(见图 3)为漏斗头部提供了价值锚点:即便按官方自认的下限估算,被验证组织释放的防御产出已达可观量级;"实际影响可能至少高 5 倍"与"不到半数伙伴披露补丁"两条限定,同时揭示了市场的增量空间(大量战果未被统计)与价值闭环缺口(发现了但未必修了)。对 Anthropic 而言,三级架构本质上是把"安全能力"从产品功能升级为需审核才能获得的订阅型准入资产——申请、审核、留存监控、平台绑定(Claude Platform / Vertex AI / Microsoft Foundry,Bedrock 需 EFS 资格)构成完整的商业闭环。

五、横向坐标:三巨头"验证先行"的殊途同归

把 Anthropic 的三级架构放到产业坐标系中,可以看到一个正在成形的行业范式:先验证用户,再解锁高危能力。

OpenAI 的路径是"信任计划 + 专用模型"。 2026 年 2 月推出 Trusted Access for Cyber,经供应商 Persona 做政府 ID 与 KYC 核验;4 月向受审核安全专业人员发布 GPT-5.4-Cyber;9 月 1 日起成员须使用硬件背书 passkey;8 月 10 日扩大 Daybreak 计划并推出安全专用模型 GPT-5.6-Cyber,分 Blue/Red 两级——Blue 层调整部分防护,支持授权漏洞发掘、安全代码审查、恶意软件分析与事件响应;Red 层提供专门训练的安全模型用于更高级漏洞研究与攻击验证。依 OpenAI《整备框架》,GPT-5.6 Sol 与 GPT-5.6-Cyber 的安全能力均评为"高",未达"关键"门槛。

Google DeepMind 的路径是"分阶段发布 + 伙伴限定"。 2026 年 9 月 3 日启动 Fairwind Program,面向政府与可信伙伴提供先进网络防御能力的有限访问,首发 Gemini 3.8 Flash Cyber 与 CodeMender,Gemini 4 Argon 为第二个进入该程序的模型。参与方限定三类——政府与国家网络主管机构、医疗/电信/能源/金融关键基础设施运营方、核心技术平台——须同意严格运营标准(限定内部网络安全/事件响应/渗透团队使用、多因素认证等)。有转述称 Fairwind 拥有"全球 650+ 参与伙伴"。

框架层面,三家以不同结构处理同类问题:Anthropic 以 RSP(2026 年 7 月更新)采用阈值触发式安全措施、风险报告与外部审查;OpenAI《整备框架》运行"能力→评测→风险阈值→附加防护"流水线(另有单一转述源称 GPT-6 Astra 网络能力达其 Critical 阈值,仅供参考);Google DeepMind《前沿安全框架》2026 版覆盖网络安全、CBRN、有害操纵、ML 研究、错位五大域〔Rytsense Technologies;Progressive Robot〕。火山知识库研报切片亦显示,OCCULT、HonestCyberEval、CyberGym 等学术基准被《2026 年国际人工智能安全报告》等文档引用,前沿模型网络能力评测已成制度化实践。

时间

Anthropic

OpenAI

Google DeepMind

2026-02

—

Trusted Access for Cyber ( Persona  政府  ID + KYC  核验)

—

2026-04-07

Project Glasswing  启动(初期约  50  家, Mythos Preview )

GPT-5.4-Cyber  向受审核安全人员发布( 4  月)

—

2026-06

Glasswing  扩容约  150  家、覆盖  15+  国家;原  CVP  并行( Opus/Sonnet  削减防护版)

—

—

2026-07

RSP  更新版发布(阈值触发  +  风险报告  +  外部审查)

—

—

2026-08-10

—

扩大  Daybreak  计划,推出  GPT-5.6-Cyber ( Blue/Red  双层)

—

2026-09-01

—

Trusted Access  成员须使用硬件背书  passkey

—

2026-09-03

—

—

Fairwind Program  启动( Gemini 3.8 Flash Cyber + CodeMender ; Gemini 4 Argon  随后进入)

2026-10-06

CVP  扩展为三级访问架构( Defense / Red Team / Specialized )

—

—

2026  年秋(计划)

EFS  企业级前沿防护推出(计划)

—

—


六、挑战与研判:分级放行之后,治理难题才刚开始

(1)双重用途困境:分级不是解药,而是管理术。 Anthropic 官方直言 "Cybersecurity is inherently dual use"——同一能力既可帮防御者找漏洞、也可帮攻击者利用漏洞。SecurityAffairs 评价称,Anthropic 的答案是"以三级访问取代简单开关",让控制随滥用影响递增而收紧。产业背景是外部压力:2026 年 6 月 22 日,五眼联盟情报机构发布联合警告,"AI 演进中的格局正在迅速改变网络风险,我们必须迅速行动以保持领先"。

(2)审核透明度与基准自跑局限。 Specialized Access 的审核由 Anthropic 与美国政府合作执行,但审核标准、通过率、拒绝案例均未见公开;CyScenarioBench 系自跑基准、非独立评估,分级效果目前只有厂商单方叙事。第三方验证的缺位,与 Anthropic-埃森哲五年各投至少 10 亿美元的驻场评估布局形成微妙呼应:独立评估正在成为独立产业环节,但尚未覆盖到对 CVP 分级效果本身的审计。

(3)滥用风险边界:实时拦截的"底线清单"仍有意义。 即便在最开放的 Red Team Access,对部署勒索软件、破坏物理系统、测试高风险安全系统三类行为仍保留实时拦截。这条"底线清单"说明 Anthropic 对最坏情形的想象是具体的——但底线之外的灰色行为仍待运营实践检验。Specialized Access"拦截最少"与电网、飞控、电信、银行间清算等系统的组合,意味着最强的网络能力将与"一旦出错可能危及生命或扰乱市场"的系统接触——这正是美国政府参与逐家审核的原因,也是框架中风险最高的接口。

(4)关键基础设施准入机制的产业影响。 三级架构向关键基础设施行业释放明确信号:区域医院、市政公用事业这类"小体量"防御者被正式纳入前沿 AI 能力供给范围,防御资源的不对称正被商业力量单向拉平。电力、水务、医疗、通信、硬件行业 15+ 国家的 Glasswing 实践已验证"审核—供给—产出"链路可行。可预期的产业影响是:访问分层将倒逼关键基础设施运营方建立内部 AI 使用治理——谁能申请、在什么环境使用、监控数据放在哪里(EFS 的自控云留存选项正为此设计),都将成为 CISO 的新议程。

(5)研判:从"能力管控"走向"准入竞争"。 综合已核验素材,可作三点审慎研判。第一,三级架构标志着前沿 AI 网络能力治理从"模型内置拦截"扩展为"身份验证—组织审核—政府协作—数据留存—平台绑定"的制度组合,竞争焦点将从"谁的模型更强"部分转向"谁的准入体系更可信"。第二,三巨头路径虽异,但"先验证用户、再解锁高危能力"已成共同范式,且三家均未给出放开时间表——分级化不是过渡态,而可能是长期形态。第三,自跑基准与审核不透明两大软肋短期难以闭合,第三方独立评估能否延伸到对访问分级本身的外部审计,将是观察这一框架可信度的下一个关键窗口。

责编: 爱集微
来源:爱集微 #三级访问架构# #前沿AI安全治理#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...