模型The Decoder AI·原文 2026年9月6日

美国初创公司推出“去安全护栏”开源模型商用服务,基于智谱GLM-5.3

Abliteration.ai在 8 月底推出abliterated-model-large-v2,去除GLM-5.3的拒绝机制后按API收费,声称用于网络安全测试,但记者实测可生成恶意代码与病原体培养指南。

AI解读:这条新闻的核心是:开源模型的安全机制现在可以被当作一项商品化服务剥除并出售。Abliteration.ai利用一种叫abliteration的技术,找到模型中触发拒绝回答的神经激活模式,再修改权重抑制这些模式,本质上不是越狱提示,而是直接改掉模型本身。对于需要测试AI智能体安全性的银行、大型企业的红队来说,这提供了一条快捷途径——他们不用自己搭GPU集群,花每百万token 5美元就能调用一个几乎不拒绝请求的GLM-5.3版本。但风险同样直接:TechCrunch记者用这个模型生成了提取Chrome保存密码的代码和培养危险病原体的详细指南,而服务方不强制身份验证、不存储提示与响应日志,一旦被滥用,事后几乎无法追溯。这一服务对普通用户没什么immediate影响,但如果你是安全测试人员或企业安全负责人,需要意识到这类服务在降低测试门槛的同时,也把内容限制的决策权完全交给了客户,默认状态是几乎无限制的——企业必须主动开启额外的策略网关。目前没有公开证据证明abliteration只移除拒绝能力而不影响其他行为,初步研究甚至显示它可能改变模型在原本不拒绝任务上的表现,所以用它做评估时,需要警惕结果可能受到模型整体行为变化的影响,而非纯粹反映安全性的提升。

美国初创公司Abliteration.ai将去除安全护栏的开源权重模型作为商用服务出售。该公司在 8 月底发布abliterated-model-large-v2,基于智谱(Z.AI)的GLM-5.3,通过修改权重抑制模型内部的拒绝触发模式,而非通过提示词越狱。

该服务按API调用收费,标准费率为每百万输入或输出token 5美元。Abliteration.ai不公开修改后的权重,而是自行托管和运营,用户无需下载模型或自行运行GPU基础设施。

服务内容与技术原理

Abliteration.ai采用名为abliteration的技术,流程是找出模型内部导致拒绝回答的激活模式,再调整权重以抑制这些模式。该公司声称,编码、网络攻击和智能体相关能力大多保持完整。

该公司的前代产品abliterated-model-large同样基于GLM-5.2。Abliteration.ai称,更早的GLM版本经过刻意训练,较难用于实际安全测试工作。智谱曾撰文表示,GLM-5.3的网络攻击能力在后期训练中增长超出预期。

智谱的开源许可允许修改、衍生作品及商业化的“模型即服务”(Model as a Service)供应,因此Abliteration.ai有权修改GLM-5.3、托管修改版并向客户出售访问权限。

  • Abliteration.ai内部评估显示,去护栏版GLM-5.3在CyberGym上得分 84.5%,在Terminal-Bench 4.0上得分 41.8%,在ExploitGym上两小时内解决 105 项任务。
  • 该公司自身的对比表中,GPT-5.5在CyberGym上以 85.6% 领先,GPT-5.6 Sol和Fable 5在ExploitGym上得分远高于该模型。
  • Abliteration.ai承认,对比分数来自不同的测试环境和计算预算,因此直接比较存在局限。

定位与需求来源

Abliteration.ai将该模型定位为用于进攻性网络安全、AI红队测试、智能体测试以及信任与安全研究,包括复现已知漏洞、概念验证漏洞利用、恶意软件分析和模拟钓鱼攻击。

该公司一名匿名创始人在ThursdAI播客中表示,早期需求尤其来自测试大型组织和银行部署的AI智能体的企业。这些系统需要检查攻击者能否通过越狱或提示注入触发未经授权的操作。

关于此类测试是否需要abliteration,仍存疑问。据SaferAI称,未修改的GLM-5.2在进攻性安全评估中已经拒绝了零项任务。部分从业者也持怀疑态度:TechCrunch采访的几家红队服务商表示,去护栏模型并非其常规工作流程的一部分;安全公司Fabraix更依赖对开源模型的微调。

数据保留与政策控制

TechCrunch报道,记者让该模型生成了提取Chrome已保存密码的代码,以及培养危险病原体的详细指南,未遇太多阻碍;但模型对自残请求仍会触发安全机制。据FAQ,Abliteration.ai还屏蔽涉及儿童的色情内容,客户可额外添加规则。

服务商称不存储提示和响应内容,但保留token数量、时间戳、模型ID和计费数据等运营元数据。若服务遭滥用,Abliteration.ai表示事后没有提示或响应日志可供检查,且不要求常规身份或ID验证,这会使问题使用更难调查,尽管账户、支付和使用元数据仍被保留。

该匿名公司代表辩称,身份验证无法可靠区分合法用户和恶意用户;更严格的访问控制可能使小型安全公司相比大型企业处于劣势。

  • 企业客户可通过可选策略网关自定义允许、阻止、修改或记录哪些请求;但标准模型访问基本不受限制,额外控制规则需显式开启。
  • Abliteration.ai称已在美国政府采购系统SAM.gov注册,并推广版本化模型、审计日志和按机构定制的规则,先从不涉及受控非密信息(CUI)的试点项目开始。
  • 该服务要求安全测试须获得目标系统的书面授权并遵守适用法律,但并未解决“服务商在提供易获取的强进攻能力时应承担何种责任”这一问题。

竞争与潜在影响

Abliteration.ai并非首家提供此类服务的公司。Audn.AI(旗下PenClaw)和Silk Compute也托管去护栏或基本不受限的模型,用于安全用途。Abliteration.ai的差异在于将GLM-5.3与标准化API访问及可选的策略层结合。

初步研究显示,在某些模型中,abliteration可大幅减少拒绝而不显著损害代码生成性能;但其他实验发现,即便在基础模型本就未拒绝的任务上,模型行为也出现变化。这意味着abliteration并非精确移除单一特征,而是更深入地影响模型行为。

信息来源

The Decoder AI原始来源