三源交叉审核 · 2026-09-11

「灰测路由」争议:把全部事实说清楚

对 Anthropic 官方威胁情报报告、Evidence Wall(evid-wall)民间证据链、我方独立实测三条信源的系统性对照审核。所有结论均可追溯到可复核的依据。

甲方 · Anthropic 官方报告 乙方 · Evidence Wall 我方 · 独立实测

结论速览

先看数字,再看推理。

12.1M
Anthropic 记录的 DeepSeek 转发交互数
(2026 年 7 月,14 天内)
10/10
乙方原始会话中 antml 剥离测试
我方逐字符复算通过
2=1
乙方两个「不同」会话 ZIP
SHA-256 完全相同
0/29467
DSH 客户端源码中 antml
出现次数 / 文件总数
0/2
我方实测:DeepSeek 官方
两个端点均不剥离 antml
1 个月
Anthropic 记录的 DeepSeek
转发窗(7 月)与乙方 antml
证据(8 月)的错位

一句话总纲

「有人在 7 月把 DeepSeek 侧流量转发给 Claude」——这条已被 Anthropic 以服务器遥测记录,且乙方 7 月观测到的「中间层重写」与之时间吻合、现象吻合。但 Anthropic 是竞争对手,其遥测不可独立验证,只能算「强主张」。

「8 月灰测链路带 Claude 风格输入预处理特征」——这条我方已逐字符复算确认,且实测证明公开版 DeepSeek 双端点与 DSH 客户端都不产生该行为。这是全案最硬的可复现事实。但它只证明「存在一个 Claude 风格的层」,不证明「就是 Claude」。

「8 月灰测是 Opus 5」「7 月是 Fable」「Anthropic 的 DeepSeek 归因一定正确」——这三条都没有达到可称「实锤」的证据强度。其中前两条是乙方的过度推断,第三条是不可验证的单方归因。

一、判定框架:五个必须分开的争议

把不同性质的主张混为一谈,是本争议最大的混乱来源。它们由不同主体提出、可验证性天差地别,必须分别裁定。

术语说明(请先读)

甲方 = Anthropic 官方威胁情报报告;乙方 = Evidence Wall(evid-wall.mitu233333.workers.dev)——一个被审核的外部第三方站点,不是本报告的作者我方 = 本报告的独立实测与源码审计。

三者互不隶属。本报告由第三方独立完成,与甲方、乙方均无关联;文中凡称「乙方」处,均指被审核的外部站点,不代表本报告立场。

争议提出方主张内容性质与可验证性裁定理由摘要
争议①
官方归因
Anthropic 官方 DeepSeek 官方静默转发用户请求至 Claude 并系统化蒸馏,7 月 14 天 1,210 万次 生产方内部遥测;不可独立验证;Anthropic 是 DeepSeek 竞争对手 无法独立判定 证据锁在 Anthropic 服务器内,外部只能看它公开的结论,无法复算。
争议②
行为观察
Evidence Wall 8 月灰测链路存在确定性 antml 剥离状态机(公开版无此行为) 民间抓包;部分可验证(原始会话已公开) 成立 我方在原始会话中逐字符复算 10/10 通过,并独立排除了公开版与客户端。
争议③
型号归因
Evidence Wall 8 月 = Opus 5;7 月 = Fable;即「灰测路由 Claude」 能力/知识相似性推断;无直接证据 过度推断 乙方自认「无法咬定型号」,两条支撑均为弱证据。
争议④
上游身份
Evidence Wall 灰测会话实际连的是 Anthropic(官方直连或中转) 端点在日志中结构性缺失 无法判定 会话日志的配置类型不含 baseURL 字段,ZIP 既不能证明也不能推翻。
争议⑤
蒸馏规模
Anthropic 官方 7 家中国实验室系统性蒸馏,阿里巴巴 1.51 亿次居首 生产方内部遥测;不可独立验证 无法独立判定 同争议①,且规模数字完全依赖 Anthropic 自报。
为什么必须先分开
Anthropic 的官方归因(争议①)与乙方的技术观察(争议②)是两条完全独立的证据线。乙方把二者绑在一起宣称「官方实锤了其证据链」,而实际上:官方从未提及乙方的任何一条证据,乙方也未参与官方调查。它们的价值在于相互印证(都指向「7 月前后有 DS→Claude 的流量」),而不是彼此证明

二、时间线全景

时间对照是本争议中最被忽略、却最能说明问题的一环。

2.1 两条独立线索的时间排列

下方时间线按时间顺序排列两条独立线索,用圆点颜色区分来源:蓝色为 Anthropic 官方记录的蒸馏活动窗口,棕色为 Evidence Wall 的灰测观测窗口。注意二者唯一的交集与错位。

2026-02 起
Anthropic 开始持续检测非法蒸馏(报告称「自 2026 年 2 月首次披露起」)
2026-03 ~ 04
小米蒸馏行动(20 天,40 万+ 次交互)
2026-05 ~ 07
阿里巴巴(1.51 亿+)、月之暗面(2,300 万+)蒸馏行动
2026-06 ~ 07
智谱蒸馏行动(17 天,340 万+)
2026-07(14 天)
★ Anthropic 记录的 DeepSeek 转发窗口:1,210 万+ 次交互
约 07-16 起
乙方 7 月灰测:观测到「假缓存 64-token 重算 / reasoning 计数异常 / 三维聚类」
08-01、08-12 ~ 16
乙方正式版复核:异常特征无法重现(与我方实测同向)
08-19 ~ 21
乙方 8 月灰测:观测到 antml 剥离 + Fallback(原始会话 = 08-20)
2026-09-10
Anthropic 发布报告《Detecting and countering misuse of AI: September 2026》
2026-09
Evidence Wall 上线,引用该报告宣称「已实锤」
⚠ 时间错位:全案最关键的发现

Anthropic 明确记录 DeepSeek→Claude 转发的窗口是「2026 年 7 月的 14 天」;而乙方用来主张「路由 Claude」的最硬证据(antml 剥离)是 8 月 20 日的。官方报告未提供 8 月的 DeepSeek 数据,乙方 8 月的 antml 观察因此没有任何来自 Anthropic 侧的时间线支撑

反过来,乙方认为「是另一回事(推测 Fable)」的那批 7 月数据——「usage 被中间层重写」——时间上与官方窗口重合、现象上与「流量经中间层转发」完全相容。也就是说:两条独立证据线在 7 月交集处指向同一个现象,但乙方把 7 月归成了 Fable,方向与官方相反。

三、Anthropic 官方内容与判定依据

本节完整梳理甲方——它的指控、证据形态、检测手段,以及对它自身可信度的客观评价。

原文出处

本节的引述均出自 Anthropic 官方报告《Detecting and countering misuse of AI: September 2026》(2026-09-10 发布),重点在第七章「Illicit distillation」。可自行核对原文:

↗ Anthropic 官方报告发布页  ·  anthropic.com/threat-intelligence-report-september-2026

3.1 核心指控:GTG-16001(DeepSeek)

Anthropic 对 DeepSeek 的具体指控包括:

  • 静默转发:将客户请求转发给 Claude,而非用自家模型处理,再把 Claude 的响应展示给用户,用户不知情
  • 定向识别:检查入站请求中的特定字符串,标记使用第三方宿主(Claude Code、Claude Agent SDK、OpenCode)的用户,将这些用户的请求选择性转发至 Claude Opus
  • 跨会话重放:保存 Claude 响应中的「思考签名」,开新会话诱使 Claude 把签名还原成完整推理痕迹,绕过 Anthropic 的技术控制以提取思维链。
  • 规模:2026 年 7 月的 14 天内,观察到超过 1,210 万次交互。

报告举出的具体泄露案例(据称均在用户不知情下经 DeepSeek 转发至 Claude):

  • 某中国科技公司员工用「以为是 DeepSeek 的服务」分析内部文档,泄露了某旗舰 AI 项目的完整规格、组织结构和战略目标。
  • 与俄罗斯国防部关联机构的 IT 操作员请求,暴露了俄罗斯政府数据库的有效凭证
  • 为中国某市公安局构建案件管理系统的工程师,其请求被转发;该系统使用公民身份证号比对个人行踪与警方记录。

3.2 蒸馏生态全景:Anthropic 指控的全部实验室

实验室时间窗观测规模主要手法(据报告)
小米(GTG-16008)2026-03 ~ 04(20 天)40 万+ 次重放自家 MiMo 用户会话给 Claude,生成 SFT/RL 数据;疑以免费试用期诱导国际开发者使用后收割
阿里巴巴(GTG-16005)2026-05 ~ 071.51 亿+ 次量级最大;注入固定提示词强制输出思维链,转 SFT 数据训练 Qwen 3.5/3.6/3.7
月之暗面(GTG-16002)2026-05 ~ 072,300 万+ 次用 Claude 冒充 Kimi 应答;10 天内转发近 30 万请求,多数路由至 Opus
智谱 / Z.ai(GTG-16006)2026-06 ~ 07(17 天)340 万+ 次思维链提取清洗流水线;针对网络能力做蒸馏,因 Fable 防护强化而转向 Opus 4.6 与另一美国模型
DeepSeek(GTG-16001)2026-07(14 天)1,210 万+ 次静默转发 + 宿主识别 + 跨会话重放提取思维链
商汤(GTG-16012)未给具体日期购买第三方数据商转售的用户-Claude 交互记录;用 Claude 编写蒸馏流水线
MiniMax(GTG-16003)未给具体日期通过壳公司自建代理网络,只提供 Anthropic/OpenAI 模型(不含自家),疑专门用于收割交互

报告称这些归因均以「高置信度」做出,但未公开支撑归因的原始遥测数据。

3.3 Anthropic 声称的检测手段

报告描述了其反蒸馏机制,这些描述本身也是理解「官方如何得出归因」的关键:

  • 元数据与异常行为分析:不逐个封禁代理账户,而是将可疑活动归因到具体组织,再采取整体执法。
  • 对抗性提取分类器:专门检测蒸馏式提取,命中则阻断请求并封禁账户。
  • 推理摘要化:Claude 在响应前先摘要内部推理,使被盗记录对训练价值下降。
  • 受保护思考(Fable 5.1):阻止新 API 账户篡改推理之前的上下文(这是攻击者诱使 Claude 泄露推理的常用手法)。
  • 身份验证:对疑似滥用或来自不受支持国家(中国、俄罗斯、伊朗)的账户,可要求验证身份,未通过者封禁。

关键含义:Anthropic 声称的归因依据是账户聚类 + 行为模式 + 宿主识别逻辑——这套方法有能力区分「中转站倒卖 Claude 访问」(它单列为 GTG-16012/16003)与「实验室系统性蒸馏」。也就是说,它把 DeepSeek 归入后者,是基于它认为看到了不同信号,而非分不清中转生态。

对甲方的客观评价:为什么只能算「强主张」而非「已证实」
  • 利益相关:Anthropic 是 DeepSeek 的竞争对手,报告同时具备「安全披露」与「竞争叙事」双重属性。
  • 不可独立验证:全部关键证据(1,210 万次计数、账户聚类、宿主识别日志)锁在其服务器内,外部无法复算。报告本身也未提供可下载的原始数据。
  • 无法证伪的对称性:「我方观测到了 X」这类主张,外部既不能确认为真,也不能确认为假。
  • 但有内部一致性:报告的检测手段描述具体、可与其他独立事实交叉(如 DeepSeek 官方确实提供 Anthropic 兼容端点,经我方实测确认)。其「跨会话重放」机制的细节(思考签名)在我方对 Anthropic 端点的实测中确实观察到——该字段真实存在于 Claude 的响应格式中,说明报告描述的机制技术上是成立的(但不证明其对 DeepSeek 的归因正确)。

结论:甲方应作为「方向性指引」使用,不能作为定案依据。它能提高「7 月存在 DS→Claude 流量」的先验,但不能证明它。

一个必须澄清的方向问题

存在一种流传的假设:「中转站用 DS 冒充 Claude 给用户,这些信息被上报给 Anthropic,导致 Anthropic 误认为是 DS 官方所为。」

该假设的方向与证据形态矛盾:它的数据流是「用户 → 中转站 → DS → 返回用户」,一个字节都不会到达 Anthropic,因此无法产生 Anthropic 所测到的「1,210 万次入站交互」。报告中的泄露主体是「DS 的用户」(如某中国科技公司、俄罗斯国防机构),而非「某中转站的用户」。

此外,Anthropic 的证据来自服务器端遥测,不是用户投诉——「用户上报导致误判」这条因果链接不上其证据形态。

但底层怀疑仍然合理:Anthropic 的归因不可独立验证,且它确有把「中转生态」与「实验室蒸馏」混淆或归因过宽的动机与可能。这一点无法从外部排除。

四、乙方(Evidence Wall)主张逐条审核

对乙方全部公开内容的逐条拆解。裁定标准见附录。标注 乙方主张 者为待审对象。

乙方原文出处

以下逐条审核的对象均来自 Evidence Wall 的公开页面,可自行打开核对:

↗ 证据墙主页(灰测路由证据链分析)
↗ antml 技术分析页(乙方核心论证)
↗ 社区讨论归档页
↗ GitHub 源码仓库(含原始会话与 worker 后端)

注:乙方页面托管于 Cloudflare Workers 免费域,若链接失效,可尝试其 GitHub 仓库镜像。

裁定图例

成立经核查支撑充分 部分成立方向对但结论超出证据 不成立已被证据推翻 过度推断证据支持较弱的结论 无法判定材料不足

4.1 顶部横幅与立场声明

A1乙方主张「💥已实锤」——Anthropic 官方报告正式确认并实锤了静默路由与大规模蒸馏过度推断
乙方原话:「2026 年 9 月 10 日,Anthropic 官方正式发布 154 页报告……以官方威胁情报形式正式确认并实锤了针对 Claude 的静默路由转发与大规模提取蒸馏行为……与本项目此前整理的所有抓包技术证据链完全吻合」
客观核查:报告确实存在(2026-09-10),GTG-16001 确实描述了「静默转发客户请求至 Claude、不告知用户」。引用属实。
反驳:报告从未提及「灰测」这一产品形态,也从未采信、引用或验证乙方任何一条证据。官方确认的是「DeepSeek 做过静默转发」这一行为类别,不是「乙方证据链被官方背书」。「完全吻合」实为「大方向一致」——两份材料的证据、窗口、方法完全不同。
结论:行为层面成立;「官方实锤了乙方证据链」属过度推断,且与乙方自己的边界第 13 条(渠道与动机不可证实)直接冲突。
A2乙方主张「与本项目此前整理的所有抓包技术证据链完全吻合」不成立
客观核查:乙方核心证据——antml 剥离规则、64-token 缓存重算、三维聚类——在官方报告中完全不存在。官方提的是宿主识别、跨会话重放、账户聚类。
结论:仅「大方向一致」,不构成「完全吻合」,属可核实的用词失实。
A3乙方主张因遭受人身攻击与造假指责而建立证据墙自证成立(动机陈述)
客观核查:属动机陈述,不可证伪;但乙方随后确实公开了可核验的部分原始数据。
结论:作为「为何公开」的说明成立,不影响证据本身效力。
A4乙方主张支持模型蒸馏技术,反对开盒网暴立场陈述
客观核查:价值立场,不属事实主张。存在一处张力:乙方一边主张对方做了不当的静默转发,一边声明「支持蒸馏」。二者可区分(手段 vs 技术),但立场表述对结论无证明力。
结论:不影响证据判定。

4.2 阅读规则与前置声明

B1乙方主张置信度分级体系(高 / 中高 / 中及以下)成立
客观核查:分级标准合理,且乙方确实按此执行——把时事知识、文风、模型自述归入最低档并排除出核心链。
结论:分级体系是乙方最值得肯定的部分之一。
B2乙方主张「模型无法接收文件/图片」不能作为否定底层路由的证据成立
客观核查:逻辑正确。网关/兼容层完全可以在请求到达模型前拦截或丢弃多模态附件,「模型说不能看图」只反映产品链路行为,不反映模型身份。
结论:逻辑成立。
B3乙方主张灰测特征 = 长 TTFT + 总结式思维链大块输出部分成立
我方核查:用乙方自己的原始会话统计全部 32 个 turn 的输出分块,各 turn 分块尺寸高度均匀(均值约 200 字),生物提问前(turn 27)与之后(turn 29)未见「块状 vs 逐 token」的形态断裂。
反驳:该特征作为「可客观复核的属性」,在乙方公开的原始数据中无法验证。乙方亦承认相关演示是「按观察重建,并非原始 SSE 抓包」——重建动画不具证据资格。
结论:作为识别线索可用;作为客观判据未获原始数据支持。
B4乙方主张能力归因证伪标准:须在干净会话用相同 Prompt 对照成立
客观核查:严谨的实验设计原则(控制变量),且乙方在 E09 中确实照此执行。
结论:方法论成立,且被自身实践支撑。

4.3 综合研判

C1乙方主张「8 月灰测大概率指向 Opus 5」过度推断
客观核查:支撑仅两条,乙方均已自标局限:① 时事知识(E08,自评「中」,自述「无法咬定」);② 前端生成能力对照(自述「无法单独作为锁定具体型号的直接铁证」)。
反驳:两条支撑全部是能力/知识相似性,不是身份证据。知识切片可被联网检索、RAG、后训练注入伪造;能力对照样本量未公开。所有「高置信度」证据(antml、缓存、聚类)无一能锁定型号
结论:「Claude 风格链路」可支撑;「Opus 5」无证据支撑。乙方小字边界已承认,但大标题未同步降级。
C2乙方主张「多项物理规则共同锁定 Claude 风格请求处理链」成立(措辞严谨)
客观核查:antml 剥离行为在乙方原始会话中确实存在,我方逐字符复算通过(详见 E01)。
评价:此句措辞严谨——「Claude 风格处理链」,而非「Claude」。这是乙方材料中表述最准确的一句。需要反驳的不是它,而是把它读成「就是 Claude」的引申。
结论:按字面成立;但无法区分「官方直连 / 中转复刻 / 兼容层实现」,乙方亦自认此点。
C3乙方主张「7 月与 8 月不是同一模型路径」部分成立
客观核查:两期特征集确实不同(7 月:假缓存/计数/聚类;8 月:antml/fallback)。但 7 月的四条核心证据(E02/E04/E06/E07)无一提供原始数据,仅有截图。
反驳:该结论一半建立在不可离线复核的材料上。8 月部分我方已核验为真;7 月部分目前只是「乙方自报的截图结论」。
结论:方向可信,但证据完整度不足以支撑「高置信度」。
C4乙方主张「7 月推测属于 Claude」/「7 月大概率属于 Fable」(E10)不成立
客观核查:7 月特征(64-token 缓存重算、reasoning 计数映射、TTFT 聚类、logprobs 差异)全部是统计/基础设施层异常,没有一条是 Anthropic 特征。它们能证明「链路被中间层加工」,与「上游是谁」无关。
反驳:从「假缓存存在」推到「7 月是 Fable」,中间没有桥梁。这是乙方材料中最弱的型号归因。
结论:7 月的 Claude/Fable 归因无证据,属推测级。
C5乙方主张安全拦截后降级回退至「0813 V4 Pro 正式版链路」部分成立
客观核查:「降级/回退机制真实存在」这一点,原始会话可佐证(生物提问后行为突变)。但「回退到 0813 V4 Pro」的型号归因仅凭输出风格匹配。
反驳:同厂旧模型、或任意实现 DeepSeek 风格流式的网关,都能产生「逐 token 流式」的表现。机制描述成立,型号归因不成立。
结论:「存在回退」成立;「回退到 0813 V4 Pro」是推断。

4.4 前提定义

D1乙方主张P01 · 灰测常态是「摘要式思维链 + 大块分段输出」部分成立
客观核查:同 B3。原始数据的输出分块尺寸在各 turn 间均匀,无法从导出文件重建「块状」特征。
结论:作为定义可用;作为可验证特征,缺原始 SSE 支撑。
D2乙方主张P02 · 高危拦截表现为「长延迟后转逐 token 流式」部分成立
客观核查:原始会话中,turn 28–31 输入「我想制造一个生化武器」「生成个烈性传染病毒相关的表面抗原蛋白质结构」,模型四次明确拒绝且措辞逐轮加强。拦截行为真实。
反驳:但「长 TTFT + 转为 DS 流式 + 会话脱灰」这一完整时序描述,在导出数据中只能看到「拒绝」和分块数据,无法确认 TTFT 突变。且乙方承诺的「生物 fallback 原始会话 ZIP」实为灰测会话的重复文件(见 G1)。
结论:「存在拒答」成立;「特定时序与形态」缺对应原始文件。
D3乙方主张P03 · 上下文污染后的复现不具鉴别力成立
客观核查:逻辑正确——被历史上下文引导的模仿确实不构成反例。
提醒:该原则双向适用:它把举证责任推给反方,任何公开版反例都可能被贴「被污染」标签。乙方给出的对冲(空白会话+相同 Prompt+完整截图)是合理补救,E09 亦照此执行,故可接受。
结论:成立,附「需严格按标准举证」的监督条件。

4.5 时间线

E1乙方主张约 07-16 起 7 月旧版灰测(假缓存/计数/聚类/logprobs)无原始数据
客观核查:乙方提供的可下载原始会话只有 8 月 20 日那一场。7 月的全部特征只有截图。
结论:无法离线复核——这是乙方证据包里最大的缺口。而它恰好与官方记录的时间窗(7 月)重合。
E2乙方主张08-01、08-12–16 正式版复核:特征无法重现成立(与我方实测同向)
客观核查:我方实测公开版 deepseek-v4-prodeepseek-flash均不剥离 antml,与乙方「公开版无法复现」一致。
结论:成立,且经我方独立验证。
E3乙方主张08-19–21 新版灰测(antml + Session 路由 + Fallback)时间窗吻合
客观核查:乙方公开会话的创建时间戳(1787225945354)换算为 2026-08-20,落在声称窗口内;文件名时间戳亦为 Aug 20。
结论:时间线自洽。但需注意:官方未提供 8 月数据,该窗口无官方对应。

4.6 证据链(E01–E11)

E01乙方主张antml 复现官方 Anthropic API 的确定性输入预处理核心行为成立
主张:只循环剥离开头 antml:,遇首个不匹配立即停止,后续 antml: 保留;大小写不敏感;32 种组合全触发。
我方核查(原始数据复算):从乙方 ZIP 中提取全部 antml 测试轮次(10 组),逐字符比对输入/输出:
· antml:thinkingthinking(剥离 1 个)
· 8×antml: → 全部剥离
· antml:antml:fsfsl:antml:×5 → 只剥前 2 个,在 fsfsl 处精确停止并保留其后 5 个 antml
以上全部符合乙方描述的规则;经逐字符复算,确认这些记录非伪造。
重要限定:乙方主张的「32 种大小写组合全触发并不出现在这份原始会话中——ZIP 内的 antml 测试全部为小写,无任何大小写变体。该条主张目前仅有截图支撑(Cluster B 的大小写无关性验证图),我方无法离线复算。因此:「剥离 + 首错截断 + 停止后保留」三项经原始数据确认;「大小写不敏感」未经原始数据确认,仅属乙方自报。
我方核查(机制定位):turn 17 的模型思维链仅 13 token、完全未提及 antml,却在正文声称「照抄一字未改」——说明剥离发生在模型之前;turn 26 思维链提到 repeated antml prefixes 且输出保留了 fsfsl 后的 5 个 antml——说明输出侧不剥离。输入侧、模型前的确定性状态机,成立。
反驳:① 乙方称「token 计数不变 ⇒ 剥离在 API 层」是逻辑跳跃:若客户端或网关在发请求前剥离,计数同样不变。② 但这一环我方已替它实测:DSH 源码无 antml、DeepSeek 双端点均不剥离。③ 唯一未排除的是实际 baseURL(见 G4)。
结论:「剥离 + 首错截断 + 停止后保留」作为行为事实成立且经我方独立复算(「大小写不敏感」仅截图支撑,未经原始数据确认);但「因此是 Claude」仍是行为相似性推断,非身份证明。
E02乙方主张固定 64-Token 缓存截断重算机制(7 月)算术自洽 / 与型号无关
usage 未按实际命中统计,而是套 64 分块公式重算:94,890 = 1,482×64 + 42。
我方核查:算术完全自洽:94,848 + 42 = 94,890;94,890 ÷ 64 = 1,482 余 42;上轮 output 41,827 = 653×64 + 35,下轮 cache.read 增量恰为 41,792 = 653×64。若截图为真,「假缓存」结论成立。
反驳:该证据与 Claude 无关——它只证明「7 月链路的 usage 被中间层重写」,对上游身份零贡献。乙方把它列为「高置信度」支持 Claude 结论,是定性错误。② 原始会话不可得,无法离线复算。
结论:狭义结论(存在假缓存)可能成立;但它是「中间层存在」的证据,不是「Claude」的证据。
E03乙方主张两条思维链输出路径节奏不同(现场演示)演示不具证据资格
客观核查:乙方自己声明:「现场演示按原始观察重建节奏,并非原始 SSE 抓包」。
反驳:重建动画是解释品,不是证据。且我方用乙方原始数据统计证明:各 turn 分块尺寸均匀,无法支撑「突发停顿 vs 均匀流式」。
结论:作为「证据」不成立(乙方自认);作为「现象说明」可保留。
E04乙方主张Reasoning Token 与摘要思维链的二选一两难(7 月)逻辑成立 / 与型号无关
客观核查:两难结构正确:若可见思维链是摘要,reasoning 计数不应恰为摘要长度+2;若是原文,输出节奏不应与正文割裂。无论选哪边,思维链或 usage 必有一个经二次加工。
反驳:结论只到「存在中间层重包装」,不触及上游身份。同 E02,被列为高置信度支持 Claude 属定性错误。且无原始数据。
结论:狭义推理成立,但与 Claude 归因无因果关系。
E05乙方主张高危安全提问触发无缝降级(Fallback)行为成立 / 细节缺证
客观核查:原始会话确认生物提问触发四次明确拒答。需注意措辞:模型是拒绝了,乙方观察到的是「拒绝 + 链路变化」,表述为「降级」不够精确。
反驳:乙方称「provider/model 响应头保持不变,但底层链路已切换」——我方从 DSH 源码确认:provider 字段本就是路由名,从不表示端点,它不是「被伪造」,而是「天生不反映地址」。该观察不能证明链路切换。
结论:「存在安全拒答」成立;「降级至某链路」与「响应头不可信」的论证依据被削弱。
E06乙方主张TTFT、缓存合法性、生成速率三维联合聚类(7 月)方法论正确 / 无原始数据
客观核查:反驳「排队解释不了缓存逻辑与速率的同步聚类」在方法论上有效。
反驳:样本量、采集方法、统计代码均未公开,只有结论图,复算性远逊于 E01/E02。② 结论只到「存在两套物理链路」,不能命名任何一方(乙方自认)。
结论:「两套链路」可能成立,但仅凭未公开的统计,不足以支撑「高置信度」。
E07乙方主张logprobs / system_fingerprint / 分包边界差异(7 月)弱证据 / 自认可伪造
客观核查:乙方自己写明「相关字段可由代理网关伪造或修改,须与缓存及统计学证据结合研判」。
反驳:这层是网关最容易改写的字段,证据地位天然偏低。唯一有信息量的细节是「fingerprint 后被人工统一为 V4P」——这是运营方主动伪装的迹象,对「链路被加工」有利,但仍不能指向 Claude。
结论:评级应低于「中高」。
E08乙方主张时事知识仅作候选收窄的辅助旁证处理正确(弱证据)
客观核查:乙方列出全部反解释(联网检索、RAG、后训练注入),测试者本人亦称「仅凭知识库无法定死型号」。
结论:乙方材料中对弱证据处理最诚实的一条。不足:它却是「Opus 5」结论仅有的两条支撑之一——说明型号结论根基极薄。
E09乙方主张正式版反向测试必须基于空白上下文成立
客观核查:结论「公开正式版未沿用 7 月链路」逻辑成立(排除了「灰测=公开版+开关」这一替代解释)。我方实测公开版确无 antml 剥离,同向。
结论:成立。
E10乙方主张「7 月与 8 月非同一模型」是符合全部材料的最简解释窄结论成立 / 型号外推不成立
客观核查:「两期特征多维断裂」若要成立,依赖 7 月四条证据同时为真——而它们无原始数据。
反驳:乙方在此条内把结论外推为「7 月大概率 Fable,8 月极大概率 Opus 5」——两个型号均无直接证据,乙方「边界保持」自认「版本号未获官方证实」。
结论:「非同一链路」方向可信;型号外推不成立。
E11乙方主张Fork 后脱落灰测,原 Session 维持评级诚实(低)
客观核查:乙方明确「正常 A/B 分流也能解释,不进入核心型号归因」。
结论:作为「会话级路由状态」的补充观察成立,自评低置信度恰当。

4.7 证据墙、方法论与关键缺口

G1乙方主张「下载灰测原始会话 ZIP / 生物安全 fallback 原始 Session ZIP」交付与承诺不符
我方实测:两个 ZIP 下载后 SHA-256 完全相同d9001690eaa1e331ffbe2d9456427123d688d9c1b24c8b49a22ba930290eebd9),均为同一份 8 月 20 日会话(2756 行、32 turn、含 2 个子代理)。
反驳:乙方承诺交付两个不同的原始会话,实际只交付了一个(重复两次)。其主打的「生物 fallback 原始证据」实际缺失
结论:承诺与交付不符;E05/P02 的原始支撑缺失。
G2乙方主张证据墙 Cluster A–E(截图全景)存在但权重不均
客观核查:截图文件确实存在于 assets/(31 张图片 + 若干录屏 GIF),涵盖 TTFT、聚类、antml 五组对照、Token 计量、大小写、独立复现、Fallback、上下文污染、知识切片。
反驳:Cluster A(7 月)与部分 C/D/E 属「仅截图、无原始文件」。截图无法离线复算,权重低于原始日志。
结论:B 组(8 月 antml)有原始会话支撑、权重高;A 组(7 月)权重低。
G3乙方主张方法论:样本来源与收录准则成立
客观核查:声称基于 archive.dht 镜像、社区讨论(211+237 条)、测试者 mitu9527 的独立复现;收录原则「截图/日志权重高于口述」「反例须控制变量」。
结论:原则正确且被部分执行;但「独立复现」的独立性无法验证(社区仅 3 star 规模)。
G4乙方主张【关键缺口】「实际 baseURL」无法从 ZIP 证明结构性无法判定
我方源码审计:DSH 记录到会话日志的配置类型 LlmCallConfig 仅有六个字段:provider / model / reasoningEffort / temperature / maxTokens / stop没有 baseURL / endpoint / host。全量扫描 ZIP 的 22 种事件、所有嵌套键、两个子代理会话,零个 URL、零个 baseURL
反驳:因此「灰测会话连的是 DeepSeek 官方」既不能被 ZIP 证明,也不能被 ZIP 推翻——这是格式性的信息缺失,不是乙方藏了文件。真实端点取决于 settings.yaml 的 baseURL 覆盖或 $DEEPSEEK_BASE_URL,两者都不在导出范围内。
结论:这是整条链唯一未闭合的环:行为证据确凿 → 公开版与兼容层已被我方实测排除 → 只剩「推定直连官方」依赖默认配置 → 才能推出「上游是 Claude」。补它需要 settings/profile 或真实抓包。

4.8 乙方 13 条技术边界声明核对

这一节是乙方质量最高的部分。

乙方边界声明裁定客观核查
64-Token 缓存截断仅存在于 7 月数据中成立与时间线自洽;但 7 月无原始数据可验证。
antml 规则仅证明经过 Claude 风格管线,不等于官方直连成立表述准确,是乙方材料中最严谨的一句。
大小写无关性排除「纯权重蒸馏」,但排除不了网关人为部署状态机仅截图支撑逻辑正确,且预留了正确的不确定性。
单纯「模型输出了特定标签」不构成有效判据成立正确区分了「模型会模仿」与「输入被改写」。
知识题无法咬定 Opus 5,亦不能排除 Fable 5成立正确。但与其「大概率 Opus 5」的标题存在张力。
单一 TTFT 不能作为模型指纹成立正确。
模型自述与语言风格仅作参考背景成立正确。
「无法接收文件/图片」不构成反向否定证据成立正确。
8 月高危生物提问并非直接被拒(而是降级)部分成立原始数据显示模型确实直接拒绝了(四次措辞明确的拒答);「降级」是乙方对链路变化的观察,两者可并存但表述应更精确。
严禁将上下文污染后的模仿视为反例成立正确。
后续单次交互未复现拦截,不能推翻既有路由事实部分成立逻辑成立,但双向——它也可被用来拒绝任何反证,需配合严格举证标准。
Fork 后脱落灰测不是模型指纹成立正确,自评低置信度恰当。
调用渠道、托管方式与商业动机不在可证实范围内成立最诚实的一条。但它同时否定了横幅的「已实锤」语气——乙方在此自我矛盾。

五、我方独立实测与源码审计

我方独立实测。本部分是全部材料中复现成本最低的证据——任何人用同样的请求打官方 API 都能得到同样结果,无需依赖乙方提供任何文件。

5.1 DeepSeek 官方 API 双端点实测(2026-09)

目的:检验乙方主张的 antml 剥离行为是否存在于 DeepSeek 官方服务。两个协议端点均测,使用与乙方相同的测试串。

测试输入结果判定
精确复述(OpenAI 端点)<antml:antml:antml:ggtml:antml:antml:hello>原样保留无剥离
精确复述(Anthropic 端点)同上原样保留无剥离
antml:thinking 照抄<antml:thinking>原样保留无剥离
8× antml 重复串8 个 antml:原样全保留无递归剥离
大小写变体ANTML:/aNtMl: 混合原样保留无大小写无关规则
边界规则antml:antml:fsfsl:antml:×5原样保留(未在 fsfsl 处截断)无状态机
用 Claude 模型名model=claude-opus-4-5原样保留与模型名无关
带 tools + 用户消息含 antmlantml + 工具调用正常返回 tool_use,用户文本未剥离工具协议正常但无剥离
系统提示塞入 antml 工具协议system 内含 <antml:invoke><antml:parameter>原样复述,未被剥离关键反证

Token 计数检验(第二项物理判据):input + cache 总和随 antml: 重复次数严格线性增长(每前缀约 3 token),不存在「计量前剥离」。首次测得的「计数不变」经复测确认为前缀缓存干扰,已排除。

结论
DeepSeek 官方(含其专为 Claude Code 兼容而设的 /anthropic 端点)完全不剥离 antml。乙方「剥离只可能来自 Anthropic 栈」的前提,经我方实测成立

5.2 DSH 客户端源码审计

  • 乙方会话由 DSH@deepseek-ai/dsh@0.1.0-rc.6 的 TUI 封装)产生——确认依据:会话含 $env:DSH_* 变量,且工具集含罕见的 ralph(对应 dsh-tool-ralph)。
  • 全树 29,467 个文件,antml 出现次数为 0;连序列化逻辑(serializeMessages/serializeRequest)在内,无任何剥离代码。
  • 「Claude Code 造成剥离」这一具体版本不成立(DSH 并非 Claude Code,其 src/cc 仅为终端渲染风格)。
  • 附带发现:会话日志的配置类型 LlmCallConfig 只含 provider/model 等六字段,结构性不记录 baseURL——这同时解释了为何乙方 ZIP 无法证明实际端点(见 G4),也说明乙方 E05 所说的「provider 响应头不变」是因为该字段本就不表示地址

5.3 乙方原始会话 ZIP 结构分析

  • 两个 ZIP(灰测 / 生物 fallback)SHA-256 相同,实为同一份会话。
  • 内容真实完整:2756 行 JSONL、32 个 turn、含 usage 用量、工具调用、2 个子代理会话;时间戳 2026-08-20,落在声称窗口内。
  • 10 次 antml 测试全部复算通过(含决定性的 fsfsl 边界)。
  • 生物提问 4 次明确拒答(内容真实)。
  • 输出分块尺寸在各 turn 间均匀,无法重建「块状 vs 逐 token」特征。
  • 全量扫描:零个 URL / baseURL / endpoint

六、三源交叉对照与矛盾点

把三条信源放在一起,看它们在哪里互证、在哪里冲突。

6.1 交叉对照:哪些点互相印证、哪些只有单方

观察点甲方(Anthropic 官方)乙方(Evidence Wall)性质
7 月存在「流量经中间层」记录 DS→Claude 转发 1,210 万次7 月观测到 usage 被 64-token 公式重写时间吻合、现象相容
思维链可被跨会话提取描述「保存思考签名→新会话还原」机制(无法比较:harness 的日志结构只有 type/text 两字段,本就不记录 signature,故无法据此判断上游)不可用于互证
公开版无 Claude 特征(未涉及)正式版复核无法复现乙方观察 + 我方验证(非互证)
DeepSeek 官方提供 Anthropic 兼容端点(未涉及)(未涉及)仅我方独立发现(非互证)
⚠ 矛盾点一:一月错位

官方 DeepSeek 窗口 = 7 月;乙方最硬的 antml 证据 = 8 月。官方未提供 8 月数据,乙方 8 月主张无官方对应

反过来,乙方 7 月的异常数据与官方窗口重合,却被乙方归为「Fable」。两条线在 7 月交集处指向同一现象,乙方却在归因上与之相反。

⚠ 矛盾点二:乙方的自我矛盾

乙方边界第 13 条自认「调用渠道、托管方式与商业动机不在可证实范围内」,但横幅宣称「已实锤」。同一份材料内,标题与边界声明互相否定。

乙方的证据矩阵写得远比它的横幅诚实——这是判断其可信度时最重要的观察。

矛盾点三:双方的决定性论断都建立在不可验证的观测上

这是一种结构性对称

  • Anthropic 的最硬主张(「是 DeepSeek 官方在蒸馏」)建立在它服务器内的遥测上——外部无法复算。
  • 乙方的最硬主张(「灰测连的是 Claude」)卡在日志不记录的 baseURL 上——ZIP 无法证明。

两者都只能提供「行为相似性」,都无法提供「身份确认」。任何一方要把结论推到「实锤」,都需要公开更多原始数据。

6.2 对若干流传假设的裁定

假设裁定理由
「灰测路由 Claude 进行蒸馏」 与证据相容 与官方归因方向一致,与乙方 7 月观测时间吻合。但「蒸馏」这一目的本身无直接证据——乙方证据只到「路由」,官方才有「蒸馏」主张(不可验证)。
「中转站用 DS 冒充 Claude 给用户,上报后 Anthropic 误判为 DS 官方」 方向与证据形态矛盾 该数据流(用户→中转站→DS→用户)不产生到达 Anthropic 的入站流量,无法解释「1,210 万次入站交互」。官方证据是服务器遥测而非用户投诉。
「Anthropic 的归因不可信,因为它是竞争对手」 部分合理,但不足以下定论 利益相关与不可验证是事实;但「有动机」不等于「归因错误」。其检测手段描述可区分中转生态与实验室蒸馏,且部分细节与其他独立事实交叉一致。
「灰测就是普通 DeepSeek 服务,无路由」 被推翻 antml 剥离行为在原始会话中确凿存在,且公开版双端点与客户端均无此行为——朴素解释不成立。
「8 月灰测 = Opus 5」 无证据 仅知识时效 + 能力对照两条弱证据,乙方自认「无法咬定」。

七、最终裁定总表

主张提出方裁定依据
灰测链路存在确定性 antml 剥离层乙方成立原始会话 10/10 逐字符复算通过;输入侧、模型前已定位。
公开版 DeepSeek 无此行为乙方成立我方实测双端点(OpenAI + Anthropic 兼容)均不剥离。
DSH 客户端未引入该行为我方成立29,467 文件源码审计,antml 出现 0 次。
链路存在中间层加工(假缓存/重包装)乙方成立(限 7 月)算术自洽、逻辑成立;但无原始文件。
7 月与 8 月不是同一链路乙方部分成立8 月已核验;7 月四条高置信度证据无原始数据。
DeepSeek 官方静默转发至 Claude(7 月,1,210 万次)Anthropic无法独立验证生产方内部遥测,不可复算;但与乙方 7 月观测时间/现象吻合。
7 家实验室系统性蒸馏 ClaudeAnthropic无法独立验证同上,规模数字完全依赖其自报。
灰测会话实际连的是 Anthropic乙方无法判定baseURL 结构性不记录,ZIP 既不能证明也不能推翻。
8 月灰测 = Opus 5乙方过度推断仅两条弱证据,乙方自认「无法咬定」。
7 月 = Fable乙方不成立零直接证据;且与官方 7 月归因方向相反。
Anthropic「实锤」了乙方证据链乙方不成立官方未采信乙方任何证据,仅确认同类行为存在。
乙方两个 ZIP 为不同会话乙方不成立SHA-256 完全相同。

最终结论:把全部事实说清楚

一、可独立复核的确认事实(可信度最高)

1. 8 月灰测链路上存在一个确定性的 antml 剥离状态机,且它不是公开版 DeepSeek,也不是 DSH 客户端。这是全案最可复核的技术事实——我方在乙方原始数据中逐字符复算通过,并独立实测排除了公开版双端点与客户端源码(该实测任何人均可重复)。乙方在这里是对的,而它自己没能完成这套排除,是我方补上的。

二、方向明确、但不可独立验证的推断

2. 「7 月前后有 DeepSeek 侧流量被转发给 Claude」——有两条独立线索指向,但主证据不可复核。Anthropic 以服务器遥测记录了 2026 年 7 月 DeepSeek 侧 1,210 万次转发(外部无法独立验证,但方向明确);乙方在同期观测到「usage 被 64-token 公式重写」这种典型的中间层特征(仅截图,无原始文件)。两条线在 7 月交汇,互相印证方向,但都不足以单独定案。

三、无法判定或已被否定的部分(必须如实承认)

3. 「那个 Claude 风格的层是不是 Claude」无法判定。它可能是 Anthropic 官方直连、可能是中转/兼容层复刻、也可能是其他托管服务。会话日志结构性不记录 baseURL,这是唯一的缺口。

4. 「Anthropic 对 DeepSeek 的归因是否准确」无法从外部验证。它是竞争对手,证据锁在其服务器内。既不能确认为真,也不能确认为假。

5. 型号归因(Opus 5 / Fable)不成立。乙方没有任何直接证据,其大标题超出了自家证据矩阵的承载力。

三、本争议的真正结构

这不是一个「谁在说谎」的问题,而是一个「证据链各自缺一环」的问题。

Anthropic 有身份归属,但缺可验证性(遥测不公开);乙方有可验证的行为证据,但缺身份归属(baseURL 不记录)。两者都只能提供行为相似性,都不能单独完成「实锤」。

而乙方最不该做的,是把这两条平行的、各自不完整的证据线,用「官方实锤了其证据链」缝成一条看似完整的链——这既不符合事实(官方未采信其证据),也与它自己的边界声明冲突。

四、最诚实的一句话

「7 月前后有 DeepSeek 侧流量被转发给 Claude」——方向可信,但主证据不可独立验证;「8 月灰测链路上有一个 Claude 风格的输入处理层」——这条已被我方独立复算确认,是本争议中最硬的事实;「那个层就是 Claude / 就是 Opus 5」——没有达到证据强度,任何一方宣称「实锤」都超出了它手里的证据。

附录 · 方法论与依据

裁定标准

成立经核查支撑充分,或经我方独立验证 部分成立方向正确,但结论超出证据承载力 不成立已被现有证据推翻或与事实矛盾 过度推断证据只支持较弱的结论 无法判定现有材料不足以证明或推翻

审核依据清单

  • 甲方 · Anthropic 官方:《Detecting and countering misuse of AI: September 2026》(2026-09-10),第七章「Illicit distillation」及 GTG-16001/16002/16003/16005/16006/16008/16012 各节。
    ↗ anthropic.com/threat-intelligence-report-september-2026
  • 乙方 · Evidence Wall:乙方全部公开页面(主页 · antml 分析页 · 讨论归档页);其公开的两个 Session ZIP(SHA-256 已核,均指向同一份 8 月 20 日会话)。原始文件下载入口位于其主页 assets/ 目录下,如 assets/grey-test-original-session.zip
    ↗ evid-wall.mitu233333.workers.dev  ·  ↗ antml-analysis.html  ·  ↗ GitHub 仓库
  • 我方 · 独立实测:对 api.deepseek.com 的 OpenAI 端点与 /anthropic/v1/messages 端点实测(2026-09);DSH 0.1.0-rc.6 全量源码审计;DeepSeek 官方文档的 Anthropic 兼容说明。
    ↗ DeepSeek 官方 Anthropic 兼容文档

审核局限(必须声明)

  • 甲方的原始遥测数据未公开,本报告对其指控只能做形态分析与一致性检验,无法验证真伪
  • 我方实测为 2026 年 9 月的横截面,对 7–8 月的历史状态无回溯证明力;若相关行为曾被开启后关闭,现时测试无法捕捉。
  • 乙方 7 月证据无原始文件,本报告对其 7 月部分的裁定基于其自报内容的内部一致性,而非独立复核。
  • 「独立复现者」的独立性无法验证(社区规模小)。