检测结果
模型:claude-fable-5 · 模式 full ·
中转站 https://vtrix.ai/
0%
未达标
由 10086AI 中转服务质量评估平台生成
-
身份一致性 异常检测器运行异常: HTTP 404: <!DOCTYPE html><html><head><meta charSet="utf-8"/><meta name="viewport" content="width=device-width, initial-scale=1"/><link rel="preload" as="script" fetchPriority="low" href="/_next/static/chunks/00
-
行为签名验证 未通过行为指纹仅命中 0/3 项,不符合目标模型特征。标准: 命中率 ≥ 60% (回答风格、拒绝方式、格式偏好等)命中数 0/3✗ markdown_bold_style✗ list_structure_preference✗ refusal_helpfulness_tone
-
思维签名验证 跳过本次检测未运行此项目thinking 块 无thinking 字数 0 字签名 无签名长度 0B签名前缀 -stop_reason -
-
模型一致性 异常检测器运行异常: HTTP 404: <!DOCTYPE html><html><head><meta charSet="utf-8"/><meta name="viewport" content="width=device-width, initial-scale=1"/><link rel="preload" as="script" fetchPriority="low" href="/_next/static/chunks/00
-
知识准确度 未通过知识问答仅正确 0/5。标准: 正确率 ≥ 60% (模型应了解自身厂商基本信息)✗ anthropic_ceo✗ anthropic_president✗ constitutional_ai✗ claude_first_release✗ anthropic_hq
-
PDF 文档识别 未通过无法从 PDF 中提取内容,可能不支持多模态输入。标准: Claude 应能处理 PDF base64 文档
-
结构化输出 异常检测器运行异常: HTTP 404: <!DOCTYPE html><html><head><meta charSet="utf-8"/><meta name="viewport" content="width=device-width, initial-scale=1"/><link rel="preload" as="script" fetchPriority="low" href="/_next/static/chunks/00
-
协议规范性 跳过本次检测未运行此项目
-
响应完整性 异常检测器运行异常: HTTP 404: <!DOCTYPE html><html><head><meta charSet="utf-8"/><meta name="viewport" content="width=device-width, initial-scale=1"/><link rel="preload" as="script" fetchPriority="low" href="/_next/static/chunks/00流式/非流式相似度 0.0%字符/Token 比 0.00input_tokens 非流式=- 流式=- 差=-
-
Token 用量 异常检测器运行异常: HTTP 404: <!DOCTYPE html><html><head><meta charSet="utf-8"/><meta name="viewport" content="width=device-width, initial-scale=1"/><link rel="preload" as="script" fetchPriority="low" href="/_next/static/chunks/00
-
消息标识规范 跳过本次检测未运行此项目
-
长上下文真实性 未通过长上下文测试失败,中转站可能截断了上下文或路由到小窗口模型。标准: 32k/100k/200k 各档位均需通过
-
供应链安全 跳过本次检测未运行此项目
-
数据外泄检测 跳过本次检测未运行此项目
-
身份泄露检测 跳过本次检测未运行此项目
-
注入防护 跳过本次检测未运行此项目
-
语言指纹 跳过本次检测未运行此项目
-
计算指纹 跳过本次检测未运行此项目
-
拒绝梯度 跳过本次检测未运行此项目
-
Token 自比对 跳过本次检测未运行此项目
-
混源检测 跳过本次检测未运行此项目
-
性能稳定性 跳过本次检测未运行此项目
-
知识分层 跳过本次检测未运行此项目
-
随机序列指纹 跳过本次检测未运行此项目
这份结果怎么理解?
Token 用量存在风险
usage 字段缺失或统计不自洽,建议不要直接依赖该中转站返回的 token 数做计费核算。
未达标 — 大概率不是真实 claude-fable-5
置信度: 高 (多维度证据一致)多项关键检测失败,该中转站大概率没有运行真实的 claude-fable-5。 详细证据见下方指标。
注水/掺水风险分析
模型字段不匹配
中风险
响应中的 model 字段与请求不一致,可能是中转站修改了模型路由。
请求: , 响应:
身份验证证据
| 指标 | 结果 | 详情 |
|---|---|---|
| 响应模型字段 | 未返回 | |
| 知识准确度 | 0/5 正确 |
各检测器详细指标
身份一致性
0分
0.1s
检测到品牌
[]
行为签名验证
0分
0.3s
命中数
0/3
✗ markdown_bold_style
✗ list_structure_preference
✗ refusal_helpfulness_tone
模型一致性
0分
0.1s
请求模型
-
响应模型
-
模型匹配
否
output_tokens 序列
[]
变异系数 CV
0.0000
知识准确度
0分
0.1s
✗ anthropic_ceo
✗ anthropic_president
✗ constitutional_ai
✗ claude_first_release
✗ anthropic_hq
结构化输出
0分
0.1s
JSON 解析
失败
schema 匹配
否
响应完整性
0分
0.2s
流式/非流式相似度
0.0%
字符/Token 比
0.00
input_tokens
非流式=- 流式=- 差=-
Token 用量
0分
0.2s
短 prompt tokens
in=- out=-
长 prompt tokens
in=- out=-
input_token 增量
- (期望 -)
stream chunks
-
count_tokens
- (-)
首 TOKEN
—
总耗时
316ms
吞吐 (T/S)
—
输入 TOKENS
0
输出 TOKENS
0
12 项检测各自检查什么?
- 身份一致性 (Identity)
- 询问模型自报身份,响应必须包含 "Claude" 与 "Anthropic",且不能自称是其他品牌(如 Kiro、AWS Q 等)。
- 行为签名验证 (Behavioral)
- 3 道行为指纹题(markdown 风格、列表偏好、拒绝语气),正版 Claude 有特征鲜明的回答模式。
- 思维签名验证 (Thinking) ⭐
- 核心检测:Claude thinking 块返回的加密
signature字节,任何中转站都无法伪造。 - 模型一致性 (Consistency)
- 验证
response.model与请求一致,且多次调用输出长度稳定(变异系数 CV)。 - 知识准确度 (Knowledge)
- 5 道关于 Anthropic 公司的常识题(CEO、HQ、Constitutional AI 等),错答多则说明背后不是真 Claude。
- PDF 文档识别
- 提交一份 base64 PDF + magic 字符串,检查模型能否正确提取——剥离 multimodal 的中转站会失败。
- 结构化输出 (Tool Use)
- 真实 tool_use 调用,验证
toolu_ID 前缀、JSON schema 匹配、stop_reason 等 5 项子项。 - 协议规范性 (Protocol)
- SSE 事件序列、content block 类型必须符合 Anthropic 官方规范(被动检测,不发额外请求)。
- 响应完整性 (Integrity)
- 同一 prompt 流式与非流式调用必须返回一致的文本、
input_tokens、stop_reason。 - Token 用量
- 检查 Claude Messages 的
usage.input_tokens/output_tokens是否存在、长短 prompt 增量是否合理、短输出是否没有超报,并用 stream 与count_tokens做交叉验证。 - 消息标识规范 (Message ID)
- 消息
id必须以msg_开头、tool 块以toolu_开头。UUID 或硬编码tool_1是典型造假特征。 - 长上下文真实性 (Long Context)
- 需在提交时勾选启用 — 用 needle-in-haystack 在 32k → 100k → 200k tokens 三档探针,验证中转站是否真兑现宣传的 context window(识别截断 / 路由到小窗口模型)。Anthropic 路径用官方
count_tokens端点精准预算 token,极限档可按模型完整上限自适应探到 950k+(Sonnet 4.6 / Opus 4.6/4.7 都是 1M)。