案例分析
stealth/ox-alpha 是哪家的模型?
这是一个不公开身份的匿名模型。我们看不到它的权重,但每次请求返回的 token 用量会泄露它使用的分词器词表—— 而词表是各家自己训练的,很难碰巧相同。
这个结论的边界在哪里
我们只能说「词表一致」,不能说「就是这个模型」
分词器词表和模型权重是两回事。上面的结论意味着 ox-alpha 使用的词表与该家族一致,这通常说明它出自同一厂商的同一代技术栈 —— 但严格来说,如果某个厂商刻意复用了别家的开源词表,本方法无法区分。同理,共用同一套词表的多个模型之间,我们也无法进一步分辨具体是哪一个。
为什么词表仍然是有力的证据
词表是训练早期就定下的基础设施,包含数万到数十万条 merge 规则,对生僻汉字、少数民族文字、长数字串的切分方式几乎是「指纹级」的。不同厂商独立训练出完全一致的切分行为,概率极低。我们用库内两个最接近家族的距离作为判别余量基准 —— 只有当观测值明显比这个余量更接近某一家时,才给出结论。
自己验证一次
不必相信我们的结论。用你自己的 key 测一遍,看能否复现 —— 这也是我们把方法和代码全部开源的原因。
用我的 key 测一次会预填端点和模型名,key 需要你自己填,我们不保存。