Ox Alpha 是 8 月 20 日出现在公共推理平台 OpenRouter 上的匿名旗舰模型,中文社区称「牛来」(名字借自 2025–2026 年间的一个网络梗,与英文「ox」双关)。它自报 1,048,600 token——模型处理文本或视频的最小单元——的上下文窗口(即模型一次能读入的最大长度)和原生视频输入。外部工程师用三类公开信号——Tokenizer(分词器)词表切分、视频 token 预算、API 报错字符串——把它高度疑似地指向中国 AI 公司智谱的 GLM
8 月 20 日,一个没有挂任何厂商署名的旗舰级 AI 模型,悄悄出现在公共推理平台 OpenRouter 上,自报 1,048,600 token 上下文窗口、原生文本/图像/视频输入、最大单次 131,000 token 输出。OpenRouter 是一个聚合多家大模型 API 的公共路由平台,开发者可以按 token 计费调用不同模型,不必直接对接各家厂商。
比起「是谁做的」这个问题,更值得讲的是:一家没挂品牌的前沿模型,已经可以被外部工程师从公开信号反推到两家候选厂商,而且这套方法可以重复。
社区给这个匿名模型起了一个名字:Ox Alpha,中文社区音译为「牛来大模型」,名字借自 2025–2026 年间的一个网络梗,与英文「ox」双关。
视频 token 预算是最硬的那条线索
判断一个模型「像不像」另一家厂商的训练产物,传统思路是看跑分、看风格。这次社区用的不是主观判断,而是对模型「如何把视频切成 token」做对照实验。视频 token 是模型处理视频的最小处理单元,不同厂商把视频转 token 的策略,包括每秒采多少 token、分辨率如何折算,通常是训练管线的内部细节,外界不会公开。
社区测试者用 4 段受控测试视频同时丢给 Ox Alpha 和几款已知模型,记录它们把视频切成多少 token。量子位汇总的测试结果显示,Ox Alpha 在三个独立轴上对齐 GLM-5V-Turbo:帧率变化时采样策略不被打乱;视频每多一秒,token 数大约以 147 token/秒 的速率线性增加;单帧分辨率提升时,token 数的增长曲线与 GLM-5V-Turbo 一致。MiMo、Qwen、GLM-4.6V 在同一对照下都偏离了这条曲线。
147 token/秒 这个数字本身不在 GLM-5V-Turbo 的公开文档里,但只要它在多个独立轴上同时匹配,工程师就有理由推断,两者的视频编码器共用同一套或极其接近的设计。
Tokenizer 给出了第二条线索
Tokenizer 是大模型把文本切成最小处理单元的模块,切分粒度直接反映训练语料与词表设计。
社区流传的一个混合 CJK、代码、Emoji 的测试 prompt,在 GLM-5.3 和 GLM-5.2 上切成 68 个 token,在 Ox Alpha 上切成 143 个 token。这 75 个 token 的差额恰好可以被 Ox Alpha 加载时携带的一段隐藏系统提示解释掉。第二组 25 条 prompt 的对照实验,重复出了同一个固定偏移:Ox Alpha 和 GLM-5.3 的 token 数差是一个常数,而不是随文本长度变化的复杂函数。固定偏移意味着 Ox Alpha 的词表与切分规则和 GLM-5.3 高度一致,只是默认多背了一段系统提示词。
API 报错信息暴露了第三条线索
第三条线索更细,但也更接近「现场指纹」。当用户向 Ox Alpha 传入格式错误的参数时,模型返回的错误字符串形如 [1210] The temperature parameter is illegal。错误码 1210、中英混排的响应格式,被社区测试者判断为与智谱(Zhipu)服务栈的文档行为高度一致。
此外,有用户声称在 Ox Alpha 的推理输出中看到了字面残留 trained by Z.ai,Z.ai 是智谱关联品牌的英文名之一。但这条证据只存在于社区截图和二手转述中,是整条证据链里最弱的一环,不能被当作确认。
Google 仍是活着的反例
把嫌疑压在智谱一侧之前,还有一家不能忽略:Google。Ox Alpha 的产品画像,百万级上下文、原生图像和视频、长链路 Agent(能自主调用工具完成多步任务的智能体)能力、强调代码与工具调用,和 Google 长期投入的方向重合。Google 在 2026 年 Google I/O 上预告过一款「下月发布」的 Gemini 3.5 Pro,但这款模型至今没有正式亮相。
Google 侧的社交信号同样耐人寻味。Google DeepMind 研究员 Evan Otero 在讨论 Ox Alpha 的帖子里写下「Gemini」,并在另一条推文中写下「如果 Ox Alpha 就是我们一路遇到的朋友呢」。同一时间窗内,Techmeme 也追踪到 Gemini 团队多名成员密集发帖讨论 Gemini 与下一代模型。
但社交媒体上的含混暗示并不等于确认。Ox Alpha 的 tokenizer 指纹、视频 token 预算、API 报错格式都没有显示出 Gemini 系列公开模型的对应特征。截至发稿,没有任何 Google 官方账号承认 Ox Alpha 与 Gemini 3.5 Pro 有关。
先例:Pony Alpha 已经是智谱走过的路
这不是 OpenRouter 上第一次出现「匿名模型最终被指认为智谱」的剧情。2026 年 2 月,一款名叫 Pony Alpha 的匿名模型在 OpenRouter 上线,几天后被官方确认为 GLM-5 的预发布版本。
Pony Alpha 给 Ox Alpha 留下的最重要遗产,不是「又是智谱」,而是「匿名前沿模型可以通过第三方分发平台先于官方亮相」这条路径已经被走通过一次。Ox Alpha 与 Pony Alpha 共享同一分发路径、相近的 tokenizer 设计、相同的 API 服务栈惯例,这是把嫌疑压回智谱一侧的另一个理由。
一个会重复使用的方法
Cursor 是否拿开源 GLM 训了自己的代码模型,是这次讨论里另一条更弱的支线,它只来自标题层面的猜测,公开材料里没有直接证据。
但 Ox Alpha 真正留下的遗产是方法论:Tokenizer 的固定偏移、视频 token 在多个独立轴上的一致性、API 报错字符串与已知服务栈的匹配,这三件事都是模型上线第一天就能被外部采集的信号,不依赖任何厂商主动披露。
对下一家想要匿名上线的实验室来说,这意味着:词表、视频编码器、错误信息模板这些过去被当作内部工程细节的东西,现在都会成为可被反推的指纹。前沿模型的发布方式已经变了,发布者可能仍然匿名,但「谁做的」已经不再完全无解。