同一个凌晨的两场发布:Grok 4.7 与 MiMo V2.6 实测对照

Grok 4.7 与小米 MiMo V2.6 同一凌晨相继发布,实测对比跑分、价格、速度与开源情况,并给出模型选型与工作流调整建议。

同一个凌晨,两款模型对撞:Grok 4.7 与 MiMo V2.6 的实测对照

Grok 4.7 与小米的 MiMo V2.6 在同一个凌晨相继上线,中间只隔了大约三个半小时。前者延期两周才露面,后者是在几场模型训练直播之后正式交卷。两款模型撞在同一天,实测下来的观感却截然相反。

性能、价格、速度:那个长期无法兼得的三角

在大模型身上,性能、价格、速度这三项长期难以同时满足,这是过去几年里几乎无解的取舍。

GPT-6 Astra 就是这种取舍的典型样本。能力上确实强,设定好目标之后可以直接当作执行工具使用,很多基础设施都因为它被重构过;代价是又贵又慢。此前重构底层架构与数据库时,一天消耗 200 美元额度,靠三个账号轮换、再加上之前赠送的重置卡才勉强撑住。后来改用 GPT-6 Pro 搭配 MCP,并把部分小任务降级到 GPT-6 Astra low,情况才稍微持久一些,但仍然不敢放开用。

正因为如此,Grok 4.6 发布时曾被认为最接近这个三角的平衡点:开发能力不算突出,但速度不错、价格不高,因此长期被高频使用——毕竟 GPT-5.6 Sol 的速度实在难以忍受。也正因为这样,对 Grok 4.7 的预期被拉得很高,希望它能把这条线再往上抬一档。

结果并不理想。Grok 4.7 上线后,实测表现低于预期;而它发布三个半小时之后,MiMo V2.6 深夜登场,反而超出预期,成了当前这个时间点里对三角问题解答得最好的那个。两款模型放在一起,对比格外鲜明。

Grok 4.7:预训练规模上去了,短板还在

Grok 4.7 的官方跑分参考价值有限,但可以看一下第三方口径:AA 指数 46 分,与 GPT-5.6 Sol 接近。

按官方说法,这是一个 2.1T 的全新预训练模型,规模比 Grok 4.6 的 1.5T 大出不少,训练数据里还加入了 SpaceX 多年积累的工程数据。但上下文问题依旧没有解决,只有 500K,没有做到 1M。

在最受关注的 Coding Agent 评测集 Terminal-Bench 4.0 上,由 AA 自己跑出的成绩相当难看:与 DeepSeek V4.1 Flash 齐平,没能超过 GLM 5.3 Flash,更不用说 GPT-6、Fable 5.1 这些更强的模型。在衡量前沿科研推理能力的 CritPt 上,相比 Grok 4.6 几乎没有提升。

总分之所以还看得过去,主要靠法律等知识工作类任务拉高;如果只看 Coding 与 Agent 这两项,AA 的总分很难好看。

前端层面则出现明显退步,观感甚至不如 Grok 4.6:同样是鹈鹕骑车的生成任务,与 GPT-6 Astra 的产出差距明显。在建筑前端设计加性能测试中,设计密度不足,性能优化问题突出,卡顿严重,流畅度远不及用 GLM 5.3 Flash 开发的效果。

价格维持不变,与 Grok 4.6 一致:输入每百万 Token 2 美元,输出每百万 Token 6 美元。以这样的进步幅度来看,性价比提升有限。

如果 MiMo 当晚没有发布,Grok 4.7 或许不会引起这么多讨论,甚至可能没什么热度。但 MiMo V2.6 在三个半小时后出现,对比之下,Grok 4.7 的位置就有些尴尬了。

MiMo V2.6:三个版本,把三角同时压住

坦率地说,对 MiMo 原本没有太高期待。V2.5 已经是 4 月的事,而当时已是 9 月底,一家模型厂商五个月里几乎没有新的大模型发布。但深夜登场的 MiMo V2.6 带来了最大的惊喜,一共三个版本:MiMo-V2.6-Pro、MiMo-V2.6-Flash,以及 20 倍速的 MiMo-V2.6-Pro-UltraSpeed,后者目前应该是全球最快的。

跑分。 撰稿时 AA 刚更新了 MiMo-V2.6 的成绩:46 分,与 Grok 4.7 完全打平,位列开源模型第一和国产第一。这个第一能维持多久不好说,但 MiMo V2.6 Pro 是当下的第一。从 V2.5 的 26 分提升到 V2.6 的 46 分,进步幅度相当大。

官方给出的细节跑分仅供参考。在 AA 上两个更被看重的评测中,MiMo V2.6 Pro 的表现是这样的:Terminal-Bench 4.0 这类硬核 Coding Agent 任务,在开源模型里仅次于 GLM-5.3 和刚强化过的 Qwen 3.8 Max,排名第三;而在 CritPt 科研推理任务上,仅次于 GPT 和 Claude,是得分最高的模型。其他各项任务也基本处于前列。

价格。 MiMo V2.6 Pro 缓存输入每百万 Token 0.025 元,Flash 直接是 0.02 元,与 DeepSeek V4.1 Flash 对标。没有优惠期,也没有闲时价格,就是这两个数字。输入与输出价格同样很低,如果采用可以等待的非实时批量推理,价格还能再打半折。把主流大模型的价格换算成人民币横向对比,差距一目了然——小米在价格上的力度,让 DeepSeek 都显得不够看。

速度。 输出速度达到约 130 Token/s。

智能、价格、速度三项数据摆在一起,这个版本里最接近那个不可能三角的,就是 MiMo V2.6。

内部用 AIHOT 精选的小测试跑了 2000 道题,想看看 MiMo V2.6 Flash 能否作为后端模型:结果它在品味分上排第一,速度与价格和 DeepSeek V4.1 Flash 打平。目前正在把 AIHOT 背后主要的判断 API 全面切换到 MiMo V2.6 Flash 上。

基座没换,靠后训练做到 V2.6

这一代并没有继续堆参数规模,基座沿用的是 V2.5。

MiMo-V2.6-Pro 总参数 1.02T,激活参数 42B;Flash 更小,总参数 309B,激活 15B。两款都是 1M 上下文,并且都是原生全模态,文字、图片、视频、音频都能直接输入。也就是说,基模未换,仅通过后训练就达到了 V2.6 的水平。

前几天小米做了一件少见的事:罗福莉在 X 上把 MiMo V2.6 的强化学习训练过程公开直播。所有指标都可以看到——训练进行到第几步、花了多少钱、每一步跑了多少数据、训练 Pass Rate 如何变化。这是一场豪赌。

成本方面,MiMo V2.6 Flash 这一轮强化学习花了约 85 万美元,Pro 花了 262 万美元,合计约 347 万美元,折合人民币两千多万元,为的是不到六天的后训练。这几天里各项 Benchmark 持续提升,曲线也反映出数据集质量之高。

配套的技术报告也完整产出,内容值得细读,AI 从业者尤其推荐。罗福莉也写了一篇帖子,"You Only RL Once" 的思路很有意思。

客户端与实测:主动性是这一代的特点

MiMo 桌面客户端已结束内测,正式版向所有人开放。打开客户端就能看到最新模型全部上线可用。团队还允许配置自定义模型,并把各家国产模型预设好了;此前购买过 MiMo Token Plan 的用户,也可以在这里直接添加后继续使用。客户端整体做得相当完整,下载后可以自行设置。

简单测试下来,MiMo V2.6 基本属于偏万能的水桶模型。处理小型 BUG 修复绰绰有余:看到一条告警通知或 BUG 反馈,直接交给 MiMo V2.6 Pro,通常三分钟就能定位问题。它还会更主动一些,关联过去的问题,提示有没有可以一并解决的同类情况。这种主动性是这一代的特性。

一个热点算法重构的大型任务,由 GPT-6 Pro 做规划、MiMo V2.6 负责执行,跑了一个多小时,CI 被打回一次,正在修复后继续提交,看起来问题不大。

前端方面,团队习惯用建筑设计来测试,既能看审美,也能看代码性能。露天足球场任务完成得不错,精细度和整体效果与 GPT-6 Astra 那类模型相比仍有差距,但整体精细度和性能表现大致在 Opus 4.8 到 Opus 5 之间。花朵动效网页实现得很好,性能也足够流畅。

工作流会怎么调整

GPT-6 Astra 仍是最强的主力模型。考虑到高昂的价格,大型项目前端的规划与策划一般由 GPT-6 Pro 加 GPT-6 Ultra 共同完成,再交付到执行层。

执行层会分两种情况。风险较大的工作,比如算法优化、大型重构,直接用 GPT-6 Astra Max 接着规划并开始开发,用思考深度换取在最短轮次内完成开发,避免反复提 PR、过 CI、不断修改的无限循环。风险一般的工作,比如单个功能优化或 BUG 修复,出于成本考虑可以直接交给 MiMo V2.6 Pro,完全没有问题;后续可能会再看看 GPT-6 Sol 的性价比,再做对比判断。

对于用不了国外模型的用户来说,国内目前最综合的水桶选择可能就是 MiMo V2.6 Pro。而 AIHOT 的后端 API 无脑切到 MiMo V2.6 Flash 之后,精准性更高、品味更好,成本还能再降 50%。

全面开源,连 RL 环境一起给

还有一件重要的事:MiMo V2.6 这次是全面开源,而且是模型上线第一天就全部开源。

MiMo-V2.6-Pro 与 Flash 的模型权重已经开源,Hugging Face 上可以下载。

此外还有一个很有意思的发布:MiMo-V2.6-Distill-Qwen-9B。他们专门基于 Qwen3.5-9B 做了一个只有 9B 的小模型,目的是让社区里没有几千张卡的人也能自己复现这一套 Agentic RL。

同时宣布开放的还有 7000 多个高质量 RL 任务环境——做 AI 的人都知道这意味着多大的价值。另有 mini-harnesses 一并开放。那份内容丰富的技术报告也在开源之列。

愿未来,智能属于我们每个人。

分享 微博

弹幕

还没有弹幕,来说一句。

到此一游

0

还没有人留下足迹,来签个到。

    评论 0

      昵称