实测小米新模型MiMo V2.6,我真服了第一次看开源那么彻底的
以前我用小米的模型,主要图一个便宜。 拿它跑的都是批量的固定任务。定时扫一遍邮箱,扫一遍订阅里的内容,把新进来的东西归类,抽字段,一次几千条等等等等。 19号直播MiMo-V2.6-Pro和Flash的RL训练过程的时候我是真期待啊,没想到就5天就做出来了,还一口气发三个,Pro,Flash,Pro-UltraSpeed,UltraSpeed的输出速度最高能到Pro的20倍。 我点进去先看的是价格。 跟我以前用的时候一样。 Pro的缓存命中输入每百万/0.025元,Flash/0.02元。输出端Pro是6元,Flash是2元。 不急着要结果的话,走非实时的批量推理还能再打半折。跟同级海外模型摆在一起,差距能到1/20到1/60。 我突发奇想到一个新用法,jev + deepseek + mimo做成长时间批量任务三件套有没有搞头。所以我去看了眼分数,在Artificial Analysis上,MiMo-V2.6-Pro拿了46.32分,开源第一,国产第一,跟Grok 4.7打平。V2.5那会儿26分,一次小版本迭代就涨到46,比吃了炫迈还炫迈。 这个46是十项评测合出来的综合分,里面塞了Terminal-Bench 4.0,CritPT,SciCode,Humanity's Last Exam这些东西。厂商自己那份benchmark表格我扫一眼就过去了,自测分数我一向看得不重,挑几个我自己关心的说。 一个是Terminal-Bench 4.0,测Agent在终端里干活。除开海外那两家闭源的,在开源模型里排第三,前面是GLM-5.3和刚强化过的Qwen 3.8 Max。 另一个是CritPT,测物理推理。 在这个榜上它前面只剩GPT和Claude。 还有一个我自己基本每次都会看的,DeepSWE v1.1。 这个榜测的是长程软件工程任务。Pro从58.4涨到72.57,Flash从48.8涨到65.68。 分能涨成这样,但基座没换,还是V2.5那套,1.02T总参数,42B激活,提升几乎全来自后训练。同一天,隔壁Grok 4.7也发布了,AA上也是46分,但价格差了二十倍。 而且4.7这一代速度从60掉到了38.8,评测里生成的token从94M涨到240M,每个任务的成本从1.86美元翻到3.74。这样一看小米在开源和API价格两个方向都是赛博大善人了。 OK,轮到实测环节了。 第一个活,我挑的是网站复刻。 这个case是从我们自己的goodcase里抽出来的。平时测模型的前端能力,都有个固定套路,喂提示词,或者最多再喂几张截图。因为大多数模型能看图但读不了视频。MiMo-V2.6这次我换了个玩法,它是原生全模态的,视频能直接丢进去的。我就把那段录屏原样丢给它,只加了一句话,照着这个复刻一个一模一样的网站。 也是让我玩上鼠标版格莱美慢镜头了,而且字体也是用上了玻璃雾面,视频不会反过来把信息忽略了。 它复刻出来的那个页面,滚动的手感,动效的节奏,都能跟录屏对上, 那种一帧一帧推出来的电影感也在。 然后来整点好玩,鹈鹕骑自行车。 这个题在圈里算个老梗了,隔一阵就有人拿出来测一遍。之所以总拿它出来,是因为它几乎把模型画图的所有短板都凑一块了。鸟的身子和自行车本来就不好一起画,还得让鸟坐上去,脚踩在踏板上。静态图勉强能看,一旦要它动起来,腿跟踏板对不对得上,膝盖会不会反着折,全是坑。 我把它丢给MiMo-V2.6,让它做成一个能动的SVG,就一句话, 生成一个鹈鹕骑自行车的svg动画,以H5页面展示 结果比我预期的要好不少。 轮子会转是最基本的。 它还多做了一步,脚踏板也在转,两条腿跟着踏板走,膝盖朝前弯,脚底一直贴在踏板上。还整了一个倍速条,从0.4拉到2.2,踩踏的节奏跟着变快变慢,轮子的转速也按比例跟上。 而且它有自己的一套审美。还给鸟脖子上还围了条红围巾,有点好笑。。。 第三个,我们来久违做个PPT吧! 毕竟这次还有配套的桌面端可以直接用MiMo V2.6。 其实跟其他Agent长得也大差不差,该有的功能也都是全的。 有了插件,有了自定义模型,还要什么鹈鹕自行车? Codex的computer use这里也是有的,然后还有一个特别方便的就是生成的文档有个资料库,可以让你直接看到,再也不用一个个聊天框翻我的资料了。。 为了吓模型一跳,我没有找日常的办公类任务做ppt,我就想着万一之后小米也要造火箭呢,先拿Artemis II绕月练练手,先搜了一堆材料,有PDF,录音,图等等等等。 7. 任务成功意味着什么:把 WAV 中的核心观点与 PDF 中的任务优先级合并成清晰结论。 我本来是对排版没抱太大期望的。 结果它交出来的东西,比我预期的高一截。 它按PDF里的飞行顺序重新讲了一遍故事,发射,地球轨道检查,跨月注入,月球飞越,返回溅