系统极客一直在努力
专注操作系统及软件使用技能

小米 MiMo-V2.5-Pro 发布:全链路开发能力拉满

MiMo

小米 MiMo-V2.5-Pro 正式开启公测。它彻底突破了上代 MiMo-V2-Pro 的能力局限,在 AI 智能体场景、复杂高阶软件工程、长周期开发任务中,实现了量级上的性能跃升。

内测结果印证了一点:MiMo-V2.5-Pro 突破了原有的智能边界,甚至倒逼研发团队重塑了整套指令交互模式。搭配恰当的测试框架后,模型可直接进入自主运转闭环,稳定支撑数千次级别的工具并发调度。在智能体应用场景中,将指令遵从度放到最高优先级——它能精准捕捉超长上下文中深埋的细节要求,全程严守逻辑链条不出现偏差。

目前,全线 API 平台及 AI Studio 等矩阵产品已全面上线该模型,资费维持不变。只需调用接口,将模型指向mimo-v2.5-pro即可投产。

专攻「地狱难度」

打造这个版本的核心目标,就是啃下行业里最难啃的硬骨头。团队把人类架构师往往要耗时数周完成的任务,交给 MiMo-V2.5-Pro 做无人值守开发,它交出的答卷如下:

用 Rust 徒手搓出 SysY 编译器

以北京大学《编译原理》课程的期末大作业为实战场景,要求模型从零构建一套 Rust 语言的 SysY 核心编译器,完整覆盖以下开发环节:

  • 词法分析器 Lexer
  • 语法分析器 Parser
  • 抽象语法树 AST
  • Koopa IR 中间代码生成
  • RISC-V 汇编指令后端实现
  • 运行时性能优化

名校相关专业的学生完成这个项目,保守要花掉一整个假期。MiMo-V2.5-Pro 只用了 4.3 小时,自主完成 672 次工具调用就顺利完工。放入隐藏盲测集跑分,拿到了 233/233 的满分成绩。

面对编译器这种极重逻辑链的深坑,它打破了大模型只会「盲目试错」的刻板印象。模型严格按照工程化标准推进开发节点:先完成全链路底层代码构建,再完成 Koopa IR 分支开发(斩获 110/110 满分),随后攻克 RISC-V 核心后端(103/103 满分),最后完成性能优化收尾(20/20 满分)。甚至在首次编译启动时,它仅凭初始代码就通过了 137 项测试用例,冷启动通过率达到 59%。这意味着,在还未收到报错反馈时,它的整体架构设计就已经做到了无懈可击。

在第 512 次迭代中,深度重构导致lv9/riscv分支出现问题,两项用例执行失败。它没有陷入循环试错,而是直接定位到崩溃断点,回滚错误版本、重写修复补丁后,继续推进开发流程。正是这种精准的结构化纠错能力,才能支撑起长周期的代码开发马拉松。

贯穿全链路的全平台视频工作站

只用寥寥数行 Prompt,MiMo-V2.5-Pro 就生成了一套完整的通用桌面级视频工作站应用:多轨时间线剪辑、时间轴推拉裁切、视频转场融合、底层音频混音器,以及推流渲染导出全链路能力,全部完整实现。

整个过程全自动完成,总耗时 11.5 小时,累计发起 1868 次工具调用,单模型独立生成了 8192 行准工业级可用代码。

内测演示中用到的全流程产品导览 Demo 音视频流,除了视觉交互界面,连解说音效音轨,都是模型通过内部原生挂载的 MiMo-V2-TTS 生成的。

模拟电子设计自动化 Analog EDA:极化 FVF-LDO 调优

跨界直接踏入研究生难度的深水区:基于台积电 180nm CMOS 制程,设计一款 FVF-LDO 翻转电压跟随器低压差线性稳压器。这项挑战的难度极高,需要精准计算功率管截面积、微调补偿网络、匹配钳位偏压电路,同时要求以下六大硬件指标全部达标:

  • 相位裕度
  • 线性调整率
  • 负载调整率
  • 静态电流
  • 电源抑制比
  • 瞬态响应

资深模拟芯片设计师完成这项设计,往往要连续熬多个通宵。我们将 MiMo-V2.5-Pro 接入ngspice调测闭环沙盒,以 Claude Code 作为驱动。

经过近一小时的波形读取检测与参数迭代调优,模型输出的硅片设计图完全符合设计红线要求,其中四项核心指标,较初始草图的性能提升了整整一个数量级。

三场极限测试下来,V2.5-Pro 展现出了极强的Harness awareness:它能充分调用测试环境的所有可用权限,动态优化内存占用,主动梳理上下文信息来优化最终输出,每一步都有明确的工程目标。

撕破天花板的编码直觉

依托后训练(Post-training )阶段投入的大规模集群算力,团队再次拉高了模型的结构化能力上限。

用内部基准测试集 MiMo Coding Bench 进行全面验证,这套测试集覆盖了全库代码通识、工程打包、深度代码审查、项目架构重构等高难度开发场景。测试结果显示,MiMo-V2.5-Pro 可完美适配市面上主流的技术栈,彻底解决了复杂环境依赖的痛点。

无论你的团队习惯用 Claude Code,还是 OpenCode、Kilo 这类开发脚手架,都能基于 MiMo-V2.5 的底座,用平民化的算力成本,体验到越级的模型性能。

Token 通货膨胀的终结者

只靠刷榜分数定义不了好模型,能用最少的 Token 消耗实现最高的任务通过率,才是真正的硬实力。在 ClawEval 基准测试中,V2.5-Pro 拿下了64% Pass^3 通过率,单轮测试仅消耗约 70K Token

对标阵营Token 基准资源损耗性能同档位判断
MiMo-V2.5-Pro标尺水准极低(总包约 70K)斩获顶级 Pass^3 通关率
Claude Opus 4.6高出 40%-60% 的算力消耗性能相当或存在短板
Gemini 3.1 Pro高出 40%-60% 的算力消耗性能相当或存在短板
GPT-5.4高出 40%-60% 的算力消耗性能相当或存在短板

开源预告

MiMo-V2.5 将于近期开源,开放给社区使用。

赞(1)
分享到

评论 抢沙发