系统极客一直在努力
专注操作系统及软件使用技能

小米 MiMo-V2.5 发布:让 AI Agent 睁眼、聆听、破界限

小米 MiMo

小米 MiMo-V2.5 多模态大模型发布,在 AI Agent 能力、多模态视听理解上完成了全面升级。它原生搭载极速视觉与音频解析系统,支持跨模态端到端推理,核心任务表现全面超越上一代 MiMo-V2-Pro,原生支持最高 100 万 Token 的超长上下文窗口。

依托架构升级后的专属训练管线,MiMo-V2.5 实现了底层原生的「看、听、做」三重感知闭环。这套底座设计,让模型同时具备了宽范围的高维理解能力与深粒度的底层操作能力。

顶尖的智能体执行力

MiMo-V2.5 依托极其强悍的大语言模型(LLM)基座构建,搭配独立的高规格视觉与音频编码器,通过后训练(Post-training)流程完成了机器感知、逻辑推演与工具调用能力的对齐。

在贴近真实商业部署场景的智能体基准评测中,MiMo-V2.5 的实测数据如下:

MiMo-V2.5 代码能力测试
评测基准实测表现与核心优势
MiMo Coding Bench日常编码任务表现突出,大幅缩小了与行业前沿模型的差距。仅需一半算力成本,即可达到 MiMo-V2.5-Pro 的同级水准。
Claw-Eval该榜单聚焦复杂长周期任务评测,模型在一般子集测试中取得 62.3 分,处于高阶性能与极致计算效率的帕累托前沿。

以上实测数据,核心指向了该模型的核心优势:以极高的计算能效比,实现行业第一梯队的执行能力。开发者无需再在「全场景认知能力」与「极致执行效率」之间做取舍。

更敏锐的感知与更广阔的视野

从高精度视觉细节排查、复杂动态图表解析,到多模态交互场景,MiMo-V2.5 均展现出极强的视觉理解能力,同时原生支持 100 万 Token 的超长文本上下文。

MiMo-V2.5 多模态能力测试

针对复杂感知场景,模型核心实测数据如下:

  • 多模态智能体任务交互:MiMo-V2.5 在 Claw-Eval Multimodal 测试集取得 23.8 分,与 Claude Sonnet 4.6 持平,较上一代 MiMo-V2-Omni 提升 8 分,与 Claude Opus 4.6 仅相差 1 分。
  • 超长跨度视频解析能力:模型在 Video-MME 榜单取得 87.7 分,与 Gemini 3 Pro(88.4 分)持平,显著优于 Gemini 3 Flash。在长时长、跨帧的复杂视频理解任务中,包括空间追溯、跨镜头逻辑推演、分钟级画面信息回溯,均能稳定完成高精度解析。
  • 高精静动态图像解析:模型在 CharXiv RQ 与 MMMU-Pro 测试集分别取得 81.0 分和 77.9 分,性能接近 Gemini 3 Pro 的行业标杆水平。

以上能力均基于同一套集成架构实现,让 MiMo-V2.5 在图像、文本、视频的多模态统一感知上,达到了行业前沿水平。

赞(0)
分享到

评论 抢沙发