
小米 MiMo-V2.5 多模态大模型发布,在 AI Agent 能力、多模态视听理解上完成了全面升级。它原生搭载极速视觉与音频解析系统,支持跨模态端到端推理,核心任务表现全面超越上一代 MiMo-V2-Pro,原生支持最高 100 万 Token 的超长上下文窗口。
依托架构升级后的专属训练管线,MiMo-V2.5 实现了底层原生的「看、听、做」三重感知闭环。这套底座设计,让模型同时具备了宽范围的高维理解能力与深粒度的底层操作能力。
顶尖的智能体执行力
MiMo-V2.5 依托极其强悍的大语言模型(LLM)基座构建,搭配独立的高规格视觉与音频编码器,通过后训练(Post-training)流程完成了机器感知、逻辑推演与工具调用能力的对齐。
在贴近真实商业部署场景的智能体基准评测中,MiMo-V2.5 的实测数据如下:

| 评测基准 | 实测表现与核心优势 |
|---|---|
| MiMo Coding Bench | 日常编码任务表现突出,大幅缩小了与行业前沿模型的差距。仅需一半算力成本,即可达到 MiMo-V2.5-Pro 的同级水准。 |
| Claw-Eval | 该榜单聚焦复杂长周期任务评测,模型在一般子集测试中取得 62.3 分,处于高阶性能与极致计算效率的帕累托前沿。 |
以上实测数据,核心指向了该模型的核心优势:以极高的计算能效比,实现行业第一梯队的执行能力。开发者无需再在「全场景认知能力」与「极致执行效率」之间做取舍。
更敏锐的感知与更广阔的视野
从高精度视觉细节排查、复杂动态图表解析,到多模态交互场景,MiMo-V2.5 均展现出极强的视觉理解能力,同时原生支持 100 万 Token 的超长文本上下文。

针对复杂感知场景,模型核心实测数据如下:
- 多模态智能体任务交互:MiMo-V2.5 在 Claw-Eval Multimodal 测试集取得 23.8 分,与 Claude Sonnet 4.6 持平,较上一代 MiMo-V2-Omni 提升 8 分,与 Claude Opus 4.6 仅相差 1 分。
- 超长跨度视频解析能力:模型在 Video-MME 榜单取得 87.7 分,与 Gemini 3 Pro(88.4 分)持平,显著优于 Gemini 3 Flash。在长时长、跨帧的复杂视频理解任务中,包括空间追溯、跨镜头逻辑推演、分钟级画面信息回溯,均能稳定完成高精度解析。
- 高精静动态图像解析:模型在 CharXiv RQ 与 MMMU-Pro 测试集分别取得 81.0 分和 77.9 分,性能接近 Gemini 3 Pro 的行业标杆水平。
以上能力均基于同一套集成架构实现,让 MiMo-V2.5 在图像、文本、视频的多模态统一感知上,达到了行业前沿水平。








最新评论
有多亮,是blingbling的吗🤣
这个网站眼前一亮
不要装,千万不要装,无法自定义鼠标指针,主题和壁纸需要重新设置,但是鼠标指针完全被像素版大白指针替代,无法更改。
鼠标指针也没了qwq