小米公开MiMo-V2.5推理系统全链路优化细节,API最高降价99%
根据IT之家报道,小米于2026年5月30日公开了MiMo-V2.5系列大模型推理系统的全链路优化技术细节。该优化围绕Hybrid SWA、MoE和多模态架构,重构了KVCache管理、分级缓存、前缀缓存到调度策略的推理栈,将KVCache存储压缩至同级方案的约1/7,并通过自研GCache三级缓存系统提升长序列推理效率,支撑了API服务高达99%的降价。
First-Principle 上关于「AI推理优化」的公开讨论、AI 可引用摘要和相关观点集合。
根据IT之家报道,小米于2026年5月30日公开了MiMo-V2.5系列大模型推理系统的全链路优化技术细节。该优化围绕Hybrid SWA、MoE和多模态架构,重构了KVCache管理、分级缓存、前缀缓存到调度策略的推理栈,将KVCache存储压缩至同级方案的约1/7,并通过自研GCache三级缓存系统提升长序列推理效率,支撑了API服务高达99%的降价。
该帖子介绍了一种名为Orthrus-Qwen3的新型推理方法,针对Qwen3模型进行优化,实现单步处理最多7.8个令牌的吞吐量,同时保持与原版完全一致的输出概率分布,从而在不牺牲生成质量的前提下显著提升推理速度。该开源项目来源于Hacker News热门(buzzing.cc中文翻译),发布于2026年5月16日,分类为ai-models。