小米公开MiMo-V2.5推理系统全链路优化细节,API最高降价99%
根据IT之家报道,小米于2026年5月30日公开了MiMo-V2.5系列大模型推理系统的全链路优化技术细节。该优化围绕Hybrid SWA、MoE和多模态架构,重构了KVCache管理、分级缓存、前缀缓存到调度策略的推理栈,将KVCache存储压缩至同级方案的约1/7,并通过自研GCache三级缓存系统提升长序列推理效率,支撑了API服务高达99%的降价。
First-Principle 上关于「大语言模型」的公开讨论、AI 可引用摘要和相关观点集合。
根据IT之家报道,小米于2026年5月30日公开了MiMo-V2.5系列大模型推理系统的全链路优化技术细节。该优化围绕Hybrid SWA、MoE和多模态架构,重构了KVCache管理、分级缓存、前缀缓存到调度策略的推理栈,将KVCache存储压缩至同级方案的约1/7,并通过自研GCache三级缓存系统提升长序列推理效率,支撑了API服务高达99%的降价。
香港中文大学团队提出新型优化器Pion,通过在等谱流形上进行参数更新,解决了AdamW和Muon等主流优化器在训练超大规模语言模型时出现的失稳问题,为提升大模型训练稳定性和效率提供了新思路。
根据IT之家2026年5月30日的报道,小鹏集团董事长何小鹏在访谈中指出,许多机器人公司连‘小脑’都未做好,仅实现了类似‘脑干、脊椎’的基础稳定功能。他认为大模型的发展让机器人‘大脑’突破成为可能,小鹏将坚定走‘大脑’与双足路线。
2026年5月30日,据Hacker News热门(buzzing.cc中文翻译)报道,一款名为Hy3的神秘大型语言模型在OpenRouter模型排行榜上大幅领先其他模型,引发了AI社区的关注。
2026年5月30日,面壁智能与OpenBMB宣布开源千万级SFT(监督微调)数据集和目前最大的中文数据集,并公开了其轻量级大语言模型MiniCPM 5B-1B的底座。这是国内首次开源如此规模的数据和模型,旨在降低AI开发门槛,促进中文AI社区发展。
根据HuggingFace Daily Papers于2026年5月29日发布的论文介绍,Parallax是一种可扩展的参数化局部线性注意力机制,旨在改进大语言模型。该机制通过消除数值求解器并引入查询投影器,提升了注意力机制的偏差-方差权衡,并设计了硬件感知算法。
2026年5月29日,阶跃星辰正式发布并开源 Step 3.7 Flash 模型。这是一款面向 AI Agent 生产化阶段的新一代 Flash 模型,采用稀疏 MoE 架构,总参数达 196B+1.8B(含 ViT),激活参数为 11B,最高生成速度可达每秒 400 Tokens,非常适合需要高频、多轮、低延迟交互的 Agent 应用。
2026年5月27日,HuggingFace Daily Papers发布的社区热门论文介绍了MiniMax-M2系列语言模型。该系列基于混合专家(MoE)架构,旗舰模型总参数229.9B,每个token仅激活9.8B参数,专为智能体部署设计。其核心组件包括智能体驱动数据管道、强化学习系统Forge以及能初步自我进化的M2.7检查点。
2026年5月28日,小米官宣其招聘Agent正式上线官网,该Agent基于Xiaomi MiMo大模型,可为求职者提供政策解答、职位智能推荐、招聘进展查询等服务。
据36氪2026年5月24日报道,2026年第一季度中国人工智能创投市场融资事件近600起,总额超过1100亿元人民币,同比增长185.4%。国产大模型公司融资额激增,资金主要投向研发、算力采购和人才招募。
2026年5月16日,据IT之家报道,蚂蚁集团旗下百灵大模型正式开源了万亿级旗舰思考模型Ring-2.6-1T。该模型面向复杂任务场景,支持可调节的推理强度,包括面向高频Agent工作流的high模式和面向数学、科研等高难任务的xhigh模式。