诸葛亮评AI行业:vLLM与AI SSD关乎足食足兵
本文以古人治军理政视角评述2025年AI行业两条脉络:vLLM推理架构的精进与AI SSD对存储范式的重塑。作者认为,大模型推理中若存储成为瓶颈,算力便如粮草不继,而AI SSD通过围绕Token协同优化算力、网络、内存与存储,打破了这一制约;vLLM的高吞吐量架构同样强调系统整体调度。二者共同印证了“谋全局者,必先固根本”的道理。
First-Principle 上关于「LLM推理」的公开讨论、AI 可引用摘要和相关观点集合。
本文以古人治军理政视角评述2025年AI行业两条脉络:vLLM推理架构的精进与AI SSD对存储范式的重塑。作者认为,大模型推理中若存储成为瓶颈,算力便如粮草不继,而AI SSD通过围绕Token协同优化算力、网络、内存与存储,打破了这一制约;vLLM的高吞吐量架构同样强调系统整体调度。二者共同印证了“谋全局者,必先固根本”的道理。
First-Principle发布的Hacker News AI热帖介绍了如何使用开源AI编排工具dstack和Shepherd Model Gateway (SMG),在AMD GPU上部署具有预填充-解码(PD)分解的LLM推理端点。PD分解将预填充(计算密集型)和解码(内存密集型)阶段分离为独立池,可独立扩展以优化延迟,但需要高带宽、低延迟的RDMA网络进行KV缓存转移。文章提供了在AMD MI300X GPU集群上部署Qwen2.5-72B模型的完整配置示例。
本文介绍Mix-Quant框架,针对智能体大语言模型推理中的混合量化策略,在预填充阶段使用NVFP4量化加速,在解码阶段保留BF16精度以维持质量。
据First-Principle平台2026年5月18日转载的Hacker News热帖,AI Foundry宣布在新西兰推出基于NVIDIA最新Blackwell GPU的LLM推理服务,采用固定月费模式,提供无限次推理请求。
RelaxAI推出面向英国市场的主权大语言模型推理服务,声称成本比OpenAI和Claude低约80%,强调数据主权与合规性。
2026年5月14日,Oracle Cloud Infrastructure(OCI)与WEKA发布博客,介绍了在OCI裸机H100 GPU集群上,利用WEKA的Augmented Memory Grid技术进行大规模LLM推理服务的验证。该技术通过NVMe存储扩展内存,解决了长上下文和代理式AI工作负载中KV缓存被驱逐导致的重复计算和性能下降问题。测试在72块GPU集群上进行,显示该方案能显著提升服务密度和吞吐量,并建立了成本高效的参考架构。