小米于2026年5月26日宣布,旗下MiMo-V2.5系列AI模型API价格永久降价,最高降幅达99%,取消了以往按上下文窗口长度区分价格的策略,优化了Token套餐,使得相同费用下使用量增加5至8倍 [1, 2]。小米MiMo团队负责人罗福莉表示,系统一次性能够记忆比以往多约五倍的数据,存储和处理成本降低约80%,即使大幅降价,推理引擎依然接近满负荷运行且收支平衡 [2]。其中MiMo-V2.5-Pro快速缓存输入成本低至每百万Token 0.0036美元,远低于美国主流模型数十美元的价格水平 [2]。
DeepSeek于2026年5月22日宣布其旗舰V4 Pro模型API价格永久下调75%,将输出Token价格锁定在每百万Token 0.87美元,显著降低企业使用成本,向OpenAI和Anthropic等美国AI供应商发起挑战 [2, 3]。该模型在处理一百万Token的上下文时,仅需5.48GB HBM显存,相比西方小模型最高可达89GB内存,得益于序列维度压缩等技术创新 [3]。DeepSeek V4 Pro在SWE-bench Verified和advancedMMLU-Pro等基准测试中分别获得80.6%和87.5%的高分,性能接近顶级西方模型 [3]。此外,DeepSeek的V4 Pro和V4 Flash模型开放权重,采用MIT许可,允许企业自由部署 [3]。DeepSeek获得中国国家集成电路产业投资基金支持,估值介于100亿美元至450亿美元之间 [3]。
近年,美国主流AI厂商在2026年初大幅调高API价格,其中OpenAI GPT 5.5的输出Token价格高达每百万Token 30美元,Anthropic Claude Opus 4.7则为25美元,价格差距在2026年第二季度扩大至15至30倍(不含缓存折扣) [2]。企业端对成本与授权模式的重视不断增加,2026年第一季度相关考量比例从25.4%升至36.7%,推动西方供应商采用批量折扣、提示缓存和轻量级模型以应对挑战 [3]。
大型公司如Uber、Airbnb及Pinterest均在寻求降低AI Token成本的替代方案,Airbnb CEO Brian Chesky明确表示倾向使用阿里巴巴的Qwen等更快速廉价的模型,Pinterest CTO Matt Madrigal也透露公司通过专有数据训练Qwen模型后降低了90%成本 [3]。Uber一位高管指出,Token费用高昂难以支撑其合理价值,缺乏更好产品展示 [3]。
在中国人工智能技术快速进步和成本优势明显的背景下,DeepSeek V4 Flash模型近期登顶OpenRouter排行榜,Token使用量激增48%,V4 Pro则排名第六 [3]。随着定价调整到位,小米和DeepSeek的AI模型在未来将为国内外企业提供更高性价比的AI服务。