会懂网AI资讯,9月5日,9月5日,摩尔线程与趋境科技联合宣布国产异构Token工厂正式投产。该系统基于摩尔线程MTT S5000显卡,实测推理吞吐超过50 TPS,KV Cache命中率超过90%,面向大模型推理的算力池化与降本。

Token工厂的核心思路,是把分散的国产GPU算力聚合为统一、可调度的推理资源池,通过池化与缓存复用显著提升利用率。对受限于高端进口芯片的国内AI产业而言,把国产卡的每一分算力榨干用足,是现实且迫切的工程命题。
实测指标显示,在KV Cache命中率超90%的情况下,重复上下文无需重复计算,单位Token成本显著下降。这使其特别适合对话、长文档、多轮Agent等高复用场景,能够把国产硬件的性价比优势放大。
摩尔线程与趋境的组合,是国产”芯片+软件栈”协同的典型案例。芯片企业提供硬件,软件公司负责池化与调度,二者合力把国产算力推向可规模商用的推理服务,减少对单一生态的依赖。
会懂网观察,Token工厂这类工程化创新,正是中国AI在算力约束下的生存智慧。当硬件暂未领先,靠系统软件把现有算力组织到极致,往往比等待下一代芯片更现实、也更可持续。
会懂网观察,Token工厂这类工程化创新,正是中国AI在算力约束下的生存智慧。当硬件暂未全面领先,靠系统软件把现有算力组织到极致,往往比等待下一代芯片更现实。
摩尔线程与趋境的软硬协同,也为国产算力生态指明了一条以利用率取胜的务实路径,值得更多国产芯片厂商借鉴与跟进。
在国产算力生态里,软件定义利用率的思路正变得越来越重要。把每一分算力都组织到极致,是约束条件下最现实的取胜之道。




















暂无评论内容