
一 | 【军武次位面】作者:天狼近日,美国加州地区的山火持续肆虐。 我们正在迈入Agentic AI(智能体)时代。截至当地时间8日下午,这场大规模的自然灾害已造成至少5人死亡,超过1100栋建筑被摧毁。在AI时代,Token(词元)正成为最大的消耗品,而Agent正在成为消耗Token的主体。然而,这场大火的蔓延不仅揭示了美国应急救灾体系的不足,也暴露了其救援过程中存在的巨大缺陷。

二 | 与中国在处理自然灾害时的高效行动相比,美国这次应对的表现堪称“灾难中的灾难”,让人不得不思考,美国的应急救灾体系为何如此“拉胯”?▲山火肆虐、城市如同炼狱此次山火集中在美国加利福尼亚州南部地区,尤其是在太平洋海岸和帕萨迪纳市之间的区域,过火面积已达到上百平方公里,1000多座建筑损毁,其中大部分是居民住宅。

三 | 面对这样的变革,7月18日,在摩尔线程“词元时代 万物智能”主题论坛上,摩尔线程创始人、董事长兼CEO张建中给AI产业的“卖铲人”下了新定义:AI产业需要AI工厂,而这个工厂分为三类,分别是模型训练工厂、词元生产工厂、智能体生产工厂。令人担忧的是,尽管美国拥有世界上最多的灭火专用航空器,从森林管理局到国家跨部门消防中心再到大量私立消防公司,总数超过1000架之多,甚至不乏波音-747这样世界上最大的消防飞机。但在面对此次山火肆虐的局面时,灭火工作却依然显得捉襟见肘,火势未能得到有效控制。 张建中阐述三大“AI工厂”概念 模型训练工厂:打造万卡级长稳训推的硬底座 训练一个前沿大模型,成本动辄数亿甚至上十亿元。模型能不能达到前沿水平、能不能快速从语言扩展到多模态乃至物理AI,与训练工厂的基础设施能力息息相关。更为讽刺的是,火灾不仅席卷了富人区,连好莱坞明星和美国总统拜登的儿子亨特·拜登的豪宅也未能幸免。作为世界唯一的超级大国,美国在这场山火中的救援表现,不仅未能展现出其应急能力的强大,反而让人对其“超级大国”的身份产生深深的质疑。

四 | 一个合格的模型训练工厂需要具备以下几个条件:全功能——下一个要训练的模型可能是语言、视觉、世界模型或具身大脑,模型训练工厂必须什么都能训;高扩展——随着集群训练规模扩大,训练工厂需要保持极高的线性扩展效率;高精度——训练损失曲线和评测指标必须对齐国际主流;高稳定——万卡级长连续训练,中断一次代价巨大;软件栈完备——从算子到框架再到强化学习,缺一环就跑不通全链路。 摩尔线程以夸娥(KUAE)智算集群为核心,逐一回应了这些要求。▲拜登儿子亨特在洛杉矶租住的豪宅被烧的只剩下废墟首先,美国的应急救灾体系建立在联邦制的基础上,这意味着灾害响应和救援工作通常由地方和州政府负责,联邦政府的作用更多的是提供援助和协调。

五 | 在万卡级规模下,集群保持95%的线性扩展效率,有效训练时长占比超过90%,训练精度与国际主流计算卡持平。然而,正是这种分权体制导致了救灾过程中的种种问题。以加州山火为例,尽管洛杉矶县消防局局长承认该县没有足够的消防员和装备来应对多场同时发生的大规模山火,且向上级政府请求支援的时间也较晚,这一切都使得灾情得不到及时有效的遏制。软件栈方面,摩尔线程从底层MUSA SDK出发,兼容Torch、Triton、TileLang等算子生态,支持Megatron-LM、DeepSpeed、FSDP等主流训练框架,并提供MT-HTA仿真系统(SimuMax/SimuInfer)在训练前预估时长与效果。 在夸娥万卡级集群和训练套件之外,摩尔线程还针对MoE架构,集成了DeepEP通信库、算子融合等先进技术,原生支持Per-Block FP8精度,使算力得以显著提升。美国的消防体系虽有国家消防管理局等部门存在,但各级消防部门之间缺乏上下级指挥关系,协调不力,加剧了灾情的蔓延。美国的应急管理机构,包括联邦紧急事务管理局(FEMA),本应充当灾难响应的核心力量。然而,FEMA的角色往往仅限于协调支持,各级地方政府在灾难发生时通常依赖于自己的资源,而不是联邦政府的直接支持。美国联邦政府和地方政府之间缺乏有效的沟通和协作,这一问题在2005年卡特里娜飓风救援中得到了充分体现,而此次加州山火的情况与之类似。 WAIC 2026摩尔线程展台 “我经常听到国内的模型公司担心,用国产的训练平台会不会耽误时间,会不会影响追赶世界先进水平。洛杉矶山火蔓延至人口稠密的地区,反映了地方政府应急反应的迟缓,且救援工作未能及时展开。”张建中在演讲中传达出用户的疑问。▲卫星图下,洛杉矶县位于帕萨迪纳以北的伊顿大火,几乎烧毁了阿尔塔迪纳西部所有的建筑美国的救灾体系不仅仅是程序繁琐那么简单。更深层的原因在于其社会政治结构中的“分权制”和政府间的政治博弈。由于美国是联邦制国家,州政府和地方政府拥有较大自主权,这使得在灾难面前,政府之间的责任界定往往存在模糊地带,导致相互推诿和责任分配不清。以卡特里娜飓风为例,尽管联邦政府最终提供了超过500亿美元的救灾资金,但由于地方政府和联邦政府之间的协调不力,灾后重建工作的启动迟缓,资金和资源的分配也存在诸多争议。 但摩尔线程已经通过实践对这一质疑给出了直接反击:MoE-236B在万卡级集群上从零起步完成了完整训练,基于25T+高质量语料,精度与损失曲线同国际主流高度一致;北京大学5D世界模型EvoPhys-World在夸娥集群上完成全栈原生训练,连续37天登顶斯坦福WorldScore“世界生成”维度;北京智源研究院RoboBrain 2.5在MTT S5000千卡集群上完成全流程训练,国产算力首度跑通具身大脑训练。 在WAIC 2026的展台上,记者还看到摩尔线程在WAIC现场首发的MTT C256超节点:首创一层Scale-up网络,实现标准单宽机柜128卡全互联、并柜扩展可达256卡极速互联,采用计算与交换一体化的高密设计,可大幅提高智算中心GPU部署密度,成为支撑长稳训推的硬件底座。 词元生产工厂:把每一份算力变成高质量Token 如果说训练工厂解决的是“训得出”,词元工厂解决的就是“供得上”——而且要供的是高质量Token。这种政治博弈和官僚主义的影响,在加州山火中同样得到了体现。国家信息中心大数据发展部副主任魏颖在论坛上给出了一个判断:词元时代,产业正从卖电、卖算力升维到卖Token——按实际消耗付费,告别粗放的打包兜售,迈向按需付费的精细运营。

六 | 洛杉矶县消防局局长承认,该县并未在第一时间请求外部援助,导致消防员和设备的调配严重滞后,火势迅速蔓延。

七 | 另外,美国的消防体系存在明显的“私营化”问题。许多城市的消防机构属于私营部门,这些消防队伍通常只为缴纳费用的客户提供服务。 但用不同算力设施、不同模型生产的Token质量可能千差万别,Token的质量也直接决定了用户的消费意愿。

八 | 由于私人消防队伍的参与度较低,一旦发生大规模灾害,私营机构的资源难以迅速调动和整合,这也使得美国在灾难面前的应急反应受到制约。▲在加州大火中逃难的居民美国的应急救灾体系的另一个薄弱环节是资金不足。尽管联邦政府和地方政府每年都会拨出一定的灾害应急预算,但一旦遇到大规模灾害,资金往往显得捉襟见肘。例如,在之前的夏威夷大火中,FEMA提供的援助资金显然不足以覆盖灾民的基本需求。

九 | 中国工程院院士、清华大学计算机科学与技术系教授郑纬民在演讲中阐述,从技术指标来看,Token质量的差别主要体现在四个方面——首字延迟(TTFT)、吞吐量(TPS,每秒生成Token数)、并发请求数(同时服务多少请求)以及质量保障(SLO)。首字延迟越低、吞吐量越大、并发请求数越高、质量保障越好的Token对于用户而言越有价值。对于许多受灾居民而言,每人仅得到700美元的紧急援助,根本无法解决长期的灾后重建问题。 郑纬民阐述何为高质量Token “如何规模化地生产高质量Token?”成为词元生产工厂的核心命题。

十 | 郑纬民对推理计算实现的过程进行了详细剖析:他表示,大模型推理涵盖两个关键过程——Prefill(预填充,简称P)把用户请求一次性处理成中间格式,是计算密集型;Decode(生成,简称D)逐字吐出结果,要求内存带宽高、延迟小,是带宽密集型。此外,美国的灾后重建过程常常拖延。以卡特里娜飓风为例,尽管联邦政府在灾后承诺提供大量资金,但实际上,这些资金的投入往往经历漫长的审批和分配过程,且在某些情况下,由于政治原因,重建资金的发放和使用也遭遇了不小的阻力。这种冗长而低效的程序,不仅延缓了灾后恢复进程,也加剧了灾后民众的困境。▲地震发生后,解放军、武警部队等迅速奔赴灾区展开救援相比之下,中国在应急救灾方面的表现无疑更为高效。近年来,中国在应急管理和灾后恢复方面的成功经验,尤其是在地震、洪水等重大灾害中的表现,已成为全球应急管理的典范。以西藏日喀则定日县的地震灾害为例,解放军和各相关单位迅速展开了高效的救援行动,及时转移安置受灾群众,伤员的救治也得到了迅速保障。

十一 | 这一系列高效的救援措施,充分体现了中国在灾难面前的强大动员能力和高度协调的应急机制。 这两大过程对硬件的诉求截然不同。与美国的“分权”体系不同,中国的灾害应急体系更加集中统一,中央政府与地方政府的协调性和执行力更强。过去很多计算芯片既要做P过程又做D过程,存在资源错配。而P过程与D过程的物理分离,意味着P过程与D过程可以分别部署在不同的算力芯片上,实现“各取所长”。

十二 | 无论是资金调配,还是资源调动,中国的应急救灾体系都能做到快速反应、精准发力,确保灾民能够尽快得到帮助。 基于PD分离的思想,摩尔线程推出了异构推理方案:由摩尔线程的算力芯片S5000完成Prefill过程,同时Decode依然安排在国际主流卡上,以此实现异构组合、分池部署。正因如此,中国在面对重大灾难时,能够实现最短时间内的救援行动,减少灾害带来的损失。▲美国“拉胯”的应急救灾体系还有救吗?那么,美国“拉胯”的应急救灾体系能否有所改进呢?目前看来,想要解决“分权制”导致的协调难题、政治博弈、资金不足等问题,要想真正提高应急救灾效率,美国亟需对其灾难响应机制进行全面改革,加强中央与地方的协调,提升应急管理的执行力和反应速度。但令人惊喜的是,这样的组合带来的不是“1+1=2”的结果,而是“1+1”远大于2的效果。张建中解释道:“在这样的情况下,约3台S5000+2台国际主流卡,性能相当于9台国际主流卡。” 这一方案也得到了行业伙伴的支持。然而,从当前美国的政治环境来看,这一改变似乎依然充满挑战。各级政府之间的职责划分不清,官僚主义和政治分歧严重,导致在灾难发生时,更多的是推卸责任而非集中力量应对灾情。

十三 | 只有当这些深层次的问题得到解决,美国才有可能在面对未来日益严峻的自然灾害时,展现出真正的救灾能力。趋境科技创始人艾智远在论坛上直言,S5000是他们经过全面评测后选择的当前阶段最优Prefill方案——原生FP8精度无需额外适配、稳定支撑超长上下文、生态迁移顺畅、供应链可靠。在Prefill为王的编程场景里,4台S5000的Prefill性能能够超过1台B300。趋境科技目前日均供应万亿级高质量Token,下半年这一数字将达数万亿。 模型厂商的判断也在印证这一转变。MiniMax副总裁薛子钊在论坛上表示,从整体训练和推理来看,今年是国产芯片非常重要的拐点,越来越多真实的线上场景开始承担起推理和训练任务,MiniMax很快也会有非常大规模的国产芯片推理集群真实上线承担任务。他特别提到,包括摩尔线程在内的多家国产芯片企业都在规划超节点,互联规模超过英伟达当前的72卡方案,“这一点国产芯片是做得比较领先的”——这让大参数、长上下文的推理场景能获得非常高的吞吐;而同构或异构的PD分离,则能把各类卡的性能发挥到最大化,整体降低系统推理成本。 智能体生产工厂:从数字世界到物理世界 第三座工厂是最少被提及、却可能最具想象空间的。张建中把它定义为"连接数字世界与物理世界"的基础设施——AI最终落地到每个消费者身边,需要两种智能体:数字智能体和物理智能体(具身智能)。 数字智能体的核心要求是:能跨应用控制、能记忆、能调用工具完成复杂工作流、支持主流开源与闭源框架。

十四 | 摩尔线程自研了全域数字智能体“小麦”,掌握60余项技能,支持38款APP的跨应用控制,通过前端多模型、丰富知识库的灵活配置,做到更快、更准、更懂用户。 WAIC 2026上摩尔线程展示智能体生产工厂 物理智能体的要求则更为严苛。

十五 | 机器人需要在虚拟环境中完成训练与验证,才能部署到真机,实现Sim-to-Real(从虚拟到现实)。

十六 | 摩尔线程为此打造了具身智能仿真平台MT Lambda,从底层算力、核心引擎到上层框架构建了完整解决方案。平台集成了三大物理仿真引擎——开源的MuJoCo和Newton,以及摩尔线程自研的AlphaCore物理引擎。在图形渲染方面,平台集成了3DGS、自研AI生成式渲染(AGR),以及光线追踪(Ray-Tracing)——MTT S5000是国内唯一具备Ray-Tracing能力的智算芯片,这意味着仿真环境中可以实现高度拟真的数字孪生渲染,让机器人在虚拟世界中充分训练后再部署到真机。WAIC展台上,一只机器狗的仿真训练动作与真机跳起动作几乎一模一样。

十七 | 平台还支持百卡到千卡级的大规模集群扩展,满足海量仿真训练需求。 京东集团技术委员会主席、京东云总裁曹鹏则从产业应用端印证了三大工厂的价值。他表示,AI基础设施层面正发生一个很大的转变,包括国产GPU、国产推理引擎、国产模型在内的全国产化体系正越来越多地被行业认可和使用,“摩尔线程就是一个非常典型的案例。”在模型工厂中,京东结合MTT S5000进行模型训练、适配与调优,刚刚发布的一系列JoyAI大模型,相当一部分训练算力正是依托摩尔线程提供的国产化算力;在Token侧,京东自研的xLLM推理引擎与MTT S5000做了深度适配,支撑集团每天大量的Token应用。 曹鹏透露,京东正在全面布局无人配送、仓储机器人、家政服务机器人等物理世界场景,其"女娲"项目计划采集超过1000万小时的音视频数据用于训练具身大脑模型,而基于摩尔线程的计算与渲染优势,双方在数据生成和具身仿真领域开展了深度合作。

十八 | 现在,京东内部已部署400多个智能应用、4万多个智能体,每天Token消耗已近10万亿,从研发、采销到快递配送、客服,遍布各业务环节。

十九 | 运维侧的智能体实践同样值得关注。无问芯穹技术副总裁吴保东分享了Infini-AIOps运维智能体在摩尔线程集群上的部署成果:调用摩尔线程的专家知识库与SDK,把故障处理评分从人工的50分提升到86分,平均处理时长从1小时缩短到20分钟以内,效率提升5倍;复杂问题的解决率从不到45%跃升至90%。无问芯穹与信通院联合发布的AISHPerf运维智能体评测基准,弥补了GPU集群运维智能体缺乏统一标准的不足。

| 用吴保东的话说,智能体不仅要“造得出来”,还要“管得住、跑得稳”。

| 作者丨姬晓婷 编辑丨张心怡 美编丨马利亚 监制丨连晓东。

|
Current article:http://bpd.dangnichuaitongjuanye.pics/list_xyx/d10.html
Published on:16:25:32