新华三打造千卡集群算力底座,为自动驾驶训练加速

  随着自动驾驶技术从L2辅助驾驶向L4自动驾驶跨越,算法模型正经历从CNN(卷积神经网络)到Transformer的架构变革,参数量也呈指数级增长。文远知行WeRide作为全球领先的自动驾驶科技公司,已经在全球7国30城开展自动驾驶研发、测试及运营,是业内唯一同时拥有中国、美国、阿联酋、新加坡四地自动驾驶牌照的企业,业务覆盖智慧出行、智慧货运和智慧环卫三大领域,日均产生路测数据早已达到PB级别。面对海量数据清洗、标注及大模型训练的算力“洪峰”,原有基础设施捉襟见肘。为此,紫光股份旗下新华三集团协助其构建了基于AMD EPYC处理器的超200台H3C UniServer R5350服务器、搭载近2000块GPU的超大规模智算集群,以高带宽、低延迟的AI基座,破解“算力焦虑”,助力研发效率跃升。   在追求“数据驱动”的自动驾驶2.0时代,算力基础设施的瓶颈日益凸显,文远知行在推进技术迭代时面临三大核心技术挑战:   算力密度与扩展性难题   亟需超强算力   随着BEV(鸟瞰图)+Transformer架构成为主流,单一感知模型参数量突破亿级,训练算力需求每3-4个月翻一番。文远知行原有的小规模集群难以支撑千卡级并行训练,且传统服务器在支持多卡互联时存在PCIe带宽瓶颈,限制了GPU性能的极致释放,亟需具备高扩展性与强并行能力的AI服务器底座。   通信墙制约   分布式训练呼唤网络   在大模型分布式训练中,多节点间的梯度同步(All-Reduce)对网络带宽极其敏感。千卡集群若网络配置不当,通信延迟甚至可能占据训练周期的50%以上,导致“GPU空转、等待数据”的算力空耗现象。文远知行迫切需要构建一套能够承载百亿级参数高频交互的高速无损网络架构。   TCO   追求极致性价比   自动驾驶研发属于典型的“算力密集型”投入,硬件采购成本与后期电力运维成本构成了巨大的资金压力。如何在保障模型训练精度的前提下,选择高能效比、高性价比的硬件组合,成为文远知行平衡技术领先与商业落地的关键考量。   针对上述技术痛点,新华三为文远知行量身定制了“高算力、高通量、高能效”的智算平台解决方案:   澎湃算力底座   打造异构计算集群   方案部署了超200台R5350 AI服务器,每台服务器搭载8块高性能GPU,总计近2000块GPU形成超大算力矩阵。   H3C…

新华三集团与贵安发展集团携手深化贵阳贵安图灵小镇运营

  3月2日,紫光股份董事长、新华三集团总裁兼首席执行官于英涛与贵安发展集团党委副书记、总经理曾军一行举行工作会谈。双方将通过共投资、共建设、共分享的合作模式,携手深化贵阳贵安图灵小镇运营、算力基础设施建设、产业生态拓展等领域的合作,实现互利共赢、协同发展。   会谈中,于英涛对曾军一行的到访表示欢迎。他表示,多年来,双方秉持“同向而行、相向而进”的合作理念,以“一个合资公司、一个图灵小镇、一批智能体”为重要抓手,在算力经济、产业生态、数字化转型等领域取得了阶段性成效。新华三始终高度重视在贵州及贵安新区的战略布局,期待双方在现有基础上,进一步深化各领域合作,共同助力贵州数字经济高质量发展。   曾军一行参观了新华三杭州创新体验中心,对新华三在数字化及AI解决方案方面的综合实力给予高度评价,并对新华三长期以来支持贵安数字经济建设表示感谢。曾军表示,贵安发展集团作为贵阳贵安数字经济发展主力军,正处于由传统基础设施向新型基础设施转型升级的关键阶段,希望与新华三充分发挥各自在技术、资源与场景方面的优势,建立更加紧密的战略协作关系。   新华三集团长期深耕贵州市场,已在贵阳落地贵州紫光云数科技有限公司等产业布局,深度赋能贵州数字经济建设。站在“十五五”开局之年,新华三将与贵安发展集团一道,以图灵小镇为核心载体,加快算力基础设施建设和产业生态培育,推动创新要素加速集聚和协同联动,力争将图灵小镇建设成为贵阳贵安区域数字经济创新高地和产业集聚示范载体,为贵州数字经济高质量发展贡献更大力量。   贵安发展集团党委委员、副总经理申亚柳,贵安发展集团信息产业部部长、贵安数科公司董事长赵文榛,贵安产业投资有限公司副总经理王灏,新华三集团高级副总裁张力、曾富贵,政府事业部总经理李曦哲,贵州代表处总经理刘强等参加会谈。 来源:浙江安旭旧站新闻归档

新华三X20000存储KV Cache方案助力AI推理效率提升

  据IDC预测,2026年中国智能算力规模将达2024年的两倍,其中推理算力增速将远超过训练,到2027年中国智能算力中推理占比将提高到72.6%。随着大模型推理进入规模化落地阶段,KV Cache 通过“以存换算”的思路,节省了GPU算力、提高了推理效率,成为AI推理应用落地的主流方案。   但随着8K、16K、32K乃至更大上下文长度逐渐普及,KV Cache的规模呈线性增长;在多并发场景下,KV数据读写压力更是呈指数级放大。比如,在Llama-405B上运行一个具有64K上下文的单个用户需要15.75GB KV缓存,当扩展到32个用户时,容量需求将飙升至504GB。如何高效承载KV Cache,已经成为AI推理基础设施架构中的核心议题。   此外,随着AI推理走入我们的日常生活,衡量应用体验和系统效率的关键指标——TTFT(Time To First Token,首次输出Token时延)被越来越多用户关注。TTFT不仅直接影响推理应用的用户交互体验,更决定单位时间内可承载的有效请求数。   目前,将KV Cache从GPU显存中卸载已经成为行业共识。相比本地SSD,外置分布式存储具备更强的横向扩展能力,能够将KV访问转化为并行模型,且提供全局数据共享,支持大规模PD分离部署。这意味着在模型规模持续扩大、上下文不断拉长、并发请求持续增长的情况下,存储系统仍然能够保持可控的TTFT与稳定的吞吐能力。   基于这一趋势,H3C UniStor X20000 AI原生存储围绕KV Cache场景进行了系统级协同调优,使“外置存储承载KV Cache”从概念方案真正演进为生产级可用架构。   X20000存储通过EPC私有客户端,将每个6MB文件自动切分为1MB粒度进行分布式并发处理。这种细粒度切分机制,将单次KV访问转化为多通道并发读写,数据均匀分布至多个存储节点与引擎,使访问天然具备并行性,从而有效降低单路径阻塞概率。…

如何选择适合的人工智能计算服务器?

  选择适合的人工智能计算服务器,关键在于‌明确应用场景、匹配算力需求、平衡成本与扩展性‌。对于绝大多数用户而言,优先根据任务类型(训练/推理)、模型规模和预算来锁定配置方向,是避免资源浪费或性能不足的核心。   1. ‌大模型训练   ‌特点‌:参数量大(7B以上)、数据集庞大、计算密集   ‌核心需求‌:高算力GPU集群 + 大显存 + 高速互联   ‌推荐配置‌:   GPU:NVIDIA A100 80GB 或 H100(支持TF32/BF16)   数量:4卡起步,8卡及以上更佳   内存:≥512GB DDR5   存储:NVMe SSD…