Imagination E 系列 GPU 斩获架构立异奖 交融算力架构破解物理 AI 体系设计难题 发布时间:2026-08-24 来历:转载 责任编纂:lijiahuan 【导读】8 月 20 日,第六届集成电路设计立异集会暨运用展(ICDIA 2026)于南京顺遂举办,Imagination E 系列 GPU IP 依附领先的端侧 AI 与图形交融架构立异,乐成入选 “2026 强芯 TOP100” 并斩获架构立异奖。同期的具身智能生态论坛上,Imagination 进一步分享了面向呆板人范畴的 GPU 交融计较加快方案。针对于当前物理 AI、具身智能装备遍及存于的算法迭代快、数据搬运功耗高、算力调理冲突、硬件空间散热受限等行业难题,Imagination 立异性提出 GPU 交融可编程 AI 架构,打破传统 GPU、NPU 自力异构的设计模式,以同一可编程算力底座,适配新一代呆板人、主动驾驶等端侧智能体系的持久迭代需求。 于同期举办的具身智能生态论坛上,Imagination技能司理孙千喆以《面向呆板人范畴的GPU交融计较与加快解决方案》为题发演出讲,指出跟着呆板人等物理AI体系的自立化水平不停提高,提供支撑的相干端侧芯片的计较架构已经逾越传统GPU或者专用AI加快器的领域,需要于一颗晶粒(die)上用一个可编程单位来将感知、世界模子、推理及图形处置惩罚交融(converge)于一路,以帮忙体系用户打破于新一代体系中碰到的计较及物理制约因素。 一场奖项承认,一场技能演讲,看似各有偏重,实则指向统一个正于浮出水面的财产判定:物理AI及一部门端侧AI正于鞭策新一代计较架构走出“专用加快器”的恬静区,转而要求一个可以或许同时承载场景信息处置惩罚、图形处置惩罚、AI计较与智能的交融算力单位,Imagination的E系列GPU是业界首个采用此类架构并可编程的交融处置惩罚器,这次获奖与被会商也使其成为这一趋向的缩影:其“GPU交融可编程AI架构,面向将来体系设计”的产物定位,回应的偏偏是当下物理AI体系设计面对的布局性挑战。 物理AI体系设计的三重抵牾 呆板人如许的物理AI体系的事情负载正以令硬件设计者焦急的速率演进。从感知、世界建模、推理、人机交互到天生式AI运用,险些每一年城市涌现出新的算法。与之相对于,专用加快器的机能增加往往依靠一条固定流水线,以兑现单一代际的机能承诺,这致使了软件栈日益割裂,使研发工程师不能不随加快器的每一次换代重写算子,体系架构的扩大性被一次次透支。 具身智能正于引起广泛的存眷及介入,图为人头攒动的“2026世界呆板人年夜会”(图片来历:华兴万邦) 比算法迭代更隐藏的成本,藏于数据搬运里。于典型的异构SoC中,CPU、GPU、NPU与编解码器各自挂载自力的SRAM(静态随机存取存储器),每一一次数据互换都要超过内存界限,而跨内存界限挪动数据的能耗,据估算可达计较自己的数十倍,延迟与抖动也随之累积。与此同时,功效安全要求要害路径得到断绝,能效优化又要求算力同享,混淆要害性带来的抵牾让单一固定架构难以分身。 算法演进与固定流水线的抵牾、数据搬运的隐机能耗、安全断绝与算力同享的冲突——这三重抵牾配合组成了端侧体系设计的基本约束,再加之呆板人如许的物理AI很多事情负载都并发举行使环境越发使人焦急。同时,拦阻物理AI进步的因素还有有物理及化学问题,电池容量其实不能快速晋升,并且于呆板人十分名贵的腔体空间,不克不及无穷制添加硬件,还有会碰到散热问题。也正由于云云,怎样以一套架构用GPU交融计较与AI,再也不是一个可选项,而是下一代体系设计绕不开的命题。 Neural Cores与Burst Processors:可编程底座上的两项立异 Imagination的E系列GPU IP专为端侧AI与图形体系而设计,依托高效的并行处置惩罚架构,于实现卓着图形机能的同时,可撑持从2 TOPS(每一秒万亿次运算)到200 TOPS的INT8 AI事情负载,笼罩图形衬着、桌面运用、智能手机天然语言处置惩罚、工业视觉以和主动驾驶等场景。是以,E系列GPU是开发用在呆板人及主动驾驶汽车等物理AI运用的绝佳底层IP产物。 支撑E系列独有的GPU交融AI加快器架构立异是两项深度集成在GPU中的立异。Neural Cores(神经核)作为GPU内置的AI加快单位,最高可扩大至200 TOPS(INT8),于显著晋升AI与计较机能的同时,与GPU和异构计较的软件生态系统周全交融;GPU中集成的Burst Processors(发作处置惩罚器)则经由过程架构层面的设计,使边沿运用的平均功耗效率晋升25%,于不捐躯机能的条件下,为端侧装备争夺到更长的续航与更富余的散热余量。 而贯串这两项立异的配合底座是可编程性。GPU作为可编程处置惩罚器,可以或许有用应答图形、计较与AI算法的不停演进;开发者既可以经由过程Vulkan、OpenCL等主流API直接解锁AI能力,也能够借助基在开放尺度的软件栈,将现有代码轻松迁徙至神经核。Imagination提供的高效计较库与图编译器进一步开释GPU潜能,使每一一次算法迭代都没必要等候新的硬件流片。 AI进入计较路径:交融架构怎样免却每一一次内存来回 假如说可编程性是E系列的标的目的,交融计较就是它的实现路径。这一架构由四个要素配合支撑:同享内存层级,以一套SRAM/缓存布局同时办事感知、推理、世界建模与图形;同享调理器,于SIMT(单指令多线程)治理下对于计较、矩阵乘、采样器与DMA流水线举行于线细粒度调理。同享编程模子,则以OpenCL、PyTorch、llama.cpp、ONNX、Vulkan等一套东西链买通各计较平面;矫捷架构,以同一的ISA、DDK与产物家族,从单瓦级装备笼罩到多芯粒体系。 这一思绪与传统“外挂式”(Bolt-on)NPU模式形成光鲜比照。于Bolt-on模式下,NPU与GPU各矜持有自力的存储与流水线,每一层推理都要发生内存来回,不撑持的算子还有需回退到CPU;而E系列将矩阵乘加快器(MMA)直接集成进同一着色簇(USC),与其余计较同享内存、调理与编程模子,中间成果留于片上,数据搬运与调理抖动同步降落。 于更细的履行粒度上,tile-local SRAM实现局部履行,微分块(micro-tiling)让层间折叠为单一内核,imgGC图编译器把相邻算子交融进统一个着色器,PVRIC无损帧缓冲压缩与ASTC/HDR纹理压缩进一步减少带宽需求。 假如说同享内存与调理解决的是数据“搬不搬”的问题,数据通路的设计则回覆了数据“怎么算”的问题。FP3二、FP16/BF1六、FP八、INT8与MXFP4同享统一条数据通路,吞吐最高可达FP32的16倍,精度格局混用不孕育发生分外的格局转换开消——感知主干收集、世界模子、VLA(视觉—语言—动作)计谋与量化CNN各取所需,体系设计没必要为单一精度提早站队。 统一套可编程架构,笼罩从呆板人到汽车的算力曲线 当前,呆板人正于走下舞台,走进出产及糊口。对于呆板人与具身智能而言,交融架构的收益最为直不雅。一颗芯片需要同时承载四个计较平面:卖力传感器接入与交融、计较机视觉与DNN推理的感知平面,卖力SLAM(同步定位与建图)、VLA与场景推理的世界模子平面,卖力衬着、手势辨认与遥操作的HMI平面,以和卖力及时驱动与监视的节制安全平面。确定性节制环与感知—步履环两条闭环于统一芯片上并存,刚好是同享调理与同享内存所擅长的场景。 然而,对于呆板人厂商而言,交融架构的价值不止在把四个计较平面塞进一颗芯片,更于在它可否超过从原型到量产的那道坎。原型到量产之间,绵亘着一道“硅缺口”。试验室里用基在通用GPU的开发模块验证算法是准确路径,但量产呆板人必需装进密封壳体、靠电池供电、把BOM压到消费或者工业级可接管的规模,还有要支撑长达十年的软件迭代与进级。 出货只有50台时,开发模块的成本眇乎小哉;出货5万台时,它就成为了整机BOM清单上的绝对于主角,这鞭策市场竞争酿成谁先把成本降到比基在通用GPU开发模块远远更低的水平。在是问题酿成了:量产需要一颗真实的芯片,而这颗芯片一旦流片就固定了,是以,假如它是专用NPU或者者其他加快器,算法每一演进一代就可能需要从头流片,其巨年夜的经济性挑战已经经于智能驾驶芯片企业难以盈利中获得了表现。 假如它是通用GPU,虽然可以经由过程软件实现更新,可是繁杂体系及运用显然还有需要(外挂)AI加快器,从而带来了物理AI的空间、功耗及电池续航等物理化学问题。 假如它是Imagination E系列如许GPU交融可编程AI加快器,不仅新算法经由过程软件更新便可落地,同时还有能提供可按照需求设定的AI加快器,用统一颗硅片能撑过整个产物生命周期。 当呆板人要走下舞台时,对于在物理AI,除了相识决算力问题,还有需要解决一系列物理(及化学)问题(图片来历:华兴万邦拍摄在WRC2026) 安万能力也为这条算力曲线提供了纵深。Imagination GPU 所承载的漫衍式安全机制(DSM),包括ECC(纠错码)与Parity奇偶校验、CRC(轮回冗余校验)、Safety Pairs安全对于、双核锁步固件、调理器联锁与Tile区域掩护,以不翻倍芯单方面积为价钱实现连续妨碍笼罩,撑持ISO 26262(汽车功效安全尺度ASIL-B, ASIL-D)安全尺度,并已经于车规场景完成验证,可以快速移植到呆板人及其他物理AI范畴。 面向消费与桌面市场,Imagination E系列硬件级虚拟化撑持每一核至多16个虚拟机或者者操作体系且内存彻底断绝,多核去中央化扩大与固件治理调理则让统一架构光滑笼罩AI PC与桌面计较。作为范围化验证,基在Imagination GPU架构的装备全世界累计出货已经达110亿台。 架构曲直线,芯片曲直线上的点 一颗芯片只曲直线上的一个点,一个架构才曲直线自己——这是Imagination重复夸大的判定,也是理解其E系列GPU的准确坐标。从单瓦级延长到多芯粒,从呆板人延长到汽车,Imagination E系列GPU以统一套尺度软件栈与东西链,把图形、计较与AI收敛到统一个可编程平台之上。 回到ICDIA的奖项与具身智能论坛的演讲,它们之以是值患上被放于一路会商,是由于两者配合确认了一件事:于端侧AI与图形、计较、感知及AI加快连续交融的趋向下,可以或许跟上长周期算法演进的架构,同时又能更好地适配物理AI的各类物理化学约束,而不是某一款固定功效的加快器,不是纯粹的通用GPU,而是一种GPU交融可编程加快的算力底座。 Imagination E系列GPU以“GPU交融可编程AI架构”回应“面向将来物理AI体系设计”,不绑订单一事情负载,让体系设计有能力跟上算法的下一次演进,也让芯片设计公司开发的物理AI SoC有更长的生命周期,有更多芯片出货来摊销研发成本并早日盈利。 结论 本次获奖与技能分享,印证了 Imagination E 系列交融 GPU 架构,精准契合物理 AI 与具身智能财产的成长趋向,有用解决了当前端侧智能体系设计的焦点痛点。传统异构算力架构存于算法适配性差、跨单位数据搬运能耗高、安全断绝与算力同享难以统筹等布局性抵牾,且专用加快器架构固化、迭代成本高,没法适配呆板人 AI 算法快速更新的行业节拍。 






