碎片化阅读 20260915 | 端侧模型、推理芯片科普

碎片化阅读 20260915 | 端侧模型、推理芯片科普

《计算机体系结构》无废话版本 - NPU

极简的 NPU(神经网络处理器)科普文。用通俗的语言解释了NPU为什么比CPU/GPU更适合处理AI任务:其核心在于采用了“脉动阵列(Systolic Array)”设计,极大地优化了深度学习中海量的矩阵乘法运算,并减少了数据在内存和计算单元之间的频繁搬运。

NPU 诞生的根本原因:AI (深度学习) 的本质是海量的矩阵乘法,CPU/GPU 的传统架构在做矩阵运算时,内存频繁读写太耗电耗时。

  1. 通过脉动阵列,实现「算得快」
  2. 通过数据类型 (低比特) 量化,实现「省内存」
  3. 通过片上数据复用,实现「少搬运」

NPU 的上限由内存带宽决定,性能、体验、生态由编译器决定。

三分钟讲清楚 CPU、SoC、MCU

扫盲级文章,理清了芯片领域三个核心概念:CPU是中央处理器(运算与控制核心);MCU是微控制器(单片机,算力低但实时性极强,用于家电、电机控制);SoC是片上系统(把CPU、GPU、NPU、内存控制器等打包在一块芯片上,如手机处理器)。

  • CPU (中央处理器):逻辑控制能力最强,适合跑复杂的操作系统(Windows/Linux)。
  • MCU (微控制器/单片机):集成度极高的微型电脑(算力极弱,但把RAM和ROM都包在了一起)。核心优势是实时性极强、成本极低,绝对统治电机控制和家电领域。
  • SoC (片上系统):把 CPU、GPU、NPU、内存控制器等多个模块打包在一块硅片上(如高通骁龙、苹果M系列)。

一文看懂端侧 NPU 架构:同样是 6TOPS,为什么性能能差几倍?

揭示了端侧AI芯片“算力虚标”背后的技术真相。文章指出,算力(TOPS)只是理论计算峰值,实际落地性能受到内存带宽(Memory Wall)、MAC(乘加器)阵列利用率、算子兼容性以及编译器优化水平的严重制约。因此,纸面数据相同的两款芯片,其实际跑模型的帧率可能天差地别。

  • 理论算力(TOPS) ≠ 真实落地帧率(FPS)
  • 性能衰减的三大木桶效应:
    1. 内存墙:内存带宽不够,数据搬运速度跟不上,导致 MAC (乘加器) 阵列处于饥饿等待状态。
    2. 算子支持率:如果NPU硬件不支持某个特定的AI算子,模型就会把该任务“回退”给CPU计算,导致延迟剧增。
    3. 编译器水平:优秀的编译器能优化数据排布,榨干硬件利用率;劣质编译器会让一半的计算单元闲置。

瑞芯微押注双芯,端侧AI为何要分工?

探讨端侧设备的异构化演进。在边缘侧,芯片既需要处理AI推理,又需要兼顾复杂的操作系统逻辑、多媒体编解码和低功耗待机。文章分析了厂商采用双芯或多核异构策略的原因,本质是为了在“高性能AI计算”与“低功耗日常运行”之间取得最优的商业与工程平衡。

  • 端侧芯片的矛盾:既要AI算力狂飙(功耗大),又要能长期待机(功耗要求极低)。
  • 解法(大小核/异构协同):设置一颗极低功耗的小核(类似MCU)负责休眠待机、唤醒词监听;只有当触发重度AI任务时,才瞬间唤醒大核(NPU)。这是端侧设备(如智能门锁、智能音箱)续航的生命线。

推理芯片(一)|一百万 token,到底花多少钱?

算力经济学分析。文章将大模型的“推理过程”具象化为财务成本,详细拆解了生成100万个Token背后的硬件采购摊销、电力消耗和机房运维成本。揭示了当前大模型商业化落地面临的严峻挑战——降低推理成本是AI企业盈利的前提。

  • 商业逻辑:大模型企业的生死线在于 推理成本。
  • 成本构成:单次推理成本 = (芯片折旧摊销 + 机房电费 + 运维成本) ÷ 芯片总吞吐量。
  • 关键指标:不仅仅看芯片卖多少钱,必须看 吞吐成本比 (Tokens / Second / Dollar)。算力贵不怕,怕的是单位成本产出的Token不够多。

推理芯片(三)|一颗推理芯片内部怎样分工

深入AI芯片的微观结构,解析了数据在芯片内部的流转过程。探讨了计算单元、SRAM(片上缓存)和外部HBM/DDR内存控制器之间的协同工作机制,强调了在当代芯片设计中,“存算平衡”(让计算单元不饿着肚子等数据)比单纯堆砌计算核心更重要。

  • 芯片内部“铁三角”:计算单元(打工人) + SRAM片上缓存(手边的抽屉) + HBM/DDR外存(远处的仓库)。
  • 冯·诺依曼瓶颈的具体体现:搬运数据消耗的电量和时间,远大于计算本身。
  • 现代芯片解法:存算平衡。疯狂堆大 SRAM(如苹果芯片),尽量把大模型的权重(Weights)塞进“手边的抽屉”里,减少去外部仓库(HBM)拿数据的次数。

推理芯片(七)|国产推理芯片差在系统闭环

犀利指出了国产AI芯片的痛点。国产芯片在单点硬件参数(如算力、工艺)上已能追赶,但真正的差距在于“系统闭环”——即缺乏类似英伟达 CUDA 那样极其完善的编译器、算子库、框架适配层以及庞大的开发者生态。软件栈的落后导致硬件算力难以被充分榨取。

  • 痛点:国产AI芯片的硬件参数(工艺制程、晶体管数量、标称TOPS)已经很强,但软件生态(软硬协同)严重掉队。
  • 系统闭环(护城河)的构成:不是造出芯片就行,而是要有类似英伟达 CUDA 的底座——包括极致优化的编译器、算子库、以及对主流框架(PyTorch等)的无缝兼容。
  • 后果:没有好的软件栈,用户就算买了国产芯片,也跑不起来自己的模型,或者跑出满是Bug的低帧率,导致算力被白白浪费。

芯片系列2 - rk3588的成功是运气还是实力?

复盘了瑞芯微 RK3588 在国产 AIoT 和边缘计算领域的“封神”之路。其成功并非偶然,而是基于精准的规格定义(强大的8核CPU + 6T NPU + 顶级视频编解码能力)和丰富的接口,完美踩中了边缘AI、商用显控和具身智能机器人爆发的风口,是长期技术积累与市场洞察的产物。

  • 封神原因:极其精准的产品定义(水桶机策略)。
  • 配置密码:它没有死磕极致的AI算力,而是给出了“够用的6T NPU + 强大的8核CPU + 极其恐怖的视频编解码能力 (VPU) + 超丰富的接口”。
  • 市场契合度:刚好完美契合了边缘计算、商用显示、全景相机、具身智能主控板等需要“综合处理能力”而非“纯算力”的碎片化AIoT市场。不是运气,是生态位卡得极准。

碎片化阅读 20260915 | 端侧模型、推理芯片科普
http://www.horus-space.cloud/posts/3a80ab57.html
作者
Horus
发布于
2026年9月15日
许可协议