20 TOPS 凭什么逆袭 100 TOPS?揭秘 Decode 阶段内存挑战与芯片级应对路线 本文从 LLM Decode 阶段的硬件执行逻辑切入,分析 GPU 和 NPU 在数据搬运过程中的带宽受限原理,并梳理 NVIDIA、高通、瑞芯微等厂商在应对这一挑战时,所采用的不同系统架构与芯片级内存设计路线。 2026-09-30 System Architecture #AI Inference #Inference Performance #AI Systems #System Architecture #AI Chips
RK1828 + RK3588 平台 LoRA 功能调研:用法、限制、热更新 LoRA(低秩适配)允许在不修改基础模型权重的条件下,动态加载或切换适配器,适用于多任务微调部署:一份基础模型 + 多个 LoRA 适配器,按任务切换,节省存储与内存。 2026-09-28 RKNN #RKNN #Qwen3-VL #LoRA #端侧推理
NanoJev 与 Kev 对比 NanoJev 与 Kev 是两个类似 Jev 的开源决策模型,本文对比了二者的模型底座、核心架构、训练数据以及评测体系等信息。 2026-09-23 Models > Jev #Jev #System One Models #fine-tuning #TypeSafe
截至 20260923,有关 Jev 的一切 你需要知道的有关 Jev 的一切 2026-09-23 Models > Jev #Jev #System One Models #fine-tuning #TypeSafe #RLCD #RLHF
NanoJev 模型解析:架构、训练与部署 Jev 尚未开源,但复刻版项目已经陆续涌现。本文是对 NanoJev 的讲解。NanoJev:一个 0.6B 并行决策模型,输入状态与问题,直接得到完整概率分布,无需生成答案 token。 2026-09-23 Models > Jev #Jev #System One Models #fine-tuning #NanoJev
碎片化阅读 20260915 | 端侧模型、推理芯片科普 8 篇关于芯片架构、端侧落地与算力经济学的科普文章,来源于微信公众号 2026-09-15 Daily Reads #RKNN #端侧推理 #NPU #SoC
高通平台 Qwen3-VL 多图推理时图像 tokens 膨胀问题 QNN SDK 2.45 / 2.46 版本一个多图推理的小 bug 2026-09-15 Qualcomm #Qwen3-VL #端侧推理 #多模态模型 #Qualcomm #SA8775 #SA8797 #Genie #QNN SDK
面向 Java 开发的安卓实战入门指南 | Horus-VLM 安卓项目架构详解 Horus-VLM 是一个跑在车机上的视觉大模型对话应用,本文以这个真实项目为样本,从零讲清一个 Android App 的完整架构,并给出从零搭建安卓工程的实操路线。 2026-09-10 Android #RKNN #端侧推理 #多模态模型 #Java #Android
Qwen3-TTS :从模型架构到 RKNN 板端部署 Qwen3-TTS 是怎么把一段文字变成一段语音的?模型内部长什么样?如何移植到端侧(例如 rk1828)? 2026-08-27 Models #RKNN #端侧推理 #TTS #模型架构