文章
所有文章。
-
llama.cpp 跑 Qwen3-0.6B:HTP 上从 20 到 70 token/s
一次 Snapdragon Hexagon HTP 上的真实调优记录:OPPOLL、算子过滤、lm-head 量化,以及为什么 70 token/s 不是“全上 NPU”跑出来的。
-
llama.cpp Hexagon NPU 量化:Q4_0 / IQ4_NL / MXFP4 / Q8_0
Q4_0 / Q4_1 / IQ4_NL / MXFP4 / Q8_0 五种 HTP 原生量化格式的原理、反量化路径与对比。
-
TVM 是什么:层级架构与编译流水线
从整体架构到端到端流水线,理解 TVM 是什么、分几层、一个模型如何从 Relax 走到机器码。
-
llama.cpp 高通 Hexagon NPU 初跑 Qwen3.5 4B 模型
从 GGUF 量化、交叉编译到板端推理,完整记录 llama.cpp 在骁龙 Hexagon NPU 上的部署流程与调优经验。
-
TVM FFI(三):多语言绑定与工具链
Python/Rust 绑定 SDK、JIT 即时编译、stubgen 类型标注生成、全局注册表、stream 管理及 addons。
-
TVM FFI(二):类型系统与容器
Any/AnyView 所有权语义、Array/Map/Variant/Expected 容器、结构相等性与哈希、反射系统与 Dataclass。