Ludovico's Blog
RSS Feed技术笔记、项目记录、随想。
精选
-
在 8x4090 上硬跑 DeepSeek-V4-Flash 的踩坑随记
本来想看看 4090 能不能凑合跑 DeepSeek-V4-Flash,跑是跑通了,但离"能用"还很远。一篇随记。
-
llama.cpp 跑 Qwen3-0.6B:HTP 上从 20 到 70 token/s
一次 Snapdragon Hexagon HTP 上的真实调优记录:OPPOLL、算子过滤、lm-head 量化,以及为什么 70 token/s 不是“全上 NPU”跑出来的。
-
llama.cpp Hexagon NPU 量化:Q4_0 / IQ4_NL / MXFP4 / Q8_0
Q4_0 / Q4_1 / IQ4_NL / MXFP4 / Q8_0 五种 HTP 原生量化格式的原理、反量化路径与对比。
-
TVM 是什么:层级架构与编译流水线
从整体架构到端到端流水线,理解 TVM 是什么、分几层、一个模型如何从 Relax 走到机器码。
-
llama.cpp 高通 Hexagon NPU 初跑 Qwen3.5 4B 模型
从 GGUF 量化、交叉编译到板端推理,完整记录 llama.cpp 在骁龙 Hexagon NPU 上的部署流程与调优经验。
-
TVM FFI(一):对象系统与调用约定
TVM FFI 的核心骨架:引用计数对象系统、类型擦除容器 TVMFFIAny、Packed Function 调用约定,以及 DLPack 零拷贝张量传递。
最近文章
-
QNN W8A16 的 INT32 Bias Overflow:从极小 Scale 到稳定部署
记录 QNN HTP W8A16 中 INT32 bias 溢出的根因、公式、QueOpt 修复方式,以及在真实板端的验证结果。
-
从 LoRA 到 QLoRA、QA-LoRA:低秩更新如何进入量化模型
用一个完整的数值例子解释 LoRA、QLoRA 和 QA-LoRA 的训练、推理与合并流程,并拆开 QA-LoRA 官方实现中的 group pooling 和 qzeros 写回。
-
从权重角度理解均匀量化与向量量化
用权重矩阵、scale/offset、码本和索引,拆开解释均匀量化与向量量化到底在压缩什么、如何反量化,以及为什么码本大小会决定 bit 数。
-
HQQ 算法解读:不用校准数据,怎样把大模型权重压到 4 bit
从 Dropbox HQQ 源码出发,拆解分组非对称量化、half-quadratic 零点优化、bit packing 与推理路径,并说明 axis、group size 和 backend 该怎样选。
-
DINOv3 做 W8A8 PTQ:一次 FP 激活分布定位,把问题从猜测变成证据
DINOv3 ViT-B/16 的标准全图 W8A8 为何失效?64 张图的逐层 FP32 激活 profile 表明,block 2 MLP 的 learned register 与 patch token 出现数百倍动态范围差。
-
ViT PTQ 论文与代码地图:从 PTQ4ViT、FQ-ViT、RepQ-ViT 到 RegCache,再落到 DINOv3
一张以问题为线索的 ViT 训练后量化地图:各论文实际解决什么、官方仓库能复现什么,以及为什么 DINOv3 的 learned storage token 需要不同的工程路径。