文章
所有文章。
-
MNN QNN 离线模式跑通 Qwen3-4B 大模型
完整记录从本地编译 MNN、生成 QNN 离线模型、准备高通 QNN 依赖,到在 QCS8550/8 Gen 2 板端按 MNN 文档跑通 Qwen3-4B 的全过程,以及中间遇到的权限、路径和库问题。
-
llama.cpp Hexagon HTP 长 Prompt 默认 ubatch=512 卡住的定位与修复
本来只是想在 Hexagon HTP 上跑一条稍长一点的总结题,结果 `llama.cpp` 默认 `ubatch=512` 直接卡在 prefill。最后一路排到 HMX matmul,发现是小 remainder batch 走异步 pipeline 后没回来。
-
在 8x4090 上硬跑 DeepSeek-V4-Flash 的踩坑随记
本来想看看 4090 能不能凑合跑 DeepSeek-V4-Flash,跑是跑通了,但离"能用"还很远。一篇随记。
-
Hermes Agent + Tailscale:免打扰远程控制
用 Hermes Agent 的 YOLO 模式搭配 Tailscale,让 AI 助手无缝 SSH 接管你的任何设备。
-
llama.cpp 里的 lm-head:Q6_K、Q4_0,以及为什么 4B 不一定提速
从 Qwen3/Qwen3.5 的 tied embedding 看 lm-head 性能瓶颈:0.6B 改 output-q4_0 有收益,4B 上收益有限甚至可能变慢。
-
llama.cpp HTP 调优:少用 CPU 为什么反而慢
用 Qwen3-0.6B 的 profile 解释一个朴素误区:减少 CPU 参与不等于更快。HTP attention、SET_ROWS、图切分和真实 token/s 的关系。