标签: Vision Transformer
含有标签 "Vision Transformer".
-
DINOv3 做 W8A8 PTQ:一次 FP 激活分布定位,把问题从猜测变成证据
DINOv3 ViT-B/16 的标准全图 W8A8 为何失效?64 张图的逐层 FP32 激活 profile 表明,block 2 MLP 的 learned register 与 patch token 出现数百倍动态范围差。
-
ViT PTQ 论文与代码地图:从 PTQ4ViT、FQ-ViT、RepQ-ViT 到 RegCache,再落到 DINOv3
一张以问题为线索的 ViT 训练后量化地图:各论文实际解决什么、官方仓库能复现什么,以及为什么 DINOv3 的 learned storage token 需要不同的工程路径。
-
[论文精读] RegCache:Vision Encoder 做激活量化,为什么需要 Prefixing Registers
更新于:RegCache 发现视觉编码器中的高范数 outlier 会严重放大量化误差,并通过中间层 prefix registers 和 token deletion 改善 CLIP、SigLIP、DINOv2 等模型的低比特量化。
-
[论文精读] Vision Transformers Need Registers:给 ViT 加几个工作寄存器
更新于:Vision Transformers Need Registers 解释 ViT 中背景高范数 token 的来源,并用额外的 register tokens 把模型的隐式工作空间显式化。