BriefGPT.xyz
大模型
Ask
alpha
关键词
2-bit
搜索结果 - 1
在 GPU 上实现快速 2 位硬件离线量化低内存映射:内存对齐、稀疏离群值和异步解量化
通过以较小的计算代价解决对大型语言模型(LLMs)进行量化和去量化操作时所面临的问题,我们提出了一种新的技术,并在不同模型和尺寸上进行了广泛实验,成功实现了每个权重的 2.85 位表示,模型的端到端加速比为 1.74 倍,同时降低了运行成本
→
PDF
7 months ago
Prev
Next