三件核心能力:优化器、推理量化与训练量化
官方把库的能力归纳为三项。其一是 8 位优化器:用块级量化保存优化器状态,官方称能在只占很小内存的情况下维持 32 位精度下的训练表现。其二是 LLM.int8():面向推理的 8 位量化,官方称能在大模型推理时把所需显存降到一半且不带来性能下降。其三是 QLoRA:把模型量化到 4 位再插入一小批可训练的 LoRA 权重,让大模型训练在有限显存下成为可能。三者分别对应训练开销、推理显存与训练显存三个最实际的瓶颈。
bitsandbytes官方把它定位为「通过 k 位量化为 PyTorch 提供可及的大模型能力」:用块级量化的 8 位优化器、向量级量化的 8 位推理与配合 LoRA 的 4 位训练,大幅降低推理与训练的显存占用。

深度介绍
官方把库的能力归纳为三项。其一是 8 位优化器:用块级量化保存优化器状态,官方称能在只占很小内存的情况下维持 32 位精度下的训练表现。其二是 LLM.int8():面向推理的 8 位量化,官方称能在大模型推理时把所需显存降到一半且不带来性能下降。其三是 QLoRA:把模型量化到 4 位再插入一小批可训练的 LoRA 权重,让大模型训练在有限显存下成为可能。三者分别对应训练开销、推理显存与训练显存三个最实际的瓶颈。
官方 README 解释了这个方法的思路:采用向量级量化把大部分特征压到 8 位,同时把少数「离群值」特征单独用 16 位矩阵乘法处理——离群值正是朴素 8 位量化精度崩塌的主要原因。这条设计让推理显存降到约一半而效果基本不变,也是这套库被广泛用于大模型部署的直接原因。使用时值得留意的是:显存收益随模型与上下文规模变化,长上下文场景下 KV 缓存占比上升,量化权重带来的相对收益会下降,需要按实际负载测量。
QLoRA 是这套库最广为人知的能力:先把基座模型量化到 4 位,再插入一小批可训练的低秩适配权重,官方称其组合了多项节省显存的技巧且不牺牲性能。这条路线让单张消费级显卡微调数十亿参数模型成为常见做法,也正是它被 PEFT、TRL 等训练框架集成的入口。需要权衡的是:4 位基座加适配器的组合在数值上与原模型存在差异,对结果敏感的任务应在目标硬件上做一轮对照评测,而不是直接按论文数字推断。
除集成入口外,库本身也暴露了底层组件:8 位与 4 位运算的量化原语是 bitsandbytes.nn.Linear8bitLt 与 bitsandbytes.nn.Linear4bit,8 位优化器位于 bitsandbytes.optim 模块。这意味着即使不用 Transformers 的封装,也可以在自己的 PyTorch 代码里替换线性层或优化器来完成量化。对做自定义模型结构或研究量化行为的团队,这层接口比「改个加载参数」更可控;代价是要自己处理量化配置、反量化时机与显存布局等细节。
官方 README 给出一张较完整的支持矩阵:Linux(glibc 2.24 以上)的 x86-64 上,纯 CPU(AVX2 起步、AVX512F 与 AVX512BF16 有优化)、NVIDIA(SM60 起、推荐 SM75+)、AMD(CDNA 与 RDNA 多代架构)、Intel 数据中心 GPU 与 Arc 系列、以及 Intel Gaudi 均可;aarch64 上支持 CPU 与 NVIDIA;Windows 11 与 Server 2022 以上覆盖 CPU、NVIDIA、AMD、Intel 与 arm64;macOS 14 以上支持 Apple M1 及更新的 CPU 与 Metal。三项能力在不同平台上的支持程度并不完全相同,选型前建议对照该表逐项确认。
它基本是 Hugging Face 生态里量化的默认底座:官方 README 列出与 Transformers、Diffusers 与 PEFT 的集成文档入口,加载模型时通过配置项即可启用 4 位或 8 位量化。项目的持续维护由赞助方支持,官方在 README 中列出了赞助方。这种「底层库 + 上游框架集成」的定位意味着大多数使用者其实是通过 Transformers 或 PEFT 间接用到它,只有在需要自定义量化行为时才会直接接触它的 API。
官方 README 给出了三条引用,对应三项核心能力的原始工作:QLoRA(2023 年,高效微调量化大模型)、LLM.int8()(2022 年,面向大规模 Transformer 的 8 位矩阵乘法)与 8 位优化器(ICLR 2022,基于块级量化的优化器)。对需要写技术文档或在论文中引用的团队,这三条引用是核对方法来源的可靠起点;也说明这套库不是工程上的权宜方案,而是量化研究方向直接沉淀下来的实现。
bitsandbytes 以 MIT 许可开源(版权声明来自 Meta 及其关联公司),商用限制较少;最低环境要求为 Python 3.10 以上与 PyTorch 2.4 以上,官方同时建议尽量使用较新的 PyTorch 以获得最好体验。版本方面,发布记录里的最新稳定版为 0.50.1(2026 年 7 月 25 日,标题为 RTX Spark 支持),此前有 0.49.2(2026 年 1 月)与 0.49.0(2025 年 10 月),仓库另有持续更新的 main 分支轮子(2026 年 8 月 27 日)。安装前建议核对 PyTorch 与 CUDA/驱动版本的匹配关系。
产品特点
8 位优化器降低优化器状态占用,LLM.int8() 面向推理把显存降到约一半,QLoRA 用 4 位基座加 LoRA 让训练在有限显存下可行——三者对应不同的显存瓶颈。
官方说明其做法是把大部分特征向量级量化到 8 位,同时将少数离群值特征单独用 16 位矩阵乘法计算,从而在显存减半的同时基本不损失性能。
把模型量化到 4 位后插入一小批可训练的低秩适配权重,官方称其整合了多项省显存技巧且不牺牲性能;这也是 PEFT、TRL 等框架量化训练路径的底层依赖。
支持矩阵覆盖 Linux、Windows 与 macOS,硬件包括 NVIDIA、AMD(CDNA 与 RDNA)、Intel GPU 与 Gaudi、Apple M1 以上的 Metal 与 CPU,以及无独显的纯 CPU 环境(AVX2 起步)。
最近动态
发布页记录显示 2026 年 8 月 27 日更新了 main 分支的轮子(Latest main wheel)。官方 README 同时提示:加速器支持表反映的是当前开发分支的状态,若要查看最新稳定版的支持情况应查阅 0.50.0 标签下的文档。
0.50.1 于 2026 年 7 月 25 日发布,标题标注为 RTX Spark 支持,属于跟进新硬件代际的版本;同系列此前还有 0.50.0。升级前建议先确认 PyTorch 与驱动版本匹配。
0.49.2 于 2026 年 1 月 8 日发布,此前 2025 年 10 月为 0.49.0、2025 年 9 月为 0.48.1。项目以数月一次的节奏发布稳定版本,其间在 main 分支持续合并改动。
发布记录显示 0.48.1 于 2025 年 9 月 30 日发布。该库的历史版本跨度较大,涉及加速器支持面与量化实现的变更,升级前建议阅读对应版本的说明并在目标硬件上验证量化效果。
bitsandbytes 是面向 PyTorch 的量化库,官方把它定位为「通过 k 位量化让大模型变得可及」,目标是大幅降低推理与训练的显存占用。项目以 MIT 许可开源(版权声明来自 Meta 及其关联公司),核验时 GitHub 仓库约有 8500 star,最新稳定版本为 0.50.1(2026 年 7 月 25 日,标题为 RTX Spark 支持),仓库 main 分支的轮子更新到 2026 年 8 月 27 日。 库提供三项核心能力。其一是 8 位优化器,用块级量化存储优化器状态,官方称在只占很小内存的情况下保持 32 位精度的训练表现。其二是 LLM.int8(),面向推理的 8 位量化:把大部分特征按向量量化到 8 位,少数离群值特征单独用 16 位矩阵乘法处理,从而在显存降到约一半的同时基本不损性能。其三是 QLoRA,把基座模型量化到 4 位并插入一小批可训练的低秩适配权重,让大模型训练在有限显存下可行——这也是 PEFT、TRL 等框架量化训练路径的底层依赖。除集成入口外,库本身暴露 bitsandbytes.nn.Linear8bitLt、bitsandbytes.nn.Linear4bit 与 bitsandbytes.optim 等组件,便于在自定义 PyTorch 代码中直接替换线性层或优化器。 硬件支持面较宽:Linux(glibc 2.24 以上)的 x86-64 支持纯 CPU(AVX2 起,AVX512F 与 AVX512BF16 有优化)、NVIDIA(SM60 起,推荐 SM75+)、AMD(CDNA 与 RDNA 多代)、Intel 数据中心 GPU 与 Arc 系列以及 Intel Gaudi;aarch64 支持 CPU 与 NVIDIA;Windows 11 与 Server 2022 以上覆盖 CPU、NVIDIA、AMD、Intel 与 arm64;macOS 14 以上支持 Apple M1 及更新的 CPU 与 Metal。官方 README 同时说明该矩阵反映开发分支状态,最新稳定版的支持情况需查阅对应标签的文档。 使用前需要注意:最低环境要求为 Python 3.10 以上与 PyTorch 2.4 以上,且官方建议尽量使用较新的 PyTorch;三项能力在不同平台上的支持程度不一致(例如某些平台上训练量化与优化器支持并不完整),动手前应对照支持矩阵逐项确认;4 位基座加适配器的组合与原模型存在数值差异,敏感任务应做对照评测;长上下文场景中 KV 缓存占比上升,权重量化带来的相对显存收益会下降,需按真实负载测量。
核验信息
本页事实来自 bitsandbytes 官方渠道:GitHub 仓库 README(「k 位量化让大模型可及」定位、三项核心能力说明、Linear8bitLt/Linear4bit 与 optim 模块、系统要求与加速器支持矩阵、与 Transformers/Diffusers/PEFT 的集成入口、赞助方、MIT 许可与三篇原始论文的引用)与许可文件、发布页版本与日期,以及官方文档站与 PyPI 包页。star 数、版本与支持矩阵核验于 2026 年 9 月 22 日;官方提示支持矩阵反映开发分支状态,稳定版请以对应标签的文档为准。
bitsandbytes介绍页面对您是否有帮助?