Install & Compatibility
Where this runs
tested against v0.7.1 · pip install
no network on importno background threads
Install × environment matrix
Each cell = how many times install + import succeeded across repeated harness runs. Partial = flaky.
glibc = Debian/Ubuntu slim · musl = Alpine Linux
py 3.10
✕ build_error
✕ timeout
py 3.11
✕ build_error
✓ 82.45s
py 3.12
✕ build_error
✕ build_error
py 3.13
✕ build_error
✕ build_error
py 3.9
✕ build_error
✕ timeout
5427MB installed
● package 5427MB
Code
Verified usage
Verified import paths — ran on the pinned version, not inferred.
AutoGPTQForCausalLM
✓ from auto_gptq import AutoGPTQForCausalLM
✗ from auto_gptq.modeling import AutoGPTQForCausalLM
AutoGPTQForCausalLM is exposed at package level, not in a submodule.
BaseQuantizeConfig
✓ from auto_gptq import BaseQuantizeConfig
exllama_set_max_input_length
✓ from auto_gptq import exllama_set_max_input_length
Quickstart for quantizing and running a model (quantization not shown for simplicity, but the config is set).
import torch
from transformers import AutoTokenizer
from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
model_id = "facebook/opt-125m"
tokenizer = AutoTokenizer.from_pretrained(model_id)
quantize_config = BaseQuantizeConfig(
bits=4,
group_size=128,
desc_act=False,
)
model = AutoGPTQForCausalLM.from_pretrained(
model_id,
quantize_config=quantize_config,
)
text = "AutoGPTQ is"
inputs = tokenizer(text, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=20)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Upgrade
Version history
0.7.1latest on PyPI · released Mar 1, 2024
Audit
Dependencies
torchrequiredCore dependency for tensor operations and GPU support. AutoGPTQ requires PyTorch >=2.0.
transformersrequiredHugging Face Transformers for model architectures and tokenizers.
accelerateoptionalUsed for device mapping and large model support.
datasetsoptionalUsed for loading calibration datasets during quantization.