Install & Compatibility
Where this runs
tested against v? · pip install
Install × environment matrix
Each cell = how many times install + import succeeded across repeated harness runs. Partial = flaky.
glibc = Debian/Ubuntu slim · musl = Alpine Linux
muslpy 3.10–3.920 runs
build_error
glibcpy 3.10–3.920 runs
timeout
Code
Verified usage
Verified import paths — ran on the pinned version, not inferred.
AutoModelForCausalLM
✓ from llmcompressor.models import AutoModelForCausalLM
QuantizationModifier
✓ from llmcompressor.modifiers import QuantizationModifier
SparseMLRecipe
✓ from llmcompressor.recipes import SparseMLRecipe
Compressor
✓ from llmcompressor.compression import Compressor
AutoTokenizer
✓ from transformers import AutoTokenizer
Required for model tokenization, part of HuggingFace Transformers.
This quickstart demonstrates how to initialize `llmcompressor` for a simple post-training quantization (PTQ) workflow. It involves loading a Hugging Face model, defining a compression recipe in YAML, and setting up the `Compressor`. For actual PTQ, a calibration dataloader is required when calling `compressor.compress()`.
from transformers import AutoTokenizer
from llmcompressor.models import AutoModelForCausalLM
from llmcompressor.recipes import SparseMLRecipe
from llmcompressor.compression import Compressor
import torch
# 1. Load a pre-trained model and tokenizer
model_name = "TinyLlama/TinyLlama-1.1B-Chat-v1.0"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)
# 2. Define a compression recipe (e.g., for 8-bit quantization)
# This YAML describes a simple post-training quantization (PTQ) modifier.
# For full functionality, specific targets and calibration data would be needed.
recipe_yaml = """
quantization_modifiers:
- !QuantizationModifier
start: 0.0
scheme_args:
num_bits: 8
symmetric: False
per_channel: True
"""
# 3. Parse the recipe
recipe = SparseMLRecipe.parse_yaml(recipe_yaml)
# 4. Create a Compressor instance
# The model will be modified in-place when compression is applied.
# For PTQ, a calibration dataloader is typically required for `compressor.compress()`.
compressor = Compressor(recipe=recipe, model=model, tokenizer=tokenizer)
# 5. Apply compression (requires calibration data for true PTQ)
print("Compressor initialized. To apply compression with Post-Training Quantization (PTQ),")
print("you would typically call: compressor.compress(dataloader=your_calibration_dataloader)")
print("For this quickstart, we've demonstrated the setup without running full PTQ.")
# Example of saving (after actual compression)
# compressor.save_compressed_model("path/to/save/compressed_model")
Upgrade
Version history
0.12.0latest on PyPI · released Jun 15, 2026
Audit
Dependencies
torchrequiredCore deep learning framework dependency.
transformersrequiredIntegration with HuggingFace models and utilities.
sparseml.corerequiredUnderlying core compression framework logic.
sparseml.pytorchrequiredPyTorch-specific components for compression.
compressed-tensorsrequiredOptimized tensor representations for compressed models, frequently updated.
autoroundoptionalAdvanced rounding-based quantization algorithm. Requires x86_64.