Install & Compatibility
Where this runs
tested against v1.6.0 · pip install
no network on importno background threads
Install × environment matrix
Each cell = how many times install + import succeeded across repeated harness runs. Partial = flaky.
glibc = Debian/Ubuntu slim · musl = Alpine Linux
muslpy 3.10–3.95 runs
installs and imports cleanly · install 0.0s · import 0.000s · 164.9MB
glibcpy 3.10–3.95 runs
installs and imports cleanly · install 8.0s · import 0.000s · 157MB
165MB installed
● package 165MB
Code
Verified usage
Verified import paths — ran on the pinned version, not inferred.
AnalysisRunner
✓ from pydeequ.analyzers import AnalysisRunner
✗ from pydeequ.analyzers import AnalysisRunner
This script sets up a Spark session, creates a sample DataFrame, performs a completeness analysis on column 'a', and displays the results.
import os
from pyspark.sql import SparkSession, Row
import pydeequ
# Set up Spark session
spark = (SparkSession
.builder
.config('spark.jars.packages', pydeequ.deequ_maven_coord)
.config('spark.jars.excludes', pydeequ.f2j_maven_coord)
.getOrCreate())
# Sample data
df = spark.sparkContext.parallelize([
Row(a='foo', b=1, c=5),
Row(a='bar', b=2, c=6),
Row(a='baz', b=3, c=None)]).toDF()
# Perform analysis
from pydeequ.analyzers import AnalysisRunner
analysisResult = AnalysisRunner(spark) \
.onData(df) \
.addAnalyzer(pydeequ.analyzers.Completeness('a')) \
.run()
# Show results
analysisResult
Upgrade
Version history
1.6.0latest on PyPI · released Jul 8, 2026
Audit
Dependencies
pysparkrequiredPyDeequ relies on PySpark for distributed data processing capabilities.