crawl
Crawl URLs and return rich page data including title, description, language, canonical URL, robots directives, full text, boilerplate-stripped markdown, links, images, meta tags, OG/Twitter Card, JSON-LD, microdata, commerce data, forms, analytics-detected, emails, phones, social links, hreflang, pagination, redirect chain, response headers, timing, and structured error information.
diagnose
Crawl URLs and score source readiness for a built-in extraction contract without an LLM call, returning per-URL verdict, readiness score, blockers, warnings, and a recommended next step.
extract-contract
Crawl URLs and perform LLM-powered extraction using a built-in contract schema (e.g., real-estate-listing, product-page), appending contract validation results including validation.valid and missingRequiredFields.