web_archive
Common-Crawl- und Wayback-Machine-Webarchiv-CDX-APIs direkt aus SQL abfragen
Maintainer: onnimonni
Installation und Laden
INSTALL web_archive FROM community;LOAD web_archive;Beispiel
-- Find archived pages from Wayback MachineSELECT url, timestamp, statuscodeFROM wayback_machine()WHERE url LIKE 'example.com/%' AND statuscode = 200LIMIT 10;
-- One snapshot per year using DISTINCT ON pushdownSELECT DISTINCT ON(year) url, timestampFROM wayback_machine()WHERE url = 'github.com/duckdb/duckdb' AND statuscode = 200LIMIT 5;
-- Query Common Crawl indexSELECT url, timestamp, mimetypeFROM common_crawl_index()WHERE url LIKE '%.example.com/%' AND statuscode = 200LIMIT 10;Über web_archive
Diese Erweiterung stellt zwei Tabellenfunktionen zum Abfragen von Webarchiv-CDX-APIs bereit:
- wayback_machine(): Internet Archive Wayback Machine abfragen (1996 bis heute)
- common_crawl_index(): Common-Crawl-Archiv abfragen (2008 bis heute, monatliche Snapshots)
Funktionen:
- DISTINCT-ON-Pushdown:
DISTINCT ON(year)wird zu&collapse=timestamp:4 - Filter-Pushdown: WHERE-Klauseln für statuscode/mimetype werden an die CDX-API durchgereicht
- LIMIT-Pushdown: es werden nur die angeforderten Datensätze abgerufen
- SELECT-Pushdown: über den Parameter
&fl=werden nur benötigte Spalten abgerufen - Antwortabruf: archivierte Seiteninhalte über
response.bodyherunterladen - Virtuelle Spalten:
yearundmonthaus dem Zeitstempel extrahiert
Die vollständige Dokumentation finden Sie im Erweiterungs-Repository.
Hinzugefügte Funktionen
| function_name | function_type | description | comment | examples |
|---|---|---|---|---|
| common_crawl_index | table | NULL | NULL | |
| wayback_machine | table | NULL | NULL |
Überladene Funktionen
Diese Erweiterung fügt keine Funktionsüberladungen hinzu.
Hinzugefügte Typen
Diese Erweiterung fügt keine Typen hinzu.
Hinzugefügte Einstellungen
Diese Erweiterung fügt keine Einstellungen hinzu.