Engineering-Blog

2026-08-05

Danke für 40 000 Stars auf GitHub

DuckDB hat gerade 40 000 Stars auf GitHub erreicht! Hier, was seit dem letzten 10 000-Star-Meilenstein passiert ist.

2026-07-31

Asynchrones I/O in DuckDB: Work, Thread, Work

Ab v2.0, geplant für Herbst 2026, unterstützt DuckDB asynchrone Reads von Parquet- und CSV-Dateien. Das kann Abfragen deutlich beschleunigen, wenn synchrones I/O die verfügbare Bandbreite nicht auslastet – typisch in EC2/S3-Compute-Storage-Setups.

2026-07-22

DuckDB 1.5.5 veröffentlicht

Heute veröffentlichen wir DuckDB 1.5.5 mit Bugfixes und Leistungsverbesserungen.

2026-06-17

DuckDB 1.4.5 LTS (Andium) veröffentlicht

Heute veröffentlichen wir DuckDB 1.4.5 LTS mit Bugfixes und Leistungsverbesserungen.

2026-06-17

DuckDB 1.5.4 (Variegata) veröffentlicht

Heute veröffentlichen wir DuckDB 1.5.4 (Variegata) mit Bugfixes und Leistungsverbesserungen.

2026-05-29

Neue DuckDB-Iceberg-Funktionen in v1.5.3

DuckDB-Iceberg hat eine Reihe neuer Funktionen für Iceberg-Tabellen und Iceberg REST Catalogs: `MERGE INTO`, `ALTER TABLE`, Partition Transforms, V3-Unterstützung und mehr!

2026-05-21

Das Lance-Lakehouse-Format in DuckDB ausprobieren

Lance ist ein offenes Lakehouse-Format, das auf KI-Workloads ausgelegt ist. LanceDB und DuckLabs haben gemeinsam schnelle Vektor- und Hybridsuche direkt aus DuckDB-SQL gebracht, ohne den analytischen Workflow zu verlassen. In diesem Beitrag erklären wir, was Lance ist, wie man es in DuckDB nutzt – und zeigen natürlich Benchmark-Ergebnisse.

2026-05-20

DuckDB 1.5.3: Kein gewöhnliches Patch-Release

Wir veröffentlichen DuckDB Version v1.5.3. Die Änderungen in DuckDB selbst beschränken sich auf Bugfixes, die mitgelieferten aktualisierten Erweiterungen bringen aber viele neue Funktionen. Dazu gehören das Quack-Client-Server-Protokoll als Core-Erweiterung, Quack-Unterstützung in DuckLake und mehrere neue Features für Iceberg, AWS und HTTPS.

2026-05-12

Quack: Das DuckDB-Client-Server-Protokoll

DuckDB-Instanzen können jetzt über das Quack-Remote-Protokoll miteinander sprechen. Damit betreiben Sie DuckDB im Client-Server-Setup mit mehreren gleichzeitigen Schreibern. Im Sinne von DuckDB ist Quack einfach aufzusetzen und baut auf bewährten Technologien wie HTTP auf. Es ist außerdem schnell und trägt Workloads von Bulk-Operationen bis zu kleinen Transaktionen.

2026-05-08

Das Programm von DuckCon #7 Amsterdam

Wir veranstalten DuckCon #7 am 24. Juni 2026 in Amsterdam. Kommen Sie ins Royal Tropical Institute zu Vorträgen, Lightning Sessions und einem Borrel.

2026-05-07

Delta wird erwachsen: Writes, Unity Catalog und Time Travel

DuckDBs Delta- und Unity-Catalog-Erweiterungen legen ihre Experimental-Tags ab – jetzt mit Writes, Unity Catalog und Time-Travel-Unterstützung.

2026-05-04

Die DuckLake-Spezifikation ist so einfach, dass sogar ein Clanker einen Dataframe-Reader bauen kann

Wir zeigen, wie einfach die DuckLake-v1.0-Spezifikation ist, indem wir mit KI einen Dataframe-Reader/Writer entwickeln.

2026-04-13

DuckDB 1.5.2 veröffentlicht

Wir veröffentlichen DuckDB Version v1.5.2, ein Patch-Release mit Bugfixes und Leistungsverbesserungen sowie Unterstützung für das DuckLake-v1.0-Lakehouse-Format.

2026-04-13

DuckLake v1.0: Das auf SQL basierende Lakehouse-Format ist produktionsreif

Wir haben den DuckLake-v1.0-Standard veröffentlicht!

2026-04-02

Data Inlining in DuckLake: Streaming für Data Lakes

DuckLakes Data Inlining legt kleine Updates direkt im Katalog ab, umgeht das „Small Files Problem“ und macht kontinuierliches Streaming in Data Lakes praktikabel. Unser Benchmark zeigt 926× schnellere Abfragen und 105× schnellere Ingestion im Vergleich zu Iceberg.

2026-04-01

DuckDB spricht jetzt Niederländisch!

DuckDB spricht jetzt Niederländisch! Laden Sie die Community-Erweiterung EendDB und schreiben Sie Ihre Abfragen in het Nederlands.

2026-03-23

DuckDB 1.5.1 veröffentlicht

Wir veröffentlichen DuckDB Version 1.5.1, ein Patch-Release mit Bugfixes, Leistungsverbesserungen und Unterstützung für das Lance-Lakehouse-Format.

2026-03-20

DuckDB.ExtensionKit: DuckDB-Erweiterungen in C# entwickeln

DuckDB.ExtensionKit bringt die Entwicklung von DuckDB-Erweiterungen ins .NET-Ökosystem. Auf der stabilen C Extension API von DuckDB und mit .NET Native AOT können C#-Entwickler Scalar- und Tabellenfunktionen definieren und als native DuckDB-Erweiterungen ausliefern.

2026-03-11

Big Data auf dem günstigsten MacBook

Wie schlägt sich das neueste Einsteiger-MacBook bei Datenbank-Workloads? Wir haben es mit ClickBench und TPC-DS SF300 getestet. Es hat beide Workloads abgeschlossen – manchmal mit überraschend guten Ergebnissen.

2026-03-09

Ankündigung: DuckDB 1.5.0

Wir veröffentlichen DuckDB Version 1.5.0 mit dem Codenamen „Variegata“. Dieses Release bringt eine freundliche CLI (einen neuen, ergonomischeren Command-Line-Client), Unterstützung für den Typ `VARIANT`, einen eingebauten Typ `GEOMETRY` sowie viele weitere Features und Optimierungen. Die LTS-Linie v1.4.0 („Andium“) erhält weiter Updates bis zum End-of-Life im September 2026.

2026-01-26

Ankündigung: DuckDB 1.4.4 LTS

Heute veröffentlichen wir DuckDB 1.4.4 mit Fehlerbehebungen und Performance-Verbesserungen.

2026-01-23

Ankündigung: Vortex-Unterstützung in DuckDB

Vortex ist ein neues spaltenorientiertes Dateiformat mit einem sehr vielversprechenden Design. SpiralDB und DuckLabs haben sich zusammengetan, um Ihnen eine sehr schnelle Erfahrung beim Lesen und Schreiben von Vortex-Dateien zu bieten!

2026-01-06

DuckDB auf LoongArch

In der heutigen Folge „Was steht auf Ihrem Schreibtisch?“ testen wir eine Loongson-CPU mit der LoongArch-Architektur.

2025-12-16

Iceberg im Browser

DuckDB ist die erste End-to-End-Schnittstelle zu Iceberg REST Catalogs in einem Browser-Tab. Sie können Tabellen in Iceberg-Catalogs jetzt lesen und schreiben, ohne Infrastruktur zu verwalten – direkt aus dem Browser!

2025-12-09

Ankündigung: DuckDB 1.4.3 LTS

Heute veröffentlichen wir DuckDB 1.4.3. Neben Fehlerbehebungen liefern wir native Extensions und Python-Unterstützung für Windows Arm64.

2025-11-28

Writes in DuckDB-Iceberg

Wir haben eine Reihe von Features und Verbesserungen in die DuckDB-Iceberg-Erweiterung geliefert: Insert-, Update- und Delete-Anweisungen werden jetzt alle unterstützt.

2025-11-19

Data-at-Rest-Verschlüsselung in DuckDB

DuckDB v1.4 bringt Datenbankverschlüsselung mit. In diesem Blogbeitrag gehen wir auf die Implementierungsdetails der Verschlüsselung ein, zeigen die Nutzung und demonstrieren die Performance-Auswirkungen.

2025-11-12

Ankündigung: DuckDB 1.4.2 LTS

Heute veröffentlichen wir DuckDB 1.4.2, das zweite Patch-Release unserer LTS-Edition. Das neue Release bringt mehrere Fehlerbehebungen und Performance-Optimierungen. Wir haben außerdem Schwachstellen in DuckDBs Datenbankverschlüsselung behoben und einige (opt-in) Logger-/Profiler-Features eingeführt, die helfen, Performance zu verstehen, sowie volle Schreibunterstützung über die Iceberg-Erweiterung.

2025-10-27

Relationale Scharade: Filme in Tabellen verwandeln

Sie können Videos in DuckDB speichern und sogar verarbeiten. In diesem Beitrag zeigen wir, wie.

2025-10-24

Frozen DuckLakes für Multi-User- und Serverless-Datenzugriff

Wir zeigen, wie sich hochperformante Data Lakes ohne bewegliche Teile aufbauen lassen.

2025-10-22

Finanzkriminalität aufdecken mit DuckDB und Graph-Abfragen

Sie können Graphen in DuckDB verarbeiten! In diesem Beitrag zeigen wir, wie Sie DuckDB und die DuckPGQ-Community-Erweiterung nutzen, um Finanzdaten auf betrügerische Muster zu analysieren – mit der SQL/PGQ-Graph-Syntax, die Teil von SQL:2023 ist.

2025-10-13

Streaming-Muster mit DuckDB

DuckDB für Streaming-Analytics? Dieser Beitrag zeigt Muster, mit denen Sie Ihre Daten mit DuckDB nahezu in Echtzeit aktualisieren können.

2025-10-09

Adoption-Kennzahlen und Benchmark-Ergebnisse für DuckDB v1.4 LTS

Die DuckDB-Startseite trifft starke Aussagen zur Popularität von DuckDB. In diesem Blogbeitrag belegen wir diese Aussagen.

2025-10-07

Ankündigung: DuckDB 1.4.1 LTS

Heute veröffentlichen wir DuckDB 1.4.1, das erste Patch-Release unserer LTS-Edition.

2025-09-24

DuckDBs Sort erneut neu entworfen

Nach vier Jahren haben wir uns entschieden, DuckDBs Sort-Implementierung erneut neu zu entwerfen. In diesem Beitrag stellen wir das neue Design vor und bewerten es.

2025-09-17

DuckLake 0.3 mit Iceberg-Interoperabilität und Geometry-Unterstützung

Wir veröffentlichen Version 0.3 der DuckLake-Spezifikation und der DuckDB-Erweiterung `ducklake`.

2025-09-16

Ankündigung: DuckDB 1.4.0 LTS

Wir veröffentlichen DuckDB Version 1.4.0 mit dem Codenamen „Andium“. Das ist ein LTS-Release mit einem Jahr Community-Support und bringt mehrere neue Features, darunter Datenbankverschlüsselung, die MERGE-Anweisung und Iceberg-Writes.

2025-09-11

Buchstabenrätsel mit DuckDB lösen

In diesem leichten Beitrag lösen wir einen Rätseltyp, der in niederländischen Zügen aushängt.

2025-09-08

Big Data unterwegs: DuckDB auf dem Framework Laptop 13

Wir haben DuckDB auf einem 12-Kern-Ultrabook mit 128 GB RAM durchgespielt und TPC-H-Abfragen bis SF10.000 ausgeführt.

2025-08-15

Grundlegendes Feature Engineering mit DuckDB

In diesem Beitrag zeigen wir, wie sich wesentliche Machine-Learning-Preprocessing-Aufgaben wie Imputation fehlender Werte, kategoriale Kodierung und Feature Scaling direkt in DuckDB mit SQL umsetzen lassen. Dieser Ansatz vereinfacht nicht nur Workflows, sondern nutzt auch DuckDBs performante In-Process-Execution-Engine für schnelle, effiziente Datenvorbereitung.

2025-08-08

Spatial Joins in DuckDB

DuckDB v1.3.0 hat die Skalierbarkeit von Geospatial Joins mit einem eigenen `SPATIAL_JOIN`-Operator deutlich verbessert.

2025-07-04

DuckLake 0.2

Wir haben den DuckLake-v0.2-Standard veröffentlicht, der von der `ducklake`-Erweiterung in DuckDB v1.3.1 unterstützt wird.

2025-06-27

DuckDB-Use-Cases über GitHub entdecken

In diesem Beitrag nutzen wir die GitHub-API, um Repositories zu finden, die DuckDB erwähnen, und dann DuckDB selbst, um die Ergebnisse effizient mit SQL zu parsen und abzufragen.

2025-06-13

Leichtgewichtige Text-Analytics-Workflows mit DuckDB

In diesem Beitrag zeigen wir, wie man DuckDB für Keyword-, Full-Text- und semantische Ähnlichkeitssuche mit Embeddings nutzt.

2025-06-06

Schnellere Dashboards mit approximativem Mehrspalten-Sortieren

Bei jedem spaltenorientierten Datenformat kann fortgeschrittenes Mehrspalten-Sortieren beim Laden die Performance einer großen Bandbreite selektiver Leseabfragen verbessern. Space-Filling-Curve-Encodings wie Morton (Z-Order) und Hilbert sortieren mehrere Spalten gemeinsam näherungsweise. Sortieren nach gerundeten Timestamps bringt zusätzliche Vorteile, wenn auf aktuelle Daten gefiltert wird.

2025-06-06

30 000 Sterne auf GitHub

Wir haben 30 000 Sterne auf GitHub erreicht! Hier ein Rückblick auf das, was passiert ist, während wir die letzten 5 000 Sterne gesammelt haben.

2025-05-27

DuckLake: SQL als Lakehouse-Format

DuckLake vereinfacht Lakehouses, indem es eine Standard-SQL-Datenbank für alle Metadaten nutzt statt komplexer dateibasierter Systeme – die Daten selbst bleiben in offenen Formaten wie Parquet. Das macht es zuverlässiger, schneller und einfacher zu verwalten.

2025-05-23

Arrow-IPC-Unterstützung in DuckDB

DuckDB kann jetzt das Arrow-IPC-Serialisierungsformat über die Community-Erweiterung `arrow` konsumieren und erzeugen.

2025-05-23

USING KEY in rekursiven CTEs

Rekursive CTEs in SQL erlauben mächtige iterative Abfragen wie Graph-Traversierungen, können aber speicherintensiv und langsam sein, weil Zeilen sich ständig ansammeln. DuckDBs neues Feature `USING KEY` behebt das, indem Zwischenergebnisse als Schlüssel-Wörterbuch statt als immer wachsende Menge behandelt werden: vorhandene Einträge lassen sich aktualisieren. Das kann zu deutlich besserer Performance und Speichereffizienz führen, besonders bei Graph-Algorithmen wie kürzestem Pfad und Distance-Vector-Routing. Es vereinfacht auch die Query-Logik durch direkten Zugriff auf das gesamte Wörterbuch.

2025-05-21

Ankündigung: DuckDB 1.3.0

Das DuckDB-Team freut sich, heute DuckDB Version 1.3.0 mit dem Codenamen „Ossivalis“ zu veröffentlichen.

2025-05-19

Das verlorene Jahrzehnt der Small Data?

Wir benchmarken DuckDB auf einem MacBook Pro von 2012, um zu klären: Haben wir ein Jahrzehnt damit verloren, verteilte Architekturen für Datenanalyse zu jagen?

2025-05-16

Machine-Learning-Prototyping mit DuckDB und scikit-learn

In diesem Beitrag prototypen wir einen Machine-Learning-Workflow mit DuckDB für die Datenverarbeitung und scikit-learn für das Modellieren.

2025-05-14

Sortieren beim Einfügen für schnelle selektive Abfragen

Daten beim Laden zu sortieren kann selektive Leseabfragen um eine Größenordnung beschleunigen, dank DuckDBs automatischer Min-Max-Indizes (auch Zone Maps genannt). Dieser Ansatz gilt auch für die meisten spaltenorientierten Dateiformate und Datenbanken. Dieser Beitrag zerlegt die DuckDB-Dateistruktur als Beispiel für ein spaltenorientiertes Datenformat und gibt praktische Tipps, wie Sortieren die Query-Geschwindigkeit verbessert.

2025-05-02

Zeitliche Analyse mit Stream-Windowing-Funktionen in DuckDB

DuckDB kann zeitbasierte Analytics mit Windows unterschiedlicher Semantik ausführen (z. B. Tumbling, Hopping und Sliding Windows). In diesem Beitrag zeigen wir das anhand der Erkennung von Trends und Anomalien im Bahnverkehr am Bahnhof Amsterdam Centraal.

2025-04-16

DuckDBs CSV-Reader und der Pollock-Robustheitsbenchmark: In den CSV-Abgrund

DuckDB bringt einen schnellen und robusten CSV-Reader mit, der – so unsere Einschätzung – die meisten CSV-Dateien in freier Wildbahn verarbeiten kann. Um das empirisch zu prüfen, haben wir den Pollock Benchmark genutzt, eine aktuelle Testsuite, die misst, wie gut CSV-Reader mit nicht-standardkonformen Dateien umgehen. DuckDB liegt auf Platz 1.

2025-04-04

Vollständig lokale Datentransformation mit dbt und DuckDB

In diesem Beitrag implementieren wir Datentransformations- und Reverse-ETL-Pipelines mit DuckDB und dbt über den Adapter `dbt-duckdb`.

2025-03-28

DuckDB in Streamlit nutzen

Wir nutzen einen realen Eisenbahn-Datensatz, um die Integration von DuckDB und Streamlit zu zeigen – einschließlich Datenbankverbindungs-Management, der DuckDB-Python-Relational-API und Responsivität in interaktiven Kartencharts.

2025-03-21

Maximale Delta-Scan-Performance in DuckDB

Wir haben eine neue Version der [`delta`-Erweiterung](/docs/current/core_extensions/delta) veröffentlicht, die mehrere neue Features und Performance-Verbesserungen enthält. In diesem Blogbeitrag nehmen wir die `delta`-Erweiterung mit einigen Benchmarks unter die Lupe und tauchen tiefer in einige der neuen performance-bezogenen Features ein.

2025-03-14

Preview: Amazon S3 Tables in DuckDB

Wir freuen uns, ein neues Preview-Feature bekanntzugeben, das Unterstützung für Apache Iceberg REST Catalogs ergänzt und DuckDB-Nutzerinnen und -Nutzern die einfache Anbindung an Amazon S3 Tables und Amazon SageMaker Lakehouse ermöglicht.

2025-03-12

Die lokale DuckDB-UI

Das DuckDB-Team und MotherDuck freuen sich, die Veröffentlichung einer lokalen UI für DuckDB bekanntzugeben, die als Teil der `ui`-Erweiterung ausgeliefert wird.

2025-03-07

Parquet-Bloom-Filter in DuckDB

DuckDB kann jetzt Parquet-Bloom-Filter lesen und schreiben.

2025-03-06

Highlights von DuckDB 1.2

Wir stellen ein paar spannende Features vor, die in DuckDB 1.2 neu hinzugekommen sind.

2025-02-26

Google Sheets in DuckDB lesen und schreiben

Sicher aus Google Sheets lesen und hineinschreiben – direkt in DuckDB mit der GSheets-Community-Extension! Für Ad-hoc-Queries ist die Authentifizierung so einfach wie das Einloggen bei Google im Browser. Geplante Workflows können persistente DuckDB Secrets nutzen. SQL-on-Sheets ist da!

2025-02-25

Präfix-Aliase in SQL

Aliase können in DuckDBs SQL-Dialekt jetzt vorangestellt werden, mit einem Doppelpunkt, z. B. `SELECT a: 42;`

2025-02-19

AsOf-Joins planen

AsOf-Joins sind ein gutes Beispiel dafür, wie DuckDB für eine teure Operation unterschiedliche Implementierungen wählen kann.

2025-02-14

Durch Windows fliegen

Ein Blick ins Detail der jüngsten Performance-Verbesserungen beim Windowing in DuckDB.

2025-02-10

Aufholen beim Windowing

DuckDB implementiert eine Reihe moderner Windowing-Features, von denen einige Erweiterungen des SQL-Standards sind. Dieser Beitrag stellt einige davon vor, darunter GROUPS-Framing, QUALIFY und Aggregate-/Funktionsmodifikatoren.

2025-02-05

Ankündigung von DuckDB 1.2.0

Das DuckDB-Team freut sich bekanntzugeben, dass wir heute DuckDB Version 1.2.0 veröffentlichen, mit dem Codenamen „Histrionicus“.

2025-01-22

Query Engines: Torwächter des Parquet-Dateiformats

Gängige Query Engines können neuere Parquet-Encodings nicht lesen. Systeme wie DuckDB müssen deshalb standardmäßig ältere Encodings schreiben und opfern so Kompression.

2025-01-17

TPC-H auf einem Raspberry Pi

DuckDB kann alle TPC-H-Queries auf einem Raspberry-Pi-5-Board bis zum 1.000-GiB-Datensatz ausführen.

2025-01-10

Vertikales Stapeln, wie das relationale Modell es meint: UNION ALL BY NAME

DuckDB erlaubt das vertikale Stapeln von Datensätzen nach Spaltenname statt nach Position. Damit kann DuckDB Dateien mit sich über die Zeit entwickelnden Schemas lesen und bringt SQL endlich mit Codds relationalem Modell in Einklang.

2024-12-18

DuckDB Node Neo Client

Der neue DuckDB-Node-Client „Neo“ bietet einen leistungsfähigen und freundlichen Weg, Ihre Lieblingsdatenbank zu nutzen

2024-12-16

25 000 Stars auf GitHub

Wir haben kürzlich 25 000 Stars auf GitHub erreicht. Das nehmen wir zum Anlass, auf das letzte DuckDB-Jahr zurückzublicken und unsere Pläne für die Zukunft zu skizzieren.

2024-12-09

Die DuckDB-Avro-Erweiterung

DuckDB kann jetzt Avro-Dateien lesen.

2024-12-06

DuckDB: TPC-H SF100 auf Mobiltelefonen

DuckDB läuft auf mobilen Plattformen wie iOS und Android und schließt den TPC-H-Benchmark schneller ab als state-of-the-art-Forschungssysteme auf High-End-Maschinen vor 20 Jahren.

2024-12-05

CSV-Dateien: Parquet als ultimatives Speicherformat entthronen – oder doch nicht?

Datenanalytik nutzt vor allem zwei Speicherformate: menschenlesbare Textdateien wie CSV und performanceorientierte Binärdateien wie Parquet. Dieser Blogbeitrag vergleicht die beiden Formate im ultimativen Showdown um Performance und Flexibilität – es kann nur einen Sieger geben.

2024-11-29

DuckDB-Tricks – Teil 3

In dieser neuen Folge der DuckDB-Tricks-Reihe stellen wir Features für den bequemen Umgang mit Tabellen und Performance-Tipps für Parquet- und CSV-Dateien vor.

2024-11-22

Zur Laufzeit erweiterbare SQL-Parser mit PEG

Trotz ihrer zentralen Rolle bei der Query-Verarbeitung haben Parser im Datenbereich kaum Aufmerksamkeit bekommen. State-of-the-Art-Systeme geben sich mit uralten Parser-Generatoren zufrieden. Die erzeugen monolithische, unflexible und unnachsichtige Parser, die Innovation in Abfragesprachen behindern und Nutzer frustrieren. Stattdessen sollten Parser mit modernen Abstraktionen wie Parsing Expression Grammars (PEG) neu geschrieben werden, die dynamische Änderungen der akzeptierten Query-Syntax und bessere Fehlererholung erlauben. In diesem Beitrag diskutieren wir, wie Parser mit PEG neu entworfen werden könnten, und validieren unsere Empfehlungen mit Experimenten zu Wirksamkeit und Effizienz.

2024-11-14

Optimizer: Der unauffällige MVP

Der Query-Optimizer ist ein wichtiger Teil jedes analytischen Datenbanksystems, weil er gegenüber handoptimierten Queries erhebliche Performance-Verbesserungen bringt – auch wenn sich der Zustand Ihrer Daten ändert.

2024-10-30

Für Analytik optimierte nebenläufige Transaktionen

DuckDB nutzt einzigartige, für Analytik optimierte optimistische Multi-Version-Concurrency-Control-Techniken. Damit kann DuckDB große In-Place-Updates effizient ausführen.

2024-10-25

Schnelle Top-N-Aggregation und -Filterung mit DuckDB

Die Top-N-Werte finden oder auf die neuesten N Zeilen filtern – schneller und einfacher mit dem Parameter `N` in den Aggregatfunktionen `min`, `max`, `min_by` und `max_by`.

2024-10-23

Was ist neu in der Vector-Similarity-Search-Erweiterung?

DuckDB ist wieder einen Schritt näher an einer Vektordatenbank! In diesem Beitrag zeigen wir die neuen Performance-Optimierungen in der Vector-Search-Erweiterung.

2024-10-16

CSV-Performance vorantreiben: DuckDB mit dem NYC-Taxi-Datensatz benchmarken

DuckDBs Benchmark-Suite enthält jetzt den NYC-Taxi-Benchmark. Wir erklären, wie unser CSV-Reader auf dem Taxi-Datensatz abschneidet, und zeigen Schritte zur Reproduktion des Benchmarks.

2024-10-11

DuckDB-Tricks – Teil 2

Wir setzen unsere Reihe „DuckDB-Tricks“ fort und konzentrieren uns auf Abfragen, die Daten bereinigen, transformieren und zusammenfassen.

2024-10-09

Open-Government-Daten mit duckplyr analysieren

Wir nutzen die R-Bibliothek duckplyr, um einen Open-Data-Datensatz der Regierung Neuseelands zu bereinigen und zu analysieren.

2024-10-04

Analyse der DuckDB-Nutzerumfrage

Wir teilen die Ergebnisse einer Umfrage unter mehr als 500 DuckDB-Nutzerinnen und -Nutzern.

2024-10-02

DuckDB in Python im Browser mit Pyodide, PyScript und JupyterLite

DuckDB in einer In-Browser-Python-Umgebung ausführen – für einfache Abfragen auf Remote-Dateien, interaktive Dokumentation und leicht nutzbare Schulungsmaterialien.

2024-09-27

Eine SQL-only-Extension für Excel-artiges Pivoting in DuckDB anlegen

Legen Sie leicht teilbare Extensions nur mit SQL-Makros an, die auf beliebige Tabellen und Spalten angewendet werden können. Wir zeigen die Macht dieser Fähigkeit mit der Extension pivot_table, die Excel-artiges Pivoting bietet.

2024-09-25

Daten mit Zuversicht und ACID ändern

Transaktionen sind Kernfeatures in Datenbankmanagementsystemen und auch für Datenanalyse-Workloads nützlich. DuckDB unterstützt vollständig ACID-Transaktionen, bestätigt durch die Testsuite des TPC-H-Benchmarks.

2024-09-09

Ankündigung: DuckDB 1.1.0

Das DuckDB-Team freut sich bekanntzugeben, dass wir heute DuckDB Version 1.1.0 mit dem Codenamen „Eatoni“ veröffentlichen.

2024-08-19

DuckDB-Tricks – Teil 1

Wir nutzen einen einfachen Beispieldatensatz, um ein paar Tricks vorzustellen, die beim Arbeiten mit DuckDB nützlich sind.

2024-08-08

Freundliche Listen und ihre Kumpel, die Lambdas

2024-07-09

Speicherverwaltung in DuckDB

2024-07-05

DuckDB Community Extensions

DuckDB-Extensions können jetzt als [DuckDB Community Extensions](https://duckdb.org/community_extensions/) veröffentlicht werden. Das Repository macht die Installation für Nutzer mit der Syntax `INSTALL extension_name FROM community` einfacher. Extension-Entwickler ersparen sich den Aufwand für Kompilierung und Verteilung.

2024-06-26

Uns selbst über die Zeit benchmarken bei DuckDB

In den letzten 3 Jahren ist DuckDB 3–25× schneller geworden und kann auf derselben Hardware ~10× größere Datensätze analysieren.

2024-06-22

20 000 Sterne auf GitHub

2024-06-20

Datenverarbeitung in der Kommandozeile: DuckDB als Unix-Tool nutzen

DuckDBs CLI-Client ist auf viele Plattformen und Architekturen portierbar. Er handhabt CSV-Dateien bequem und bietet Nutzern überall dieselbe reichhaltige SQL-Syntax. Diese Eigenschaften machen DuckDB zu einem idealen Werkzeug, um traditionelle Unix-Tools für die Datenverarbeitung in der Kommandozeile zu ergänzen.

2024-06-10

Native Delta-Lake-Unterstützung in DuckDB

DuckDB hat jetzt native Unterstützung für [Delta Lake](https://delta.io/), ein Open-Source-Lakehouse-Framework, mit der Extension `delta`.

2024-06-03

Ankündigung: DuckDB 1.0.0

Das DuckDB-Team ist <i>sehr froh</i>, heute DuckDB Version 1.0.0 mit dem Codenamen „Snow Duck“ (anas nivis) zu veröffentlichen.

2024-05-31

Eisenbahnverkehr in den Niederlanden analysieren

Wir nutzen einen realen Eisenbahn-Datensatz, um einige zentrale DuckDB-Features zu zeigen, darunter das Abfragen verschiedener Dateiformate, die Verbindung zu Remote-Endpunkten und erweiterte SQL-Features.

2024-05-29

Über 150.000 Datensätze von Hugging Face mit DuckDB nutzen

DuckDB kann Daten von [Hugging Face](https://huggingface.co/) jetzt über das Präfix `hf://` lesen.

2024-05-03

Vektorsuche in DuckDB

Dieser Blogpost zeigt eine Vorschau auf DuckDBs neue `vss`-Extension, die HNSW-Indizes (Hierarchical Navigable Small Worlds) zur Beschleunigung der Vektorsuche einführt.

2024-04-02

duckplyr: dplyr, angetrieben von DuckDB

Das neue R-Paket duckplyr übersetzt die dplyr-API auf DuckDBs Ausführungsengine.

2024-03-29

Kein Speicher? Kein Problem. Externe Aggregation in DuckDB

Seit dem Release 0.9.0 kann DuckDBs vollständig parallele Aggregate-Hash-Tabelle effizient über deutlich mehr Gruppen aggregieren, als in den Speicher passen.

2024-03-26

42.parquet – Eine Zip-Bombe für das Big-Data-Zeitalter

Eine 42-kB-Parquet-Datei kann über 4 PB Daten enthalten.

2024-03-22

Abhängigkeitsverwaltung in DuckDB-Extensions

Während der DuckDB-Kern keine externen Abhängigkeiten hat, ist das Bauen von Extensions mit Abhängigkeiten jetzt sehr einfach – mit eingebauter Unterstützung für vcpkg, einen Open-Source-Paketmanager mit über 2000 C/C++-Paketen. Lust, selbst eine zu bauen? Schauen Sie sich das [Extension-Template](https://github.com/duckdb/extension-template) an.

2024-03-01

SQL-Gymnastik: SQL in flexible neue Formen biegen

Die Kombination mehrerer Features von DuckDBs [Friendly SQL](/docs/guides/sql_features/friendly_sql) erlaubt hochflexible Abfragen, die über Tabellen hinweg wiederverwendet werden können.

2024-02-13

Ankündigung: DuckDB 0.10.0

Das DuckDB-Team freut sich, die neueste DuckDB-Version (0.10.0) anzukündigen. Diese Version trägt den Namen Fusca nach der [Samtente](https://en.wikipedia.org/wiki/Velvet_scoter), die in Europa beheimatet ist.

2024-01-26

Multi-Datenbank-Unterstützung in DuckDB

DuckDB kann neben Datenbanken im eigenen Format auch MySQL-, Postgres- und SQLite-Datenbanken anhängen. So lassen sich Daten bequem in DuckDB einlesen und zwischen diesen Systemen verschieben.

2023-12-18

Erweiterungen für DuckDB-Wasm

Nutzer von DuckDB-Wasm können jetzt DuckDB-Erweiterungen laden und sie im Browser ausführen.

2023-11-03

Aktualisierungen des H2O.ai db-benchmark!

Der H2O.ai db-benchmark wurde mit neuen Ergebnissen aktualisiert. Zusätzlich wurde die AWS-EC2-Instanz für die Benchmarks auf eine c6id.metal umgestellt, damit die Läufe besser wiederholbar und fairer zwischen den Bibliotheken sind. DuckDB ist bei Join- und Group-by-Abfragen fast in jeder Datengröße die schnellste Bibliothek.

2023-10-27

DuckDBs CSV-Sniffer: Automatische Erkennung von Typen und Dialekten

DuckDB ist vor allem auf Leistung ausgerichtet und nutzt die Stärken moderner Dateiformate. Gleichzeitig kümmern wir uns um flexible, nicht leistungsgetriebene Formate wie CSV-Dateien. Für ein angenehmes Lesen von CSV implementiert DuckDB einen CSV-Sniffer, der Dialektoptionen, Spaltentypen und sogar schmutzige Daten zum Überspringen automatisch erkennt. So lassen sich CSV-Dateien erkunden, ohne Angaben zum Dateiformat machen zu müssen.

2023-09-26

Ankündigung von DuckDB 0.9.0

2023-09-15

DuckDBs AsOf-Joins: Fuzzy temporale Lookups

DuckDB unterstützt AsOf-Joins – eine Möglichkeit, nahe beieinanderliegende Werte zu matchen. Besonders nützlich zum Durchsuchen von Event-Tabellen in der temporalen Analyse.

2023-08-23

Noch freundlicheres SQL mit DuckDB

DuckDB schiebt die Grenzen der SQL-Syntax weiter, um Abfragen zu vereinfachen und fortgeschrittenere Analysen möglich zu machen. Highlights sind dynamische Spaltenauswahl, Abfragen, die mit der FROM-Klausel beginnen, Function Chaining und List Comprehensions. Wir gehen kühn dorthin, wo noch keine SQL-Engine war! Mehr in der Dokumentation zu [freundlichen SQL-Features](/docs/guides/sql_features/friendly_sql).

2023-08-04

DuckDB ADBC – Zero-Copy-Datentransfer über Arrow Database Connectivity

DuckDB unterstützt jetzt [Arrow Database Connectivity (ADBC)](https://arrow.apache.org/adbc/0.5.1/index.html), einen API-Standard für effizientes Einlesen und Abrufen von Daten aus Datenbanksystemen, ähnlich der Schnittstelle [Open Database Connectivity (ODBC)](https://learn.microsoft.com/en-us/sql/odbc/microsoft-open-database-connectivity-odbc?view=sql-server-ver16). Im Gegensatz zu ODBC ist ADBC speziell auf das spaltenorientierte Speichermodell ausgerichtet und ermöglicht schnelle Transfers zwischen einer spaltenorientierten Datenbank und einer externen Anwendung.

2023-07-07

Vom Watscheln zum Fliegen: DuckDBs Funktionalität schnell mit skalaren Python-UDFs erweitern

DuckDB unterstützt jetzt vektorisierte skalare Python User Defined Functions (UDFs). Mit Python-UDFs lässt sich die Funktionalität von DuckDB leicht erweitern und dabei DuckDBs schnelles Ausführungsmodell, SQL und Datensicherheit nutzen.

2023-05-26

Korrelierte Subqueries in SQL

2023-05-17

Ankündigung von DuckDB 0.8.0

2023-05-12

10 000 Sterne auf GitHub

2023-04-28

PostGEESE? Die Spatial-Erweiterung von DuckDB

DuckDB hat jetzt eine offizielle [Spatial-Erweiterung](https://github.com/duckdb/duckdb-spatial) für geospatiale Verarbeitung.

2023-04-21

DuckDB für Swift

DuckDB hat jetzt eine native Swift-API. DuckDB auf Mobilgeräten – los geht’s!

2023-04-14

Die Rückkehr des H2O.ai Database-like Ops Benchmark

Wir haben den H2O.ai Database-like Ops Benchmark mit aktuellen Bibliotheken wiederbelebt und wollen ihn weiter regelmäßig ausführen.

2023-03-03

Tief verschachteltes JSON zerlegen, ein Vektor nach dem anderen

Wir haben DuckDBs JSON-Erweiterung verbessert, sodass JSON-Dateien sich direkt wie Tabellen abfragen lassen.

2023-02-24

JupySQL-Plots mit DuckDB

[JupySQL](https://github.com/ploomber/jupysql) bietet eine nahtlose SQL-Erfahrung in Jupyter und nutzt DuckDB, um Datensätze größer als der Speicher in matplotlib zu visualisieren.

2023-02-13

Ankündigung von DuckDB 0.7.0

2022-11-14

Ankündigung: DuckDB 0.6.0

2022-10-28

Leichtgewichtige Kompression in DuckDB

DuckDB unterstützt effiziente leichtgewichtige Kompression, die automatisch genutzt wird, um die Datengröße niedrig zu halten, ohne hohe Kosten für Kompression und Dekompression zu verursachen.

2022-10-12

Modern Data Stack in a Box mit DuckDB

Ein schneller, kostenloser und quelloffener Modern Data Stack (MDS) lässt sich jetzt vollständig auf dem Laptop oder auf einer einzelnen Maschine bereitstellen – mit der Kombination aus DuckDB, [Meltano](https://meltano.com/), [dbt](https://www.getdbt.com/) und [Apache Superset](https://superset.apache.org/).

2022-09-30

Postgres-Tabellen direkt aus DuckDB abfragen

DuckDB kann jetzt Tabellen, die in PostgreSQL gespeichert sind, direkt abfragen und komplexe analytische Abfragen beschleunigen, ohne Daten zu duplizieren.

2022-07-27

Persistente Speicherung von Adaptive Radix Trees (ART) in DuckDB

DuckDB nutzt Adaptive-Radix-Tree-(ART-)Indexes, um Constraints durchzusetzen und Query-Filter zu beschleunigen. Bisher wurden Indexes nicht persistiert, was Probleme wie den Verlust von Indexinformationen und hohe Reload-Zeiten für Tabellen mit Daten-Constraints verursachte. Wir persistieren ART-Indexes jetzt auf die Platte, was die Datenbank-Ladezeiten drastisch senkt (bis zu Größenordnungen), und wir verlieren bestehende Indexes nicht mehr aus dem Blick. Dieser Blogpost enthält einen Deep Dive in die Implementierung der ART-Speicherung, Benchmarks und zukünftige Arbeit. Um besser zu verstehen, wie unsere Indexes genutzt werden, bitte ich Sie, die folgende [Umfrage](https://forms.gle/eSboTEp9qpP7ybz98) zu beantworten. Sie wird uns bei der Definition unserer zukünftigen Roadmap leiten.

2022-05-27

Range Joins in DuckDB

DuckDB hat vollständig parallelisierte Range Joins, die Millionen von Range-Prädikaten effizient joinen können.

2022-05-04

Freundlicheres SQL mit DuckDB

DuckDB bietet mehrere Erweiterungen der SQL-Syntax. Eine vollständige Liste dieser Features finden Sie auf der [Dokumentationsseite zu Friendly SQL](/docs/guides/sql_features/friendly_sql).

2022-03-07

Parallele gruppierte Aggregation in DuckDB

DuckDB hat eine vollständig parallelisierte Aggregate-Hash-Tabelle, die effizient über Millionen von Gruppen aggregieren kann.

2022-01-06

DuckDB-Zeitzonen: Unterstützung für Kalendererweiterungen

Die DuckDB-ICU-Erweiterung bietet jetzt Zeitzonenunterstützung.

2021-12-03

DuckDB quakt Arrow: Eine Zero-Copy-Datenintegration zwischen Apache Arrow und DuckDB

Die Zero-Copy-Integration zwischen DuckDB und Apache Arrow ermöglicht die schnelle Analyse größerer-als-Speicher-Datensätze in Python und R – mit SQL oder relationalen APIs.

2021-11-26

DuckDB – Der Herr der Enums: Die Gefährten der Categorical und Factors

2021-11-12

Schnelle gleitende holistische Aggregationen

DuckDB, ein freies und quelloffenes analytisches Datenverwaltungssystem, hat eine Windowing-API, die komplexe gleitende Aggregationen wie Interquartilsabstände und mediane absolute Abweichung deutlich schneller berechnen kann als herkömmliche Ansätze.

2021-10-29

DuckDB-Wasm: Effizientes analytisches SQL im Browser

[DuckDB-Wasm](https://github.com/duckdb/duckdb-wasm) ist eine In-Process-analytische SQL-Datenbank für den Browser. Sie wird von WebAssembly angetrieben, spricht fließend Arrow, liest Parquet-, CSV- und JSON-Dateien über Filesystem-APIs oder HTTP-Requests und wurde mit Chrome, Firefox, Safari und Node.js getestet. Sie können sie unter [shell.duckdb.org](https://shell.duckdb.org) oder auf [Observable](https://observablehq.com/@cmudig/duckdb) ausprobieren.

2021-10-13

Windowing in DuckDB

DuckDB, ein freies und quelloffenes analytisches Datenverwaltungssystem, hat eine moderne Windowing-Engine, die komplexe gleitende Aggregationen wie Interquartilsabstände ebenso berechnen kann wie einfachere gleitende Mittelwerte.

2021-08-27

Die schnellste Tabellensortierung im Westen – DuckDBs Sort neu entworfen

DuckDB, ein freies und quelloffenes analytisches Datenverwaltungssystem, hat eine neue, hocheffiziente parallele Sortierimplementierung, die deutlich mehr Daten sortieren kann, als in den Hauptspeicher passen.

2021-06-25

Parquet präzise mit DuckDB abfragen

DuckDB, ein freies und quelloffenes analytisches Datenverwaltungssystem, kann SQL-Abfragen direkt auf Parquet-Dateien ausführen und nutzt automatisch die fortgeschrittenen Eigenschaften des Parquet-Formats.

2021-05-14

Effizientes SQL auf Pandas mit DuckDB

DuckDB, ein freies und quelloffenes analytisches Datenverwaltungssystem, kann SQL-Abfragen direkt und effizient auf Pandas-DataFrames ausführen.

2021-01-25

DuckDBs Full-Text-Search-Erweiterung im Test

DuckDB hat jetzt eine Volltextsuche, ähnlich der FTS5-Erweiterung in SQLite. Der wichtigste Unterschied: Unsere FTS-Erweiterung ist vollständig in SQL formuliert. Getestet haben wir sie auf den TREC-Disks 4 und 5.