The FastLanes File Format
|—––|—––| | Paper | The FastLanes File Format (PDF) | | Konferenz | VLDB 2025 |
Zusammenfassung
Dieser Beitrag stellt ein neues Open-Source-Big-Data-Dateiformat namens FastLanes vor. Es ist für moderne datenparallele Ausführung (SIMD oder GPU) entworfen und entwickelt die Eigenschaften früherer Datenformate wie Parquet weiter, die die Grundlage von Data Lakes bilden und zunehmend in KI-Pipelines verwendet werden. Dazu verzichtet es auf generische Kompressionsverfahren (z. B. Snappy) zugunsten leichtgewichtiger Encodings, die vollständig datenparallel sind. Zur Verbesserung der Kompressionsrate kaskadiert es Encodings über einen flexiblen Mechanismus der Expression Encoding. Dieser Mechanismus ermöglicht außerdem Multi-Column Compression (MCC) und verbessert die Kompression, indem er Korrelationen zwischen Spalten nutzt – eine langjährige Schwäche spaltenorientierter Speicherung. Wir tragen einen 2-Phasen-Algorithmus bei, der Encoding-Ausdrücke während der Kompression findet.
FastLanes innoviert auch in seiner API und bietet flexible Unterstützung für partielle Dekompression, sodass Engines Anfragen auf komprimierten Daten ausführen können. FastLanes ist für feingranularen Zugriff auf der Ebene kleiner Batches statt Rowgroups entworfen, damit der Dekompressions-Speicherbedarf in CPU- und GPU-Caches passt.
Wir tragen eine Open-Source-Implementierung von FastLanes in portablem (auto-vektorisierendem) C++ bei. Unsere Auswertung auf einem Korpus realer Daten zeigt, dass FastLanes die Kompressionsrate gegenüber Parquet verbessert und zugleich die Dekompression stark beschleunigt – ein Gewinn auf beiden Seiten gegenüber dem Stand der Technik.