Skip to main content

Datenstruktur

Tidy Data​

Eine gute Datenstruktur ist die Grundlage für maschinenlesbare und weiterverwendbare OGD. Das zentrale Prinzip dabei ist Tidy Data, welche eine einheitliche Art beschreibt, Daten in Tabellen zu strukturieren. Dabei gilt:

  1. Jede Variable bildet eine Spalte
  2. Jede Beobachtung bildet eine Zeile
  3. Jede Zelle enthält genau einen Wert

Langes vs. breites Format​

Breites Format (Wide)​

gemeinde_codegemeinde_name202020212022
261Zürich421'000423'000425'000
230Winterthur114'000115'000116'000

Das breite Format ist für Menschen leicht lesbar, aber für Maschinen schwerer zu verarbeiten, wenn die Anzahl Spalten variiert.

Langes Format (Long)​

gemeinde_codegemeinde_namejahrwert
261Zürich2020421'000
261Zürich2021423'000
261Zürich2022425'000
230Winterthur2020114'000
230Winterthur2021115'000
230Winterthur2022116'000

Das lange Format wird für OGD bevorzugt: Es nimmt neue Zeitperioden ohne Strukturänderung auf, hat konsistente Spaltendefinitionen und wird von Analysetools wie Python, R oder SQL besser verarbeitet.


Gute und weniger gute Beispiele​

✗ Nicht tidy

Regel 1 verletzt "Jede Variable bildet eine Spalte"

gemeinde_codegemeinde_name202320242025
230Winterthur118989120136120491
198Uster362793645736941
Begründung: Das Jahr steckt im Spaltennamen statt als Wert in einer Spalte. Kommt ein neues Jahr hinzu, ändert sich die Tabellenstruktur.

CSV mit KI prüfen

Mit dem CSV-Check kannst du deine Distribution auf die Einhaltung des OGD-Datenstandards prüfen.