Skip to main content

Datenstruktur

Tidy Data

Eine gute Datenstruktur ist die Grundlage für maschinenlesbare und weiterverwendbare OGD. Das zentrale Prinzip dabei ist Tidy Data, welche eine einheitliche Art beschreibt, Daten in Tabellen zu strukturieren. Dabei gilt:

  1. Jede Variable bildet eine Spalte
  2. Jede Beobachtung bildet eine Zeile
  3. Jede Zelle enthält genau einen Wert

Langes vs. breites Format

Breites Format (Wide)

gemeinde_codegemeinde_name202020212022
261Zürich421'000423'000425'000
230Winterthur114'000115'000116'000

Das breite Format ist für Menschen leicht lesbar, aber für Maschinen schwerer zu verarbeiten, wenn die Anzahl Spalten variiert.

Langes Format (Long)

gemeinde_codegemeinde_namejahrwert
261Zürich2020421'000
261Zürich2021423'000
261Zürich2022425'000
230Winterthur2020114'000
230Winterthur2021115'000
230Winterthur2022116'000

Das lange Format wird für OGD bevorzugt: Es nimmt neue Zeitperioden ohne Strukturänderung auf, hat konsistente Spaltendefinitionen und wird von Analysetools wie Python, R oder SQL besser verarbeitet.


Gute und weniger gute Beispiele

✗ Nicht tidy

Regel 1 verletzt "Jede Variable bildet eine Spalte"

gemeinde_codegemeinde_name202320242025
230Winterthur118989120136120491
198Uster362793645736941
Begründung: Das Jahr steckt im Spaltennamen statt als Wert in einer Spalte. Kommt ein neues Jahr hinzu, ändert sich die Tabellenstruktur.

CSV mit KI prüfen

Mit dem CSV-Check kannst du deine Distribution auf die Einhaltung des OGD-Datenstandards prüfen.