Datenstruktur
Tidy Data
Eine gute Datenstruktur ist die Grundlage für maschinenlesbare und weiterverwendbare OGD. Das zentrale Prinzip dabei ist Tidy Data, welche eine einheitliche Art beschreibt, Daten in Tabellen zu strukturieren. Dabei gilt:
- Jede Variable bildet eine Spalte
- Jede Beobachtung bildet eine Zeile
- Jede Zelle enthält genau einen Wert
Langes vs. breites Format
Breites Format (Wide)
| gemeinde_code | gemeinde_name | 2020 | 2021 | 2022 |
|---|---|---|---|---|
| 261 | Zürich | 421'000 | 423'000 | 425'000 |
| 230 | Winterthur | 114'000 | 115'000 | 116'000 |
Das breite Format ist für Menschen leicht lesbar, aber für Maschinen schwerer zu verarbeiten, wenn die Anzahl Spalten variiert.
Langes Format (Long)
| gemeinde_code | gemeinde_name | jahr | wert |
|---|---|---|---|
| 261 | Zürich | 2020 | 421'000 |
| 261 | Zürich | 2021 | 423'000 |
| 261 | Zürich | 2022 | 425'000 |
| 230 | Winterthur | 2020 | 114'000 |
| 230 | Winterthur | 2021 | 115'000 |
| 230 | Winterthur | 2022 | 116'000 |
Das lange Format wird für OGD bevorzugt: Es nimmt neue Zeitperioden ohne Strukturänderung auf, hat konsistente Spaltendefinitionen und wird von Analysetools wie Python, R oder SQL besser verarbeitet.
Gute und weniger gute Beispiele
✗ Nicht tidy
Regel 1 verletzt "Jede Variable bildet eine Spalte"
| gemeinde_code | gemeinde_name | 2023 | 2024 | 2025 |
|---|---|---|---|---|
| 230 | Winterthur | 118989 | 120136 | 120491 |
| 198 | Uster | 36279 | 36457 | 36941 |
Begründung: Das Jahr steckt im Spaltennamen statt als Wert in einer Spalte. Kommt ein neues Jahr hinzu, ändert sich die Tabellenstruktur.
CSV mit KI prüfen
Mit dem CSV-Check kannst du deine Distribution auf die Einhaltung des OGD-Datenstandards prüfen.