Onderdeel van Het bedrijfsbrein: waar de kennis van je organisatie gaat wonen
Wat is Databricks?
Databricks is een lakehouse-platform: opslag, verwerking, catalogus en modellen op één plek. Wat het wel doet, wat het niet doet, en wanneer het de juiste keuze is.

Databricks is een dataplatform gebouwd rond het lakehouse: de goedkope, open opslag van een data lake gecombineerd met de betrouwbaarheid en snelheid die je van een datawarehouse verwacht. Opslag, verwerking, catalogus, modellen en dashboards zitten in één omgeving.
De praktische samenvatting: één plek waar ruwe gegevens binnenkomen, betrouwbaar worden gemaakt en bevraagd kunnen worden - zonder ze eerst naar een tweede systeem te kopiëren.
Het lakehouse in lagen
Brons, zilver, goud: dezelfde gegevens, oplopend in betrouwbaarheid.
Ruwe data komt binnen zoals ze is (brons), wordt geschoond en gekoppeld (zilver), en wordt daarna vastgelegd in tabellen waar de organisatie op stuurt (goud). Delta Lake voegt transacties en versiebeheer toe, zodat je kunt terugkijken naar hoe een tabel er vorige maand uitzag - het verschil tussen een cijfer verklaren en een cijfer verdedigen.
Unity Catalog is de laag eromheen: één plek voor definities, herkomst en toegangsrechten. Dat is precies de betekenislaag uit data architectuur, en de reden dat we het platform in veel omgevingen inzetten.
De onderdelen die je in de praktijk gebruikt
Databricks is één omgeving met een aantal duidelijk te onderscheiden onderdelen. Je hoeft ze niet allemaal te gebruiken, maar het helpt te weten wat waarvoor is.
- Delta Lake. Het tabelformaat: open, met transacties, schemabeheer en tijdreizen naar eerdere versies.
- Unity Catalog. Het register: definities, eigenaren, herkomst per veld en rechten per rol, over alle werkruimtes heen.
- Jobs en pipelines. Het uitvoerwerk: geplande of gebeurtenisgestuurde verwerking, met declaratieve pipelines voor de brons-zilver-goud-stappen.
- SQL warehouses. De bevraging: gewone SQL voor rapportage en dashboards, op dezelfde opslag.
- MLflow en model serving. Het modelwerk: experimenten vastleggen, modellen versioneren en als endpoint aanbieden.
- Notebooks en clusters. De werkplek voor engineering en analyse, met rekenkracht die aan- en uitgaat.
Belangrijk detail voor bestuur en inkoop: de gegevens staan in open formaat in je eigen opslagomgeving. Je kunt er met andere gereedschappen bij, en een latere overstap is een migratie van verwerking, niet van je hele archief.
Waar het past
Geen ranglijst maar een profiel: waar het platform sterk in is en waar iets anders logischer is.
Databricks is sterk bij veel data, gemengde werklasten en teams die zowel analyseren als modellen bouwen. Een klassiek datawarehouse blijft prima als de vraag stabiel en tabellair is. Microsoft Fabric ligt dichter bij organisaties die volledig in het Microsoft-landschap zitten en dat ook willen blijven. Snowflake wordt vaak gekozen als SQL en rapportage het zwaartepunt zijn en er weinig eigen engineering is.
De keuze hangt zelden op functionaliteit. Ze hangt op waar je team al thuis is, hoeveel domeinen tegelijk moeten leveren en hoe streng het toezicht op toegang moet zijn.
De vragen die de keuze werkelijk bepalen
De keuze valt op organisatie en toezicht, niet op een functielijst.
Stel deze vier vragen voordat je een platform kiest, en schrijf de antwoorden op. Ze wegen zwaarder dan elke vergelijkingstabel: hoeveel domeinen leveren tegelijk, waar staat je team al thuis, hoe streng is het toezicht op toegang, en wat moet er over drie jaar nog kunnen zonder overstap.
Wat het kost, in grote lijnen
Databricks rekent voor rekenkracht per verbruikseenheid, bovenop de opslag- en netwerkkosten van je cloudleverancier. Dat betekent twee dingen in de praktijk. Ten eerste zijn kosten stuurbaar: clusters die uitgaan, kleinere warehouses en goed gepartitioneerde tabellen schelen direct geld. Ten tweede zijn kosten zichtbaar per werklast, wat het mogelijk maakt om een dure vraag te herkennen voordat hij een gewoonte wordt.
Wat het duur maakt is bijna nooit het platform zelf. Het zijn pijplijnen die niemand meer gebruikt, dezelfde bewerking op drie plekken, en tabellen die elk kwartier verversen terwijl het besluit maandelijks valt.
Wat het niet oplost
Databricks maakt je definities niet eenduidig. Het brengt geen eigenaarschap aan, schrijft geen data contracten en bepaalt niet wat "op tijd geleverd" betekent. Een platform kan afdwingen wat je hebt afgesproken; het kan de afspraak niet voor je maken.
Dat is geen kritiek op het gereedschap, maar wel de reden dat een platformmigratie zelden het probleem oplost waarvoor hij is gestart. Wie met vier versies van de omzet begint, heeft na de migratie vier versies in een nieuwe omgeving.
Hoe een eerste inrichting eruitziet
Een werkbare start is klein en volledig, niet groot en half:
- Eén catalogusstructuur. Werkruimtes, rechten en naamgeving één keer bedacht, voordat er tabellen bij komen.
- Twee bronnen, brons tot goud. Voor één vraag die het bedrijf elke maand stelt.
- Definities erbij. Elk goud-veld heeft een definitie in woorden en een eigenaar met een naam.
- Rechten per rol. Ingericht in de catalogus, niet in het dashboard.
- Kosten en versheid gemeten. Zodat het gesprek over de volgende stap over getallen gaat.
Daarna is uitbreiden een herhaling van hetzelfde patroon, en dat is precies de bedoeling.
Waar het bij ons in past
Wij zetten Databricks altijd samen met de gestuurde laag neer: eigenaarschap per domein, vastgelegde betekenis en herleidbaarheid tot de bron. Hoe die opzet eruitziet, staat op de motor. Wil je het eigenaarschap per domein organiseren, lees dan wat is een data mesh.
Over de uitgever
Datahub
Redactie Datahub
Stukken zonder persoonlijke auteur zijn geschreven en nagelezen door het team van Datahub. Wij bouwen governed datafundamenten voor logistiek, retail en industrie en publiceren alleen cijfers die wij zelf hebben gemeten of in een primaire bron hebben gelezen.
Waarom deze bron
- Elke publicatie wordt nagelezen voordat die live gaat
- Cijfers volgen de methodologie op /onderzoek/methodologie
Schrijft over: Datafundamenten · AI-gereedheid
Meer over het team