Begrip
    Begrippen
    Begrippen

    Onderdeel van Het bedrijfsbrein: waar de kennis van je organisatie gaat wonen

    Wat is Databricks?

    Databricks is een lakehouse-platform: opslag, verwerking, catalogus en modellen op één plek. Wat het wel doet, wat het niet doet, en wanneer het de juiste keuze is.

    DatahubRedactie Datahub8 min lezen
    Deel op
    Wat is Databricks?

    Databricks is een dataplatform gebouwd rond het lakehouse: de goedkope, open opslag van een data lake gecombineerd met de betrouwbaarheid en snelheid die je van een datawarehouse verwacht. Opslag, verwerking, catalogus, modellen en dashboards zitten in één omgeving.

    De praktische samenvatting: één plek waar ruwe gegevens binnenkomen, betrouwbaar worden gemaakt en bevraagd kunnen worden - zonder ze eerst naar een tweede systeem te kopiëren.

    Het lakehouse in lagen

    05Gestuurde betekenisDefinities en eigenaren bovenop het platform04GoldCijfers waarop besloten wordt03SilverOpgeschoond en samengebracht02BronzeRuwe bron, onaangetast01Opslag in je eigen omgevingOpen formaat, DeltaBrons, zilver, goud: dezelfde gegevens, oplopend in betrouwbaarheid.

    Ruwe data komt binnen zoals ze is (brons), wordt geschoond en gekoppeld (zilver), en wordt daarna vastgelegd in tabellen waar de organisatie op stuurt (goud). Delta Lake voegt transacties en versiebeheer toe, zodat je kunt terugkijken naar hoe een tabel er vorige maand uitzag - het verschil tussen een cijfer verklaren en een cijfer verdedigen.

    Unity Catalog is de laag eromheen: één plek voor definities, herkomst en toegangsrechten. Dat is precies de betekenislaag uit data architectuur, en de reden dat we het platform in veel omgevingen inzetten.

    De onderdelen die je in de praktijk gebruikt

    Databricks is één omgeving met een aantal duidelijk te onderscheiden onderdelen. Je hoeft ze niet allemaal te gebruiken, maar het helpt te weten wat waarvoor is.

    • Delta Lake. Het tabelformaat: open, met transacties, schemabeheer en tijdreizen naar eerdere versies.
    • Unity Catalog. Het register: definities, eigenaren, herkomst per veld en rechten per rol, over alle werkruimtes heen.
    • Jobs en pipelines. Het uitvoerwerk: geplande of gebeurtenisgestuurde verwerking, met declaratieve pipelines voor de brons-zilver-goud-stappen.
    • SQL warehouses. De bevraging: gewone SQL voor rapportage en dashboards, op dezelfde opslag.
    • MLflow en model serving. Het modelwerk: experimenten vastleggen, modellen versioneren en als endpoint aanbieden.
    • Notebooks en clusters. De werkplek voor engineering en analyse, met rekenkracht die aan- en uitgaat.

    Belangrijk detail voor bestuur en inkoop: de gegevens staan in open formaat in je eigen opslagomgeving. Je kunt er met andere gereedschappen bij, en een latere overstap is een migratie van verwerking, niet van je hele archief.

    Waar het past

    Waar Databricks sterk inisGroot volume en zware verwerkingOpen formaat, data blijft in je eigenomgevingEngineering, analyse en AI op dezelfdeopslagMeegroeien zonder overstapWat het niet voor jeoplostWelke definitie van marge geldtWie over een begrip gaatOf een antwoord te herleiden isOf de vergadering het vertrouwtGeen ranglijst maar een profiel: waar het platform sterk in is en waar iets anders logischer is.

    Databricks is sterk bij veel data, gemengde werklasten en teams die zowel analyseren als modellen bouwen. Een klassiek datawarehouse blijft prima als de vraag stabiel en tabellair is. Microsoft Fabric ligt dichter bij organisaties die volledig in het Microsoft-landschap zitten en dat ook willen blijven. Snowflake wordt vaak gekozen als SQL en rapportage het zwaartepunt zijn en er weinig eigen engineering is.

    De keuze hangt zelden op functionaliteit. Ze hangt op waar je team al thuis is, hoeveel domeinen tegelijk moeten leveren en hoe streng het toezicht op toegang moet zijn.

    De vragen die de keuze werkelijk bepalen

    VRAAG DIE JE STELTWAT HET ANTWOORD BEPAALTHoeveel domeinen leveren tegelijk?Of zelfbediening en catalogus nodigzijnWaar staat je team al thuis?Hoeveel overdracht en opleiding hetkostHoe streng is het toezicht optoegang?Of rechten per rij en herkomst perveld moetenWat moet er over drie jaar nogkunnen?Of open formaat een eis is of eengemakDe keuze valt op organisatie en toezicht, niet op een functielijst.

    Stel deze vier vragen voordat je een platform kiest, en schrijf de antwoorden op. Ze wegen zwaarder dan elke vergelijkingstabel: hoeveel domeinen leveren tegelijk, waar staat je team al thuis, hoe streng is het toezicht op toegang, en wat moet er over drie jaar nog kunnen zonder overstap.

    Wat het kost, in grote lijnen

    Databricks rekent voor rekenkracht per verbruikseenheid, bovenop de opslag- en netwerkkosten van je cloudleverancier. Dat betekent twee dingen in de praktijk. Ten eerste zijn kosten stuurbaar: clusters die uitgaan, kleinere warehouses en goed gepartitioneerde tabellen schelen direct geld. Ten tweede zijn kosten zichtbaar per werklast, wat het mogelijk maakt om een dure vraag te herkennen voordat hij een gewoonte wordt.

    Wat het duur maakt is bijna nooit het platform zelf. Het zijn pijplijnen die niemand meer gebruikt, dezelfde bewerking op drie plekken, en tabellen die elk kwartier verversen terwijl het besluit maandelijks valt.

    Wat het niet oplost

    Databricks maakt je definities niet eenduidig. Het brengt geen eigenaarschap aan, schrijft geen data contracten en bepaalt niet wat "op tijd geleverd" betekent. Een platform kan afdwingen wat je hebt afgesproken; het kan de afspraak niet voor je maken.

    Dat is geen kritiek op het gereedschap, maar wel de reden dat een platformmigratie zelden het probleem oplost waarvoor hij is gestart. Wie met vier versies van de omzet begint, heeft na de migratie vier versies in een nieuwe omgeving.

    Hoe een eerste inrichting eruitziet

    Een werkbare start is klein en volledig, niet groot en half:

    1. Eén catalogusstructuur. Werkruimtes, rechten en naamgeving één keer bedacht, voordat er tabellen bij komen.
    2. Twee bronnen, brons tot goud. Voor één vraag die het bedrijf elke maand stelt.
    3. Definities erbij. Elk goud-veld heeft een definitie in woorden en een eigenaar met een naam.
    4. Rechten per rol. Ingericht in de catalogus, niet in het dashboard.
    5. Kosten en versheid gemeten. Zodat het gesprek over de volgende stap over getallen gaat.

    Daarna is uitbreiden een herhaling van hetzelfde patroon, en dat is precies de bedoeling.

    Waar het bij ons in past

    Wij zetten Databricks altijd samen met de gestuurde laag neer: eigenaarschap per domein, vastgelegde betekenis en herleidbaarheid tot de bron. Hoe die opzet eruitziet, staat op de motor. Wil je het eigenaarschap per domein organiseren, lees dan wat is een data mesh.

    Over de uitgever

    Datahub

    Redactie Datahub

    Stukken zonder persoonlijke auteur zijn geschreven en nagelezen door het team van Datahub. Wij bouwen governed datafundamenten voor logistiek, retail en industrie en publiceren alleen cijfers die wij zelf hebben gemeten of in een primaire bron hebben gelezen.

    Waarom deze bron

    • Elke publicatie wordt nagelezen voordat die live gaat
    • Cijfers volgen de methodologie op /onderzoek/methodologie

    Schrijft over: Datafundamenten · AI-gereedheid

    Meer over het team

    Volgende stap

    Zien wat er nu al in jouw organisatie zit?

    Laat je gegevens achter. We nemen contact op en plannen een scan. Binnen dertig dagen zie je één concreet resultaat.

    Geen nieuwsbrief, geen doorverkoop. Alleen dit gesprek.

    Reacties

    Reacties worden eerst gelezen door de redactie en daarna geplaatst.

    Reageren kan met je Google- of Apple-account, of met je zakelijke e-mailadres.

    Log in om te reageren