Overslaan naar hoofdinhoud
Pulse
Leestijd, 3 min.

Er wordt ontzettend veel data verzameld en dat wordt alleen maar meer, zoveel was me al duidelijk. Soms gestructureerd, maar vaak ook niet. We noemen het Big Data of advanced analytics en het staat verdeeld over enkele of zelfs honderden servers. Dat je met de juiste tooling verborgen schatten uit die data tevoorschijn kan toveren, haalde de avonturier in mij naar boven. Met een schatkaart in de vorm van een zoekmachine ging ik op zoek naar gereedschap.

Hoe moeilijk kan het zijn?

Al snel kwam ik erachter dat Hadoop en Big Data bijna onlosmakelijk met elkaar verbonden zijn. Mooi, want Hadoop wordt ondersteund op Microsoft Azure door middel van HDInsight. “Hoe moeilijk kan het zijn?”, dacht ik. Ik installeer simpelweg een Hadoop-cluster met de bijbehorende tools en ik kan aan de slag. Ik had er een middag voor ingeruimd. Mensen die dit ook hebben geprobeerd moeten nu waarschijnlijk lachen, want inderdaad: een Hadoop-cluster installeren, dat doe je niet even. Een Hadoop-cluster configureren en beheren? Dat is helemaal een verhaal apart.

Het kan natuurlijk aan mij liggen, maar ik vind Hadoop echt ontzettend complex. Nadat ik uitgevist had hoe de data gestructureerd was, moest het nog geprepareerd worden om een analyse te kunnen maken. Dat alles via scripting en de Command Line. Dat moet toch makkelijker kunnen, dacht ik zo. Als Microsoftie ben ik immers dol op interfaces ?

En ja, het kan dus inderdaad makkelijker, met Cloudera! Dit is een van de Hadoop-distributies die het leven een stuk eenvoudiger maken. Cloudera geeft mij een grafische interface om Hadoop heen, precies waar ik naar op zoek was. Je kunt het vergelijken met een grafische interface voor bijvoorbeeld Linux. Misschien vind je me nu een watje, maar ik hou ervan. Het mooie aan Cloudera is dat er automatisch een aantal tools worden bijgeleverd, die je anders zelf zou moeten installeren.

Cloudera Analysetools

Big Data kan van alles zijn en het kan overal staan. Dat is wat plat gezegd, maar waar het op neerkomt is dat het kan gaan om zowel gestructureerde data als ongestructureerde data, bijvoorbeeld zowel foto’s als tweets. En dan kan het ook nog eens op verschillende servers opgeslagen staan, met verschillende filesystems. Cloudera zorgt ervoor dat je hier niets van merkt. Het helpt je de data te structureren en biedt bovendien Hive, een tool om gestructureerde data te analyseren. De syntax van Hive lijkt veel op de query-taal SQL, die ik gelukkig wel kende. Het geeft me zelfs de mogelijkheid om mijn tabellen vanuit Cloudera naar SQL of MSAcces te importeren.

Bovendien kan ik op Cloudera met MapReduce alle typen data analyseren. Praktisch! Helaas kom ik er in de praktijk al snel achter, dat ik bij lange na niet genoeg ervaring met Java heb om hiermee aan de slag te kunnen. Zelfs voor de meest eenvoudige instructie is een flinke lap code nodig. Te veel om even aan de buurjongen te vragen. Gelukkig is er PiG, dat qua syntax op SQL lijkt. Het genereert MapReduce code, een buurjongen in toolvorm. PiG bevat uitgebreide datamanipulatie en -statistiekcommando’s, maar je kunt ook relatief eenvoudig gestructureerde data maken van semi-gestructureerde data. Met Hive analyseer je die vervolgens verder. Het heeft wel wat beperkingen ten opzichte van MapReduce, maar daar staat het tegenover dat het alle soorten data kan verwerken.

Met Hadoop en Cloudera, sta ik aan het begin van mijn data-avontuur. En het mooiste is dat het gewoon in de Azure Marketplace staat. Voor de echte liefhebbers is zelfs de Enterprise Data Hub editie in de Marketplace beschikbaar. Dankzij Cloudera was mijn Hadoop-omgeving écht up & running in een middagje. Ik ben benieuwd naar jouw ervaringen. Waar loop jij tegenaan? Laat het me weten in de comments!

Meer weten over Cloudera? De CTO van Cloudera legt alles uit over zijn bedrijf in dit interview:

Leer van klantervaringen met het gratis Cloud Strategy eBook

Ontdek de bewezen methoden om je business in de cloud te brengen

Ontdek meer gerelateerde artikelen per branche:

Educatie

Financiële dienstverlening

  • uitzicht op een stad

    Gegevens verzamelen is water besparen

    Het ruim 140 jaar oude financiële dienstverleningsbedrijf Ibercaja zet zich volledig in voor de noordoostelijke regio van Spanje. Om de klanten op het platteland te steunen en de lokale problemen met waterschaarste op te lossen, helpt het bedrijf de boeren nu met de digitale transformatie van hun gewasbeheer. Essentieel in deze transformatie zijn de Internet […]

  • overleg op kantoor tussen twee vrouwen

    Snellere productinnovatie dankzij cloud HPC

    Snel, sneller snelst is het adagium bij productinnovatie in de hightechsector. Producten hebben een steeds kortere levensduur en moeten rap na introductie alweer opgevolgd worden door superieure exemplaren. “Om in de race met de concurrentie voorop te lopen, moeten de research and development-afdelingen ongehinderd modellen kunnen doorrekenen. Vaak worden ze beperkt in hun mogelijkheden door […]

Government

Overheid

Productie

Retail

Zorg

  • Een vrouw die een scan krijgt

    Predictive maintenance verbetert de levenskwaliteit van kankerpatiënten

    Ruim 17 miljoen mensen worden jaarlijks getroffen door kanker en dat aantal zal alleen maar toenemen in de komende jaren. Daarom zijn efficiënte en voordelige behandelingen van levensbelang. Dankzij Microsoft Azure IoT heeft IBA Worldwide, een vooraanstaande ontwikkelaar van medische apparatuur voor de behandeling van kanker, de onderhoudskosten van de apparaten weten te verlagen en […]

  • Startup Stories – ‘De zorg is geen speeltuin voor probeersels’

    Startup Stories – ‘De zorg is geen speeltuin voor probeersels’

    In Startup Stories delen we de verhalen, best practices, levenslessen van Nederlandse start en scaleups, zodat jij je apps of business nog sneller kunt bouwen. Dit keer zijn we in gesprek met Berend Jutte, co-founder van Attendi. Attendi is in 2021 genomineerd voor de Zorginnovatieprijs. “Wij zetten slimme technologie in om de medische administratie, zoals verslaglegging en documentatie, van […]

Ontdek meer gerelateerde artikelen per dossier:

Digitale transformatie

Klantverhalen

  • Startup Stories – ‘De zorg is geen speeltuin voor probeersels’

    Startup Stories – ‘De zorg is geen speeltuin voor probeersels’

    In Startup Stories delen we de verhalen, best practices, levenslessen van Nederlandse start en scaleups, zodat jij je apps of business nog sneller kunt bouwen. Dit keer zijn we in gesprek met Berend Jutte, co-founder van Attendi. Attendi is in 2021 genomineerd voor de Zorginnovatieprijs. “Wij zetten slimme technologie in om de medische administratie, zoals verslaglegging en documentatie, van […]

Partners

  • Drie redenen waarom BIM Cloud Workspace jouw bouwbedrijf op voorsprong zet

    Drie redenen waarom BIM Cloud Workspace jouw bouwbedrijf op voorsprong zet

    Ik vertel je niets nieuws als ik zeg dat veel bouwbedrijven een uitdaging hebben op het gebied van hun applicatielandschap. Bedrijven die zich bezighouden met bijvoorbeeld het ontwerp van gebouwen of tunnels maken nou eenmaal gebruik van applicaties die veel (grafische) rekenkracht eisen van hun computersystemen. Dus zien we nog steeds BIM-modelleurs slepen met zware […]

Pers

  • Intercept

    Intercept is Microsoft Country Partner Of The Year 2020

    Intercept is uitgeroepen tot Microsoft Country Partner of the Year 2020. Een prestigieuze prijs die uitsluitend wordt uitgereikt aan partners die zich onderscheiden in een vooraanstaand veld. Deze award is de bekroning op de jarenlange samenwerking tussen Intercept en Microsoft. Intercept wordt onder meer erkend voor het leveren van toonaangevende en waardevolle oplossingen voor ISV’s. […]

Pers / Nieuws

  • een man met een hololens

    Verandering in een stroomversnelling

    De eerste fase van de COVID-19-uitbraak stond vooral in het teken van snelle oplossingen en crisismanagement om de dagelijkse gang van zaken in goede banen te leiden. Nu gaan we over naar een nieuwe fase, een hybride realiteit, waarin we zowel thuis als op locatie werken. Een tijd waarin verzorgingstehuizen weer voorzichtig opengaan en bedrijven […]

Security & Privacy

  • Bouwen aan cloudvertrouwen

    Bouwen aan cloudvertrouwen

    In een tijd waarin technologische ontwikkelingen elkaar in rap tempo opvolgen, is vertrouwen misschien wel het belangrijkste onderwerp. Zoals Brad Smith, President & Chief Legal Officer van Microsoft, het recent zei: “Technology needs to advance, but timeless values need to endure. Privacy and the proper rule of law stand among these timeless values.” Waar het […]

Tips

  • Innoveren in een snel veranderende wereld doe je zo

    Innoveren in een snel veranderende wereld doe je zo

    Je wilt innoveren, een sterke positie opbouwen of behouden. In een snel veranderende wereld betekent dat beter en anders kijken naar je businessmodel. Het draait vooral om een goede visie en het valideren van je dienst of product. In deze serie over businessmodellen gaat Niels Lohuis (Product Marketing Manager Microsoft Nederland) in gesprek met de […]

Webinars

  • een close-up van een logo

    Microsoft Power Platform Virtual Training Day

    The Microsoft Power Platform Virtual Training Day will cover everything you need to know about building and managing innovative business solutions. You’ll discover how to connect data to analyze real-time business performance, act on insights with custom-built apps, and automate workflows to improve how people work. All sessions were recorded at Microsoft Ignite in Orlando […]