Ga naar de inhoud
Software8 min leestijd

Automatisering van AI-ontwikkeling: AutoML, MLOps en ROI

Door Intyb Technologies·
Automatisering van AI-ontwikkeling met AutoML en MLOps
Afbeelding: Unsplash

Automatisering van AI-ontwikkeling is nuttig wanneer ze herhaalbaar werk wegneemt zonder de beslissingen te verhullen waarvoor nog steeds een ervaren persoon nodig is. AutoML kan experimenten met modellen en parameters uitvoeren. MLOps kan training, tests, releases en monitoring consistenter maken. Geen van beide bepaalt of een model het juiste probleem oplost, of de gegevens geschikt zijn en of het resultaat veilig kan worden gebruikt.

De praktische vraag is daarom niet: “Hoeveel kunnen we automatiseren?” De vraag is: “Levert automatisering meer bruikbare, geaccepteerde modelreleases op voor de tijd en het geld die we eraan besteden?” Om die vraag te beantwoorden, zijn een nulmeting, een gecontroleerde proef en operationele kosten waarin menselijke beoordeling is opgenomen nodig.

Wat AutoML en MLOps automatiseren

AutoML omvat onderdelen van modelontwikkeling die repetitief maar computationeel veeleisend zijn. Een team definieert het probleem, levert gelabelde gegevens aan, kiest een evaluatiemaatstaf en stelt beperkingen vast. Het platform kan vervolgens combinaties van algoritmen, kenmerken en parameters uitproberen. Microsofts overzicht van Azure AutoML beschrijft dit als een iteratief trainingsproces met door de gebruiker gedefinieerde parameters en stopcriteria. Er zijn ook mensen nodig om de taak te identificeren, het experiment te configureren en de resultaten ervan te beoordelen.

MLOps richt zich op het bredere traject van een experiment naar een operationeel systeem. De MLOps-architectuurgids van Google Cloud behandelt automatisering en monitoring voor integratie, tests, releases, implementatie en infrastructuur. De gids maakt een belangrijk onderscheid: het testen van een ML-systeem omvat gegevens, schema’s en modelkwaliteit, en niet alleen applicatiecode. Monitoring in productie moet ook veranderingen in gegevens en modelgedrag kunnen detecteren.

Deze tools kunnen handmatige overdrachten tussen stappen verminderen, experimenten reproduceerbaar maken en duidelijkere registraties bieden van wat is getraind en uitgebracht. Ze nemen gegevensvoorbereiding, domeinkennis, beveiligingsbeoordeling, modelevaluatie of operationeel eigenaarschap niet weg.

Ontwikkelaar die een geautomatiseerde machinelearningpijplijn beoordeelt
Foto door Fotis Fotopoulos op Unsplash

Waar automatisering kan helpen

Een workflow met herhaalde experimenten of releases is een nuttig uitgangspunt. AutoML kan helpen om kandidaatmodellen voor een classificatie-, regressie- of prognosetaak te vergelijken. Een pijplijn kan helpen wanneer voor elk goedgekeurd model dezelfde stappen voor validatie, verpakking en implementatie worden herhaald. Monitoring kan een team helpen om ontbrekende invoergegevens, veranderingen in distributies, latentieproblemen of kwaliteitsverlies eerder op te merken.

Met low-code-interfaces kunnen analisten en domeinspecialisten een experiment configureren of resultaten inspecteren, maar toegang tot een interface is niet hetzelfde als de deskundigheid om een model goed te keuren. Iemand moet nog steeds de doelvariabele, steekproeftrekking, datalekken, evaluatieopzet en gevolgen van fouten controleren. Hoe ingrijpender de beslissing, hoe sterker die controles moeten zijn.

Gezondheidszorg

In de gezondheidszorg kan automatisering gecontroleerde experimenten ondersteunen voor taken zoals beeldclassificatie, risico-inschatting of operationele prognoses. Elk model dat in klinisch werk wordt gebruikt, vereist nog steeds geschikte gegevens, klinische evaluatie, privacy- en beveiligingsmaatregelen, een beoordeling van de regelgeving waar van toepassing en monitoring binnen de populatie waarin het wordt gebruikt. Een veelbelovende offlinescore toont niet aan dat er sprake is van voordeel of veiligheid voor patiënten.

Financiën

Voor financiële workflows kunnen teams experimenten voor fraudesignalen, documentclassificatie of prognoses automatiseren. Gebruik in productie vereist aandacht voor gegevenstoegang, uitlegbaarheid, vooringenomenheid, auditregistraties, governance rond modelrisico’s en terugvalprocedures. Geautomatiseerde hertraining mag een model niet automatisch promoveren, tenzij het de afgesproken tests doorstaat en de organisatie heeft bepaald wie de wijziging mag goedkeuren.

Productie en retail

Productie- en retailbedrijven kunnen modellen testen voor vraagprognoses, inspectie, voorraadplanning of onderhoud. De waarde hangt af van de gegevenskwaliteit en van de manier waarop de voorspelling een daadwerkelijke beslissing verandert. Een prognose die iets nauwkeuriger is, kan nog steeds weinig waarde hebben als ze te laat beschikbaar is, niet aan planningssystemen kan worden gekoppeld of meer beoordelingswerk veroorzaakt dan ze wegneemt. Ons artikel over automatisering van personeelstaken en ROI bespreekt eveneens de noodzaak om werk binnen zijn context te meten, terwijl AI voor e-commerce verwante toepassingen in de retail beschrijft.

Meten of automatisering rendeert

Begin met het meten van het huidige handmatige proces voor een representatieve reeks modelwijzigingen. Registreer het aantal actieve uren dat wordt besteed aan gegevensvoorbereiding, het opzetten van experimenten, toezicht op training, evaluatie, verpakking, implementatie en incidentafhandeling. Tel hoeveel kandidaatmodellen zijn beoordeeld, hoeveel er zijn afgewezen en hoeveel releases voor gebruik zijn geaccepteerd. Registreer de verstreken tijd afzonderlijk: wachten op rekencapaciteit is niet hetzelfde als personeelsinzet.

Pas vervolgens de geautomatiseerde aanpak toe op vergelijkbaar werk en leg dezelfde maatstaven vast. Neem alle kosten op, en niet alleen het platformabonnement:

  • handmatige inzet voor engineering en datawetenschap vóór en na de automatisering;
  • kosten voor rekenkracht tijdens training, opslag en het volgen van experimenten;
  • kosten voor inferentie en dienstverlening bij realistische verkeersvolumes;
  • platformlicenties, orkestratie en observeerbaarheid;
  • beoordelingstijd voor gegevens, modelkwaliteit, beveiliging en acceptatie door domeinspecialisten;
  • onderhoud, mislukte uitvoeringen, rollbacks en afhandeling van uitzonderingen.

Bruikbare, geaccepteerde modelreleases vormen een betere noemer dan voltooide experimenten. Een platform dat honderden tests uitvoert, kan de kosten verhogen zonder het aantal of de kwaliteit te verbeteren van de modellen die het team op verantwoorde wijze kan gebruiken. Vergelijk de totale kosten per geaccepteerde release, de doorlooptijd tot een geaccepteerde release, de beoordelingsinspanning, de betrouwbaarheid in productie en de bedrijfsmaatstaf die voor de toepassing is vastgesteld.

Een eenvoudige beslisregel is om door te gaan wanneer de gemeten waarde van de verbeterde capaciteit, betrouwbaarheid of resultaten de bijkomende operationele kosten overstijgt met een marge die de organisatie aanvaardbaar vindt. Als het voordeel voornamelijk bestaat uit personeelscapaciteit en niet uit geld dat daadwerkelijk uit een budget verdwijnt, benoem het dan ook zo. Bereken dit na de ingebruikname opnieuw, omdat inferentievolumes, beoordelingspercentages en modelgedrag kunnen veranderen.

Bouw controles in de pijplijn in

Automatisering moet stoppen wanneer een controle mislukt, en mag die controle niet omzeilen. Een praktische pijplijn kan gegevensschema’s valideren, code testen, modelmaatstaven vergelijken met een goedgekeurde nulmeting, de herkomst registreren en een beoordeling vereisen vóór promotie. Een implementatie moet kunnen worden teruggedraaid. Monitoring moet de gezondheid van de dienst en het modelgedrag omvatten, met een eigenaar en een reactieprocedure voor elke waarschuwing.

Automatische hertraining is alleen gepast wanneer nieuwe gegevens, evaluaties en promotieregels betrouwbaar zijn. In veel omgevingen is geautomatiseerde training gevolgd door menselijke goedkeuring het veiligere ontwerp. De MLOps-richtlijnen van Google behandelen validatie van gegevens en modellen eveneens als verplichte onderdelen van een geautomatiseerde productiepijplijn, en niet als optioneel werk na de implementatie.

Een praktische volgende stap

Kies één modelworkflow met terugkerend handmatig werk en voldoende historische gegevens om een nulmeting vast te stellen. Meet twee of drie recente releases, met inbegrip van rekenkracht, beoordeling en afgewezen werk. Automatiseer één duidelijk afgebakende stap en vergelijk vervolgens de volgende releases aan de hand van dezelfde maatstaven. Zo krijgt het team bewijs om uit te breiden, bij te sturen of te stoppen zonder zich op een algemene besparingsclaim te baseren.

Veelgestelde vragen

Wat is automatisering van AI-ontwikkeling?
Automatisering van AI-ontwikkeling gebruikt tools zoals AutoML en MLOps-pijplijnen om herhaalbare onderdelen van experimenten, tests, verpakking, implementatie en monitoring uit te voeren. Mensen blijven verantwoordelijk voor het definiëren van het probleem en de beperkingen, het beoordelen van de gegevens en resultaten, het goedkeuren van releases en het afhandelen van uitzonderingen.
Neemt low-code-AI de behoefte aan datawetenschappers of engineers weg?
Nee. Een low-code-interface kan configuratie en experimenten toegankelijker maken, maar vervangt geen expertise op het gebied van gegevens, het domein, engineering, beveiliging of governance. De vereiste beoordeling hangt af van de toepassing en van de gevolgen van een onjuist resultaat.
Wat is de ROI van een MLOps-platform?
Er bestaat geen universeel rendement. Meet de huidige handmatige inspanning en het aantal geaccepteerde releases en vergelijk die vervolgens met het geautomatiseerde proces, waarbij u de kosten voor training, inferentie, het platform, beoordeling en onderhoud meerekent. De ROI hangt af van die gemeten kosten en resultaten, en niet alleen van het aantal geautomatiseerde experimenten.