Personvernprinsipper ved utvikling av KI
Lov på eksamen
- Datamaskin med programmeringsverktøy
- Lærebok, dokumentasjon og egne notater og programmer
Ikke åpent internett (bare noen utvalgte nettressurser), kommunikasjon med andre eller kunstig intelligens.
Kan den løses uten PC?
Alle deloppgavene kan løses uten PC.
Fra 2027 er det bare kalkulator og skriftlige hjelpemidler på del 2. Vurderingen er gjort med KI og kan inneholde feil.
Velg de tre personvernprinsippene som er mest relevante for utfordringer knyttet til utvikling og bruk av kunstig intelligens (KI), ifølge kildene fra forberedelsesdelen.
Velg ett av de tre personvernprinsippene du krysset av for i punkt a. Drøft dilemmaer og utfordringer som oppstår rundt utvikling og bruk av KI, knyttet til det prinsippet du har valgt.
Fasit
Formålsbegrensning, dataminimering og lovlighet, rettferdighet og gjennomsiktighet. Det er disse prinsippene Datatilsynets rapport «Kunstig intelligens og personvern» knytter de viktigste personvernutfordringene ved KI til.
For eksempel dataminimering: KI-modeller blir ofte bedre med mer data, og det er vanskelig å vite på forhånd hvilke opplysninger som trengs. Samtidig krever prinsippet at bare nødvendige og relevante opplysninger brukes, og at inngrepet står i forhold til formålet. En god drøfting tar for seg argumenter på begge sider og ender i en begrunnet konklusjon.
LøsningsforslagKI-generert
GDPR artikkel 5 har sju personvernprinsipper, og alle gjelder ved utvikling og bruk av KI. Datatilsynet peker i rapporten likevel ut prinsippene om rettferdighet, formålsbegrensning, dataminimering og gjennomsiktighet som de mest relevante for KI. Rettferdighet og gjennomsiktighet er samlet i ett prinsipp i listen, «lovlighet, rettferdighet og gjennomsiktighet». De tre riktige alternativene er derfor
- lovlighet, rettferdighet og gjennomsiktighet: Skjeve treningsdata kan gi diskriminerende avgjørelser, og det er vanskelig å forklare hvordan en modell kommer fram til et resultat.
- formålsbegrensning: KI frister til å gjenbruke opplysninger som er samlet inn til andre formål.
- dataminimering: KI er ofte avhengig av store mengder personopplysninger.
De fire andre prinsippene (ansvarlighet, riktighet, lagringsbegrensning og integritet og konfidensialitet) gjelder også, men er ikke de rapporten legger hovedvekten på.
Svaret nedenfor er et eksempel. Kandidaten kan like gjerne velge formålsbegrensning eller lovlighet, rettferdighet og gjennomsiktighet.
Prinsippet. Dataminimering betyr at personopplysninger skal være adekvate, relevante og begrenset til det som er nødvendig for formålet. Prinsippet handler ikke bare om antall opplysninger. Det inneholder også et krav om proporsjonalitet: Bruken skal ikke være et større inngrep i personvernet enn nødvendig.
Dilemmaet. Maskinlæring bygger på at modellen finner mønstre i store datamengder. Jo flere og mer varierte data, desto mer treffsikker blir modellen ofte. Samtidig sier prinsippet at man skal bruke så lite personopplysninger som mulig. Utviklerne står derfor mellom en best mulig modell og et best mulig personvern.
Argumenter for å bruke mye data:
- En modell som skal oppdage kreft på røntgenbilder, blir bedre og tryggere jo flere bilder den trenes på. Her kan mer data redde liv, og samfunnsnytten er stor.
- Et lite og ensidig datasett kan gi skjeve modeller. Mangler en gruppe i treningsdataene, kan modellen fungere dårlig for den gruppen. Mer data kan altså gjøre modellen mer rettferdig.
- Det er vanskelig å vite på forhånd hvilke opplysninger som er relevante. Algoritmen kan finne sammenhenger ingen hadde tenkt på, og formålet kan endre seg etter hvert som modellen lærer.
Argumenter for streng dataminimering:
- Hver ekstra personopplysning øker risikoen. Store datasett er attraktive mål for angrep, og ved en datalekkasje rammes mange.
- Irrelevante opplysninger kan gi falske sammenhenger. Datatilsynet peker på at algoritmen da kan legge vekt på tilfeldige mønstre som ikke er reelle, og modellen blir dårligere, ikke bedre.
- Mange data om hver person gjør det lettere å identifisere enkeltpersoner og lage detaljerte profiler. Det kan avsløre sensitive opplysninger (særlige kategorier) som helse, religion eller seksuell orientering, selv om de ikke er registrert direkte.
- De registrerte mister oversikten over hva som finnes om dem. Det svekker autonomien deres og tilliten til teknologien.
Mulige løsninger. Dilemmaet kan gjøres mindre. Opplysningene kan pseudonymiseres eller anonymiseres, slik at modellen lærer av data uten å vite hvem de gjelder. Syntetiske data og føderert læring, der dataene blir liggende hos eieren, er andre teknikker. Utviklerne kan også starte med få opplysninger og legge til flere bare når de kan dokumentere at det gir en bedre modell. Datatilsynet anbefaler at behovet vurderes fortløpende gjennom hele utviklingen, og at vurderingene dokumenteres.
Konklusjon. Etter en konsekvensetisk vurdering kan det være riktig å bruke store datamengder når nytten er stor, som i medisinsk diagnostikk. Pliktetikken minner likevel om at hver enkelt har rett til å bestemme over opplysninger om seg selv, uansett hvor nyttig modellen blir. Etter mitt syn betyr ikke dataminimering at KI må bygges på få data. Det betyr at utviklerne må kunne begrunne hvorfor hver opplysning trengs, og velge den minst inngripende måten å nå formålet på. Med pseudonymisering, fortløpende vurderinger og god dokumentasjon er det mulig å lage gode modeller og samtidig ivareta personvernet.