Fire niveauer afgør hvad der må sendes til en AI. PUBLIC kan gå hvorhen som helst, INTERNAL til systemer I kontrollerer, CONFIDENTIAL kun med kontraktlige garantier mod træning og videregivelse, og RESTRICTED sendes aldrig. Klassifikationen laves på kilden, ikke på den enkelte forespørgsel.
Du har økonomital, HR-data, mødereferater, konkurrentanalyser og kundesegmenteringer.
Du vil lade en AI analysere noget af det. Spørgsmålet er hvor meget.
Svaret er ikke det hele. Men det er mere end de fleste tror, hvis klassifikationen er lavet på forhånd.
De fire niveauer
PUBLIC
Alt der allerede er offentligt tilgængeligt.
Eksempler: brancherapporter, konkurrenters offentliggjorte regnskaber, jeres egne udgivne cases, offentlige markedsanalyser, priser I selv har publiceret.
Kan sendes hvorhen som helst. Der er ingen sikkerhedsgrænse, fordi der ikke er noget at beskytte.
INTERNAL
Virksomhedsspecifikt, men ikke fortroligt.
Eksempler: interne strateginoter, mødereferater uden personoplysninger, jeres egen segmenteringsmodel, procesdokumentation, interne roadmaps.
Kan sendes til systemer I har kontrol over. I praksis betyder det behandling inden for EU, et revisionsspor, og en kontrakt der siger at data ikke videregives.
CONFIDENTIAL
Ting der skader forretningen hvis de bliver kendt.
Eksempler: jeres forretningsmodel og indtjeningslogik, partnervilkår, prisbeslutninger der ikke er udmeldt, HR-vurderinger, overvejelser om opkøb.
Bemærk at eksakte tal ikke hører til her. Selve omsætningstallet, dækningsgraden og EBITDA er RESTRICTED, se nedenfor. Forskellen går på præcision: at I tjener penge på abonnementer er CONFIDENTIAL, hvad abonnementerne indbragte sidste år er ikke.
Her skal betingelserne være skrevet ned, ikke antaget. Tre ting skal være på plads: behandlingen sker et sted I har accepteret, data bruges ikke til at træne modeller, og der findes et spor over hvad der blev sendt hvornår.
Bemærk at det ikke kræver at modellen kører på jeres egen server. Det er en udbredt misforståelse. Det kræver at betingelserne er kontraktlige frem for underforståede. En lokal model uden logning er ikke mere fortrolig end en cloudmodel med en ordentlig aftale.
RESTRICTED
Data der aldrig skal til en model.
Eksempler: CPR-numre, kreditkortoplysninger, adgangskoder og tokens, helbredsoplysninger, private kontaktoplysninger koblet til navne. Og eksakte økonomiske nøgletal: årsomsætning, månedsomsætning, dækningsgrad, nettomargin og EBITDA.
Sendes ikke. Heller ikke til EU-systemer, heller ikke til lokale. Skal analysen bruge konteksten omkring den slags data, arbejder den med aggregerede eller pseudonymiserede udgaver.
Grænsen mellem CONFIDENTIAL og RESTRICTED er den eneste der er svær, og tommelfingerreglen går på to ting: personoplysninger er altid RESTRICTED, og det samme er eksakte tal. Beskrivelser, vilkår og vurderinger er CONFIDENTIAL.
Den anden halvdel overrasker de fleste, for et omsætningstal handler jo om forretningen og ikke om et menneske. Men netop de felter er markeret RESTRICTED i platformens klassifikation og fjernes før noget sendes, så en analyse der bygger på dem vil mangle dem uden at sige det højt. Bemærk at marginer ikke er en vej udenom: gross_margin, net_margin og ebitda_margin er selv RESTRICTED, og det samme gælder kundeanskaffelsespris, kundelivstidsværdi og eksakte priser. Skal en analyse forholde sig til økonomien, så beskriv modellen frem for tallene. Indtjeningslogik og omkostningsstruktur er CONFIDENTIAL og må gerne med; det er cifrene der ikke må.
Hvad der håndhæver klassifikationen
En klassifikation uden håndhævelse er et regneark ingen åbner. I praksis er der tre lag, og de kan noget forskelligt.
Feltniveau. Felter der er markeret følsomme fjernes ud fra hvad slags model der arbejdes med, før noget forlader systemet. Det her er det eneste lag der er kategorisk. Det gætter ikke, det slår op, og det er derfor RESTRICTED kan garanteres.
Legitimationsoplysninger. En scanner fanger nøgler, adgangskoder, tokens og certifikater i fritekst.
Personoplysninger under transport. Navne, e-mails, telefonnumre, CPR, IBAN og kortnumre håndteres af det lag der ligger nærmest udbyderen.
De to sidste er mønstergenkendelse, og det er værd at være præcis om hvad det betyder: de kan fejle i begge retninger. De fanger ikke alt, og de blokerer nogle gange noget harmløst. De er et sikkerhedsnet under klassifikationen, ikke en erstatning for den.
Det er også hvorfor det ikke virker at springe klassifikationen over og regne med at scanneren fanger det. Et dokument der hedder "kundeliste Q3" indeholder personoplysninger uanset om der står et CPR-nummer i det.
Lav klassifikationen på en halv time
1. Skriv jeres datakategorier ned. For de fleste virksomheder er der fem til otte: markedsdata, interne strateginoter, økonomital, løn og HR, kundedata, kontrakter.
2. Giv hver kategori et niveau. Én linje per kategori. Mødereferater er INTERNAL. Lønsummer er CONFIDENTIAL. Kundelisten med kontaktoplysninger er RESTRICTED.
3. Aftal reglen ved tvivl. Er I i tvivl, tag niveauet over. Det koster lidt besvær og ingenting i risiko.
4. Sig det til dem der leverer data. Den der uploader et dokument skal vide hvilket niveau det har, før det uploades. Ikke bagefter.
Punkt 4 er det der afgør om det virker. Klassifikationen er ikke et dokument, den er en vane hos de fem personer der faktisk lægger filer ind.
Hvad du får ud af det
Uden klassifikation sender I alt og håber. I ved det ikke, og I kan ikke dokumentere det.
Med klassifikation sender I det der er trygt, og I kan gøre rede for det. Kommer der et spørgsmål fra revisor eller Datatilsynet, kan I vise hvad der blev sendt, hvornår og af hvem. Den dokumentation er både sikkerhed og compliance, og den findes kun hvis klassifikationen lå der på forhånd.
Hvad EU AI Act oven i det kræver af dokumentation, står i EU AI Act for SMV'er, og hvordan det spiller sammen med GDPR i det daglige, står i GDPR og AI-assisteret strategi.
Derfor er RESTRICTED bundet til nodetypen hos os
Den almindelige måde at implementere klassifikation på er som en indstilling. Det holder indtil nogen har travlt.
I 360° Sprint er RESTRICTED-felter derfor bundet til nodetypen selv. De sendes aldrig til nogen AI-udbyder, uanset hvem der arbejder i systemet, og det kan ikke slås fra. Det er en begrænsning, og den er med vilje: et sikkerhedsniveau der kan konfigureres væk er reelt et sikkerhedsniveau der er konfigureret væk.
Oven på ligger secrets-scanneren og håndteringen af personoplysninger under transport. Der er også en kontrol af svaret på vej ud, men den er ikke aktiv på alle veje gennem systemet, så den er et supplement og ikke en garanti.
Hvor behandlingen sker, og hvorfor det er et spørgsmål om sted frem for om leverandørens nationalitet, er uddybet i AI og datasikkerhed i EU.
Har I ikke klassificeret endnu, så start med ét spørgsmål: hvilke data ville være et problem hvis de blev offentlige i morgen? Dem er mindst CONFIDENTIAL. Resten falder hurtigt på plads.
Klassifikationen er første trin. Resten af beslutningen står i må vi bruge AI på vores egne data.
Hvad klassifikationen gør muligt i selve strategiarbejdet, står i AI til virksomhedsstrategi.