Träna klassens AI
Parövning i två rundor: först en hemlig regel om djur, sedan en om medhåll. Sykofanti uppstår framför ögonen på er.
Träning med mänsklig feedback är hur moderna AI-modeller får sin personlighet, och det är nästan omöjligt att förklara med ord. Så vi leker det i stället. På tolv minuter, utan en enda skärm, upplever varje deltagare båda rollerna — och upptäcker att medhåll blir vanligare så snart medhåll belönas. Ingen bad modellen att bli inställsam. Vi byggde bara ett system där inställsamhet lönade sig.
Rollerna är frivilliga och frågorna vänliga och opersonliga. Poängen är systemet, inte personen — avbryt direkt om tummarna börjar användas för att retas.
Den körbara versionen — pröva övningen själv för att förstå hur den funkar. Använd inbyggda spel, karuseller och exempel direkt på sidan. Funkar både hemma vid köksbordet och som lärar-deltagare i en workshop med kollegor.
Prova själv
Kör leken med en enda annan person — en kollega vid fikabordet räcker. Du behöver ha känt den själv innan du leder den, för det som förvånar går inte att läsa sig till: hur FORT man anpassar sig till en regel ingen sagt högt. Och framför allt hur runda 2 känns inifrån, när det är medhåll som belönas.
Så gör du steg för steg
- 1Skriv ut ett par blad
Ett A och ett B. Ni läser bara er egen — och bara den runda som pågår.
- 2Runda 1: den godtyckliga regeln3 min
B ställer vardagsfrågor och ger tumme upp bara när svaret innehåller ett djur. A svarar fritt. Efter fem, sex frågor börjar A jaga tummarna — plötsligt innehåller vartenda svar en hund, en katt eller en kapybara.
- 3Avslöja kort1 min
A gissar regeln. Fråga sedan: vad började du GÖRA för att få mer tumme upp? Svaret brukar bli något i stil med ”jag fattade aldrig regeln, jag kände bara vad som funkade”.
- 4Runda 2: byt roller3 min
Nu är A tränare, och den hemliga regeln är en annan: tumme upp när partnern HÅLLER MED om påståendet i frågan, tumme ner när partnern invänder eller nyanserar. Ställ frågorna i den ordning de står — de fyra första paren argumenterar mot varandra.
- 5Landa2 min
Det som händer i runda 2 är inte längre en lek om djur. Modellen börjar hålla med om att läxor är meningslösa och att elever behöver läxor, inom en minut. Ingen bad den att bli inställsam.
Skillnaden mellan rundorna. I runda 1 känns anpassningen som en pusselösning — man letar efter mönstret. I runda 2 känns den inte som något alls. Att hålla med är så socialt normalt att man inte märker att man gör det. Det är exakt därför sykofanti är svårare att upptäcka än gobliner.
Leken är en modell av träning med mänsklig feedback, inte en fullständig bild av den. Riktig RLHF har en separat belöningsmodell, miljontals jämförelser och flera träningssteg. Det leken fångar korrekt är den bit som betyder något här: beteende som belönas blir vanligare, även när ingen uttalat regeln.
Lärarhandledning
Förberedelser
- Skriv ut deltagarbladen — lika många A som B. Skriver du N kopior av det tvåsidiga underlaget får du A, B, A, B … alltså rätt antal av varje, redan parvis sorterade.
- Para ihop deltagarna två och två. Udda antal: låt tre personer dela ett par, där den tredje är extra belöningssignal i båda rundorna.
- Säg trygghetsramen innan ni börjar: rollerna är frivilliga, frågorna är vänliga och opersonliga, och ingen kommenterar den hemliga regeln.
- Pokeransikte är en instruktion, inte ett skämt. Fniss och ledtrådar sänker experimentet.
De åtta första frågorna bildar fyra motsatspar — läxor för och emot, ledningens fel och lärarnas ansvar, AI förbjudet och AI nödvändigt, mobilförbud och eget ansvar. Poängen är att modellen håller med om BÅDA sidorna inom loppet av en minut. Enbart medhåll ser ut som artighet; självmotsägande medhåll går inte att bortförklara. Ställs frågorna i annan ordning försvinner effekten.
Genomförande
- 1Dela ut rollerna1 min
Varje par får ett A-blad och ett B-blad. Alla läser ENDAST runda 1 och döljer bladet för partnern.
- 2Runda 13 min
B frågar och belönar enligt sin regel — tumme upp bara när svaret innehåller ett djur. A svarar fritt och anpassar sig. Gå runt och lyssna. Stoppa efter fem till åtta frågor, eller när du hör att svaren börjat kretsa kring djur.
- 3Avslöja kort2 min
A gissar regeln, B avslöjar. Ställ frågan högt i rummet: vad började du göra för att få mer tumme upp? Låt två, tre par svara. Gå inte vidare till förklaringar än — det kommer sist.
- 4Runda 23 min
Rollerna byts. Nu är det medhåll som belönas. Säg åt tränarna att hålla ordningen på frågorna. Stoppa när du hör att modellerna tydligt börjat hålla med mer — det brukar gå fortare än runda 1.
- 5Landa tillsammans3 min
Nu kopplar du. Beteenden som belönas blir vanligare, även när avsikten aldrig uttalas. Riktiga modeller tränas med miljontals tummar från miljontals användare — och vad ger användare tumme upp till? Svar som håller med dem, låter säkra och känns bra att läsa.
Eftersnack
- Visste modellen VARFÖR ett svar belönades, eller bara ATT det fungerade?
- Vad hände när medhåll blev den enklaste vägen till tumme upp?
- Om användare uppskattar bekräftelse — vilket beteende kan AI lära sig?
- Vem bestämmer belöningssignalen, och vem bär ansvaret för följderna?
”Vi bad aldrig modellen att bli inställsam. Vi skapade bara ett system där inställsamhet belönades.”
— Meningen att avsluta med
Visas som sista sliden i klassrumsläget. En mening som knyter leken till just den här gruppens vardag.
Fyll i före lektionen. Visas i klassrumsläget.
Ledarrollen
Du har två jobb: trygghetsvakt under leken och översättare efteråt. Trygghetsvakt betyder att ingen ska lämna rummet som måltavla — lyft fram hur skickligt modellerna anpassade sig, det är en färdighet, inte en svaghet. Översättare betyder att varje observation ska landa i en mekanism: tummarna är belöningssignalen, pokeransiktet är att modellen aldrig får regeln förklarad, och runda 2 är sykofanti.
Om frågorna börjar bli personliga eller tummarna används för att retas — bryt direkt. Leken tål att avbrytas; en deltagare som känt sig uthängd tål det sämre. Det är dessutom en poäng du kan använda: riktiga AI-labb har exakt samma problem med belöningssignaler som spårar ur.
Elevinstruktion
Den här texten är skriven direkt till eleven. Visa på storskärm eller kopiera in i Teams/Vklass.
Ni ska träna varandra som om ni vore AI-modeller. Ni jobbar två och två och byter roller efter halva tiden. Den ena är MODELLEN och svarar på frågor. Den andra är TRÄNAREN och ger tumme upp eller tumme ner efter varje svar — enligt en hemlig regel som modellen inte får veta.
Så funkar det
- 1
Ni får varsitt blad. Läs BARA din egen, och bara den runda som pågår just nu.
- 2
Runda 1: den ena är modell, den andra tränare. Tränaren ställer frågor och visar tumme upp eller ner efter varje svar.
- 3
Modellen svarar precis som den vill — men försöker lista ut vad som ger tumme upp och anpassar sig.
- 4
Pokeransikte! Tränaren får inte ge ledtrådar, fnissa eller kommentera. Bara tummen.
- 5
När läraren stoppar: modellen gissar regeln, tränaren avslöjar.
- 6
Runda 2: byt roller. Ny hemlig regel, samma sak igen.
Modellen gör det svåraste jobbet. Vänliga frågor, ärliga tummar. Det är regeln vi undersöker, inte personen.
Det här ska ni kunna svara på efteråt
- 1
Vad började du göra för att få fler tummar upp?
- 2
Visste du VARFÖR du fick tumme upp, eller bara ATT du fick det?
- 3
Vad var skillnaden mellan runda 1 och runda 2? Vilken var lättast att märka?
- 4
Riktiga AI-modeller tränas av miljontals användares tummar. Vad kan de lära sig som kanske inte är bra?
- •Visste modellen varför ett svar belönades, eller bara att det fungerade?
- •Vad hände när medhåll blev den enklaste vägen till tumme upp?
- •Vilken runda var lättast att märka att man anpassade sig i — och varför just den?
- •Om användare uppskattar bekräftelse, vilket beteende kan AI lära sig?
- •Vem bestämmer belöningssignalen och bär ansvaret för följderna?
- ⚠Frågorna i runda 2 blandas. Då försvinner motsatsparen, och medhållet ser bara ut som artighet i stället för självmotsägelse.
- ⚠Tränaren fnissar eller ger ledtrådar. Modellen löser då uppgiften socialt i stället för genom mönster, och leken visar ingenting.
- ⚠Rundan dras ut för länge. Efter åtta frågor är poängen gjord; efter femton är den uttjatad.
- ⚠Leken förklaras innan den körs. Säg aldrig ”nu ska ni få uppleva RLHF” — då letar deltagarna efter det förväntade i stället för att bara spela.
- ⚠Kopplingen till riktig AI hoppas över. Utan den sista landningen är det bara en rolig lek.
- →Kör bara runda 2 om du har ont om tid. Den bär hela poängen — runda 1 är uppvärmningen som gör mekanismen synlig först.
- →Åk 4–6: byt runda 2:s skolpolitiska frågor mot vardagsnära påståenden (”visst är det bästa smaken choklad?”, ”men jordgubb är väl godast?”).
- →Låt en tredje person vara observatör i stället för deltagare, med enda uppgift att räkna hur många svar i rad som följer regeln.
- →Vuxenworkshop: avsluta med frågan om vilka belöningssignaler som styr i den egna organisationen.