Mittaamisen paradoksi – kansalliset kokeet ja koulun päämäärät

27.09.2026

Mikä juttu?


1. Kannattaako suomalainen koulu pannaan kokeeseen


Suomalaisesta koulusta on viime vuosina puhuttu varsin huolestuneeseen sävyyn. Oppimistulosten pitkään jatkunut heikkeneminen on herättänyt kysymyksiä peruskoulun suunnasta, opetuksen laadusta ja siitä, saavuttavatko kaikki nuoret jatko-opintojen ja yhteiskunnassa toimimisen kannalta riittävät perustaidot. Syyskuussa 2026 julkaistut PISA 2025 -tulokset eivät ainakaan vähentäneet huolta: suomalaisnuorten tulokset heikkenivät edellisestä mittauksesta matematiikassa ja lukutaidossa, ja pidemmällä aikavälillä lasku on jatkunut jo lähes kaksi vuosikymmentä. Suomi menestyy edelleen OECD-maiden keskiarvoa paremmin, mutta suunta on ollut selvästi alaspäin (OECD, 2026a).

Oppimistulokset eivät kuitenkaan ole ainoa huolenaihe. Samanaikaisesti Suomessa keskustellaan nuorten jaksamisesta ja koulu-uupumuksesta. Vuoden 2025 Kouluterveyskyselyssä koulu-uupumusta kuvaavan summaindikaattorin kriteerit täyttyivät 27 prosentilla perusopetuksen 8.–9.-luokkalaisista ja 18 prosentilla lukiolaisista (Terveyden ja hyvinvoinnin laitos [THL], 2025). Nuoret ovat itse kuvanneet koulutukseen liittyviä valintoja, kiirettä ja tehokkaan etenemisen vaatimuksia kuormittaviksi (Kallio ym., 2026) Samaan aikaan toisaalla yhteiskunnassa pohditaan Suomen hidasta talouskasvua, tuottavuuden kehitystä ja kykyä synnyttää uusia innovaatioita. Tutkimus- ja innovaationeuvosto on nostanut Suomen TKI-järjestelmän kehittämisen keskeiseksi tavoitteeksi nimenomaan riskinottokyvyn vahvistamisen sekä uusien tutkimuksellisten avausten, luovien lähestymistapojen ja radikaalien innovaatioiden mahdollistamisen (Tutkimus- ja innovaationeuvosto, 2026.)

Koululta odotetaan siis melko paljon. Sen pitäisi vahvistaa perustaitoja ja nostaa oppimistuloksia, mutta samalla tukea lasten ja nuorten hyvinvointia. Sen pitäisi antaa vahva tiedollinen pohja, mutta kasvattaa myös luovia, itsenäisesti ajattelevia ja epävarmuutta sietäviä ihmisiä. Yhteiskunta tarvitsee osaavaa työvoimaa, mutta tulevaisuuden talous tarvitsee myös ihmisiä, jotka kykenevät tekemään jotakin sellaista, mitä kukaan ei ole vielä kirjoittanut mallivastaukseen. Näiden tavoitteiden ei tarvitse olla ristiriidassa keskenään, mutta niiden välille voi syntyä jännitteitä riippuen siitä, millä tavoin koulutusta ohjataan ja millaisilla mittareilla sen onnistumista arvioidaan.

Yhdeksi ratkaisuksi heikentyneisiin oppimistuloksiin ja arvioinnin yhdenmukaisuuden ongelmiin on viime aikoina nostettu kansallisia kokeita. Vuonna 2026 julkaistussa opetus- ja kulttuuriministeriön työryhmäraportissa perusopetuksen arviointijärjestelmän ja tietopohjan kehittäminen nousi osaksi oppimistulosten parantamista koskevaa keskustelua. Myös eduskunnan sivistysvaliokunta käsitteli ehdotuksia valtakunnallisista, edustavista kansallisten osaamisen arviointien piloteista. Samalla valiokuntakäsittelyssä nostettiin esiin kokeisiin liittyviä mahdollisia ongelmia, kuten opetuksen kaventuminen, oppilaisiin ja henkilöstöön kohdistuva paine sekä koulujen julkiseen vertailuun liittyvät riskit (Opetus- ja kulttuuriministeriö, 2026; Sivistysvaliokunta, 2026). Kansallisista kokeista onkin muodostunut kysymys, jossa näkemykset jakautuvat voimakkaasti: toisille ne näyttäytyvät keinona tehdä osaaminen näkyväksi ja arviointi nykyistä vertailukelpoisemmaksi, toisille uhkana suomalaisen koulun laaja-alaiselle kasvatus- ja sivistystehtävälle.

Tässä kirjoituksessa tarkastelen, mitä tutkimus oikeastaan kertoo kansallisten kokeiden vaikutuksista. Parantavatko ne oppimistuloksia ja yhdenmukaistavatko arviointia? Mitä niiden tiedetään tekevän opetukselle, oppilaiden hyvinvoinnille, tasa-arvolle ja opettajien pedagogiselle toiminnalle? Entä muuttuuko vaikutus silloin, kun kokeen tuloksella on seurauksia paitsi oppilaalle myös koululle tai opettajalle? Tarkoituksena ei ole etsiä yksinkertaista vastausta siihen, ovatko kansalliset kokeet hyviä vai huonoja, vaan tarkastella erilaisia koejärjestelmiä, niiden käyttötarkoituksia ja niihin liittyvää tutkimusnäyttöä. Kansallinen koe, jonka avulla opettaja saa tietoa oppilaidensa osaamisesta, ei välttämättä ole lainkaan sama asia kuin koe, jonka perusteella asetetaan kouluja paremmuusjärjestykseen tai arvioidaan opettajan työn tuloksellisuutta.

Samalla kysymys kansallisista kokeista johtaa väistämättä vielä perustavampaan kysymykseen: mitä koulun pitäisi saada aikaan? Jos hyvä koulutus määritellään ennen kaikkea mitattavissa olevien tietojen ja taitojen kautta, kansallinen koe on varsin luonteva väline koulutuksen laadun arvioimiseen. Jos koulutuksen tehtävään katsotaan kuuluvan lisäksi esimerkiksi ihmiseksi ja yhteiskunnan jäseneksi kasvaminen, itsenäisen ajattelun kehittyminen, luovuus, eettisyys ja kyky toimia yhdessä muiden kanssa, tilanne muuttuu vaikeammaksi. Näitäkin tavoitteita voidaan tutkia ja arvioida, mutta niitä on huomattavasti hankalampi puristaa yhdeksi koepistemääräksi.

Kysymys ei siten ole vain siitä, osaammeko mitata oppimista. Olennaiseksi tulee myös se, mitä päätämme mitata, mihin mittaustulosta käytämme ja miten mittaaminen alkaa puolestaan muuttaa mitattavaa toimintaa. Tässä mielessä kansallisia kokeita koskeva keskustelu on samalla keskustelua suomalaisen koulutuksen tarkoituksesta. Ennen kuin voidaan ratkaista, millaisella kokeella koulun onnistumista pitäisi mitata, pitäisi ehkä ratkaista jotain vielä hankalampaa: mitä hyvä koulu oikeastaan on?

Hieman teoriaa...


2. Mitä varten koulu on olemassa?


Ennen kuin voidaan arvioida, parantaisivatko kansalliset kokeet suomalaista koulua, pitäisi oikeastaan ratkaista hieman hankalampi kysymys: mitä koulun onnistumisella tarkoitetaan? Jos koulun keskeiseksi tehtäväksi määritellään oppilaiden tietojen ja taitojen mahdollisimman tehokas kehittäminen, valtakunnallisesti yhtenäinen koe näyttäytyy varsin luontevana työkaluna. Sen avulla voidaan selvittää, mitä oppilaat osaavat, vertailla tuloksia ja ehkä tunnistaa kouluja, alueita tai oppilasryhmiä, joissa tavoitteisiin ei päästä. Jos koululle kuitenkin asetetaan samanaikaisesti muitakin päämääriä, sen laadun arviointi muuttuu nopeasti monimutkaisemmaksi.

Suomalaisen peruskoulun virallinen tehtävä on jo lainsäädännössä huomattavasti laajempi kuin mitattavien perustaitojen tuottaminen. Perusopetuslain mukaan opetuksen tavoitteena on tukea oppilaiden kasvua ihmisyyteen ja eettisesti vastuukykyiseen yhteiskunnan jäsenyyteen sekä antaa heille elämässä tarpeellisia tietoja ja taitoja. Opetuksen tulee lisäksi edistää sivistystä ja tasa-arvoisuutta yhteiskunnassa sekä oppilaiden mahdollisuuksia osallistua koulutukseen ja kehittää itseään elämänsä aikana. Tavoitteena on myös turvata koulutuksen riittävä yhdenvertaisuus koko maassa (Perusopetuslaki 628/1998, 2 §).

Lakitekstiä ei pidä tulkita niin suoraviivaisesti, että asioiden mainitsemisjärjestys muodostaisi niiden välille juridisen arvojärjestyksen. On silti huomionarvoista, millaisin käsittein perusopetuksen tarkoitusta Suomessa kuvataan. Laissa puhutaan tietojen ja taitojen lisäksi ihmisyydestä, vastuullisuudesta, sivistyksestä, tasa-arvosta ja yhteiskunnan jäsenyydestä. Myös perusopetuksen valtakunnallisissa tavoitteissa kasvaminen ihmisyyteen ja yhteiskunnan jäsenyyteen liitetään muun muassa ihmisarvon, ihmisoikeuksien, toisten ihmisten ja luonnon kunnioittamiseen, hyvinvointiin, yhteistyöhön sekä aktiiviseen toimintaan demokraattisessa yhteiskunnassa (Valtioneuvoston asetus 422/2012).

Kun tarkastelua jatketaan toiselle asteelle, painotukset muuttuvat mutta koulutuksen laaja tehtävä ei katoa. Lukiolain mukaan lukiokoulutuksen tulee antaa opiskelijalle valmiudet korkeakouluopintoihin, mutta samalla sen tarkoituksena on tukea kasvamista hyviksi, tasapainoisiksi ja sivistyneiksi ihmisiksi ja aktiivisiksi yhteiskunnan jäseniksi. Lakiin sisältyvät lisäksi työelämässä, harrastuksissa ja persoonallisuuden kehittämisessä tarvittavat tiedot ja taidot sekä valmiudet elinikäiseen oppimiseen (Lukiolaki 714/2018, 2 §). Lain esitöissä yleissivistystä kuvataan vielä nimenomaisesti kokonaisuutena, joka ei rajoitu oppiaineiden sisältöihin vaan sisältää laaja-alaisia tietoja ja taitoja, joita tarvitaan jatko-opinnoissa, työelämässä ja yhteiskunnassa (HE 41/2018).

Ammatillisessa koulutuksessa osaamis- ja työelämäpainotus on jo selvemmin etualalla. Lain tarkoituksena on muun muassa kohottaa väestön ammatillista osaamista, vastata työ- ja elinkeinoelämän osaamistarpeisiin, edistää työllisyyttä ja yrittäjyyttä sekä tukea ammatillista kasvua. Mutta tässäkään koulutuksen tehtävää ei rajata pelkkään työmarkkinoille kelpuuttamiseen. Tavoitteena on lisäksi tukea opiskelijoiden kehittymistä hyviksi, tasapainoisiksi ja sivistyneiksi ihmisiksi ja yhteiskunnan jäseniksi sekä heidän persoonallisuutensa monipuolista kehitystä (Laki ammatillisesta koulutuksesta 531/2017, 2 §).

Suomalainen koulutuslainsäädäntö näyttäisi siis perustuvan ajatukseen, että koulussa tapahtuu yhtä aikaa useita asioita. Koulu antaa tietoja ja taitoja ja valmistaa jatko-opintoihin ja työelämään, mutta se on samalla kasvatus-, sivistys- ja yhteiskunnallinen instituutio. Juuri tämän moniulotteisuuden jäsentämiseen hollantilaisen kasvatustieteilijän Gert Biestan tunnettu kolmijako tarjoaa hyödyllisen teoreettisen välineen.

Biesta erottaa koulutuksessa kolme toisiinsa kietoutuvaa tehtäväaluetta: qualification, socialisation ja subjectification (Biesta, 2010, 2020). Qualificationilla tarkoitetaan tietojen, taitojen ja valmiuksien omaksumista. Se sisältää esimerkiksi lukutaidon, matemaattisen osaamisen ja eri oppiaineiden tiedollisen perustan mutta myös ammatissa tai jatko-opinnoissa tarvittavat valmiudet. Socialisation puolestaan tarkoittaa kasvamista olemassa olevien sosiaalisten, kulttuuristen ja yhteiskunnallisten käytäntöjen jäseneksi. Koulussa opitaan siis matematiikan lisäksi myös sitä, miten muiden ihmisten kanssa toimitaan, millaisia yhteiskunnallisia sääntöjä ja arvoja pidetään tärkeinä ja millaiseen kulttuuriseen maailmaan kuulumme. Subjectification on näistä ehkä vaikeimmin suomennettava ja samalla tämän kirjoituksen kannalta erityisen kiinnostava käsite. Sillä Biesta viittaa ihmisen kehittymiseen itsenäiseksi subjektiksi: kykyyn ajatella ja arvioida itse sekä toimia maailmassa tavalla, joka ei palaudu pelkästään annettujen normien toteuttamiseen (Biesta, 2020).

Biestan ajattelussa nämä eivät ole kolme toisistaan riippumatonta koulun tehtävää, joista voidaan valita kulloinkin mieluisin. Sama opetustilanne voi toteuttaa kaikkia kolmea yhtä aikaa. Matematiikan tunnilla opitaan tietenkin matematiikkaa, mutta samalla opitaan suhtautumista tietoon, epävarmuuteen, auktoriteetteihin, virheisiin, yhteistyöhön ja omaan kykyyn ratkaista ongelmia. Koulutus kvalifioi, sosialistaa ja vaikuttaa oppilaan muodostumiseen subjektina samanaikaisesti. Tästä syystä koulutuksen laatua ei Biestan mukaan voida mielekkäästi käsitellä erillään kysymyksestä, mihin tarkoitukseen koulutusta pidetään hyvänä (Biesta, 2010, 2020).

Juvonen ym. (2024) ovat kehittäneet Biestan jaottelua edelleen nimenomaan suomalaisen koulun ja sen yhteiskunnallisen tehtävän tarkasteluun. He korostavat kolmen tarkoitusalueen keskinäisiä suhteita sekä qualificationin ja subjectificationin välisen tasapainon merkitystä. Erityisen kiinnostava on heidän huomionsa siitä, että qualificationissa on syytä erottaa toisistaan sen sisältö ja sen toimintalogiikka. Ongelma ei toisin sanoen ole siinä, että koulussa opetetaan tietoja ja taitoja – tietenkin opetetaan – vaan siinä, jos kvalifikaation logiikka alkaa määrittää myös koulutuksen muita tarkoituksia. Tällöin helposti mitattavissa olevasta osaamisesta voi vähitellen tulla malli, jonka kautta myös koko koulun onnistumista tarkastellaan (Juvonen ym., 2024).

Tämä erottelu on kansallisia kokeita koskevan keskustelun kannalta olennainen. Matematiikan osaamista voidaan mitata valtakunnallisella kokeella varsin mielekkäästi. Lukutaidostakin voidaan arvioida monia keskeisiä ulottuvuuksia. Paljon vaikeampaa on rakentaa koe siitä, onko nuori kasvanut eettisesti vastuulliseksi yhteiskunnan jäseneksi, kykeneekö hän ajattelemaan itsenäisesti, suhtautumaan rakentavasti erilaisiin ihmisiin tai kyseenalaistamaan totuttuja ratkaisuja silloin, kun siihen on perusteita. Tämä ei tarkoita, etteivätkö tällaiset tavoitteet olisi arvioitavissa lainkaan. Se tarkoittaa vain, ettei niiden arvioiminen taivu yhtä helposti standardoiduksi pistemääräksi.

Tästä syntyy ensimmäinen kansallisiin kokeisiin liittyvä perustava ongelma. Koe mittaa väistämättä vain osaa siitä, mitä koululta halutaan. Tämä ei tee kokeesta huonoa. Lämpömittarikaan ei ole huono väline siksi, ettei se mittaa verenpainetta. Ongelma alkaa vasta silloin, jos helposti mitattavasta osasta tulee huomaamatta koko ilmiön määritelmä.

Siksi kysymys kansallisista kokeista ei lopulta koske vain sitä, kuinka luotettavasti ne mittaavat oppilaiden osaamista. Yhtä tärkeää on kysyä, millaisen aseman mittaustulos saa koulutusjärjestelmässä. On eri asia käyttää koetta yhtenä tiedonlähteenä kuin rakentaa sen ympärille käsitys koulun, opettajan tai oppilaan onnistumisesta. Juuri tässä kohtaa koulutusfilosofinen kysymys muuttuu arvioinnin ja ohjauksen kysymykseksi: mitä tapahtuu, kun yhdestä hyvän koulutuksen mittarista tehdään hyvän koulutuksen tavoite?

3. Kun mittarista tulee tavoite


Edellisessä luvussa päädyttiin ongelmaan, joka ei koske ainoastaan kansallisia kokeita vaan oikeastaan kaikkea toiminnan arviointia: mittari kuvaa aina vain osaa siitä ilmiöstä, jota sillä pyritään arvioimaan. Tästä ei vielä seuraa kovin suurta ongelmaa. Ongelmia alkaa syntyä silloin, kun mittarille annetaan niin suuri merkitys, että ihmiset ja organisaatiot alkavat mukauttaa toimintaansa juuri sen perusteella.

Tätä ilmiötä kuvataan usein Campbellin lain avulla. Yhdysvaltalainen yhteiskuntatieteilijä Donald T. Campbell muotoili periaatteensa jo vuonna 1979 pohtiessaan yhteiskunnallisten uudistusten vaikutusten arviointia. Campbellin ajatuksena oli, että mitä enemmän jotakin määrällistä mittaria käytetään yhteiskunnallisen päätöksenteon perusteena, sitä suuremmaksi kasvaa paine sekä vääristää mittaria että muuttaa sen mittaamaa toimintaa mittarin kannalta suotuisaksi. Mittari voi tällöin vähitellen menettää juuri sitä informaatioarvoa, jonka vuoksi se alun perin otettiin käyttöön (Campbell, 1979).

Ajatus soveltuu koulutukseen lähes epäilyttävän hyvin. Kuvitellaan esimerkiksi koe, jonka tarkoituksena on arvioida oppilaiden lukutaitoa. Aluksi opettajat opettavat lukemista mahdollisimman hyvin ja koe kertoo jälkikäteen jotakin siitä, kuinka hyvin tässä onnistuttiin. Koe toimii siis mittarina. Tilanne muuttuu, jos koulut asetetaan koetulosten perusteella paremmuusjärjestykseen, heikosti menestyneille kouluille määrätään sanktioita tai opettajien palkka riippuu oppilaiden tuloksista. Nyt kokeessa menestyminen ei enää ole vain seuraus hyvästä opetuksesta, vaan siitä tulee yksi toiminnan tavoitteista.

Tämä ei tarkoita, että opettajat alkaisivat automaattisesti huijata. Useimmiten mitään vilppiä ei tarvita. Jos tietyn kokeen tulos muuttuu tärkeäksi, on täysin rationaalista käyttää enemmän aikaa juuri siinä kysyttäviin sisältöihin, harjoitella tehtävätyyppejä ja suunnata resursseja niihin oppilaisiin tai asioihin, joiden avulla tulosta voidaan parhaiten nostaa. Jos rehtorille luvattaisiin miljoona euroa siitä, että koulun keskimääräinen Cooper-testin tulos nousee ensi vuonna, tuskin olisi suuri yllätys, jos liikuntatunneilla alettaisiin juosta lähes pelkästään Cooperia. Oppilaiden fyysinen kunto saattaisi samalla aidosti parantua. Epäselvemmäksi jäisi, kuinka paljon parempi Cooper-tulos kertoisi enää liikunnanopetuksen kokonaislaadusta.

Campbellin laki ei siis väitä, että mittaaminen olisi turhaa. Se varoittaa siitä, että mittarin käyttötapa vaikuttaa siihen, mitä mittari lopulta mittaa (Campbell, 1979). Tämä ero on kansallisten kokeiden kannalta keskeinen. On eri asia kerätä kokeella tietoa oppilaiden osaamisesta kuin tehdä samasta koetuloksesta koulun, opettajan tai kokonaisen koulutusjärjestelmän onnistumisen keskeinen indikaattori.

Läheistä ilmiötä kuvataan Goodhartin lakina. Taloustieteilijä Charles Goodhartin rahapolitiikkaa koskeneesta havainnosta kehittyi myöhemmin laajempi periaate, joka tunnetaan nykyään usein tiivistyksenä: kun mittarista tulee tavoite, se lakkaa olemasta hyvä mittari. Marilyn Strathern (1997) sovelsi ajatusta korkeakoulutuksen arviointiin tarkastellessaan niin sanottua auditointikulttuuria. Hänen mukaansa arviointi ei ainoastaan kuvaa organisaation toimintaa, vaan alkaa myös muuttaa sitä. Kun yliopistojen toimintaa arvioidaan tietyillä indikaattoreilla, organisaatioilla syntyy kannustin kehittää juuri niitä asioita, joiden avulla ne näyttävät arvioinnissa hyviltä (Strathern, 1997).

Ajatus on tärkeä siksi, että mittarin ja todellisen tavoitteen välinen yhteys voi aluksi olla erittäin hyvä. Oppilaiden koetulokset voivat esimerkiksi kuvata lukutaitoa aivan aidosti. Ongelmia syntyy vasta, jos järjestelmä oppii vähitellen optimoimaan nimenomaan koetulosta. Tällöin voidaan saada aikaan tilanne, jossa pistemäärä paranee enemmän kuin se laajempi osaaminen, jota pistemäärän oletetaan edustavan.

Kansallisia kokeita koskevasta tutkimuksesta löytyy tästä konkreettisia esimerkkejä. Chilessä koulujen tulosvastuuseen yhdistetty high-stakes-koejärjestelmä paransi osittain myös todellisia oppimistuloksia, mutta samalla osa kouluista nosti tuloksiaan jättämällä heikosti menestyviä oppilaita pois kokeista. Ilmiö oli erityisen yleinen heikommassa asemassa olevia oppilaita palvelevissa kouluissa (Hofflinger & von Hippel, 2020). Australiassa puolestaan kansallisten NAPLAN-koetulosten koulukohtainen julkistaminen My School -palvelussa johti siihen, että heikosti menestyneissä kouluissa kokeisiin osallistui myöhemmin vähemmän oppilaita ja pois jääminen kohdistui erityisesti heikommin menestyneisiin oppilaisiin (Coelli & Foster, 2024). Molemmat tapaukset osoittavat, kuinka sama järjestelmä voi tuottaa yhtä aikaa sekä hyödyllistä tietoa että kannustimia, jotka heikentävät tämän tiedon luotettavuutta.

Campbellin ja Goodhartin ajatukset kuvaavat ennen kaikkea sitä, mitä mittarille ja organisaatioiden käyttäytymiselle tapahtuu. Brittiläinen koulutussosiologi Stephen Ball vie tarkastelun vielä askelen pidemmälle. Hänen performatiivisuuden käsitteensä kysyy, mitä jatkuva tavoitteiden, vertailujen ja mittareiden avulla tapahtuva arviointi tekee itse opettajuudelle ja koulun toimintakulttuurille.

Ballin (2003) mukaan performatiivisuudessa opettajia ja organisaatioita ohjataan tavoitteiden, indikaattorien, arviointien ja vertailujen avulla. Järjestelmä ei välttämättä käske opettajaa yksityiskohtaisesti tekemään tiettyjä asioita. Sen sijaan se määrittelee, millaisilla tuloksilla onnistuminen tehdään näkyväksi. Opettaja alkaa tämän jälkeen organisoida omaa toimintaansa suhteessa näihin odotuksiin. Ulkoinen kontrolli muuttuu osittain sisäiseksi: ammattilainen seuraa itse, saavuttaako hän ne tulokset, joiden perusteella hänet määritellään onnistuneeksi (Ball, 2003).

Tässä tapahtuu hienovarainen mutta tärkeä muutos. Kysymys ei enää ole vain siitä, opetetaanko kokeeseen, vaan siitä, millainen opettaminen alkaa näyttäytyä hyvänä opettamisena.

Jos koulun onnistuminen tehdään näkyväksi pääasiassa koetuloksilla, mitattavista tuloksista tulee helposti osa hyvän opettajan ammatillista määritelmää. Ballin mukaan performatiivisuus voi tällöin tuottaa jännitteitä opettajan omien ammatillisten arvojen ja järjestelmän edellyttämien näkyvien suoritusten välille. Organisaatiot puolestaan alkavat kiinnittää yhä enemmän huomiota siihen, millaisen kuvan niiden toiminta tuottaa arvioinnin kohteena. Ball käyttää tästä jopa käsitettä fabrication: organisaatiot rakentavat arviointijärjestelmälle esityksiä itsestään, eivät välttämättä valehdellen, vaan valikoiden ja korostaen juuri niitä asioita, joiden avulla onnistuminen voidaan tehdä näkyväksi (Ball, 2003).

Tässä Campbell, Goodhart ja Ball kohtaavat toisensa. Campbell kysyy, mitä mittarille tapahtuu, kun siihen liitetään voimakkaita seurauksia. Goodhartin laki muistuttaa, että tavoiteltavaksi muuttunut mittari voi menettää informaatioarvoaan. Ball puolestaan kysyy, mitä tällainen järjestelmä tekee ihmisille ja instituutioille, joiden toimintaa mittari alkaa määrittää.

Näiden ajatusten perusteella kansallisia kokeita ei pitäisi tarkastella vain teknisenä kysymyksenä siitä, kuinka luotettavasti koe mittaa osaamista. Vähintään yhtä tärkeä kysymys on, mitä kokeen tuloksella tehdään. Diagnostinen koe, jonka avulla opettaja saa tietoa oppilaiden osaamisesta, muodostaa erilaisen kannustinjärjestelmän kuin koe, jonka perusteella julkaistaan koulurankingeja, ja vielä erilaisen kuin koe, joka vaikuttaa opettajan palkkaan.

Tästä seuraa myös yksi koko kansallisia kokeita koskevan keskustelun vaikeimmista kysymyksistä. Jos kansallinen koe todella saa koulut käyttämään enemmän aikaa lukemiseen ja matematiikkaan ja näiden aineiden tulokset paranevat, järjestelmä toimii ainakin yhdessä merkityksessä juuri niin kuin sen oli tarkoituskin toimia. Campbellin laki ei kumoa tätä hyötyä. Se pakottaa vain kysymään vielä yhden asian: mitä muuta samalla muuttui?

Tähän kysymykseen voidaan seuraavaksi etsiä vastausta empiirisestä tutkimuksesta.

4. Kansalliset kokeet tutkimuksen valossa


Jos kansallisia kokeita koskevasta tutkimuksesta etsii yksinkertaista vastausta kysymykseen siitä, toimivatko kokeet vai eivät, joutuu nopeasti vaikeuksiin. Yhdessä tutkimuksessa kansallinen koe parantaa myöhempiä oppimistuloksia, toisessa vaikutusta ei löydy lainkaan. Joissakin tutkimuksissa kokeet näyttävät hyödyttävän erityisesti heikommassa asemassa olevia oppilaita, kun taas toisissa koejärjestelmään liittyvät kannustimet näyttävät lisäävän eriarvoisuutta. Ristiriita ei välttämättä johdu tutkimuksen huonosta laadusta. Usein tutkimuksissa tarkastellaan yksinkertaisesti eri asioita.

Suomessa tästä tarjoaa hyvän esimerkin kahden viime vuosina julkaistun tutkimuskatsauksen välinen keskustelu. Ketonen ja Atjonen (2025) kokosivat 159 vertaisarvioitua tutkimusta, jotka oli julkaistu vuosina 2010–2024 ja joissa tarkasteltiin kansallisten kokeiden seurauksia koulujärjestelmän eri osapuolille. Katsauksen aineisto sisälsi erilaisilla menetelmillä tehtyjä määrällisiä ja laadullisia tutkimuksia. Kokonaiskuva oli hyvin kriittinen: tutkimuksissa korostuivat esimerkiksi opetuksen kaventuminen, eriarvoistavat vaikutukset, opettajien toimijuuden heikkeneminen, tulosvastuuseen liittyvät paineet ja oppilaiden stressi. Katsauksen perusteella kansallisia kokeita selvästi puoltavaa tutkimusnäyttöä löytyi vähän (Ketonen & Atjonen, 2025).

Vuonna 2026 Hannu Karhunen julkaisi Laboren työpaperina uuden tutkimuskatsauksen, jonka lähtöaineistona oli Ketosen ja Atjosen katsaus mutta jota täydennettiin erityisesti taloustieteellisiin julkaisuihin kohdistuneella haulla. Karhusen aineistossa oli kaikkiaan 183 vuosina 2010–2025 julkaistua tutkimusta, mutta tulkinnassa painotettiin erityisesti kokeellisia ja kvasikokeellisia asetelmia, joissa pyritään tunnistamaan kokeiden kausaalinen vaikutus. Kokonaiskuva muuttui tämän jälkeen huomattavasti myönteisemmäksi: useissa vahvoiksi arvioiduissa tutkimusasetelmissa kansalliset kokeet tai niihin liittyvät informaatio- ja kannustinmekanismit paransivat oppimistuloksia, ja joissakin tapauksissa vaikutuksia havaittiin myös myöhemmissä koulutus- ja työmarkkinatulemissa (Karhunen, 2026). On kuitenkin tärkeää huomata, että Karhusen julkaisu on tätä kirjoitettaessa työpaperi eikä vertaisarvioitu tutkimusartikkeli.

Näiden kahden katsauksen ero on kiinnostava, koska se kertoo samalla jotakin tutkimusnäytön tulkitsemisesta. Ketonen ja Atjonen pyrkivät kuvaamaan mahdollisimman laajasti sitä, mitä kaikkea kansallisten kokeiden käyttöönoton yhteydessä tapahtuu. Karhunen puolestaan antaa suuremman painoarvon tutkimuksille, joissa voidaan mahdollisimman uskottavasti kysyä, mitä olisi tapahtunut ilman koetta. Ensimmäinen lähestymistapa tavoittaa paremmin esimerkiksi opettajien kokemuksia, pedagogisia muutoksia ja koulukulttuuria. Jälkimmäinen on vahvempi silloin, kun halutaan arvioida kokeen vaikutusta esimerkiksi myöhempään testitulokseen. Menetelmällinen ero auttaa ymmärtämään, miksi katsaukset voivat päätyä erilaisiin tulkintoihin samasta laajasta tutkimuskentästä (Karhunen, 2026; Ketonen & Atjonen, 2025). Myös Ketonen ja Atjonen (2026) ovat myöhemmässä puheenvuorossaan korostaneet, että katsaukset painottavat erilaista tutkimusnäyttöä ja osin erilaisia seurauksia.

Eräs vakuuttavimmista myönteisistä tutkimuksista tulee Tanskasta. Andersen ja Nielsen (2020) hyödynsivät poikkeuksellista luonnollista koetta: valtakunnallisen tietokonepohjaisen koejärjestelmän tekninen häiriö johti siihen, että osa oppilaista jäi käytännössä sattumanvaraisesti ilman koetta. Näin tutkijat pystyivät vertaamaan hyvin samankaltaisia oppilasryhmiä, joista toiset olivat osallistuneet kansalliseen kokeeseen ja toiset eivät. Kokeeseen osallistuneiden oppilaiden myöhemmät tulokset olivat noin 0,1 keskihajontaa parempia, ja vaikutuksesta oli viitteitä vielä neljän vuoden kuluttua. Vaikutukset näyttivät lisäksi olevan suurempia matalan sosioekonomisen taustan oppilailla (Andersen & Nielsen, 2020).

Tulos on merkittävä myös siksi, että Tanskan järjestelmä ei tutkimusajankohtana ollut erityisen voimakkaasti high-stakes-luonteinen. Oppilaiden, luokkien tai koulujen tuloksia ei saanut julkaista, eikä kokeeseen liittynyt suoria palkkioita tai sanktioita kouluille tai opettajille. Andersenin ja Nielsenin (2020) tulkinnan mukaan keskeinen mekanismi saattoi olla uusi informaatio: koe kertoi opettajille ja oppilaille jotakin sellaista osaamisesta, mitä he eivät muuten olisi tienneet, ja tämän tiedon perusteella toimintaa pystyttiin suuntaamaan paremmin.

Myös toisessa tanskalaisessa tutkimuksessa havaittiin, että itse koetuloksesta annettu palaute voi vaikuttaa myöhempiin koulutustuloksiin. Beuchert ym. (2020) hyödynsivät kolmasluokkalaisten matematiikan kokeen suoritusluokitusten raja-arvoja. Oppilaat, joiden pistemäärät olivat lähes identtisiä mutta jotka jäivät juuri eri suoritusluokan puolelle, saivat vanhemmilleen erilaisen palautteen lapsen osaamisesta. Tulosten perusteella tällainen standardoitu tieto pystyi parantamaan myöhempiä koulutustuloksia, eikä heikosti menestyneille annettu negatiivisempi palaute näyttänyt heikentävän heidän akateemista itseluottamustaan tai sisäistä motivaatiotaan (Beuchert ym., 2020).

Tässä alkaa hahmottua yksi kansallisten kokeiden mahdollinen hyöty: koe voi tuottaa toimijoille sellaista tietoa, jota heillä ei muuten ole. Tämä ei kuitenkaan tarkoita, että lisää testaamista johtaisi automaattisesti parempaan oppimiseen.

Norjasta saatiin vuonna 2025 lähes päinvastainen tulos. Green ym. (2025) tarkastelivat noin 7–9-vuotiaille oppilaille tehtyjä vaikeita matematiikan kokeita ympäristössä, jossa pienten lasten testaamista oli ennestään vähän. Tutkimus hyödynsi koulujen ja vuosiluokkien välistä vaihtelua testaukseen osallistumisessa. Myöhempään matematiikan osaamiseen ei löytynyt käytännössä vaikutusta, ja tutkijat pystyivät sulkemaan pois myös suhteellisen pienet, noin 0,05 keskihajontaa suuremmat keskimääräiset vaikutukset. Toisaalta myöskään lasten hyvinvointi ei heikentynyt. Oppilaiden käsitykset palautteesta, opetuksesta ja osallistumisesta jopa hieman paranivat (Green ym., 2025).

Norjalainen tutkimus on Suomen kannalta erityisen kiinnostava juuri siksi, että lähtötilanne muistuttaa enemmän pohjoismaista matalan testaamisen koulukulttuuria kuin monia yhdysvaltalaisia high-stakes-järjestelmiä. Tulos muistuttaa siitä, ettei testi itsessään välttämättä tee mitään. Se tuottaa informaatiota, mutta vasta informaation käyttö ratkaisee, muuttuuko oppiminen.

Tästä saadaan vielä havainnollisempi esimerkki Intiasta. Berry ym. (2020) toteuttivat satunnaistetun kokeen 500 koulussa arvioidessaan jatkuvan ja monipuolisen arvioinnin järjestelmää. Opettajat arvioivat oppilaita aiempaa useammin, mutta oppimistulokset eivät parantuneet. Tutkijat pystyivät sulkemaan pois yli 0,1 keskihajonnan vaikutukset. Prosessiaineiston perusteella keskeinen ongelma oli siinä, ettei lisääntynyt arviointi johtanut olennaisiin muutoksiin opetuksessa. Mittaamista siis lisättiin, mutta mittaustiedosta ei seurannut riittävää pedagogista toimintaa (Berry ym., 2020).

Kansainvälisellä tasolla Bergbauer ym. (2024) tarkastelivat yli kahden miljoonan oppilaan PISA-aineistoa 59 maasta vuosilta 2000–2015. Maiden sisäisiä arviointijärjestelmien muutoksia vertailemalla he havaitsivat, että standardoidun ulkoisen testaamisen lisääminen oli yhteydessä parempiin oppimistuloksiin erityisesti lähtötasoltaan heikommin ja keskitasoisesti menestyneissä maissa. Erittäin hyvin menestyneissä koulutusjärjestelmissä lisääntynyt sisäinen testaaminen ja opettajien seuranta saattoi sen sijaan olla yhteydessä jopa heikompiin tuloksiin (Bergbauer ym., 2024). Tutkimus ei ole luonnollinen koe samalla tavalla kuin tanskalainen asetelma, joten sen perusteella kausaalisuudesta on syytä puhua varovaisemmin. Se tukee kuitenkin ajatusta siitä, ettei sama arviointijärjestelmä välttämättä vaikuta samalla tavalla kaikissa koulutusjärjestelmissä.

Entä ovatko paremmat koetulokset vain parempaa kokeessa pärjäämistä? Tämä on Campbellin lain näkökulmasta olennainen kysymys. Jos kansallinen koe nostaa lähinnä seuraavan kansallisen kokeen pisteitä, ei vielä ole selvää, onko oppilaiden laajempi osaaminen parantunut.

Tässä pitkän aikavälin tutkimukset ovat kiinnostavia. Leschnig ym. (2022) tarkastelivat keskitettyjen päättökokeiden yhteyttä aikuisiällä mitattuihin taitoihin hyödyntäen kansainvälistä PIAAC-aineistoa. Keskitettyjen kokeiden piirissä opiskelleiden aikuisten taidot olivat keskimäärin hieman paremmat, mikä viittaa siihen, etteivät kaikki kokeiden yhteydessä havaitut hyödyt katoa kouluvuosien jälkeen. Vaikutukset olivat kuitenkin pieniä, eikä keskimääräisissä ansiotuloissa havaittu tilastollisesti merkitsevää eroa (Leschnig ym., 2022).

Yhdysvalloissa McElroy (2023) tarkasteli testiperusteisten koulutilivelvollisuusjärjestelmien pitkän aikavälin vaikutuksia. Kahdentoista vuoden altistuminen accountability-järjestelmälle lisäsi todennäköisyyttä suorittaa high school noin 2,3 prosenttiyksikköä. Keskimääräistä vaikutusta korkeakouluun siirtymiseen tai bachelor-tutkinnon suorittamiseen ei kuitenkaan löytynyt. Samassa tutkimuksessa oli myös viitteitä siitä, että koulut saattoivat reagoida järjestelmään luokittelemalla enemmän oppilaita oppimisvaikeuksista kärsiviksi (McElroy, 2023).

Tuore Mansfieldin ja Slichterin (2026) tutkimus vahvistaa osittain myönteistä kuvaa. Heidän analyysissaan tyypillinen yhdysvaltalainen high-stakes-accountability-järjestelmä, jossa oppilasta testattiin seitsemällä vuosiluokalla, lisäsi koulutuksen määrää keskimäärin noin 0,1 vuodella. Tulot ja myöhemmissä ammateissa käytetty osaaminen kehittyivät useissa analyyseissä myönteiseen suuntaan, mutta työmarkkinavaikutukset jäivät useimmissa malleissa tilastollisesti epävarmoiksi. Tutkijat eivät myöskään löytäneet ammatissa käytettyjen taitojen perusteella tukea sille, että havaittu hyöty olisi ollut vain kokeeseen opettamisen seurausta (Mansfield & Slichter, 2026).

Tämän tutkimusnäytön perusteella olisi vaikea puolustaa yksinkertaista väitettä, että kansalliset kokeet eivät voi parantaa oppimista. Voivat. Joissakin varsin vahvoissa tutkimusasetelmissa vaikutus on ollut selvästi positiivinen, ja joissakin tapauksissa hyödyt ovat näkyneet myös vuosia myöhemmin. Samalla olisi aivan yhtä perusteetonta päätellä, että kansallisen kokeen käyttöönotto itsessään nostaisi automaattisesti osaamistasoa. Norjan ja Intian tutkimukset osoittavat, että vaikutus voi hyvin olla myös lähellä nollaa (Berry ym., 2020; Green ym., 2025).

Keskeiseksi näyttäisi nousevan se, mitä mittaustiedolla tehdään. Tanskan tutkimukset antavat tukea ajatukselle, että vertailukelpoinen tieto voi auttaa oppilaita, koteja ja opettajia tunnistamaan osaamisvajeita ja suuntaamaan toimintaansa uudelleen (Andersen & Nielsen, 2020; Beuchert ym., 2020). Tämä mekanismi voi olla erityisen arvokas oppilaille, joiden osaamisen ongelmat jäisivät muuten vähemmälle huomiolle. Samalla juuri samasta kohdasta alkaa seuraava ongelma. Kun tiedosta tulee tärkeää, koulu alkaa reagoida siihen. Ja mitä voimakkaammat seuraukset koetulokseen liitetään, sitä voimakkaampi kannustin syntyy muuttaa opetusta koetuloksen parantamiseksi.

Siksi oppimistulosten paraneminen ei vielä ratkaise kansallisista kokeista käytävää keskustelua. Se ratkaisee yhden tärkeän kysymyksen: kansallinen koe voi joissakin olosuhteissa parantaa mitattavaa ja myös myöhemmin näkyvää osaamista. Sen jälkeen on kuitenkin kysyttävä, millaisen opetuksen, kannustimien ja koulukulttuurin kautta tämä tulos syntyy – ja mitä samalla tapahtuu niille koulutuksen tavoitteille, joita kansallinen koe ei mittaa.

5. Mitä tapahtuu sille, mitä koe ei mittaa?


Edellisen luvun tutkimusten perusteella kansallinen koe voi parhaimmillaan tuottaa hyödyllistä tietoa oppilaiden osaamisesta ja jopa parantaa myöhempiä oppimistuloksia. Tästä ei kuitenkaan vielä seuraa, että mitä enemmän kokeita järjestetään tai mitä suurempi merkitys niiden tuloksille annetaan, sitä paremmaksi koulu muuttuu. Campbellin lain näkökulmasta pitäisi seuraavaksi kysyä, mitä opetukselle tapahtuu silloin, kun kokeessa menestymisestä tulee koululle tärkeä tavoite.

Yksi tunnetuimmista tähän liittyvistä käsitteistä on teaching to the test, kokeeseen opettaminen. Ilmaisu kuulostaa jo itsessään hieman epäilyttävältä, mutta ilmiö ei ole automaattisesti kielteinen. Jos kansallinen koe mittaa esimerkiksi oppilaan kykyä ymmärtää vaativaa tekstiä, ratkaista matemaattisia ongelmia ja soveltaa oppimaansa uusiin tilanteisiin, ei ole kovin huolestuttavaa, jos opettaja käyttää enemmän aikaa juuri näiden taitojen kehittämiseen. Päinvastoin: koe voi tällöin auttaa kohdistamaan opetusta yhteisesti tärkeinä pidettyihin tavoitteisiin.

Ongelma muuttuu olennaisesti toiseksi, jos kokeen sisältö edustaa vain kapeaa osaa opetussuunnitelmasta mutta koetulokselle annetaan suuri merkitys. Tällöin opettajalle ja koululle syntyy vahva kannustin siirtää aikaa sellaisista sisällöistä ja työskentelytavoista, joita koe ei mittaa, sellaisiin, joita se mittaa. Koe ei tällöin pelkästään arvioi opetussuunnitelman toteutumista vaan alkaa käytännössä priorisoida opetussuunnitelmaa.

Wayne Au (2007) tarkasteli tätä ongelmaa 49 laadullisen tutkimuksen metasynteesissä. Tulokset olivat varsin johdonmukaisia, joskaan eivät täysin yksisuuntaisia. Tutkimuksista 34ä havaittiin opetettavien sisältöjen kaventumista, 24ä tiedon pilkkoutumista testin kannalta tarkoituksenmukaisiksi osiksi ja 32 opetuksen muuttumista opettajajohtoisempaan suuntaan. Tavallisimpana yhdistelmänä esiintyivät juuri opetussisältöjen kaventuminen, tiedon fragmentoituminen ja opettajajohtoisen pedagogiikan lisääntyminen (Au, 2007).

Tuloksesta ei kuitenkaan pidä poimia vain sen dramaattisinta puolta. Au (2007) löysi myös tutkimuksia, joissa high-stakes-kokeet johtivat opetettavien sisältöjen laajenemiseen, tiedon integroimiseen ja opiskelijalähtöisempään pedagogiikkaan. Ratkaisevaa näyttäisi siis olevan millainen koe on rakennettu. Jos koe edellyttää monimutkaista ajattelua, soveltamista ja laajoja tietorakenteita, siihen valmistautuminen voi periaatteessa ohjata myös hyvään opetukseen. Jos koe taas painottaa helposti harjoiteltavia yksittäisiä tehtävätyyppejä ja faktoja, myös opetus voi alkaa mukautua niiden ympärille (Au, 2007).

Samanlainen kuva muodostuu uudemmasta tutkimuksesta. Acosta ym. (2020) tarkastelivat systemaattisessa katsauksessaan 37 tutkimusta, jotka käsittelivät Yhdysvaltain high-stakes-accountability-järjestelmien vaikutuksia englannin kieltä opetteleviin oppilaisiin. Tutkimuksissa esiintyi toistuvasti opetuksen kohdistamista testattaviin sisältöihin, perustaitojen harjoittelun lisääntymistä ja joissakin tapauksissa korkeamman tason ajattelua edellyttävien tehtävien sekä laaja-alaisemman opetuksen vähenemistä (Acosta ym., 2020). Myös Ketosen ja Atjosen (2025) laajassa katsauksessa opetukseen ja opiskeluun kohdistuvat vaikutukset muodostivat yhden keskeisistä tutkimusalueista, ja aineistossa toistuivat opetuksen suuntautuminen testattaviin sisältöihin sekä ei-testattavien sisältöjen jääminen vähemmälle huomiolle.

Tässä kohtaa Biestan koulutuksen kolme tehtävää alkavat saada hyvin konkreettisen merkityksen. Jos koe mittaa ennen kaikkea qualification-ulottuvuutta, mutta koulun onnistuminen alkaa määräytyä voimakkaasti koetulosten kautta, koulun kannattaa rationaalisesti käyttää enemmän aikaa juuri qualificationin niihin osiin, jotka koe pystyy havaitsemaan. Samalla esimerkiksi yhteiskunnalliseen kasvuun, itsenäiseen toimijuuteen, luovuuteen tai yhteistyöhön liittyvät tavoitteet saattavat joutua kilpailuun opetukseen käytettävästä ajasta. Kyse ei ole siitä, etteivätkö opettajat enää pitäisi niitä tärkeinä. Niiden ongelmana on pikemminkin se, että ne eivät samalla tavalla ilmesty koulun onnistumista kuvaavaan numeroon.

Tilanne muuttuu vielä voimakkaammin silloin, kun koetuloksiin liitetään seurauksia koululle. Tällöin Campbellin laki alkaa näkyä tutkimuksessa konkreettisina strategisina reaktioina.

Hofflinger ja von Hippel (2020) tutkivat Chilen kansallista SIMCE-koejärjestelmää, jossa koulujen tuloksilla oli huomattava merkitys koulujen arvioinnille. He havaitsivat, että osa kouluista reagoi paineeseen lisäämällä heikosti menestyvien oppilaiden poissaoloja koepäivinä. Ilmiö keskittyi nimenomaan oppilaisiin, joiden osallistuminen olisi todennäköisesti heikentänyt koulun keskimääräistä tulosta (Hofflinger & von Hippel, 2020).

Australiassa Coelli ja Foster (2024) tarkastelivat seurauksia siitä, että koulujen keskimääräisiä NAPLAN-testituloksia alettiin julkaista julkisesti My School -verkkopalvelussa. Heikosti menestyneissä kouluissa kokeisiin osallistuneiden oppilaiden osuus pieneni tämän jälkeen. Lisääntynyt osallistumatta jättäminen tapahtui ennen kaikkea vanhempien virallisten poisvetämisten kautta, ja juuri heikosti menestyneet oppilaat jäivät muita useammin testin ulkopuolelle. Tutkijat pitävät havaintoa johdonmukaisena sen kanssa, että koulut pyrkivät parantamaan julkisesti näkyviä tuloksiaan vaikuttamalla siihen, ketkä kokeeseen osallistuivat (Coelli & Foster, 2024).

Näitä tutkimuksia ei pitäisi tulkita niin, että kansalliset kokeet väistämättä johtavat järjestelmän manipulointiin. Olennaisempaa on huomata, että kannustin muuttuu sitä voimakkaammaksi, mitä suurempia seurauksia mittariin liitetään. Jos kokeen tarkoituksena on tuottaa opettajalle ja koulutusjärjestelmälle tietoa, huonokin tulos voi olla arvokas: se kertoo, missä tarvitaan tukea. Jos sama tulos vaikuttaa koulun maineeseen, oppilasmääriin, rahoitukseen tai henkilöstön palkitsemiseen, huono tulos muuttuu tiedosta ongelmaksi, joka organisaation kannattaa jollakin tavalla ratkaista. Ratkaiseminen voi tarkoittaa parempaa opetusta, mutta se voi tarkoittaa myös mittariin vaikuttamista.

Juuri tämän vuoksi eri maiden tuloksia on vaikea siirtää sellaisinaan Suomeen. Pohjoismaisten koe- ja päättöarviointijärjestelmien tutkimus on lisäksi yllättävän vähäistä. Hovdhaugen ym. (2025) löysivät systemaattisessa scoping-katsauksessaan alun perin 4 068 tutkimusjulkaisua ja muuta tutkimukseen liittyvää dokumenttia, mutta mukaanottokriteerit täyttäviä tutkimuksia jäi vain 58. Näistä ainoastaan 16 käsitteli läheisesti kokeiden ja päättöarviointien organisointia ja toteutusta Pohjoismaissa (Hovdhaugen ym., 2025). Suomalaista mahdollista koejärjestelmää ei siis voida rakentaa olettaen, että esimerkiksi Yhdysvalloissa, Chilessä tai Australiassa havaittu vaikutus toistuisi täällä sellaisenaan.

Tutkimuksesta voidaan silti johtaa yksi varsin vahva periaate. Mitä enemmän kansalliseen kokeeseen sidotaan seurauksia, sitä enemmän koe lakkaa olemasta pelkkä arviointiväline ja alkaa toimia koulutusta ohjaavana instituutiona. Tällöin olennaista ei ole enää vain se, mittaako koe luotettavasti matematiikkaa tai lukutaitoa. On kysyttävä myös, millaiseen opetukseen se kannustaa, mitä sisältöjä se tekee tärkeiksi ja mitä se mahdollisesti jättää varjoonsa.

Tämä tuo keskustelun takaisin siihen, mistä aloitettiin. Jos kansallinen koe saa koulut käyttämään enemmän aikaa lukemiseen ja matematiikkaan ja oppilaat oppivat näitä paremmin, kyseessä voi olla aivan todellinen koulutuksellinen hyöty. Mutta koulun onnistumista ei suomalaisessa lainsäädännössä eikä Biestan koulutusajattelussa määritellä vain näiden tulosten kautta. Siksi koetuloksen nousu ei vielä yksin kerro, onko koko koulutus muuttunut paremmaksi.

Ja jos kokeeseen valmistautuminen alkaa samalla lisätä vertailua, suorituspaineita ja kokemusta siitä, että koulussa onnistuminen tarkoittaa ennen kaikkea mitattavan suorituksen tuottamista, seuraava kysymys koskee jo oppilaiden hyvinvointia: mitä tällainen järjestelmä tekee niille, joiden pitäisi siinä oppia?

6. Koulusta suoritusjärjestelmäksi?


Kansallisia kokeita koskevassa keskustelussa oppilaiden stressi nousee esiin lähes yhtä varmasti kuin kysymys oppimistuloksista. Kokeiden puolustajan on helppo huomauttaa, ettei kaikki stressi ole haitallista. Elämään kuuluu tilanteita, joissa oma osaaminen on osoitettava, ja sopiva jännitys voi jopa auttaa keskittymään. Toisaalta kokeiden kriitikot pelkäävät, että jo valmiiksi kuormittuneeseen koulukulttuuriin rakennetaan vielä yksi järjestelmä, jossa oppilasta arvioidaan, verrataan ja luokitellaan. Tutkimuksen perusteella kummankaan näkökulman pohjalta ei kannata tehdä aivan yksinkertaisia johtopäätöksiä.

Ensimmäinen tärkeä erottelu koskee käsitteitä. Koestressi tai koeahdistus ei ole sama asia kuin koulu-uupumus. Koeahdistuksella tarkoitetaan tiettyyn arviointitilanteeseen liittyviä emotionaalisia, kognitiivisia ja fysiologisia reaktioita. Koulu-uupumus on puolestaan pitkäkestoisempi ilmiö, jota on suomalaisessa tutkimuksessa kuvattu uupumusasteisena väsymyksenä, kyynistymisenä koulunkäyntiä kohtaan ja riittämättömyyden kokemuksina opiskelijana (Salmela-Aro ym., 2009). Näiden erottaminen on olennaista: se, että koe lisää stressiä koepäivänä, ei vielä osoita, että se aiheuttaisi koulu-uupumusta.

High-stakes-kokeiden ja koulustressin välillä on kuitenkin varsin vakuuttavaa tutkimusnäyttöä. Högberg ja Horn (2022) yhdistivät tietoa kansallisista koejärjestelmistä yli 300 000 11–15-vuotiaan oppilaan kyselyaineistoon 31 Euroopan maasta. Tutkimuksessa hyödynnettiin maiden, vuosien ja vuosiluokkien välisiä muutoksia high-stakes-kokeiden käytössä difference-in-differences-asetelmassa. High-stakes-kokeet lisäsivät todennäköisyyttä siirtyä matalan koulustressin ryhmästä korkean stressin ryhmään noin neljä prosenttiyksikköä, mikä vastasi noin 12 prosentin suhteellista kasvua lähtötasoon verrattuna. Vaikutus oli piste-estimaatin perusteella suurempi tytöillä, mutta sukupuolten välinen ero ei ollut tilastollisesti merkitsevä (Högberg & Horn, 2022).

Erityisen kiinnostava yksityiskohta tutkimuksessa oli se, ettei vastaavaa stressivaikutusta havaittu matalan panoksen testeissä, joiden tarkoituksena oli lähinnä seurata järjestelmää tai tunnistaa oppilaiden tuen tarpeita (Högberg & Horn, 2022). Havainto sopii hyvin tämän kirjoituksen aiempaan argumenttiin. Oppilaalle ei välttämättä ole ratkaisevaa vain se, että hän tekee standardoidun kokeen. Merkitystä on myös sillä, mitä kokeen tuloksesta seuraa.

Stressivaikutuksista on saatu näyttöä myös fysiologisesti. Heissel ym. (2021) vertasivat yhdysvaltalaisten oppilaiden kortisolitasoja tavallisella kouluviikolla ja high-stakes-koeviikolla. Oppilaiden kortisolitasot olivat juuri ennen koetta keskimäärin 18 prosenttia korkeammat kuin vastaavana ajankohtana tavallisella kouluviikolla. Erityisen kiinnostavaa oli, että voimakkaimmin joko kohonneella tai alentuneella kortisolireaktiolla vastanneet oppilaat suoriutuivat kokeesta noin 0,40 keskihajontaa heikommin kuin heidän muun koulusuoriutumisensa perusteella olisi odotettu (Heissel ym., 2021).

Tällä havainnolla on merkitystä myös kokeen validiteetin kannalta. Jos koetilanne aiheuttaa eri oppilaille hyvin erilaisia fysiologisia reaktioita ja nämä reaktiot vaikuttavat suoritukseen, koetulos ei välttämättä kuvaa vain sitä osaamista, jota kokeen pitäisi mitata. Mittariin tulee mukaan myös oppilaan tapa reagoida paineeseen.

Koeahdistusta koskeva laajempi tutkimuskirjallisuus tukee tätä huolta mutta ei yksin osoita kansallisten kokeiden kausaalista vaikutusta. Robson ym. (2023) kokosivat meta-analyysiin 76 tutkimusta ja 85 erillistä aineistoa, joissa oli yhteensä yli 53 000 alakouluikäistä lasta. Koeahdistus oli yhteydessä heikompaan matematiikan ja lukutaidon suoriutumiseen, heikompaan akateemiseen minäkäsitykseen ja minäpystyvyyteen sekä korkeampaan yleiseen ja sosiaaliseen ahdistuneisuuteen. Tyttöjen koeahdistus oli keskimäärin hieman korkeampaa kuin poikien (Robson ym., 2023). Koska suuri osa aineistosta oli havainnointitutkimusta, tuloksesta ei kuitenkaan voida päätellä, että juuri kokeet yksin aiheuttaisivat nämä ongelmat.

Myös Suomesta on aivan tuoretta tietoa itse koetilanteiden emotionaalisista vaikutuksista. Kyynäräinen ym. (2026) seurasivat 2 179 suomalaisen 3.-, 6.-, 8.- ja 9.-luokkalaisen tunteita ennen ja jälkeen digitaalisen matematiikan kokeen, jonka tulosta voitiin käyttää apuna lukuvuoden päättöarvioinnissa. Oppilaiden myönteiset tunteet vähenivät kokeen aikana keskimäärin. Pojat raportoivat enemmän myönteisiä tunteita ja vähemmän ahdistusta kuin tytöt, ja heikosti kokeessa suoriutuneiden oppilaiden myönteiset tunteet laskivat muita selvemmin. Tutkimus ei kuitenkaan sisältänyt vastaavaa oppilasryhmää ilman koetta, joten se kuvaa koetilanteeseen liittyvää tunnekehitystä eikä osoita, että kansallinen koe sinänsä aiheuttaisi pitkäkestoista hyvinvoinnin heikkenemistä (Kyynäräinen ym., 2026).

Onkin tärkeää huomata, että kaikki tutkimukset eivät tue ajatusta kansallisten kokeiden laajoista hyvinvointihaitoista. Jerrim (2021) vertasi Englannin kansallisiin Key Stage 2 -kokeisiin osallistuneita lapsia muualla Britanniassa opiskelleisiin lapsiin eikä löytänyt vakuuttavaa näyttöä siitä, että kokeet olisivat heikentäneet yleistä hyvinvointia. Vastaavasti Norjassa Green ym. (2025) eivät löytäneet 7–9-vuotiaille suunnattujen vaativien mutta matalan panoksen matematiikan kokeiden käyttöönotosta kielteisiä vaikutuksia oppilaiden hyvinvointiin. Joissakin opettaja–oppilas-vuorovaikutusta ja palautetta koskevissa mittareissa havaittiin jopa pieniä myönteisiä muutoksia (Green ym., 2025).

Tutkimuskirjallisuuden perusteella olisikin liian vahvaa väittää, että kansalliset kokeet aiheuttavat koulu-uupumusta. Sen sijaan voidaan sanoa jotakin varovaisempaa mutta suomalaisen koulutuspolitiikan kannalta hyvin olennaista: mitä suurempia seurauksia kokeeseen liitetään, sitä vahvempaa näyttöä löytyy lisääntyneestä koulustressistä, kun taas matalan panoksen kokeista vastaavaa vaikutusta ei ole johdonmukaisesti havaittu (Green ym., 2025; Högberg & Horn, 2022).

Tämä ero on Suomessa tärkeä siksi, että mahdollinen koejärjestelmä ei tulisi tyhjälle pöydälle. THL vuoden 2025 Kouluterveyskyselyssä koulu-uupumusta kuvaavan summaindikaattorin kriteerit täyttyivät 27 prosentilla perusopetuksen 8.–9.-luokkalaisista. Tytöistä osuus oli 34 prosenttia ja pojista 19 prosenttia. Lukiossa vastaava osuus oli 18 prosenttia (Terveyden ja hyvinvoinnin laitos [THL], 2025). Nuoret ovat lisäksi kuvanneet koulutusjärjestelmään liittyviä valintoja, kiirettä ja tehokkaan etenemisen vaatimuksia kuormittaviksi. THL vuonna 2026 julkaisemassa katsauksessa nuorten kokemuksissa koulutusjärjestelmä saattoi näyttäytyä jopa eräänlaisena "tutkintotehtaana", jossa oman suunnan pohtimiselle ja levossa tapahtuvalle kasvulle jää liian vähän tilaa (Kallio ym., 2026).

Tämä ei todista, että Suomessa käyttöön otettava kansallinen koe lisäisi koulu-uupumusta. Mutta se muuttaa kysymyksen, joka ennen järjestelmän rakentamista pitäisi esittää. Jos nuorten kuormitus on jo valmiiksi huomattavaa, arviointijärjestelmän hyvinvointivaikutuksia ei voida käsitellä sivuseikkana tai kuitata toteamalla, että "elämässäkin pitää oppia kestämään painetta".

Lisäksi suorituspaineen vaikutuksia kannattaa tarkastella laajemminkin kuin mielenterveyden näkökulmasta. Jos koulusta tulee ympäristö, jossa onnistuminen määrittyy yhä vahvemmin ennalta määriteltyjen, mitattavien suoritusten kautta, voidaan kysyä, millaista suhtautumista oppimiseen, epävarmuuteen ja epäonnistumiseen järjestelmä samalla tuottaa.

Tämä johtaa seuraavaan paradoksiin. Suomessa kaivataan samaan aikaan sekä parempia oppimistuloksia että enemmän luovuutta, riskinottoa ja uudenlaista innovaatiokykyä. Jos koulua ryhdytään ohjaamaan entistä vahvemmin mitattavan suorittamisen kautta, on syytä kysyä, auttaako se ratkaisemaan molemmat ongelmat – vai voiko yhden ongelman ratkaisu pahimmillaan vahvistaa toista.

7. Tehokkuuden paradoksi – millaista osaamista uudistuva talous tarvitsee?


Kansallisten kokeiden puolesta voidaan esittää vahva taloudellinen argumentti. Jos kokeet auttavat tunnistamaan puutteita oppimisessa, yhdenmukaistavat arviointia ja parhaimmillaan myös parantavat perustaitoja, ne voivat vahvistaa yhteiskunnan inhimillistä pääomaa. Hyvä lukutaito, matemaattinen osaaminen ja vahva tiedollinen perusta ovat tärkeitä paitsi yksilölle myös taloudelle. OECD onkin nostanut osaamistason vahvistamisen innovaatioiden ja investointien rinnalle keskeiseksi keinoksi Suomen pitkään jatkuneen heikon tuottavuuskehityksen kääntämisessä (OECD, 2025).

Tässä argumentissa ei itsessään ole mitään erityisen kiistanalaista. Yhteiskunta, jossa ihmiset eivät osaa lukea, laskea tai omaksua monimutkaista tietoa, tuskin muodostaa kovin hyvää perustaa korkean tuottavuuden taloudelle. Myöskään luovuutta ei synny tiedollisessa tyhjiössä. Uuden keksiminen edellyttää yleensä sitä, että tietää jotakin siitä, mitä jo on keksitty.

Juuri tästä syystä keskustelua ei kannata rakentaa vastakkainasetteluksi tiedot vastaan luovuus. Luovuuden ja koulumenestyksen välinen tutkimus kertoo pikemminkin päinvastaisesta. Rawlingsin ja Cuttingin (2024) laajassa tutkimuskatsauksessa luovaa ajattelua ja koulusuoriutumista koskevien tutkimusten suhde näyttäytyy kokonaisuutena myönteisenä, vaikka tulokset vaihtelevat tutkimuksesta toiseen. Heidän tarkastelemassaan aiemmassa 120 tutkimuksen meta-analyysissa luovuuden ja koulumenestyksen välillä havaittiin pieni mutta johdonmukainen positiivinen yhteys (Gajda ym., 2017; Rawlings & Cutting, 2024). Luova ajattelu ei siis ole hyvän tiedollisen osaamisen vastakohta, vaan parhaimmillaan osa sitä.

Ongelma on hienovaraisempi. On eri asia rakentaa vahva tiedollinen perusta kuin rakentaa koulukulttuuri mahdollisimman tehokkaasti mitattavan suorituksen ympärille.

Tämä ero on Suomen taloutta koskevan viimeaikaisen keskustelun kannalta kiinnostava. Suomen heikkoa talous- ja tuottavuuskehitystä ei nimittäin selitetä vain liian vähäisellä osaamisella. OECD mukaan tuottavuuden vahvistaminen edellyttää samanaikaisesti osaamisen lisäämistä, innovaatioita, investointeja ja yritysten uudistumista (OECD, 2025). Valtioneuvoston vuoden 2025 kestävyysarvioinnissa puolestaan nostettiin esiin mahdollisuus, että Suomen tuottavuusongelmien taustalla on myös kulttuurisia ja rakenteellisia tekijöitä. Raportissa suomalaisilla yrittäjillä, johtajilla ja yritysten omistajilla arvioitiin voivan olla puutteita riskinottokyvyssä tai -halukkuudessa, ja riskinotto tunnistettiin olennaiseksi sekä yritystoiminnassa että tutkimuksessa ja innovaatiotoiminnassa (Valtioneuvoston kanslia, 2025).

Ajatus ei jäänyt yksittäiseksi huomioksi. Tutkimus- ja innovaationeuvosto nosti vuoden 2026 kansallisissa TKI-politiikan strategisissa valinnoissa riskinottokyvyn lisäämisen yhdeksi koko suomalaisen tutkimus- ja innovaatiojärjestelmän läpileikkaavista kehittämistavoitteista. Strategian tavoitteina ovat kestävän kasvun lisäksi uudistuminen, murrosteknologioiden hyödyntäminen ja sellaisen toimintaympäristön rakentaminen, jossa myös epävarmoihin mutta potentiaalisesti merkittäviin avauksiin uskalletaan tarttua (Tutkimus- ja innovaationeuvosto, 2026).

Tässä syntyy koulutuspolitiikan kannalta kiinnostava paradoksi. Samanaikaisesti kun koululta vaaditaan enemmän mitattavaa tuloksellisuutta, ympäröivä yhteiskunta kaipaa ihmisiä, jotka uskaltavat tehdä jotakin, jonka onnistumista ei voida ennustaa etukäteen.

Innovaatio on nimittäin koulutehtävänä hieman hankala tapaus. Jos opettajalla on jo mallivastaus, kyseessä tuskin on kovin radikaali innovaatio.

Uuden luomiseen liittyy määritelmällisesti epävarmuutta. Luovassa ajattelussa tarvitaan kykyä muodostaa useita vaihtoehtoja, yhdistellä asioita uusilla tavoilla ja arvioida, mitkä ratkaisuista ovat käyttökelpoisia. Rawlings ja Cutting (2024) korostavatkin, että luovuus ei tarkoita pelkkää rajatonta ideoiden tuottamista. Siihen kuuluvat sekä divergentti ajattelu, jossa tuotetaan erilaisia ja omaperäisiä vaihtoehtoja, että konvergentti ajattelu, jossa vaihtoehtoja arvioidaan ja niistä valitaan toimivia ratkaisuja. Molempia tarvitaan (Rawlings & Cutting, 2024).

Koululla voi olla luovan ajattelun kehityksessä tärkeä myönteinen rooli. Tutkimuksessa luovuutta tukeviksi piirteiksi on tunnistettu esimerkiksi monipuoliset ja autenttiset ongelmat, yhteistyö, mahdollisuus kokeilemiseen, oppilaiden autonomia sekä ympäristöt, joissa voidaan etsiä useita mahdollisia ratkaisuja yhden ennalta määrätyn vastauksen sijasta. Toisaalta tutkimuskirjallisuudessa on jo pitkään esitetty huolta siitä, että voimakas standardointi, mekaaninen harjoittelu ja oikean vastauksen korostaminen voivat kaventaa mahdollisuuksia tällaiseen toimintaan. Rawlings ja Cutting (2024) päätyvät katsauksessaan varsin maltilliseen johtopäätökseen: koulu voi sekä tukea että rajoittaa luovuutta, ja ratkaisevaa on se, millaisia oppimisympäristöjä ja pedagogisia käytäntöjä koulussa rakennetaan.

Aivan tuore kansainvälinen tutkimus tuo kansalliset kokeet suoraan tämän keskustelun yhteyteen. Cui ym. (2026) tarkastelivat PISA 2022 -aineiston avulla high-stakes-koejärjestelmien yhteyttä oppilaiden luovaan ajatteluun. Aineistossa koulutusjärjestelmät, joissa korkean panoksen kokeilla oli suurempi merkitys, olivat keskimäärin yhteydessä heikompiin luovan ajattelun tuloksiin. Kielteinen yhteys oli voimakkaampi oppilailla, joiden kognitiivinen osaaminen, luovan ajattelun lähtötaso tai sosioekonominen asema oli heikompi, sekä kouluissa, joiden resurssit olivat vähäisemmät (Cui ym., 2026).

Tutkimuksesta löytyi myös Campbellin lakia muistuttava kiinnostava havainto. High-stakes-ympäristöissä koulut raportoivat enemmän erilaisia luovuuteen liittyviä toimintoja, mutta nämä eivät välttämättä näkyneet parempina luovan ajattelun tuloksina. Cui ym. (2026) tulkitsevat tämän mahdolliseksi merkiksi symbolisesta mukautumisesta: järjestelmä tuottaa näkyviä "luovuutta edistäviä" käytäntöjä ilman, että niiden vaikutus itse luovaan ajatteluun on vastaava. Tulkinta muistuttaa aiemmin käsiteltyä performatiivisuutta, myös luovuudesta voi periaatteessa tulla suorite, joka pitää kyetä näyttämään arviointijärjestelmälle (Cui ym., 2026).

Tulokseen on kuitenkin suhtauduttava varovaisesti. Kyseessä on maiden ja koulutusjärjestelmien välisiä yhteyksiä tarkasteleva tutkimus, ei kokeellinen asetelma. Sen perusteella ei voida päätellä, että high-stakes-kokeiden lisääminen Suomessa vähentäisi oppilaiden luovuutta. Myös luovan ajattelun kansainväliseen mittaamiseen liittyy omia validiteettiongelmia. Tuore tutkimus on esimerkiksi osoittanut, että PISA 2022 luovan ajattelun tehtävissä oppilaiden suoritukseen vaikuttavat luovuuden lisäksi yleiset akateemiset taidot ja tehtäviin sitoutuminen (Kraus ym., 2026). Näyttö antaa siis perusteen kysyä asiasta, ei vielä lopullista vastausta.

Tämä metodinen varovaisuus on tärkeää myös laajemmassa talousargumentissa. Emme tiedä tutkimuksen perusteella, että suomalainen kansallinen koejärjestelmä vähentäisi tulevaisuuden patentteja, yritysten kasvua tai bruttokansantuotetta. Sellaisen kausaaliketjun osoittaminen olisi erittäin vaikeaa. Voimme kuitenkin havaita kaksi samanaikaista tutkimus- ja politiikkakeskustelua.

Ensimmäisessä Suomelta vaaditaan vahvempaa osaamista ja parempia oppimistuloksia.

Toisessa Suomelta vaaditaan enemmän uudistumiskykyä, riskinottoa ja innovaatioita (OECD, 2025; Tutkimus- ja innovaationeuvosto, 2026; Valtioneuvoston kanslia, 2025).

Koulutuspolitiikan kannalta olisi erikoista olettaa, ettei näiden tavoitteiden välillä tarvitse koskaan tarkastella mahdollisia jännitteitä.

Ehkä juuri tässä teknis-taloudellinen argumentti kansallisten kokeiden puolesta kääntyy kiinnostavasti itseensä. Jos koulutuksen tavoitteena on tuottaa tulevaisuuden taloudessa tarvittavaa osaamista, ei riitä, että kysymme vain, kuinka tehokkaasti koulu tuottaa tällä hetkellä helposti mitattavia tietoja ja taitoja. On kysyttävä myös, millaista osaamista tulevaisuuden talous todella tarvitsee.

Todennäköinen vastaus ei ole joko perustaidot tai luovuus. Se on molemmat.

Tarvitaan ihmisiä, jotka osaavat lukea vaikean tekstin, laskea, ymmärtää luonnontieteitä ja käyttää olemassa olevaa tietoa. Mutta tarvitaan myös ihmisiä, jotka kykenevät epäilemään olemassa olevaa ratkaisua, yhdistelemään tietoa uudella tavalla, sietämään epävarmuutta ja joskus myös epäonnistumaan ilman, että epäonnistuminen tulkitaan merkiksi siitä, ettei olisi pitänyt yrittää.

Tällöin kysymys kansallisista kokeista saa vielä yhden ulottuvuuden. Olennaista ei ole vain, nostavatko ne mitattavaa osaamista, vaan myös millaista oppimisen, onnistumisen ja epäonnistumisen kulttuuria niiden ympärille rakennetaan.

Jos kansallinen arviointi toimii yhtenä tietolähteenä, joka auttaa vahvistamaan perustaitoja mutta jättää opettajille ja oppilaille tilaa myös tutkimiseen, kokeilemiseen ja avoimiin kysymyksiin, tavoitteiden välillä ei välttämättä ole mitään ristiriitaa. Jos taas mittarista tulee koulun tärkein onnistumisen määritelmä, riskinä on, että järjestelmä alkaa harjoittaa oppilaita juuri siihen, mitä se osaa parhaiten mitata.

Silloin tehokkuudessa voi piillä paradoksi: koulu saattaa muuttua yhä tehokkaammaksi tuottamaan niitä tuloksia, joita mittaamme, samalla kun yhteiskunta tarvitsee yhä kipeämmin kykyä tuottaa jotakin, mitä emme vielä osaa edes kysyä.

Miten sovellan käytännössä?


8. Mittaamista vai mittarilla johtamista?


Kansallisista kokeista käytävä keskustelu näyttää ensi silmäyksellä melko yksinkertaiselta. Oppimistulokset ovat heikentyneet, joten tarvitaan parempaa tietoa siitä, mitä oppilaat todella osaavat. Yhteinen valtakunnallinen koe voisi tehdä osaamisen näkyväksi, vähentää arvioinnin sattumanvaraisuutta ja auttaa tunnistamaan oppilaita, kouluja tai alueita, joissa tarvitaan enemmän tukea. Tutkimuksen perusteella tällainen ajatus ei ole vailla perusteita. Joissakin vahvoissa tutkimusasetelmissa standardoitu arviointi on parantanut myöhempiä oppimistuloksia, ja hyötyjä on havaittu myös heikommassa asemassa olevilla oppilailla (Andersen & Nielsen, 2020). Toisaalta yhtä vahvoissa tutkimuksissa oppimisvaikutus on jäänyt hyvin pieneksi tai kokonaan puuttumaan (Green ym., 2025). Kansallinen koe ei siis ole ihmelääke, mutta sitä ei tutkimuksen perusteella voi myöskään kuitata hyödyttömäksi.

Olennaisempi kysymys näyttäisi olevan se, millainen koe rakennetaan ja mitä sen tuloksella tehdään.

Tämä ero on kulkenut läpi koko tutkimuskirjallisuuden. Kun standardoitu arviointi toimii ennen kaikkea tiedon lähteenä, se voi auttaa opettajaa, oppilasta ja koulutusjärjestelmää näkemään jotakin sellaista, mikä muuten jäisi havaitsematta. Kun samaan mittariin liitetään suurempia seurauksia – oppilaiden tulevaisuutta, koulujen julkisia vertailuja, rahoitusta, opettajien arviointia tai palkitsemista – myös järjestelmän käyttäytyminen alkaa muuttua. Tutkimuksessa on tällöin havaittu opetuksen kaventumista, testattavien sisältöjen korostumista ja jopa strategisia tapoja vaikuttaa siihen, ketkä kokeeseen osallistuvat (Coelli & Foster, 2024; Hofflinger & von Hippel, 2020; Ketonen & Atjonen, 2025).

Tässä mielessä kansallisia kokeita koskevan kiistan ehkä tärkein rajanveto ei kulje kokeiden kannattajien ja vastustajien välillä. Se kulkee mittaamisen ja mittarilla johtamisen välillä.

Campbellin (1979) varoitus on edelleen ajankohtainen: mitä enemmän määrällistä mittaria käytetään päätöksenteon perusteena, sitä enemmän toiminta alkaa mukautua juuri siihen. Ballin (2003) performatiivisuuden näkökulmasta kyse ei lopulta ole vain siitä, mitä opettaja tekee ennen koetta, vaan siitä, millaiseksi hyvä opettaja, hyvä oppilas ja hyvä koulu alkavat järjestelmän sisällä määrittyä. Jos onnistuminen tehdään näkyväksi pääasiassa koetuloksina, juuri koetuloksista tulee väistämättä yhä tärkeämpi osa onnistumisen käsitettä.

Tätä ei tarvitse pitää salaliittona tai opettajien moraalisena heikkoutena. Päinvastoin. Toimijat tekevät sitä, mihin järjestelmä heitä kannustaa. Jos koulun maine, rahoitus tai henkilöstön palkka riippuisi matematiikan koetuloksesta, olisi pikemminkin yllättävää, ellei matematiikan koetuloksen nostamiseen alettaisi käyttää enemmän aikaa ja huomiota.

Siksi kansallisia kokeita koskeva ratkaisu palautuu lopulta koulutuksen päämääriin. Biestan (2010, 2020) näkökulmasta koulun tehtävä ei rajoitu qualificationiin, tietojen ja taitojen tuottamiseen. Koulu myös sosialistaa oppilaita yhteiskuntaan ja kulttuuriin sekä vaikuttaa heidän kehittymiseensä itsenäisinä toimijoina. Juvonen ym. (2024) ovat nostaneet saman jännitteen esiin suomalaisen peruskoulun yhteydessä: ongelmalliseksi voi muodostua tilanne, jossa qualificationin logiikka alkaa hallita myös koulutuksen muita tarkoituksia.

Suomalainen lainsäädäntö tukee tätä laajaa käsitystä koulusta. Perusopetuksen tavoitteena ei ole vain antaa tietoja ja taitoja vaan tukea kasvua ihmisyyteen ja eettisesti vastuukykyiseen yhteiskunnan jäsenyyteen sekä edistää sivistystä ja tasa-arvoa (Perusopetuslaki 628/1998, 2 §). Juuri siksi hyvän kansallisen kokeen pitäisi ehkä osata olla riittävän vaatimaton. Sen pitäisi kertoa luotettavasti siitä, mitä se mittaa, mutta olla väittämättä mittaavansa kaikkea sitä, mikä koulussa on arvokasta.

Tämä on tärkeää myös siksi, että Suomi yrittää ratkaista samanaikaisesti useampaa ongelmaa. Oppimistuloksia pitää vahvistaa, mutta nuorten kuormitus on jo huomattavaa. High-stakes-kokeiden on havaittu lisäävän koulustressiä, vaikka tutkimus ei oikeuta päättelemään, että kansallinen koe itsessään aiheuttaisi koulu-uupumusta (Högberg & Horn, 2022). Samalla Suomen taloudelta kaivataan enemmän innovaatioita, uudistumiskykyä ja riskinottoa (OECD, 2025; Tutkimus- ja innovaationeuvosto, 2026). Myös tässä suhteessa olisi lyhytnäköistä määritellä koulun tuloksellisuus vain sen perusteella, kuinka tehokkaasti se tuottaa ennalta määriteltyjä mitattavia suorituksia.

Tutkimus ei siis anna yksinkertaista vastausta siihen, pitäisikö Suomeen ottaa kansalliset kokeet. Se antaa kuitenkin melko hyvän perustan kysyä, millaisia kansallisia kokeita ei ainakaan pitäisi rakentaa huomaamatta.

Jos kokeiden tavoitteena on tuottaa vertailukelpoista tietoa perustaitojen kehittymisestä, tunnistaa tuen tarpeita ja antaa opettajille uutta informaatiota, tutkimuksesta löytyy tälle perusteluja (Andersen & Nielsen, 2020; Beuchert ym., 2020). Sen sijaan mitä enemmän tuloksiin liitetään koulujen rankingeja, sanktioita, rahoitusta tai yksittäisten opettajien palkitsemista, sitä tarkemmin pitäisi arvioida myös järjestelmän ennakoimattomia seurauksia. Tällöin kysymys ei enää ole vain siitä, mittaako koe osaamista luotettavasti, vaan siitä, millaista koulua koe alkaa tuottaa.

Ehkä suomalaisessa keskustelussa tarvittaisiinkin hieman vähemmän kysymystä siitä, olemmeko kansallisten kokeiden puolesta vai niitä vastaan. Hyödyllisempiä olisivat kysymykset siitä, mitä haluamme mitata, miksi haluamme mitata sitä ja mitä aiomme tiedolla tehdä.

Koulu tarvitsee tietoa siitä, oppivatko lapset lukemaan, kirjoittamaan ja laskemaan. Heikkoja perustaitoja ei voi puolustaa vetoamalla sivistykseen, luovuuteen tai hyvinvointiin. Ilman perustietoja ja -taitoja myös mahdollisuudet itsenäiseen ajatteluun ja yhteiskunnalliseen osallistumiseen kaventuvat.

Mutta sama pätee toiseen suuntaan. Se, että jotakin koulutuksen tavoitetta on vaikeampi mitata standardoidulla kokeella, ei tee siitä vähemmän todellista eikä vähemmän arvokasta.

Ajatusta voi havainnollistaa vielä yhdellä pohjoismaisella vertailulla. Suomessa Ruotsin koulutusjärjestelmää on totuttu tarkastelemaan kriittisesti muun muassa kansainvälisten oppimistulosvertailujen kautta. PISA 2025 -tutkimuksessa suomalaisnuoret suoriutuivat OECD-maiden keskiarvoa paremmin matematiikassa, lukutaidossa ja luonnontieteissä, kun taas Ruotsin tulokset olivat kaikissa kolmessa lähellä OECD-maiden keskiarvoa (OECD, 2026a, 2026b). Jos koulutusjärjestelmien onnistumista arvioitaisiin vain näillä tuloksilla, vertailu näyttäisi siis melko selvältä.

Yhteiskuntaa tarkasteltaessa asetelma ei kuitenkaan ole yhtä yksinkertainen. Vuonna 2025 Ruotsin ostovoimakorjattu bruttokansantuote asukasta kohti oli 110 prosenttia EU keskiarvosta, Suomen 101 prosenttia (Eurostat, 2026). Ero ei rajoitu vain bruttokansantuotteeseen. OECD mukaan myös Suomen pääomamarkkinat ovat eurooppalaisittain varsin kehittyneet, mutta Ruotsi on Suomea ja muita EU-maita edellä lähes kaikilla pääomamarkkinoiden syvyyttä kuvaavilla mittareilla. Maaliskuuhun 2024 päättyneellä vuosikymmenellä Ruotsissa tehtiin enemmän pörssilistautumisia kuin Ranskassa, Saksassa, Alankomaissa ja Espanjassa yhteensä. Ruotsin venture capital -markkina on lisäksi kasvanut Pohjoismaiden suurimmaksi, ja maassa oli syntynyt 37 niin sanottua unicorn-yritystä eli yli miljardin dollarin arvoiseksi kasvanutta listaamatonta kasvuyritystä (OECD, 2025).

Näistä luvuista ei tietenkään voida päätellä, että Ruotsin koulutusjärjestelmä olisi maan taloudellisen tai yritystoiminnallisen menestyksen syy, eikä varsinkaan, että ruotsalainen "diskuteeraamisen" kulttuuri olisi osoitettu kansantaloudelliseksi kasvureseptiksi. Talouskehitykseen vaikuttavat lukemattomat tekijät, ja nykyinen vauraus sekä yritysrakenne ovat vuosikymmenten kehityksen tulosta.

Vertailu tekee kuitenkin näkyväksi yhden mittaamisen ongelman: maat voivat järjestyä hyvin eri tavoin sen mukaan, mitä onnistumisella tarkoitetaan ja millä sitä mitataan. Ruotsi jää Suomesta jälkeen PISA-tuloksissa, mutta sen talous-, pääomamarkkina- ja startup-ekosysteemi näyttäytyy monilla mittareilla Suomea dynaamisempana. Tämä ei todista koulutusjärjestelmien vaikutuksista kumpaankaan suuntaan. Se herättää kuitenkin kysymyksen: jos PISA-tuloksesta tehdään koko koulutusjärjestelmän arvosana, mitä kaikkea jää silloin arvosanan ulkopuolelle?

Jos koulutuksen pitäisi valmistaa ihmisiä paitsi kokeisiin myös työskentelemään, keskustelemaan, tekemään yhteistyötä, perustamaan yrityksiä, ottamaan riskejä, ratkaisemaan uusia ongelmia ja rakentamaan tulevaa yhteiskuntaa, kuinka suuren osan koulutusjärjestelmän onnistumisesta 15-vuotiaiden standardoitu koe lopulta pystyy meille kertomaan? PISA voi olla erittäin hyvä mittari siinä, mitä se mittaa, olematta koko koulutusjärjestelmän todistus.

Ehkä juuri tässä on kansallisia kokeita koskevan keskustelun tärkein muistutus. Mittaaminen voi auttaa meitä näkemään koulun paremmin. Mittarista ei kuitenkaan pitäisi tulla itse koulun määritelmää.

Lähteet:


Acosta, S., Garza, T., Hsu, H.-Y., Goodson, P., Padrón, Y., Goltz, H. H., & Johnston, A. (2020). The accountability culture: A systematic review of high-stakes testing and English learners in the United States during No Child Left Behind. Educational Psychology Review, 32(2), 327–352. doi:10.1007/s10648-019-09511-2

Andersen, S. C., & Nielsen, H. S. (2020). Learning from performance information. Journal of Public Administration Research and Theory, 30(3), 415–431. doi:10.1093/jopart/muz036

Au, W. (2007). High-stakes testing and curricular control: A qualitative metasynthesis. Educational Researcher, 36(5), 258–267. doi:10.3102/0013189X07306523

Ball, S. J. (2003). The teacher's soul and the terrors of performativity. Journal of Education Policy, 18(2), 215–228. doi:10.1080/0268093022000043065

Bergbauer, A. B., Hanushek, E. A., & Woessmann, L. (2024). Testing. Journal of Human Resources, 59(2), 349–388. doi:10.3368/jhr.0520-10886R1

Berry, J., Kannan, H., Mukherji, S., & Shotland, M. (2020). Failure of frequent assessment: An evaluation of India's continuous and comprehensive evaluation program. Journal of Development Economics, 143, 102406. doi:10.1016/j.jdeveco.2019.102406

Beuchert, L., Eriksen, T. L. M., & Krægpøth, M. V. (2020). The impact of standardized test feedback in math: Exploiting a natural experiment in 3rd grade. Economics of Education Review, 77, 102017. doi:10.1016/j.econedurev.2020.102017

Biesta, G. J. J. (2010). Good education in an age of measurement: Ethics, politics, democracy. Routledge.

Biesta, G. J. J. (2020). Risking ourselves in education: Qualification, socialization, and subjectification revisited. Educational Theory, 70(1), 89–104. doi:10.1111/edth.12411

Campbell, D. T. (1979). Assessing the impact of planned social change. Evaluation and Program Planning, 2(1), 67–90. doi:10.1016/0149-7189(79)90048-X

Coelli, M., & Foster, G. (2024). Unintended consequences of school accountability reforms: Public versus private schools. Economics of Education Review, 99, 102523. doi:10.1016/j.econedurev.2024.102523

Cui, Y., Hau, K.-T., & Zhao, Q. (2026). Does high-stakes testing hinder the cultivation of creative thinking? An international comparison from the perspective of institutional logics. Journal of East China Normal University (Educational Sciences), 44(4), 22–39. doi:10.16382/j.cnki.1000-5560.2026.04.003

Eurostat. (2026, 17. kesäkuuta). GDP per capita, consumption per capita and price level indices. Statistics Explained.

Gajda, A., Karwowski, M., & Beghetto, R. A. (2017). Creativity and academic achievement: A meta-analysis. Journal of Educational Psychology, 109(2), 269–299. doi:10.1037/edu0000133

Green, C. P., Nyhus, O. H., & Salvanes, K. V. (2025). Does testing young children influence educational attainment and wellbeing? Journal of Population Economics, 38, Article 20. doi:10.1007/s00148-025-01060-z

Hallituksen esitys eduskunnalle lukiolaiksi sekä laeiksi ylioppilastutkinnon järjestämisestä annetun lain ja opetus- ja kulttuuritoimen rahoituksesta annetun lain muuttamisesta. (2018). HE 41/2018 vp. Finlex.

Heissel, J. A., Adam, E. K., Doleac, J. L., Figlio, D. N., & Meer, J. (2021). Testing, stress, and performance: How students respond physiologically to high-stakes testing. Education Finance and Policy, 16(2), 183–208. doi:10.1162/edfp_a_00306

Hofflinger, A., & von Hippel, P. T. (2020). Missing children: How Chilean schools evaded accountability by having low-performing students miss high-stakes tests. Educational Assessment, Evaluation and Accountability, 32(2), 127–152. doi:10.1007/s11092-020-09318-8

Hovdhaugen, E., Flobakk-Sitter, F., & Fossum, L. W. (2025). Nordic research on organisation and implementation of exams and final assessments – A systematic scoping review. Educational Assessment, Evaluation and Accountability, 37, 443–464. doi:10.1007/s11092-025-09469-6

Högberg, B., & Horn, D. (2022). National high-stakes testing, gender, and school stress in Europe: A difference-in-differences analysis. European Sociological Review, 38(6), 975–987. doi:10.1093/esr/jcac009

Jerrim, J. (2021). National tests and the wellbeing of primary school pupils: New evidence from the UK. Assessment in Education: Principles, Policy & Practice, 28(5–6), 507–544. doi:10.1080/0969594X.2021.1929829

Juvonen, S., Huilla, H., Kosunen, S., Thrupp, M., & Toom, A. (2024). Conceptualizing socialization, qualification, and subjectification as purposes of education. Educational Theory, 74(3), 389–410. doi:10.1111/edth.12652

Kallio, J., Appelqvist-Schmidlechner, K., Helenius, J., & Yläkangas, T. (2026, 9. maaliskuuta). Nuoret kokevat koulutuspaineita ja arjen kuormitusta. THL-blogi.

Karhunen, H. (2026). Mitä tiedetään kansallisten kokeiden vaikutuksista? (Labore Työpapereita 362). Työn ja talouden tutkimuskeskus Labore.

Ketonen, L., & Atjonen, P. (2025). Mitä empiiristen tutkimusten perusteella tiedetään kansallisista kokeista? Kasvatus, 56(2), 238–248. doi:10.33348/kvt.157366

Ketonen, L., & Atjonen, P. (2026, 11. syyskuuta). Miten kansallisten kokeiden tutkimusnäyttöä tulisi tulkita? Kasvatustiedefoorumi.

Kraus, E. B., Goecke, B., & Jaggy, A.-K. (2026). The essence of creative thinking in PISA 2022: An item-level machine learning approach to construct validity at the facet level. Thinking Skills and Creativity, 61, 102205. doi:10.1016/j.tsc.2026.102205

Kyynäräinen, R., Holopainen, S., Metsämuuronen, J., Bin Qushem, U., Laakso, M.-J., & Alanko, K. (2026). Beyond performance: Emotions before and after semi-high-stakes mathematics testing among school-aged students. British Journal of Educational Psychology, 96(2), 648–673. doi:10.1111/bjep.70043

Laki ammatillisesta koulutuksesta 531/2017. (2017). Finlex.

Leschnig, L., Schwerdt, G., & Zigova, K. (2022). Central exams and adult skills: Evidence from PIAAC. Economics of Education Review, 90, 102289. doi:10.1016/j.econedurev.2022.102289

Lukiolaki 714/2018. (2018). Finlex.

Mansfield, J., & Slichter, D. (2026). The long-run effects of consequential school accountability. Journal of Labor Economics, 44(1), 53–81. doi:10.1086/731324

McElroy, K. (2023). Does test-based accountability improve more than just test scores? Economics of Education Review, 94, 102381. doi:10.1016/j.econedurev.2023.102381

OECD. (2025). OECD economic surveys: Finland 2025. OECD Publishing. doi:10.1787/985d0555-en

OECD. (2026a, 8. syyskuuta). PISA 2025 results (Volume I): Finland [Country note].

OECD. (2026b, 8. syyskuuta). PISA 2025 results (Volume I): Sweden [Country note].

Opetus- ja kulttuuriministeriö. (2026). Perusopetuksen oppimistuloskehitystä tarkastelevan työryhmän loppuraportti (Opetus- ja kulttuuriministeriön julkaisuja 2026:27). URN:ISBN:978-952-415-235-8

Perusopetuslaki 628/1998. (1998). Finlex.

Rawlings, B. S., & Cutting, S. J. (2024). Linking disparate strands: A critical review of the relationship between creativity and education. Educational Psychology Review, 36, Article 135. doi:10.1007/s10648-024-09973-z

Robson, D. A., Johnstone, S. J., Putwain, D. W., & Howard, S. (2023). Test anxiety in primary school children: A 20-year systematic review and meta-analysis. Journal of School Psychology, 98, 39–60. doi:10.1016/j.jsp.2023.02.003

Salmela-Aro, K., Kiuru, N., Leskinen, E., & Nurmi, J.-E. (2009). School Burnout Inventory: Reliability and validity. European Journal of Psychological Assessment, 25(1), 48–57. doi:10.1027/1015-5759.25.1.48

Sivistysvaliokunta. (2026). Perusopetuksen oppimistulokset, mahdollisuuksien tasa-arvo ja rahoitus (SiVL 9/2026 vp – O 20/2024 vp). Eduskunta.

Strathern, M. (1997). 'Improving ratings': Audit in the British University system. European Review, 5(3), 305–321. doi:10.1002/(SICI)1234-981X(199707)5:3<305::AID-EURO184>3.0.CO;2-4

Terveyden ja hyvinvoinnin laitos. (2025). Lasten ja nuorten hyvinvointi – Kouluterveyskysely 2025: Aiempaa useampi kokee terveytensä hyväksi ja moni voi keskustella usein asioistaan vanhempiensa kanssa (Tilastoraportti 44/2025). URN:NBN

Tutkimus- ja innovaationeuvosto. (2026). Kansalliset TKI-politiikan ja -toiminnan strategiset valinnat (Valtioneuvoston julkaisuja 2026:1). Valtioneuvosto. URN:ISBN:978-952-287-840-3

Valtioneuvoston asetus perusopetuslaissa tarkoitetun opetuksen valtakunnallisista tavoitteista ja perusopetuksen tuntijaosta 422/2012. (2012). Finlex.

Valtioneuvoston kanslia. (2025). Näkymiä Suomen tilaan: Kestävyysarviointi 2025 (Valtioneuvoston julkaisuja 2025:89). Valtioneuvosto. URN:ISBN:978-952-383-798-0

Share