427 blogiartikkelia analysoitu 75 sentillä
Kim Laine· 18.4.2026· 6 min
Suomalaisen SaaS-tuotteen blogissa oli 427 artikkelia, joista vanhimmat lähestyivät kymmentä ikävuotta. Arkistossa makasi tyypillinen sisältövelka: vanhentuneita veroprosentteja, COVID-ajan ohjeistuksia ja päällekkäisiä artikkeleita samoista aiheista. Kaikki tiesivät sen, kukaan ei ollut käynyt arkistoa läpi.
Syy on ymmärrettävä. Sisältöauditointi on perinteisesti viikkojen manuaalityö: avaa artikkeli, lue, arvioi, kirjaa exceliin, seuraava. Neljänsadan artikkelin arkistolla se on kuukauden projekti, eikä sellaista budjetoida koskaan.
Ajoin koko arkiston kielimalliputken läpi. Kustannus oli noin 0,75 euroa ja käsittelyaika 3-5 sekuntia per artikkeli.
Ensin data luettavaan muotoon
Ennen yhtäkään kielimallikutsua artikkelit piti saada rakenteiseen, koneellisesti luettavaan muotoon. Otin sivuston tietokannasta exportin, johon poimittiin jokaisesta artikkelista otsikko, kategoria, varsinainen sisältö, kirjoittaja ja julkinen osoite.
Ensimmäinen exportti Google Sheetsissä näytti vähän liiankin datarikkaalta, sillä sisältökentät olivat täynnä raakaa HTML:ää ja CSS:ää. Siivosin ja parsin ne pois, eikä syy ollut vain ihmissilmää miellyttävämpi lopputulos. Kaikki mikä artikkelin mukana syötetään kielimallille kasvattaa inputin kokoa, eli jokainen turha koodirivi kuluttaa tokeneita, ja 427 artikkelin mittakaavassa siivoamaton data olisi näkynyt suoraan ajon hinnassa.
Sama artikkeli ennen ja jälkeen siivouksen
Havainnekuva, merkkimäärät suuntaa antavia. Suhde oli tyypillisesti tätä luokkaa.
Mitä putki teki
Rakensin Google Sheetsin, Apps Scriptin ja Gemini-kielimallin varaan putken, joka teki jokaiselle artikkelille kolme asiaa:
- Tiivistelmä. Viiden bulletin TL;DR tuotteen omalla äänensävyllä, eli yrityksen tone-of-voice-ohjeistus sisällytettiin suoraan Geminille annettuun promptiin. Lopputulos ei ole geneeristä yhteenvetoa vaan julkaisuvalmista tekstiä.
- Vanhentuneisuustarkistus kahdessa vaiheessa. Ensin sääntöpohjainen seula poimi ilmeiset merkit, sitten kielimalli arvioi muuttuvat faktat, eli esimerkiksi veroprosentit, lakiviittaukset ja vuosilukuihin sidotut ohjeet.
- Duplikaattien tunnistus. Samasta aiheesta kirjoitetut päällekkäiset artikkelit ryhmiin, jotta yhdistämispäätökset voi tehdä kokonaisuus kerrallaan.
Putkeen rakennettiin myös kevyet suojakaiteet (guard-rails), kuten aina kun kielimalli päästetään ison massan kimppuun: käsitellyt artikkelit merkitään, jotta uusintakierros ei aja samoja rivejä uudestaan, ja ajolla on katto, jonka jälkeen putki pysähtyy eikä jää looppiin. Ilman näitä pieni virhe voi kertautua sadoiksi turhiksi kutsuiksi, eli tokenilasku kasvaa hiljaa vaikka lopputulos ei parane senttiäkään.
Putki kokonaisuutena
Tietokantaexport
427 artikkelia: otsikko, kategoria, sisältö, kirjoittaja ja julkinen osoite.
Siivous ja parsinta
HTML ja CSS pois, eli kielimallin input kutistuu murto-osaan ja tokenilasku sen mukana.
Google Sheets + Apps Script
Käsittelyjono ja suojakaiteet: käsitellyt rivit merkitään, ajolla on katto.
Gemini käsittelee, 3–5 s per artikkeli
Kolme analyysia jokaiselle artikkelille samalla kutsukierroksella.
Ihminen päättää
Säilytä, päivitä vai yhdistä. Putki luokittelee, ei päätä.
Takaisin sivustolle
Tiivistelmät artikkelien yhteyteen, koneluettavassa muodossa myös kielimallihakuja varten.
Tiivistelmät eivät jääneet raporttiin. Ne syötetään sivustolle artikkelien yhteyteen omaan kenttäänsä, komponenttiin joka on rakennettu myös kielimallihakuja varten. Kun Perplexity tai Google poimii vastaukseensa lähteitä, tiiviisti ja koneluettavasti muotoiltu ydinsisältö on halvin yksittäinen keino parantaa todennäköisyyttä tulla siteeratuksi.
Kuukauden työ vai kahvikupin hinta
Tässä kohtaa joku laskee, että 427 artikkelia kertaa vaikka vartti per artikkeli on reilut sata tuntia työtä, ja toteaa säästön. Se laskelma on totta, mutta se ei ole pointti.
Pointti on, että sadan tunnin projektia ei koskaan aloiteta, ja 75 sentin ajo aloitetaan tänään. Kun auditin hinta putoaa tarpeeksi alas, se lakkaa olemasta projekti ja muuttuu prosessiksi: saman putken voi ajaa vaikka neljännesvuosittain, jolloin sisältövelka ei ehdi kasaantua. Sisältöauditointi palveluna, eli se konsulttiraportti joka ostetaan kerran ja jonka suositukset vanhenevat laatikkoon, on kuoleva tuote. Auditointi jatkuvana prosessina on vasta syntymässä, ja sen työkalut jokainen tiimi voi rakentaa itse.
Missä ihmistä edelleen tarvitaan
Rehellinen rajaus: putki ei päättänyt yhdenkään artikkelin kohtalosta. Se luokitteli, ihminen päätti. Kielimalli ei tiedä, mikä vanhentuneelta näyttävä artikkeli tuo edelleen liidejä, eikä se tunne tuotestrategiaa, jonka takia jokin aihe halutaan pitää esillä päällekkäisyyksistä huolimatta.
Kielimallin arvio vanhentuneisuudesta on sekin vain arvio. Siksi putki oli kaksivaiheinen: sääntöpohjainen seula löytää sen minkä säännöillä voi löytää, ja kielimalli merkitsee epävarmat tapaukset ihmisen tarkistettavaksi sen sijaan että väittäisi tietävänsä. Tekoälyputken tärkein suunnittelupäätös on se, missä kohdassa se lakkaa luottamasta itseensä.
Jos organisaatiosi blogiarkisto on samassa kunnossa kuin useimmat, eli kukaan ei oikeasti tiedä mitä siellä on, tämä on yksi konkreettisimmista paikoista aloittaa tekoälyn hyödyntäminen. Ei chatbotista, vaan omasta sisällöstä, jonka arvo on jo maksettu ja joka odottaa löytämistään.
Jos tämä aihe on teillä ajankohtainen, katso Automaatiot tai varaa etäpalaveri.