mainostoimisto.ai
Oulu · 06:00:00

5 minGEO — tekoälyhakuKirjoitti kone · faktat tarkisti kone · vastuu: Ilkka Immonen

Perplexity ja suomenkieliset lähteet: mitä se lainaa ja miksi

Vastaus lyhyestiPerplexity hakee omasta indeksistään, joka pilkkoo jokaisen sivun pieniin osiin ja pisteyttää osat erikseen kysymystä vasten. Se lainaa siis sivun kohtaa, ei sivua, ja numeroi lähteet vastaukseen. Suomenkielinen sivu pääsee lähteeksi, kun PerplexityBot saa lukea sen ja kysymykseen vastaava kohta on sivulla selvästi. Suomenkielisestä lainaamisesta ei ole julkista tutkimusta, joten se pitää testata itse.

Perplexity on kolmesta suuresta tekoälyhausta se, joka on kertonut eniten omasta hakukoneestaan. Se on myös se, jonka lainaukset osuvat useimmin Googlen kärkituloksiin. Molemmat asiat auttavat suomenkielistä yritystä, kun tietää, mitä niistä seuraa.

Perplexityllä on oma indeksi, ja se on tuore

Toisin kuin ChatGPT, joka hakee kumppanihakukoneilta (ks. Miten ChatGPT valitsee lähteensä), Perplexity kertoo hakevansa omasta indeksistään. Yhtiön mukaan indeksi kattaa “hundreds of billions of webpages”, ja “each second, our systems process tens of thousands of index update requests” (Perplexity). Sama infrastruktuuri pyörittää julkista vastauskonetta ja kehittäjille myytävää hakurajapintaa.

Indeksin täyttää PerplexityBot, joka Perplexityn mukaan “is designed to surface and link websites in search results on Perplexity” ja jota “is not used to crawl content for AI foundation models” (Perplexity). Se noudattaa robots.txt-tiedostoa. Jos suomalaisen yrityksen sivusto ei näy Perplexityssä, ensimmäinen tarkistus on, onko PerplexityBot estetty jollain yleisellä “estä kaikki tekoälybotit” -säännöllä, joita palomuurit ja lisäosat tarjoavat.

Toinen robotti, Perplexity-User, hakee sivun silloin, kun käyttäjä pyytää sitä, ja “generally ignores robots.txt rules” (Perplexity). Cloudflare syytti Perplexityä elokuussa 2025 siitä, että yhtiö haki sivuja myös ilmoittamattomalla Chrome-selaintunnisteella, kun sen ilmoitettu robotti oli estetty, ja poisti sen vahvistettujen bottien listalta (Cloudflare). Perplexity vastasi samana päivänä, että käyttäjän pyynnöstä tehdyt haut “prioritize your experience over robots.txt restrictions because these requests happen on your behalf” ja että Cloudflare sekoitti liikenteen toisen yhtiön selainpalveluun (Perplexity). Kumpi on oikeassa, ei tästä ratkea. Yritykselle riittää tieto, että robots.txt ei ole Perplexityn kohdalla ehdoton raja.

Perplexity lainaa sivun kohtaa, ei sivua

Tämä on tärkein asia, jonka Perplexity on julkisesti kertonut. Sen hakuinfrastruktuuri “divides documents up into fine-grained units. These sub-document units are individually surfaced and scored against the original query parameters” (Perplexity). Hakukone ei siis kysy, onko tämä sivu hyvä, vaan onko tässä sivun kappaleessa vastaus.

Maaliskuussa 2026 Perplexity kuvasi, miten se poimii katkelmat. Sivun jaksot luokitellaan: “vital spans that must be included in the snippet, various classes of ‘irrelevant’ spans that should be excluded, duplicates, and other categories”. Uudistus paransi taulukoiden, sisäkkäisten listojen ja dynaamisesti ladatun sisällön käsittelyä (Perplexity). Tavoite on lyhyempi ja tarkempi katkelma, koska sen lukee kielimalli, jonka konteksti maksaa.

Suomenkieliselle kirjoittajalle tämä tarkoittaa, että sivun rakenteella on väliä, mutta eri syystä kuin toimistot yleensä sanovat. Sivua ei tarvitse pilkkoa pieniksi sivuiksi; Google sanoo sen turhaksi, ja Perplexity pilkkoo sen itse. Sen sijaan jokaisen väliotsikon alla pitää olla kappale, joka kelpaa yksinään vastaukseksi siihen, mitä otsikko lupaa. Hintataulukko, jossa on oikeat euromäärät, on parempi kuin lause “hinnat vaihtelevat”. Jos vastaus on levällään kolmessa kappaleessa, mikään niistä ei saa korkeaa pistettä.

Perplexityn ohje käyttäjille kuvaa kolme vaihetta: se tulkitsee kysymyksen, “searches the internet, gathering information from authoritative sources like articles, websites, and journals” ja kokoaa vastauksen numeroiduilla lähdeviitteillä (Perplexity Help Center). Research-tila tekee “dozens of searches automatically”. Mitä “authoritative” tarkoittaa käytännössä, Perplexity ei kerro. Sitä ei tässä arvata.

Perplexity nojaa Googlen kärkeen enemmän kuin ChatGPT

Ahrefs vertasi elokuussa 2025 neljän tekoälyhaun lainauksia 15 000 pitkän hännän kyselyllä Googlen ja Bingin tuloksiin. Perplexityn lainaamista osoitteista 28,6 prosenttia oli Googlen top 10:ssä ja 14,0 prosenttia Bingin, kun ChatGPT:llä vastaavat osuudet olivat 8,0 ja 8,1 prosenttia (Ahrefs). Aineisto on englanninkielinen ja yhdysvaltalainen, mutta suunta on selvä: Perplexity on tekoälyhauista se, jossa Google-sijoitus ennustaa lainausta parhaiten.

Suomenkieliselle yritykselle se on hyvä uutinen. Sivu, joka on jo Googlen kärjessä suomenkielisellä kysymyksellä, on Perplexityssä lähempänä lainausta kuin ChatGPT:ssä. Toinen puoli: 71 prosenttia Perplexityn lainauksista tuli Googlen kärjen ulkopuolelta, joten sijoitus ei riitä yksin. Tämän sivuston pilari GEO: näin yritys näkyy tekoälyhauissa selittää, miksi: malli hakee eri kysymyksiä kuin käyttäjä kirjoitti.

Suomenkielisestä lainaamisesta ei ole tutkimusta

Etsin tätä artikkelia varten tutkimusta siitä, kuinka usein Perplexity lainaa suomenkielisessä kysymyksessä suomenkielistä sivua ja kuinka usein englanninkielistä. En löytänyt. Kaikki julkiset vertailut ovat englanniksi. Jos joku toimisto väittää tietävänsä osuuden, kysy aineistoa.

Se, mitä dokumentaatiosta tiedetään: Perplexityn hakurajapinnassa on search_language_filter, joka suodattaa tulokset ISO 639-1 -kielikoodeilla, sekä country-parametri, jolla saa “more geographically relevant results” (Perplexity). Indeksissä on siis kielitieto ja maatieto. Julkinen Perplexity ei kerro, miten se painottaa niitä suomenkielisessä kysymyksessä. Tätä ei ole tällä sivustolla vielä testattu, joten siitä ei väitetä tässä mitään.

Näin mittaat suomenkieliset lainaukset omalla alallasi

Puuttuvan tutkimuksen korvaa oma koe, ja Perplexityssä se on helpompi tehdä toistettavasti kuin ChatGPT:ssä, koska hakurajapinta antaa saman indeksin käyttöön kielisuodattimella. Tämä sivusto ei ole vielä ajanut koetta; alla on protokolla. Se on prosessi, siksi numeroitu.

  1. Kirjoita 20 suomenkielistä kysymystä, joita asiakkaasi kysyvät. Puolet paikallisia (“kotikampaaja Oulu hinta”), puolet yleisiä (“miten valitsen tilitoimiston”).
  2. Kysy ne julkisessa Perplexityssä uudessa selainikkunassa ilman kirjautumista. Kirjaa jokaisen vastauksen numeroidut lähteet, niiden kieli ja domain.
  3. Aja samat kysymykset hakurajapinnan kautta kahdesti: kerran ilman suodattimia, kerran parametreilla search_language_filter = fi ja country = FI. Tallenna max_results-arvolla 20 koko lista.
  4. Laske kolme lukua: suomenkielisten lähteiden osuus julkisessa vastauksessa, oman domainin esiintymät ja se, montako sinun sivuasi nousee kielisuodattimella mutta ei ilman.
  5. Avaa ne omat sivusi, jotka rajapinta palautti mutta joita julkinen vastaus ei lainannut. Katso, missä kohdassa vastaus on. Jos se on kolmannessa kappaleessa väliotsikon alla, joka lupaa muuta, siirrä se.

Neljännen kohdan viimeinen luku on hyödyllisin. Se kertoo, ovatko sivusi indeksissä ja häviävätkö ne kielirajan yli englanninkielisille, vai puuttuvatko ne kokonaan. Ensimmäinen korjataan sisällöllä, toinen robots.txt-tiedostolla ja indeksoinnilla.

Kun testi on tehty, tulokset kannattaa toistaa kuukausittain, koska Perplexity päivittää indeksiä jatkuvasti ja vastaukset vaihtelevat. Artikkeli Näin testaat näkyvyytesi ChatGPT:ssä antaa vastaavan protokollan ChatGPT:lle, ja pilari Näkyvyyden mittaaminen tekoälyssä kokoaa mittarit yhteen.

Kysymyksiä, joita tästä haetaan

Lukeeko Perplexity suomenkielisiä sivuja?

Kyllä. Perplexityn hakurajapinnassa on kielisuodatin ISO 639-1 -koodeilla, ja suomi on niistä yksi. Siitä, kuinka usein suomenkielisiä sivuja lainataan englanninkielisten sijaan, ei ole julkista tutkimusta.

Käyttääkö Perplexity sivuni sisältöä mallien kouluttamiseen?

Perplexityn mukaan PerplexityBot ei kerää sisältöä tekoälymallien kouluttamiseen vaan hakutuloksia varten. Sen voi estää robots.txt-tiedostossa, mutta silloin sivu putoaa myös Perplexityn hausta.

Lähteet

  1. Perplexity: Perplexity CrawlersPerplexityBot hakua varten, ei koulutukseen; Perplexity-User ohittaa robots.txt:n yleensä; IP-listat
  2. Perplexity: Introducing the Perplexity Search APIIndeksi satoja miljardeja sivuja; kymmeniä tuhansia päivityspyyntöjä sekunnissa; sivut pilkotaan yksiköihin, jotka pisteytetään erikseen (25.9.2025)
  3. Perplexity: Search API: Better Extraction, Dynamic BenchmarksKatkelmien poiminta: välttämättömät ja epäolennaiset jaksot, taulukot ja sisäkkäiset listat (11.3.2026)
  4. Perplexity Help Center: How does Perplexity work?Hakee, kokoaa ja numeroi lähteet; Research tekee kymmeniä hakuja
  5. Perplexity: Search API guidesearch_language_filter (ISO 639-1), country, search_domain_filter, max_results 1–20
  6. Ahrefs: Only 12% of AI Cited URLs Rank in Google's Top 10 for the Original PromptPerplexityn lainauksista 28,6 % Googlen top 10:ssä, 14,0 % Bingin (15 000 kyselyä, elokuu 2025)
  7. Cloudflare: Perplexity is using stealth, undeclared crawlers to evade website no-crawl directivesCloudflaren syytös 4.8.2025: ilmoittamaton selaintunniste estojen ohi
  8. Perplexity: Agents or Bots? Making Sense of AI on the Open WebPerplexityn vastaus 4.8.2025: käyttäjän pyynnöstä tehdyt haut ohittavat robots.txt:n tarkoituksella

Löysitkö virheen?

Tämän tekstin kirjoitti kone ja toinen kone tarkisti faktat. Ihminen ei ole lukenut jokaista tekstiä. Jos jokin on väärin, kerro — ilmoitus menee Ilkka Immoselle, korjaus tehdään ja se merkitään tähän tekstiin näkyviin.

Sama menetelmä on myytävänä.

Jos löysit tänne hakukoneen tai tekoälyn kautta, näit jo tuloksen. Cosmic Thing tekee saman sinun yrityksellesi: verkkosivut, joista näet vaihtoehdot ennen buildia, ja sisältökoneen, joka tarkistaa omat faktansa ja kertoo sen lukijalle.

Pyydä tarjousKuka tämän takana on