Robots.txt, sitemap og AI-crawlere: Hva bør du egentlig tillate?
· AI-synlighet · 7 min
GPTBot, PerplexityBot, Google-Extended og de andre AI-crawlerne leser robots.txt. Lær forskjellen på trenings- og søkecrawlere, og hvilke du bør slippe inn.

Robots.txt er en liten tekstfil som ligger i roten av nettstedet ditt, og som de fleste bedriftseiere aldri har åpnet. Likevel avgjør den hvilke roboter som får lese innholdet ditt. Før handlet dette nesten bare om Googlebot og Bingbot. I dag banker en hel rekke AI-crawlere på døren: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot og flere til. Hvilke av dem du slipper inn, påvirker om bedriften din kan dukke opp i svarene fra ChatGPT, Perplexity og andre AI-tjenester.
I denne artikkelen går vi gjennom hvordan robots.txt og sitemap fungerer, hva som skiller de ulike AI-crawlerne fra hverandre, og hvilke valg som gir mening for en typisk norsk bedrift.
Hva robots.txt faktisk gjør (og ikke gjør)
Robots.txt ligger alltid på samme adresse, for eksempel dittdomene.no/robots.txt. Filen består av grupper med regler. Hver gruppe starter med en linje som sier hvilken robot reglene gjelder for (User-agent), etterfulgt av Disallow- og Allow-linjer som sier hvilke stier roboten ikke skal, eller skal, besøke.
Det er viktig å forstå tre ting om robots.txt:
- Filen er frivillig å følge. Seriøse aktører som Google, Microsoft, OpenAI, Anthropic og Perplexity oppgir at crawlerne deres respekterer den, men filen er ingen teknisk sperre. Innhold som må være hemmelig, skal beskyttes med innlogging, ikke med robots.txt.
- Disallow stopper crawling, ikke nødvendigvis indeksering. Google kan fortsatt vise en blokkert URL i søkeresultatene hvis andre sider lenker til den, bare uten beskrivelse.
- Den mest spesifikke User-agent-gruppen vinner. Har du en egen gruppe for GPTBot, følger GPTBot den gruppen og ignorerer reglene under stjernen (User-agent: *).
Hvis du vil hindre at en side vises i Google, er det derfor noindex du trenger, enten som meta-tagg i HTML-en eller som X-Robots-Tag i HTTP-headeren. Og her kommer en klassisk felle: Hvis du både blokkerer siden i robots.txt og legger på noindex, kan ikke Google crawle siden og ser dermed aldri noindex-instruksen. Vil du fjerne en side fra indeksen, må den altså være crawlbar til Google har fått med seg noindex.
Treningscrawlere og søkecrawlere er ikke det samme
Det viktigste skillet når du skal ta stilling til AI-crawlere, er hva innholdet ditt brukes til. Grovt sett finnes det to typer:
- Treningscrawlere samler inn tekst som brukes til å trene fremtidige språkmodeller. Blokkerer du dem, havner innholdet ditt ikke i fremtidige treningsdata fra den aktøren, men det gir ingen direkte trafikk den ene eller andre veien.
- Søke- og hentecrawlere henter innhold i sanntid for å svare på et konkret spørsmål fra en bruker, ofte med lenke til kilden. Blokkerer du dem, kan du ikke bli sitert eller lenket til i disse svarene.
For de fleste bedrifter som ønsker å bli anbefalt av AI-assistenter, er det særlig søkecrawlerne det er viktig å slippe inn. Det er de som gjør at ChatGPT eller Perplexity kan finne åpningstidene, tjenestene og prisene dine når noen spør om det i dag.
De viktigste AI-crawlerne du bør kjenne til
Her er en oversikt over de mest relevante user-agentene per 2026. Navnene er hentet fra aktørenes egen dokumentasjon, som du bør sjekke jevnlig fordi listene endres.
- GPTBot (OpenAI): samler inn innhold som kan brukes til å trene OpenAIs modeller.
- OAI-SearchBot (OpenAI): brukes til søkefunksjonen i ChatGPT, slik at nettstedet ditt kan vises og lenkes til i søkeresultatene der.
- ChatGPT-User (OpenAI): brukes når en ChatGPT-bruker, eller en handling i ChatGPT, ber om å besøke en bestemt side. Dette er brukerinitiert henting, ikke tradisjonell crawling.
- PerplexityBot (Perplexity): indekserer nettsider slik at de kan vises og lenkes til i svarene fra Perplexity.
- ClaudeBot (Anthropic): samler inn innhold som kan brukes til modelltrening. Anthropic har også egne agenter for søk og brukerinitiert henting.
- Google-Extended (Google): dette er ikke en egen robot, men et kontrolltoken. Det er fortsatt Googlebot som crawler, men ved å blokkere Google-Extended sier du nei til at innholdet brukes til å trene og forankre Gemini-modellene. Det påvirker ikke rangeringen din i Google Søk, og det styrer heller ikke om du vises i AI-oversikter, som bygger på Googles vanlige søkeindeks.
- Applebot-Extended (Apple): også et kontrolltoken, som styrer om innhold Applebot har hentet kan brukes til å trene Apples generative modeller. Vanlig Applebot brukes blant annet til Siri og Spotlight.
- CCBot (Common Crawl): bygger et åpent nettarkiv som mange har brukt som treningsdata for språkmodeller.
Hva bør en vanlig bedrift tillate?
Det finnes ikke ett riktig svar, men for en typisk norsk bedrift som selger tjenester eller produkter og ønsker å bli funnet, er dette et fornuftig utgangspunkt:
- Tillat alltid Googlebot og Bingbot. Bing er dessuten en viktig datakilde for flere AI-tjenester.
- Tillat søkecrawlerne OAI-SearchBot, ChatGPT-User og PerplexityBot, slik at du kan bli sitert og lenket til i AI-svar.
- Ta et bevisst valg om treningscrawlerne GPTBot, ClaudeBot, Google-Extended, Applebot-Extended og CCBot.
Valget om trening handler om hva slags innhold du har. Har du markedsføringsinnhold som skal gjøre bedriften kjent, er det sjelden noe å tape på å være med i treningsdata. Tvert imot kan det bidra til at modellene kjenner til merkevaren din. Er innholdet ditt selve produktet, for eksempel betalte fagartikler, kurs eller unike databaser, kan det være gode grunner til å si nei.
Vil du for eksempel tillate søk, men blokkere trening hos OpenAI, kan reglene se slik ut:
- User-agent: GPTBot
- Disallow: /
- User-agent: OAI-SearchBot
- Allow: /
I selve filen står hver linje for seg, uten bindestrek foran, og det er lurt å skille gruppene med en tom linje. Pass på at du ikke ved et uhell blokkerer alt med en generell regel under User-agent: *, som AI-crawlere uten egen gruppe da faller tilbake på.
Ikke blokker CSS, JavaScript og bilder
En vanlig feil, ofte arvet fra gamle maler eller utvidelser, er å blokkere mapper med stilark, skript og bilder. Google gjengir siden omtrent slik en nettleser gjør, og trenger disse filene for å forstå layout, mobilvennlighet og innhold. Blokkerte ressurser kan gjøre at Google ser en ødelagt eller tom side. På WordPress-nettsteder ser man av og til at hele wp-content eller wp-includes er blokkert. Det bør du fjerne.
Blokker heller bare det som faktisk ikke har verdi i søk, for eksempel interne søkeresultater, handlekurv, kasse og innloggingssider.
Sitemap: kartet du gir robotene
Et XML-nettstedskart er en liste over URL-ene du ønsker at søkemotorer skal kjenne til, gjerne med dato for siste endring. Det garanterer ikke indeksering, men gjør det lettere for crawlere å finne nye og oppdaterte sider.
Tre enkle grep gjør sitemapen din mer nyttig:
- Legg inn en linje i robots.txt som peker til sitemapen, for eksempel Sitemap: https://dittdomene.no/sitemap.xml. Linjen må bruke full URL og gjelder for alle crawlere som leser filen.
- Send inn sitemapen i Google Search Console og Bing Webmaster Tools, så får du rapporter om hvilke sider som faktisk blir indeksert.
- Ta bare med sider som skal indekseres og svarer med statuskode 200. Sider med noindex, omdirigeringer og 404-sider hører ikke hjemme i sitemapen.
Sørg også for at datoen for siste endring gjenspeiler reelle innholdsendringer. Hvis alle sider alltid får dagens dato, lærer crawlerne raskt at signalet ikke er til å stole på.
Hva med llms.txt?
Du har kanskje hørt om llms.txt, en foreslått fil i markdown-format som skal gi språkmodeller en kortfattet oversikt over nettstedet med lenker til det viktigste innholdet. Det er et forslag fra miljøet rundt AI-utvikling, ikke en vedtatt standard, og det er foreløpig uklart i hvilken grad de store AI-tjenestene faktisk bruker filen. Det skader neppe å lage en, men den erstatter ikke en ryddig robots.txt, en god sitemap og et nettsted der innholdet er tilgjengelig som vanlig HTML.
Slik går du frem i praksis
- Åpne dittdomene.no/robots.txt i nettleseren og les hva som faktisk står der.
- Sjekk at viktige sider, CSS, JavaScript og bilder ikke er blokkert.
- Bestem deg for hvilke AI-crawlere du vil tillate, og skriv egne grupper for dem.
- Legg til Sitemap-linjen og kontroller at sitemapen bare inneholder indekserbare sider.
- Test endringene med robots.txt-rapporten i Google Search Console.
- Gå gjennom filen på nytt ved større endringer på nettstedet og minst én gang i året, fordi nye crawlere stadig dukker opp.
Robots.txt har gått fra å være en teknisk detalj til å bli et strategisk valg. Skillet mellom treningscrawlere og søkecrawlere gjør at du kan være restriktiv med det ene og åpen for det andre. For de fleste bedrifter er det viktigste å ikke blokkere søkemotorene og AI-tjenestenes søkecrawlere ved et uhell, og å gi dem en god sitemap å navigere etter. Vil du se hvordan nettstedet ditt faktisk fremstår for både Google og AI-assistenter, kan du kjøre en gratis analyse på HighRank.io og få en oversikt over hva som bør ryddes opp i.


