Robots.txt je obična tekstualna datoteka u korijenu domene (siite.hr/robots.txt) koja botovima govori koje dijelove web mjesta smiju pregledavati. Prva je stvar koju bot pročita prije nego dodirne ijednu stranicu.
Kako izgleda
User-agent: *
Disallow: /wp-admin/
Disallow: /?orderby=
Allow: /
Sitemap: https://siite.hr/sitemap-index.xml
User-agent bira na koga se pravilo odnosi, Disallow blokira putanju, a redak Sitemap botovima daje popis stranica koje vrijedi pregledati. Pravila se čitaju odozgo prema dolje i vrijedi najspecifičnije podudaranje, a ne prvo po redu.
Čemu služi, a čemu ne
Služi za štednju crawl budgeta — blokirajte filtere, sortiranja, interne pretrage i beskorisne arhive da bot troši vrijeme na stranice koje zarađuju.
Ne služi za skrivanje sadržaja. Blokirani URL Google i dalje može indeksirati ako na njega vode linkovi — samo bez opisa. Za izbacivanje iz indeksa koristi se noindex meta tag, a on radi jedino ako stranica nije blokirana u robots.txt-u. Blokiranjem stranice s noindexom postižete suprotno od namjere.
Najskuplja greška
Disallow: / zaostao s razvojnog okruženja blokira cijeli sajt. Simptom je nagli pad indeksiranih stranica u Search Consoleu nakon redizajna — provjerite datoteku prvog dana nakon lansiranja.
AI botovi
Datoteka kontrolira i AI crawlere (GPTBot, ClaudeBot, PerplexityBot). Ako želite da vas AI pretraga citira, ne blokirajte ih — inače ste se sami isključili iz kanala.
Povezani pojmovi
Crawling
Proces kojim Googleovi botovi 'pregledavaju' web stranice kako bi otkrili i pročitali sadržaj. Prvi korak prije indeksacije i rangiranja.
Indeksiranje
Proces u kojem Google odlučuje hoće li pročitanu stranicu dodati u svoj indeks. Bez indeksacije stranica se ne može pojaviti u rezultatima.
Sitemap
XML datoteka koja tražilicama popisuje sve važne stranice web sjedišta. Pomaže Googleu brže i potpunije indeksirati sadržaj.
SEO
Optimizacija za tražilice — skup tehnika kojima web stranica postiže bolju vidljivost u organskim (neplaćenim) rezultatima Googlea.