- A tanítás és az AI-keresés két külön döntés, az egyiket tilthatod úgy, hogy a másikat engeded.
- A robots.txt kérés, műszaki zárat nem ad, valódi kizárás csak tűzfalszinten, ellenőrzött IP-tartományok alapján lehetséges.
- Egy kis magyar oldalnak a díjazott hozzáférés inkább kontrolleszköz, érdemi bevételt aligha hoz.
- Döntés előtt legalább 4-6 hét alapállapotot rögzíts a szervernaplóban, a GA4-ben és egy idézettségi próbával.
- Kezeld a döntést kísérletként, és előre rögzített időpontban nézd át újra.
Egy tartalomtulajdonos ma három irányba mehet az AI-cégekkel szemben. Szabadon engedi a botokat, mert neki a láthatóság ér a legtöbbet. Letilt mindent, mert úgy érzi, a tartalmát ingyen viszik el. Vagy feltételhez köti a hozzáférést, akár díjazáshoz, valamelyik szolgáltatói megoldáson keresztül. Egyik sem jó vagy rossz önmagában. Ez a cikk abban segít, hogy a saját számaid alapján dönts, és a döntés után se vakon repülj.

A szövegben háromféle állítást különítünk el. Hivatalosan igazolt az, ami a szolgáltatók nyilvános dokumentációjában, jogszabályban vagy szabványban szerepel. Saját tapasztalat az, amit weboldalak üzemeltetése közben rendszeresen látunk. Szakmai feltételezés az, ami logikus következtetés, de nincs mögötte mérés vagy hivatalos megerősítés.
Miért kell egyáltalán döntened arról, ki olvashatja a tartalmadat?
Azért, mert ha te nem döntesz, a tárhelyed, a CDN-szolgáltatód vagy egy biztonsági bővítmény alapbeállítása dönt helyetted. Sok tulajdonos úgy tudja, hogy az oldala nyitva áll minden AI-asszisztens előtt, közben egy tűzfalszabály régóta kizárja a botokat.
Hivatalosan igazolt. A Cloudflare 2025 nyarán bejelentette, hogy az új domaineknél alapból blokkolja az ismert AI-crawlereket, a tulajdonos pedig a felületen engedheti vissza őket. Ha az oldalad Cloudflare mögött van, ez a beállítás a te oldaladra is vonatkozhat.
Saját tapasztalat. Ha egy oldal nem jelenik meg a ChatGPT vagy a Perplexity válaszaiban, gyakran nem a tartalommal van baj. A szervernaplóból kiderül, hogy a keresőbotok 403-as választ kapnak, és erről senki sem tudott. Ezért az első lépés mindig a jelenlegi állapot megnézése, a döntés csak utána jön.
Milyen AI-botok kérik le a tartalmadat, és mire használják?
Három csoportot érdemes megkülönböztetni. A tanító botok modellfejlesztéshez gyűjtenek szöveget. A kereső botok az AI-keresők indexét építik, és ebből lesz a forrásmegjelölés. A felhasználói lekérés pedig akkor történik, amikor valaki egy asszisztensnek konkrétan a te oldaladat adja meg, vagy az asszisztens a kérdés miatt valós időben megnyitja.
- OpenAI. A
GPTBota tanításhoz, azOAI-SearchBota ChatGPT keresési funkciójához, aChatGPT-Usera felhasználói kérésre induló lekérésekhez tartozik. - Anthropic. A
ClaudeBota tanításhoz, aClaude-SearchBota kereséshez, aClaude-Usera felhasználói lekérésekhez tartozik. - Perplexity. A
PerplexityBotaz indexeléshez, aPerplexity-Usera felhasználói lekérésekhez tartozik. - Google. A
Google-Extendednem külön bot, hanem robots.txt-token. Azt szabályozza, hogy a Googlebot által begyűjtött tartalmat a Google felhasználhatja-e a Gemini-modellek tanításához és a válaszok megalapozásához. - Common Crawl. A
CCBotnyilvános adatkészletet épít, amelyből sok modellfejlesztő dolgozik.
Hivatalosan igazolt. A fenti nevek és szerepek a szolgáltatók saját crawler-dokumentációjából származnak. A Google leírása szerint a Google-Extended tiltása nem befolyásolja, hogy az oldalad szerepel-e a Google Keresőben, az AI-áttekintések pedig a Kereső részeként működnek. Ha onnan maradnál ki, azt a Kereső saját eszközeivel (például nosnippet) lehet szabályozni, ami viszont a hagyományos találati megjelenésedet is érinti. Az OpenAI és az Anthropic dokumentációja jelzi, hogy a felhasználói kérésre induló lekérésekre a robots.txt másképp vonatkozhat, ezért ezt mindig a friss leírásban ellenőrizd.
A gyakorlati következmény egyszerű. A tanítás és a keresés két külön döntés, az egyiket tilthatod úgy, hogy a másikat engeded.
Mit nyersz és mit kockáztatsz, ha szabadon engeded a hozzáférést?
Szabad hozzáféréssel növeled az esélyét annak, hogy az AI-válaszok idéznek, és linkkel hivatkoznak rád. Cserébe a tartalmad egy része kattintás nélkül is eljut a felhasználóhoz, és a modellek tanításába is bekerülhet.
Saját tapasztalat. A legtöbb szolgáltató kisvállalkozás oldalán az AI-asszisztensekből érkező forgalom ma még kis részarány. Ezek a látogatók viszont sokszor már konkrét kérdéssel, összehasonlítás után érkeznek, ezért jellemzően nem ritkábban jutnak el az ajánlatkérésig, mint az organikus látogatók átlaga.
Szakmai feltételezés. Egy helyi szolgáltatónál, ahol az a cél, hogy a „ki csinál ilyet a közelben” kérdésre a te neved jöjjön ki, a láthatóság többet ér, mint amennyit a tartalom elzárásával megvédhetsz. Egy fodrászat nyitvatartásán vagy egy villanyszerelő szolgáltatáslistáján nincs mit licencelni.
A kockázat inkább a szerveroldalon jelentkezik. Egyes botok sűrűn és agresszíven kérnek le oldalakat, és ez lassíthatja a kiszolgálást. Ez azonban jó eséllyel kezelhető sebességkorlátozással, teljes tiltás nélkül.
Mikor ésszerű a teljes tiltás?
Akkor, ha a tartalmad maga a termék, és minden kattintás nélküli felhasználás közvetlenül a bevételedből vesz el. Ilyen lehet egy fizetős szakmai adatbázis, egy egyedi kutatási anyag vagy egy előfizetéses kiadvány.
Hivatalosan igazolt. A robots.txt (RFC 9309) kérés, műszaki zárat nem ad. A nagy szolgáltatók saját nyilatkozatuk szerint betartják, egy ismeretlen scraper viszont nem köteles erre. Ha valódi kizárás kell, azt tűzfalszinten lehet megoldani, a botok ellenőrzött IP-tartományai és viselkedése alapján.
Hivatalosan igazolt. Az EU DSM-irányelv (2019/790) 4. cikke lehetővé teszi, hogy a jogosult gépileg olvasható módon fenntartsa magának a szöveg- és adatbányászat jogát. Az EU AI-rendelet előírja az általános célú modellek szolgáltatóinak, hogy ezt a fenntartást tartsák tiszteletben. Ez a jogi háttér, konkrét ügyben egyeztess jogásszal.
Szakmai feltételezés. A tiltás visszamenőleg nem hat. Amit egy modell korábban megtanult, az a tiltás után is benne marad. A tiltás a jövőbeli gyűjtést és a friss lekéréseket akadályozza, ezért a legnagyobb vesztesége jellemzően az idézettség, ami a keresőbotokon múlik.
Hogyan működik a feltételes vagy díjazott hozzáférés?
Ezen az úton az ajtót se ki nem nyitod teljesen, se be nem zárod. Szabályokat adsz meg arra, hogy melyik bot milyen feltétellel, esetleg milyen ellenérték fejében férhet hozzá. Erre ma több szolgáltatói megoldás létezik, eltérő érettséggel.
- Cloudflare AI Crawl Control és Pay per crawl. A felületen botonként engedélyezhetsz, tilthatsz, vagy lekérésenkénti díjat kérhetsz. A díjköteles botok HTTP 402 („fizetés szükséges”) választ kapnak. A Pay per crawl induláskor zárt béta volt, ezért nézd meg, elérhető-e a te fiókodban.
- TollBit és hasonló közvetítők. A kiadó és az AI-cég között állnak, mérik a lekéréseket, és a megállapodás szerint elszámolnak.
- RSL (Really Simple Licensing). Nyílt formátum, amellyel gépileg olvasható licencfeltételeket teszel közzé, és a robots.txt-ből hivatkozol rájuk.
- IETF AI Preferences. Szabványosítási munka, amelynek célja, hogy a használati preferenciákat (például a tanítás tiltását a keresés engedése mellett) egységes szókinccsel lehessen jelezni.
Hivatalosan igazolt. A fenti megoldásokat a szolgáltatók és a szabványosító szervezetek nyilvános anyagai írják le. Hogy melyik AI-cég fizet ténylegesen, és melyik fogadja el a feltételeket, az szolgáltatónként és időben is változik.
Szakmai feltételezés. Egy kis magyar oldal a díjazott hozzáférésből aligha szerez érdemi bevételt, mert kevés a fizető fél, és a magyar nyelvű tartalom iránti kereslet szűk. Neki a feltételes hozzáférés inkább kontrolleszköz. Te döntöd el, ki olvashat, és ezt naplózni is tudod. A díjazás főleg a nagy, egyedi archívummal rendelkező kiadóknál lehet reális út.
Milyen szempontok alapján dönts?
A döntés gerincét négy kérdés adja. Mindegyiket pontozd 1-től 5-ig, és írd mellé, milyen adatra alapozod a pontszámot.
- Mennyire egyedi a tartalom? Ha ugyanez az információ tíz másik oldalon is megvan, a tiltással nem véded meg, csak kimaradsz az idézett források közül. Saját mérés, saját adat vagy saját módszertan esetén viszont van mit védeni.
- Mekkora a forgalom értéke? Nézd meg, hogy a bevételed magából a látogatásból (hirdetés, előfizetés) vagy a látogatás utáni lépésből (ajánlatkérés, hívás, vásárlás) jön. Az utóbbi esetben az AI-hivatkozás gyakran a megrendelés előszobája.
- Van-e valós alternatív bevétel? A díjazott hozzáférésnek csak akkor van értelme, ha van fizető fél. Ha nincs, a tiltás nem hoz bevételt, csak láthatóságot vesz el.
- Mibe kerül a karbantartás? Új botok jelennek meg, a nevek változnak, az IP-tartományok frissülnek. Egy részletes, botonkénti szabályrendszert negyedévente át kell nézni. Ha erre nincs ember, az egyszerűbb szabály a biztonságosabb.
Két kiegészítő szempont is számít. Az egyik a szerverterhelés, vagyis hogy bírja-e a tárhely a botok forgalmát. A másik a márkakockázat. Gondold végig, mi történik, ha egy AI-asszisztens a saját oldalad helyett egy elavult katalógusbejegyzés alapján válaszol rólad.
Saját tapasztalat. A szolgáltató kisvállalkozások többségénél a mérlegelés oda fut ki, hogy a kereső- és a felhasználói botokat engedik, a tanító botokról pedig ízlés szerint döntenek. A tiltás vagy a díjazás főleg ott kerül elő, ahol a tartalom maga a bevételforrás.
Hogyan néz ki egy vegyes beállítás a robots.txt-ben?
Az alábbi minta engedi a keresést és a felhasználói lekérést, a tanítást pedig tiltja. Kiindulópontnak szántuk, a botneveket élesítés előtt vesd össze a szolgáltatók aktuális dokumentációjával.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Élesítés után három dolgot ellenőrizz. A robots.txt 200-as státusszal töltődjön be, átirányítás és hiba nélkül. A Googlebotra vonatkozó szabályod maradjon változatlan. A CDN vagy a tűzfal se blokkolja külön azokat a botokat, amelyeket a robots.txt-ben engedélyeztél.
Milyen visszamérést állíts be a döntés után?
Mérj a változtatás előtt és után is, mert alapállapot nélkül nem fogod tudni, volt-e hatása a döntésnek. A változtatás előttről legalább 4-6 hét adatot rögzíts.
- Szervernapló botonként. Szűrd a naplót user-agent szerint, és számold a lekéréseket, a státuszkódokat és a leggyakrabban lekért URL-eket. A user-agent hamisítható, ezért a forrást a nagy szolgáltatók által közzétett IP-tartományokkal ellenőrizd.
- AI-hivatkozó forgalom a GA4-ben. Hozz létre csatornacsoportot a
chatgpt.com,perplexity.ai,gemini.google.com,copilot.microsoft.comésclaude.aihivatkozókra. A konverziókat is kövesd, mert a látogatásszám önmagában keveset mond. - Idézettségi próba. Állíts össze 15-20 kérdést, amelyekre az oldaladnak kellene választ adnia, és havonta futtasd le őket ugyanazokban az asszisztensekben. Jegyezd fel, megjelensz-e forrásként, és helyes-e, amit rólad mondanak.
- Szerverterhelés. Kövesd a válaszidőt és a CPU-terhelést a botforgalom csúcsidőszakaiban.
- Search Console. Ellenőrizd, hogy a Google-kattintások és a feltérképezési statisztikák nem változtak-e váratlanul. Ha igen, valamelyik szabály a Googlebotot is érintheti.
Saját tapasztalat. Az idézettség nem reagál azonnal arra, ha a kereső AI-botokra vonatkozó beállításon változtatsz. Hetekbe telhet, mire a változás látszik, ezért egy-két hét adatából ne vonj le következtetést.
Milyen jelek alapján érdemes visszakozni?
Akkor érdemes, ha a mért adatok ellentmondanak annak a feltevésnek, amelyre a döntést építetted. Tiltás vagy feltételes hozzáférés után ezekre a jelekre figyelj.
- Érezhetően csökkennek az AI-hivatkozó forgalomból jövő konverziók, miközben ugyanazokra a kérdésekre a versenytársaid forrásként szerepelnek.
- Az asszisztensek elavult vagy hibás adatot mondanak rólad (nyitvatartás, szolgáltatás, cím), mert a friss oldaladhoz nem férnek hozzá.
- A díjazott hozzáférés hónapok alatt sem hoz bevételt, a botok egyszerűen elmaradnak.
- A szabályrendszer karbantartása több munkát visz el, mint amennyit a védett tartalom ér.
Szabad hozzáférés után az ellenkező irányú jelek számítanak.
- A botforgalom lassítja az oldalt, és ezen sebességkorlátozással sem tudsz segíteni.
- A tartalmad szinte szó szerint visszaköszön az AI-válaszokban, kattintás nélkül, miközben a saját látogatottságod és bevételed csökken.
- Az egyedi, sok munkával előállított anyagaidat hivatkozás nélkül használják.
Szakmai feltételezés. A visszakozás nem kudarc. A robots.txt és a CDN-szabályok percek alatt módosíthatók, ezért érdemes a döntést kísérletként kezelni, előre rögzített felülvizsgálati időponttal.
Milyen sorrendben érdemes végigmenni a döntésen?
Öt lépésben, és a mérés mindig megelőzi a változtatást.
- Nézd meg a jelenlegi állapotot a robots.txt-ben, a CDN-ben és a tűzfalban.
- Rögzítsd az alapállapotot a naplóban, a GA4-ben és az idézettségi próbával.
- Pontozd a négy szempontot, és botcsoportonként válaszd ki az utat.
- Élesíts, és ellenőrizd, hogy a szabály úgy működik-e, ahogy tervezted.
- Három hónap múlva nézd meg újra a számokat, és dönts a folytatásról.
Források és további olvasnivalók
- Google Search Central, a Google feltérképező robotjai és a Google-Extended leírása
- OpenAI dokumentáció, az OpenAI crawlereinek áttekintése
- Anthropic súgóközpont, a Claude crawlereiről szóló leírás
- Perplexity dokumentáció, a Perplexity crawlerei
- Cloudflare dokumentáció, AI Crawl Control és Pay per crawl
- IETF RFC 9309, Robots Exclusion Protocol
- IETF AI Preferences munkacsoport
- RSL Collective, Really Simple Licensing specifikáció
- Az Európai Parlament és a Tanács (EU) 2019/790 irányelve (DSM-irányelv)
- Az Európai Parlament és a Tanács (EU) 2024/1689 rendelete (AI-rendelet)
Gyakori kérdések
Ha letiltom a GPTBotot, kimaradok a ChatGPT keresési válaszaiból?
Az OpenAI dokumentációja szerint nem feltétlenül, mert a GPTBot a tanítást szolgálja, a ChatGPT keresését pedig az OAI-SearchBot végzi. A kettőt külön szabályozhatod a robots.txt-ben.
A Google-Extended tiltása kivesz a Google AI-áttekintéseiből?
A Google leírása szerint nem. A Google-Extended a Gemini-modellek tanítását és megalapozását szabályozza, az AI-áttekintések viszont a Kereső részei, ezért ott a Kereső saját eszközei érvényesek.
Elég a robots.txt ahhoz, hogy egy AI-cég ne férjen hozzá a tartalmamhoz?
Nem elég. A robots.txt kérés, amelyet a nagy szolgáltatók saját nyilatkozatuk szerint betartanak, de műszakilag nem kötelező. Valódi kizárást tűzfalszinten, ellenőrzött IP-tartományok alapján lehet elérni.
Érdemes egy kisvállalkozásnak fizetős crawlt beállítania?
Szakmai feltételezésünk szerint egy kis magyar oldal ebből aligha szerez érdemi bevételt, mert kevés a fizető fél. Kontrolleszközként viszont hasznos lehet, mert látod és szabályozod, ki olvas.
Mennyi idő után látszik a döntés hatása?
Saját tapasztalatunk szerint az idézettség hetek alatt reagál a változásra. Érdemes 4-6 hét alapállapotot rögzíteni, és a döntést nagyjából három hónap után újraértékelni.
Visszavonhatom a tiltást, ha rossznak bizonyul?
Igen, a robots.txt és a CDN-szabályok gyorsan módosíthatók. Arra viszont nincs garancia, hogy a korábbi idézettséged azonnal visszatér, ezért a visszaállítás után is mérj tovább.
Források és további olvasnivalók
Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.