Ha nem szeretnéd, hogy a weboldalad szövegei AI-modellek tanítóadatába kerüljenek, több jelzés közül választhatsz. Ilyen a robots.txt-szabály az egyes AI-botokra, a noai meta címke, a TDM-fenntartás és a HTTP-fejlécek. A súlyuk nagyon eltérő. Van, amit a nagy szolgáltatók hivatalosan betartanak, van, ami inkább szokás, és van, amit szinte senki nem olvas. Ebben a cikkben végigmegyünk rajtuk, és megmutatjuk, hogyan állítsd be őket úgy, hogy közben ne tűnj el az AI-válaszokból.

Milyen jelzésekkel mondhatja ki egy weboldal, hogy nem kér AI-tanítást?
Négy jelzéstípus terjedt el. Ezek a robots.txt-ben név szerint kitiltott tanító crawlerek, a noai és noimageai meta címke, a TDM Reservation Protocol (röviden TDMRep), valamint ezek HTTP-fejléces megfelelői. Egyik sem technikai zár. Mind kérés, és a betartása a crawler üzemeltetőjén múlik.
Robots.txt-tiltás a tanító botokra
Ez a legszélesebb körben tisztelt jelzés. A nagy szolgáltatók dokumentálják, melyik user-agentjük gyűjt tanítóadatot, és vállalják, hogy követik a robots.txt tiltását. Hivatalosan igazolt. Az alábbi tokeneket a saját dokumentációjuk köti tanításhoz vagy AI-felhasználáshoz.
GPTBot(OpenAI, modelltanítás)ClaudeBot(Anthropic, modelltanítás)Google-Extended(Google, a Gemini-modellek tanítása és a Gemini-alkalmazások grounding funkciója; ez nem külön crawler, hanem robots.txt-token, a letöltést a Googlebot végzi)Applebot-Extended(Apple, az Apple saját alapmodelljeinek tanítása; szintén csak token)CCBot(Common Crawl, nyílt adatkészlet, amelyből sok modell tanul)Meta-ExternalAgent(Meta, többek között AI-modellek tanítása)
A noai és noimageai meta címke
A noai és noimageai értéket 2022-ben a DeviantArt vezette be, hogy az alkotók jelezhessék, nem járulnak hozzá a munkáik AI-tanításához. Nem szabvány. Hivatalosan igazolt. A Google a támogatott robots-meta értékek között nem sorolja fel, tehát figyelmen kívül hagyja, és a nagy modellfejlesztők crawler-dokumentációjában sem szerepel követett jelzésként.
Saját tapasztalat. Auditok során rendszeresen látunk olyan oldalt, ahol a noai címke az egyetlen védelem, miközben a robots.txt minden botot beenged. A tulajdonos ilyenkor biztonságban érzi magát, pedig a legtöbb tanító crawler szempontjából semmi nem változott.
TDMRep és a HTTP-fejlécek
A TDM Reservation Protocol a W3C egyik közösségi csoportjának (Community Group) specifikációja, és kifejezetten az EU-s szöveg- és adatbányászati kivételhez készült. Háromféleképpen jelezhetsz vele. Elhelyezhetsz egy /.well-known/tdmrep.json fájlt, küldhetsz tdm-reservation: 1 HTTP-fejlécet, vagy használhatod HTML-ben a tdm-reservation nevű meta címkét. Megadhatsz egy tdm-policy hivatkozást is, amely a licencelési feltételeidre mutat. Hivatalosan igazolt. A specifikáció nyilvános, de közösségi csoportos jelentés, nem W3C-ajánlás, így a támogatottsága szolgáltatónként eltér.
Újabb kezdeményezés a Cloudflare 2025-ben bevezetett Content Signals javaslata. Ez a robots.txt-ben külön szabályozná a keresést, az AI-válaszba való bevitelt és a tanítást, például Content-Signal: search=yes, ai-train=no formában. Az IETF AI Preferences (aipref) munkacsoportja pedig egységes szókészleten dolgozik. Szakmai feltételezés. Középtávon valószínűleg egy robots.txt-re épülő, szabványos szókészlet váltja ki a mai szétaprózott jelzéseket. Amíg ez nem véglegesedik, érdemes a már dokumentált megoldásokat párhuzamosan használni.
Mekkora a jogi súlya ezeknek a jelzéseknek?
Az EU-ban egy gépileg olvasható tiltásnak valódi jogi jelentősége van, mert a szerzői jogi szabályozás kifejezetten erre a formára épít. Ettől még nem kényszeríthető ki automatikusan, és nem is tartja be minden szolgáltató.
Hivatalosan igazolt. A 2019/790/EU (DSM) irányelv 4. cikke megengedi a jogszerűen elérhető tartalmak szöveg- és adatbányászatát, kivéve, ha a jogosult ezt megfelelő módon fenntartotta magának. Online nyilvános tartalomnál a (3) bekezdés szerint ilyen megfelelő mód különösen a gépileg olvasható eszköz. Magyarország az irányelvet a szerzői jogi törvény módosításával ültette át. Az EU mesterséges intelligenciáról szóló rendelete (AI Act, 2024/1689) 53. cikke előírja az általános célú AI-modellek szolgáltatóinak, hogy szerzői jogi szabályzatot vezessenek be, és azonosítsák, illetve tartsák tiszteletben az ilyen fenntartásokat. A 2025-ben közzétett általános célú AI gyakorlati kódex (Code of Practice) aláírói vállalták, hogy követik a robots.txt-et és más, megfelelő gépileg olvasható protokollokat.
Három korlátot érdemes tisztán látni. A tiltás csak előre hat, a már begyűjtött adatot nem vonja vissza. EU-n kívüli szolgáltatóval szemben a kikényszerítés nehézkes. Arról pedig, hogy melyik jelzés minősül pontosan megfelelő fenntartásnak, még nincs kiforrott bírói gyakorlat. Egy 2024-es hamburgi elsőfokú ítélet mellékesen a felhasználási feltételekben természetes nyelven megfogalmazott fenntartást is elfogadhatónak tartotta, de ez nem végleges iránymutatás. Ez a cikk nem jogi tanácsadás. Üzletileg érzékeny tartalomnál kérj szerzői jogi szakvéleményt.
Mi a különbség a tanítás és a válaszban való idézés között?
Tanításkor a tartalmad a modell súlyaiba épül be, és később forrásmegjelölés nélkül befolyásolja a válaszokat. Idézéskor az AI-kereső a kérdés pillanatában lehívja az oldaladat, és a válaszban linkkel hivatkozik rá. A két folyamatot a legtöbb szolgáltatónál külön bot vagy token vezérli, így az egyik tiltása nem feltétlenül érinti a másikat.
Ez a téma leggyakoribb félreértése. Sok tulajdonos egy lendülettel kitilt minden AI-botot, aztán nem érti, miért nem hivatkozik rá többé a ChatGPT keresése vagy a Perplexity. A nagy szolgáltatók saját crawler-dokumentációja szerint (hivatalosan igazolt) a felosztás a következő.
- OpenAI.
GPTBota tanításhoz,OAI-SearchBota ChatGPT keresési találataihoz,ChatGPT-Usera felhasználó által kezdeményezett lekérésekhez. - Anthropic.
ClaudeBota tanításhoz,Claude-SearchBota keresési találatokhoz,Claude-Usera felhasználói lekérésekhez. - Google. A
Google-Extendeda Gemini-modellek tanítását és a Gemini-alkalmazások groundingját szabályozza, a Google Keresést és benne az AI-áttekintéseket nem. Az AI-áttekintésekben való megjelenést a Googlebot hozzáférése és a snippet-direktívák (nosnippet,max-snippet,data-nosnippet) befolyásolják. - Perplexity. A
PerplexityBota cég leírása szerint a keresési találatokhoz gyűjt, nem alapmodell-tanításhoz, aPerplexity-Userpedig felhasználói kérésre érkezik.
A gyakorlati következmény egyszerű. Ha nem szeretnéd, hogy a szövegeidből modellek tanuljanak, de az AI-válaszokban forrásként megjelennél, a tanító tokeneket tiltod, a keresési botokat pedig engeded. Azt is érdemes tudni, hogy a felhasználó által kezdeményezett lekéréseknél több szolgáltató jelezte, hogy a robots.txt nem feltétlenül vonatkozik rájuk, mert emberi kérésnek tekintik őket.
Hogyan állítod be a jelzéseket szerveroldalon?
Először döntsd el, melyik botot mire engeded, utána jön a robots.txt, a HTTP-fejléc, a tdmrep.json és végül a meta címke. Ebben a sorrendben a legszélesebb körben tisztelt jelzés kerül ki elsőként.
- Döntsd el, mit engedsz. Írd le botonként, hogy tanításról vagy idézésről van szó, és mit szeretnél vele. Ez a lista lesz az ellenőrzés alapja is.
- Bővítsd a robots.txt-et. Minden tanító tokenhez külön blokk kell, például
User-agent: GPTBotés alattaDisallow: /, ugyanígy aClaudeBot,Google-Extended,Applebot-Extended,CCBotésMeta-ExternalAgentesetén. AzOAI-SearchBot, aClaude-SearchBotés aPerplexityBotalá ne írj tiltást, és a meglévőUser-agent: *blokkodhoz ne nyúlj. - Küldj HTTP-fejlécet minden válaszban. Nginx alatt a szerverblokkba kerül az
add_header tdm-reservation "1" always;sor, Apache alatt a .htaccess-be aHeader always set tdm-reservation "1"(ehhez a mod_headers modul kell). A fejléc előnye, hogy PDF-en és képen is kimegy, ahová meta címkét nem tehetsz. A noai jelzés fejléces megfelelője azX-Robots-Tag: noai, noimageai, de ezt a Google nem értelmezi. - Tedd ki a tdmrep.json fájlt. A
/.well-known/tdmrep.jsonútvonalon egy JSON-tömb áll, például[{"location": "/*", "tdm-reservation": 1}]. Ha licencelési feltételeid is vannak, egy"tdm-policy"mezőben add meg az URL-jüket. - Egészítsd ki meta címkékkel. A sablon fejlécébe kerül a
<meta name="tdm-reservation" content="1">, és ha szeretnéd, a<meta name="robots" content="noai, noimageai">. Utóbbit a Google ismeretlen értékként kihagyja, az indexelést nem rontja.
Hogyan állítod be WordPressen?
WordPressen ugyanez a három réteg kell (robots.txt, fejléc, meta), csak a WordPress horgain vagy egy SEO-bővítményen keresztül. A tdmrep.json fájlt tárhelyszinten töltöd fel, mert azt a WordPress magától nem szolgálja ki.
- Nézd meg, fizikai vagy virtuális a robots.txt. Ha a gyökérkönyvtárban van fájl, azt szerkeszted, például FTP-n vagy a Yoast SEO fájlszerkesztőjében. Ha nincs, a WordPress generálja, és a
robots_txtszűrővel bővíted. - Bővítsd a virtuális robots.txt-et. Egy saját kis bővítménybe vagy a gyermektéma functions.php fájljába ez kerül:
add_filter('robots_txt', function ($output) { return $output . "\nUser-agent: GPTBot\nDisallow: /\n"; });. A többi tanító tokent ugyanígy fűzöd hozzá. - Küldd ki a fejlécet.
add_action('send_headers', function () { header('tdm-reservation: 1'); });. Ez csak a WordPress által generált oldalakon fut. A médiatár fájljait a webszerver közvetlenül adja ki, ezért azokhoz a .htaccess-es megoldás kell. - Tedd ki a meta címkét.
add_action('wp_head', function () { echo '<meta name="tdm-reservation" content="1">' . "\n"; }); - Töltsd fel a tdmrep.json fájlt a tárhely gyökerében lévő
.well-knownmappába. - Ürítsd a gyorsítótárakat (bővítmény, szerver, CDN), különben a régi válaszok még napokig fejléc nélkül mehetnek ki.
Saját tapasztalat. Gyakori hiba, hogy a robots.txt-et két helyen kezelik. Van fizikai fájl, és közben egy bővítményben is beállítják a tiltást. Ilyenkor a fizikai fájl nyer, és a bővítményben megadott szabály sosem jelenik meg.
Hogyan ellenőrzöd, hogy a jelzés tényleg minden oldalon kimegy?
Ne a sablonra hagyatkozz, hanem a tényleges szerverválaszokat nézd meg. Parancssori próbákkal, egy teljes feltérképezéssel és a szervernaplóval együtt kapsz megbízható képet.
- A
curl -s https://pelda.hu/robots.txtkimenetében legyen ott a tanító tokenek tiltása, és ne legyen véletlenDisallow: /a*alatt. - A
curl -sI https://pelda.hu/ | grep -i tdmpróbát minden fő oldaltípuson futtasd le (főoldal, bejegyzés, kategória, termék, 404-es oldal). - Nézz meg egy PDF-et és egy képet is a médiatárból. Itt derül ki, hogy a fejlécet a webszerver küldi, vagy csak a PHP.
- A
curl -s https://pelda.hu/.well-known/tdmrep.jsonérvényes JSON-t adjon 200-as kóddal, ne átirányítást a főoldalra. - Ellenőrizd az aldomaineket is (www, shop, blog). A robots.txt hosztonként érvényes, a fődomain fájlja nem védi az aldomaint.
- Futtass teljes feltérképezést egy crawler eszközzel (például Screaming Frog egyéni kinyerési szabállyal a meta címkére és a fejlécre), hogy kiderüljön, van-e sablon, amelyből kimarad a jelzés.
- Nginx esetén nézd meg, van-e
add_headera location blokkokban, mert ilyenkor a szerverszintű fejlécek ott nem öröklődnek. - A Google Search Console robots.txt-jelentésében ellenőrizd, hogy a Google a friss változatot olvasta be, hibák nélkül.
- Két-négy hét után nézd át a naplót, kér-e még a tiltott user-agentek bármelyike a robots.txt-n kívül más URL-t. A szolgáltatók jellemzően legfeljebb egy napig gyorsítótárazzák a robots.txt-et, így az első órák adata még nem mérvadó.
Milyen nem kívánt következménnyel járhat a túl széles tiltás?
A legnagyobb kockázat, hogy a tanítás elleni védekezés közben az oldal kikerül az AI-válaszok forrásai közül, rosszabb esetben a hagyományos keresőből is.
- Eltűnés az idézett források közül. Ha az
OAI-SearchBot, aClaude-SearchBotvagy aPerplexityBotis tiltást kap, ezek a szolgáltatások jó eséllyel nem hivatkoznak rád. - Keresőoptimalizálási kár. Egy elgépelt blokk vagy a
User-agent: *alá írtDisallow: /a Googlebotot is kizárja. - Snippet-veszteség. Aki az AI-áttekintések miatt
nosnippet-et tesz ki, a hagyományos találati leírásait is elveszíti. - Gyengébb jelenlét a Geminiben. A
Google-Extendedtiltása a Gemini-alkalmazások groundingját is érinti. Ez legyen tudatos döntés, ne mellékhatás. - Túl szigorú tűzfalszabály. WAF- vagy IP-alapú tiltásnál könnyű a Googlebotot vagy egy felhasználói lekérést is megfogni. A látogató ilyenkor azt tapasztalja, hogy az AI nem tudja megnyitni a linkedet.
- Hamis biztonságérzet. A már begyűjtött adatra a tiltás nem hat, és a jelzést figyelmen kívül hagyó botokat sem állítja meg.
Szakmai feltételezés. Egy helyi szolgáltatónál vagy webshopnál az AI-válaszokban való idézettség üzleti értéke jellemzően nagyobb, mint amit a tanítás tiltásával nyer. Kreatív, fizetős vagy egyedi szakmai tartalomnál ez megfordulhat. A döntést érdemes tartalomtípusonként meghozni, akár mappánként eltérő szabállyal, és félévente felülvizsgálni, mert a botok listája és a szabványosítás is gyorsan változik.
Források és további olvasnivalók
- Google Search Central, a Google crawlerjeinek és a Google-Extended tokennek a leírása
- Google Search Central, robots meta címke, data-nosnippet és X-Robots-Tag specifikáció
- OpenAI dokumentáció, Overview of OpenAI Crawlers
- Anthropic súgóoldal a webes crawlerekről
- Perplexity dokumentáció, Perplexity Crawlers
- W3C TDM Reservation Protocol Community Group, TDMRep specifikáció
- IETF RFC 9309, Robots Exclusion Protocol
- IETF AI Preferences (aipref) munkacsoport anyagai
- Az (EU) 2019/790 irányelv (DSM-irányelv) 4. cikke
- Az (EU) 2024/1689 rendelet (AI Act) 53. cikke és az általános célú AI gyakorlati kódex
- A robots.txt-ben név szerint tiltott tanító tokenek (GPTBot, ClaudeBot, Google-Extended, CCBot) a legszélesebb körben tisztelt jelzés, a noai meta címkét a Google nem értelmezi.
- Az EU-ban a gépileg olvasható TDM-fenntartásnak jogi súlya van a DSM-irányelv 4. cikke és az AI Act 53. cikke miatt, de a jelzés csak előre hat.
- A tanítást és az AI-válaszban való idézést a legtöbb szolgáltatónál külön bot vezérli, ezért az egyik tiltása nem feltétlenül érinti a másikat.
- A beállítás után curl-lel, teljes feltérképezéssel és szervernaplóval ellenőrizd, hogy a jelzés minden oldaltípuson, PDF-en és aldomainen kimegy-e.
- A túl széles tiltás kiveheti az oldalt az AI-válaszok forrásai közül, rosszabb esetben a Googlebotot is kizárja.
Gyakori kérdések
Elég a noai meta címke ahhoz, hogy ne tanítsanak a tartalmamon?
Nem. A noai nem szabvány, a Google figyelmen kívül hagyja, és a nagy modellfejlesztők dokumentációjában sem szerepel követett jelzésként. A robots.txt-ben név szerint tiltott tanító tokenek és a TDM-fenntartás erősebb jelzés.
Ha kitiltom a GPTBotot, eltűnök a ChatGPT keresési válaszaiból?
Az OpenAI dokumentációja szerint nem, mert a keresési találatokhoz az OAI-SearchBot gyűjt, a GPTBot a tanításhoz. Ha az OAI-SearchBotot engeded, a ChatGPT keresése továbbra is hivatkozhat rád, de ezt nem garantálja semmi.
A Google-Extended tiltása kivesz a Google AI-áttekintéseiből?
Nem. A Google szerint a Google-Extended nem érinti a Google Keresést, benne az AI-áttekintéseket sem. Ott a Googlebot hozzáférése és a snippet-direktívák számítanak.
Van jogi súlya a robots.txt-tiltásnak az EU-ban?
A DSM-irányelv 4. cikke szerint online tartalomnál a gépileg olvasható fenntartás a megfelelő mód a szöveg- és adatbányászat kizárására, az AI Act pedig kötelezi az általános célú modellek szolgáltatóit ennek tiszteletben tartására. A bírói gyakorlat még kiforratlan, és a tiltás a már begyűjtött adatra nem hat.
Hogyan ellenőrzöm, hogy a tdm-reservation fejléc minden oldalon kimegy?
Futtass curl -sI kéréseket a fő oldaltípusokra, egy PDF-re és egy képre, nézd meg az aldomaineket, majd egy teljes feltérképezéssel keresd meg azokat a sablonokat, amelyekből kimarad. A gyorsítótárak ürítését se felejtsd el.
Források és további olvasnivalók
Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.