Crawler

noai és TDM-jelzések: tartalomvédelem az AI-tanítás ellen

noai, TDM és robots.txt jelzések: így kéred, hogy a tartalmad ne kerüljön AI-tanításba, de az AI-válaszokban továbbra is idézhető maradjon.

Scheo · · olvasási idő ~10 perc · Szerző: Schmidt Péter

Összefoglalva: A tanító AI-botokat robots.txt-ben, TDM-fenntartással és HTTP-fejléccel kérheted távol maradásra, de a jelzések súlya eltérő, és egyik sem technikai zár. A tanítás tiltása és a válaszban való idézés két külön döntés, ezért a keresési botokat ne zárd ki vele együtt.

Ha nem szeretnéd, hogy a weboldalad szövegei AI-modellek tanítóadatába kerüljenek, több jelzés közül választhatsz. Ilyen a robots.txt-szabály az egyes AI-botokra, a noai meta címke, a TDM-fenntartás és a HTTP-fejlécek. A súlyuk nagyon eltérő. Van, amit a nagy szolgáltatók hivatalosan betartanak, van, ami inkább szokás, és van, amit szinte senki nem olvas. Ebben a cikkben végigmegyünk rajtuk, és megmutatjuk, hogyan állítsd be őket úgy, hogy közben ne tűnj el az AI-válaszokból.

noai és TDM-jelzések: tartalomvédelem az AI-tanítás ellen
noai és TDM-jelzések: tartalomvédelem az AI-tanítás ellen

Milyen jelzésekkel mondhatja ki egy weboldal, hogy nem kér AI-tanítást?

Négy jelzéstípus terjedt el. Ezek a robots.txt-ben név szerint kitiltott tanító crawlerek, a noai és noimageai meta címke, a TDM Reservation Protocol (röviden TDMRep), valamint ezek HTTP-fejléces megfelelői. Egyik sem technikai zár. Mind kérés, és a betartása a crawler üzemeltetőjén múlik.

Robots.txt-tiltás a tanító botokra

Ez a legszélesebb körben tisztelt jelzés. A nagy szolgáltatók dokumentálják, melyik user-agentjük gyűjt tanítóadatot, és vállalják, hogy követik a robots.txt tiltását. Hivatalosan igazolt. Az alábbi tokeneket a saját dokumentációjuk köti tanításhoz vagy AI-felhasználáshoz.

A noai és noimageai meta címke

A noai és noimageai értéket 2022-ben a DeviantArt vezette be, hogy az alkotók jelezhessék, nem járulnak hozzá a munkáik AI-tanításához. Nem szabvány. Hivatalosan igazolt. A Google a támogatott robots-meta értékek között nem sorolja fel, tehát figyelmen kívül hagyja, és a nagy modellfejlesztők crawler-dokumentációjában sem szerepel követett jelzésként.

Saját tapasztalat. Auditok során rendszeresen látunk olyan oldalt, ahol a noai címke az egyetlen védelem, miközben a robots.txt minden botot beenged. A tulajdonos ilyenkor biztonságban érzi magát, pedig a legtöbb tanító crawler szempontjából semmi nem változott.

TDMRep és a HTTP-fejlécek

A TDM Reservation Protocol a W3C egyik közösségi csoportjának (Community Group) specifikációja, és kifejezetten az EU-s szöveg- és adatbányászati kivételhez készült. Háromféleképpen jelezhetsz vele. Elhelyezhetsz egy /.well-known/tdmrep.json fájlt, küldhetsz tdm-reservation: 1 HTTP-fejlécet, vagy használhatod HTML-ben a tdm-reservation nevű meta címkét. Megadhatsz egy tdm-policy hivatkozást is, amely a licencelési feltételeidre mutat. Hivatalosan igazolt. A specifikáció nyilvános, de közösségi csoportos jelentés, nem W3C-ajánlás, így a támogatottsága szolgáltatónként eltér.

Újabb kezdeményezés a Cloudflare 2025-ben bevezetett Content Signals javaslata. Ez a robots.txt-ben külön szabályozná a keresést, az AI-válaszba való bevitelt és a tanítást, például Content-Signal: search=yes, ai-train=no formában. Az IETF AI Preferences (aipref) munkacsoportja pedig egységes szókészleten dolgozik. Szakmai feltételezés. Középtávon valószínűleg egy robots.txt-re épülő, szabványos szókészlet váltja ki a mai szétaprózott jelzéseket. Amíg ez nem véglegesedik, érdemes a már dokumentált megoldásokat párhuzamosan használni.

Mekkora a jogi súlya ezeknek a jelzéseknek?

Az EU-ban egy gépileg olvasható tiltásnak valódi jogi jelentősége van, mert a szerzői jogi szabályozás kifejezetten erre a formára épít. Ettől még nem kényszeríthető ki automatikusan, és nem is tartja be minden szolgáltató.

Hivatalosan igazolt. A 2019/790/EU (DSM) irányelv 4. cikke megengedi a jogszerűen elérhető tartalmak szöveg- és adatbányászatát, kivéve, ha a jogosult ezt megfelelő módon fenntartotta magának. Online nyilvános tartalomnál a (3) bekezdés szerint ilyen megfelelő mód különösen a gépileg olvasható eszköz. Magyarország az irányelvet a szerzői jogi törvény módosításával ültette át. Az EU mesterséges intelligenciáról szóló rendelete (AI Act, 2024/1689) 53. cikke előírja az általános célú AI-modellek szolgáltatóinak, hogy szerzői jogi szabályzatot vezessenek be, és azonosítsák, illetve tartsák tiszteletben az ilyen fenntartásokat. A 2025-ben közzétett általános célú AI gyakorlati kódex (Code of Practice) aláírói vállalták, hogy követik a robots.txt-et és más, megfelelő gépileg olvasható protokollokat.

Három korlátot érdemes tisztán látni. A tiltás csak előre hat, a már begyűjtött adatot nem vonja vissza. EU-n kívüli szolgáltatóval szemben a kikényszerítés nehézkes. Arról pedig, hogy melyik jelzés minősül pontosan megfelelő fenntartásnak, még nincs kiforrott bírói gyakorlat. Egy 2024-es hamburgi elsőfokú ítélet mellékesen a felhasználási feltételekben természetes nyelven megfogalmazott fenntartást is elfogadhatónak tartotta, de ez nem végleges iránymutatás. Ez a cikk nem jogi tanácsadás. Üzletileg érzékeny tartalomnál kérj szerzői jogi szakvéleményt.

Mi a különbség a tanítás és a válaszban való idézés között?

Tanításkor a tartalmad a modell súlyaiba épül be, és később forrásmegjelölés nélkül befolyásolja a válaszokat. Idézéskor az AI-kereső a kérdés pillanatában lehívja az oldaladat, és a válaszban linkkel hivatkozik rá. A két folyamatot a legtöbb szolgáltatónál külön bot vagy token vezérli, így az egyik tiltása nem feltétlenül érinti a másikat.

Ez a téma leggyakoribb félreértése. Sok tulajdonos egy lendülettel kitilt minden AI-botot, aztán nem érti, miért nem hivatkozik rá többé a ChatGPT keresése vagy a Perplexity. A nagy szolgáltatók saját crawler-dokumentációja szerint (hivatalosan igazolt) a felosztás a következő.

A gyakorlati következmény egyszerű. Ha nem szeretnéd, hogy a szövegeidből modellek tanuljanak, de az AI-válaszokban forrásként megjelennél, a tanító tokeneket tiltod, a keresési botokat pedig engeded. Azt is érdemes tudni, hogy a felhasználó által kezdeményezett lekéréseknél több szolgáltató jelezte, hogy a robots.txt nem feltétlenül vonatkozik rájuk, mert emberi kérésnek tekintik őket.

Hogyan állítod be a jelzéseket szerveroldalon?

Először döntsd el, melyik botot mire engeded, utána jön a robots.txt, a HTTP-fejléc, a tdmrep.json és végül a meta címke. Ebben a sorrendben a legszélesebb körben tisztelt jelzés kerül ki elsőként.

  1. Döntsd el, mit engedsz. Írd le botonként, hogy tanításról vagy idézésről van szó, és mit szeretnél vele. Ez a lista lesz az ellenőrzés alapja is.
  2. Bővítsd a robots.txt-et. Minden tanító tokenhez külön blokk kell, például User-agent: GPTBot és alatta Disallow: /, ugyanígy a ClaudeBot, Google-Extended, Applebot-Extended, CCBot és Meta-ExternalAgent esetén. Az OAI-SearchBot, a Claude-SearchBot és a PerplexityBot alá ne írj tiltást, és a meglévő User-agent: * blokkodhoz ne nyúlj.
  3. Küldj HTTP-fejlécet minden válaszban. Nginx alatt a szerverblokkba kerül az add_header tdm-reservation "1" always; sor, Apache alatt a .htaccess-be a Header always set tdm-reservation "1" (ehhez a mod_headers modul kell). A fejléc előnye, hogy PDF-en és képen is kimegy, ahová meta címkét nem tehetsz. A noai jelzés fejléces megfelelője az X-Robots-Tag: noai, noimageai, de ezt a Google nem értelmezi.
  4. Tedd ki a tdmrep.json fájlt. A /.well-known/tdmrep.json útvonalon egy JSON-tömb áll, például [{"location": "/*", "tdm-reservation": 1}]. Ha licencelési feltételeid is vannak, egy "tdm-policy" mezőben add meg az URL-jüket.
  5. Egészítsd ki meta címkékkel. A sablon fejlécébe kerül a <meta name="tdm-reservation" content="1">, és ha szeretnéd, a <meta name="robots" content="noai, noimageai">. Utóbbit a Google ismeretlen értékként kihagyja, az indexelést nem rontja.

Hogyan állítod be WordPressen?

WordPressen ugyanez a három réteg kell (robots.txt, fejléc, meta), csak a WordPress horgain vagy egy SEO-bővítményen keresztül. A tdmrep.json fájlt tárhelyszinten töltöd fel, mert azt a WordPress magától nem szolgálja ki.

  1. Nézd meg, fizikai vagy virtuális a robots.txt. Ha a gyökérkönyvtárban van fájl, azt szerkeszted, például FTP-n vagy a Yoast SEO fájlszerkesztőjében. Ha nincs, a WordPress generálja, és a robots_txt szűrővel bővíted.
  2. Bővítsd a virtuális robots.txt-et. Egy saját kis bővítménybe vagy a gyermektéma functions.php fájljába ez kerül: add_filter('robots_txt', function ($output) { return $output . "\nUser-agent: GPTBot\nDisallow: /\n"; });. A többi tanító tokent ugyanígy fűzöd hozzá.
  3. Küldd ki a fejlécet. add_action('send_headers', function () { header('tdm-reservation: 1'); });. Ez csak a WordPress által generált oldalakon fut. A médiatár fájljait a webszerver közvetlenül adja ki, ezért azokhoz a .htaccess-es megoldás kell.
  4. Tedd ki a meta címkét. add_action('wp_head', function () { echo '<meta name="tdm-reservation" content="1">' . "\n"; });
  5. Töltsd fel a tdmrep.json fájlt a tárhely gyökerében lévő .well-known mappába.
  6. Ürítsd a gyorsítótárakat (bővítmény, szerver, CDN), különben a régi válaszok még napokig fejléc nélkül mehetnek ki.

Saját tapasztalat. Gyakori hiba, hogy a robots.txt-et két helyen kezelik. Van fizikai fájl, és közben egy bővítményben is beállítják a tiltást. Ilyenkor a fizikai fájl nyer, és a bővítményben megadott szabály sosem jelenik meg.

Hogyan ellenőrzöd, hogy a jelzés tényleg minden oldalon kimegy?

Ne a sablonra hagyatkozz, hanem a tényleges szerverválaszokat nézd meg. Parancssori próbákkal, egy teljes feltérképezéssel és a szervernaplóval együtt kapsz megbízható képet.

Milyen nem kívánt következménnyel járhat a túl széles tiltás?

A legnagyobb kockázat, hogy a tanítás elleni védekezés közben az oldal kikerül az AI-válaszok forrásai közül, rosszabb esetben a hagyományos keresőből is.

Szakmai feltételezés. Egy helyi szolgáltatónál vagy webshopnál az AI-válaszokban való idézettség üzleti értéke jellemzően nagyobb, mint amit a tanítás tiltásával nyer. Kreatív, fizetős vagy egyedi szakmai tartalomnál ez megfordulhat. A döntést érdemes tartalomtípusonként meghozni, akár mappánként eltérő szabállyal, és félévente felülvizsgálni, mert a botok listája és a szabványosítás is gyorsan változik.

Források és további olvasnivalók

Amit érdemes megjegyezni
  • A robots.txt-ben név szerint tiltott tanító tokenek (GPTBot, ClaudeBot, Google-Extended, CCBot) a legszélesebb körben tisztelt jelzés, a noai meta címkét a Google nem értelmezi.
  • Az EU-ban a gépileg olvasható TDM-fenntartásnak jogi súlya van a DSM-irányelv 4. cikke és az AI Act 53. cikke miatt, de a jelzés csak előre hat.
  • A tanítást és az AI-válaszban való idézést a legtöbb szolgáltatónál külön bot vezérli, ezért az egyik tiltása nem feltétlenül érinti a másikat.
  • A beállítás után curl-lel, teljes feltérképezéssel és szervernaplóval ellenőrizd, hogy a jelzés minden oldaltípuson, PDF-en és aldomainen kimegy-e.
  • A túl széles tiltás kiveheti az oldalt az AI-válaszok forrásai közül, rosszabb esetben a Googlebotot is kizárja.

Gyakori kérdések

Elég a noai meta címke ahhoz, hogy ne tanítsanak a tartalmamon?

Nem. A noai nem szabvány, a Google figyelmen kívül hagyja, és a nagy modellfejlesztők dokumentációjában sem szerepel követett jelzésként. A robots.txt-ben név szerint tiltott tanító tokenek és a TDM-fenntartás erősebb jelzés.

Ha kitiltom a GPTBotot, eltűnök a ChatGPT keresési válaszaiból?

Az OpenAI dokumentációja szerint nem, mert a keresési találatokhoz az OAI-SearchBot gyűjt, a GPTBot a tanításhoz. Ha az OAI-SearchBotot engeded, a ChatGPT keresése továbbra is hivatkozhat rád, de ezt nem garantálja semmi.

A Google-Extended tiltása kivesz a Google AI-áttekintéseiből?

Nem. A Google szerint a Google-Extended nem érinti a Google Keresést, benne az AI-áttekintéseket sem. Ott a Googlebot hozzáférése és a snippet-direktívák számítanak.

Van jogi súlya a robots.txt-tiltásnak az EU-ban?

A DSM-irányelv 4. cikke szerint online tartalomnál a gépileg olvasható fenntartás a megfelelő mód a szöveg- és adatbányászat kizárására, az AI Act pedig kötelezi az általános célú modellek szolgáltatóit ennek tiszteletben tartására. A bírói gyakorlat még kiforratlan, és a tiltás a már begyűjtött adatra nem hat.

Hogyan ellenőrzöm, hogy a tdm-reservation fejléc minden oldalon kimegy?

Futtass curl -sI kéréseket a fő oldaltípusokra, egy PDF-re és egy képre, nézd meg az aldomaineket, majd egy teljes feltérképezéssel keresd meg azokat a sablonokat, amelyekből kimarad. A gyorsítótárak ürítését se felejtsd el.

Források és további olvasnivalók

Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.

A cikk szerzője

Schmidt Péter, online marketing szakértő, a Scheo Tanácsadó Kft. alapítója. Székesfehérvárról, országosan dolgozó csapattal végzünk keresőoptimalizálást, AI-láthatóság mérést, Google és Meta hirdetéskezelést, weboldalkészítést. Amit itt leírunk, azt ügyfélmunkában is használjuk. Rólunk bővebben · Szolgáltatásaink

Kapcsolódó olvasnivaló

Kapcsolódó

Engedd vagy tiltsd az AI-crawlereket? Döntési fa vállalkozásoknak

Kapcsolódó

Honnan tudod, hogy tényleg AI-bot járt nálad, és nem valaki más adta ki magát annak

Kapcsolódó

Amikor az AI-botok megterhelik a szervert: mit tegyél

Helyi szolgáltatás a környékeden

Országosan dolgozunk, online és személyesen. Válaszd ki a városodat, és nézd meg, hogyan segítünk helyben:

Online marketing & AI SEO BékéscsabaOnline marketing & AI SEO EgerOnline marketing & AI SEO ZalaegerszegOnline marketing & AI SEO SzekszárdOnline marketing & AI SEO SalgótarjánOnline marketing & AI SEO Székesfehérvár

Weboldalkészítés városra bontva

Ha először a honlap kell, itt városonként arról írtunk:

Weboldalkészítés VeszprémWeboldalkészítés DunaújvárosWeboldalkészítés GyőrWeboldalkészítés DebrecenWeboldalkészítés SzegedWeboldalkészítés Miskolc

Mind a 20 városunk és az összes szolgáltatás →

15 perces AI-láthatósági gyorselemzés - díjmentesen

Megnézzük három, számodra fontos keresőkérdésnél, hogy megjelenik-e a céged a ChatGPT, a Gemini és a Google AI-válaszaiban, mely versenytársakat ajánlják helyetted, és melyik három területen érdemes először javítani. A weboldaladat előzetesen átnézzük, tehát nem sablonos, automata riportot kapsz.

Adataidat kizárólag a kapcsolatfelvételhez használjuk. Kapcsolat: m@rketinges.hu
💬 Konzultáció