- A keresőrobotok és az AI-crawlerek nem jelentkeznek be, ezért a portálon lévő tudás az AI-válaszok számára nem létezik.
- A tudás (fogalom, módszertan, lépések) jó eséllyel nyilvánossá tehető, a kész eszköz (sablon, kalkulátor, adatbázis) zárva marad.
- Ha a Googlebot több szöveget kap, mint a látogató, a zárt részt isAccessibleForFree és hasPart jelöléssel kell megjelölni.
- Kiszivárgásnál a sorrend a forrás lezárása, az ideiglenes eltávolítás, és csak utána a robots.txt, különben a noindex nem érvényesül.
- A tanítóadatba már bekerült szöveget jó eséllyel nem lehet visszavonni, ezért a megelőzés többet ér az utólagos javításnál.
Sok cégnél a legértékesebb szakmai anyag ügyfélportálon, regisztrációs fal mögött vagy zárt tudásbázisban van. Ott a módszertan, a kalkulátor, a részletes útmutató, amit évekig csiszoltatok. Az AI-alapú keresők és válaszmotorok ebből semmit nem látnak. Amikor valaki a te szakterületedről kérdez egy chatbotot, a válasz más forrásokból áll össze, jó eséllyel a versenytársaid nyilvános cikkeiből. Ez a cikk abban segít, hogy eldöntsd, mi maradjon zárva, miből legyen nyilvános kivonat, és mit tegyél, ha valami véletlenül kiszivárgott.
AI-láthatóság" loading="lazy" decoding="async" width="1200" height="669">A szövegben három jelölést használunk. Hivatalosan igazolt az, ami a Google, az OpenAI, a Microsoft vagy egy szabvány dokumentációjában le van írva. Saját tapasztalat az, amit projektekben rendszeresen látunk. Szakmai feltételezés az, ami logikus következtetés, de nyilvános adat nem igazolja teljesen.
Miért nem létezik az AI-motorok számára a bejelentkezés mögötti tartalom?
Mert a keresőrobotok és az AI-crawlerek nem jelentkeznek be. Amit csak felhasználónévvel, jelszóval vagy munkamenet-sütivel lehet elérni, azt nem tudják letölteni, így nem is indexelik és nem is idézik.
Hivatalosan igazolt. A Google dokumentációja szerint a jelszóval védett oldalak nem kerülnek be az indexbe, a jelszavas védelem kifejezetten ajánlott módja annak, hogy egy oldal ne jelenjen meg a találatok között. Az OpenAI a saját robotjait (OAI-SearchBot a ChatGPT keresőfunkciójához, GPTBot a modellfejlesztéshez) nyilvános oldalakra küldi, és ezek a robots.txt utasításait követik. A Bing, a Perplexity és az Anthropic robotjai is nyilvános URL-eket töltenek le, így ahol nincs nyilvános URL, ott nincs mit feldolgozni.
Saját tapasztalat. Ha egy szakmai kérdésre a legjobb válasz egy cég portálján van, az AI-válasz jellemzően fórumbejegyzésből, egy általánosabb blogcikkből vagy egy aggregátor oldalból épül fel. A pontatlan válasz ilyenkor sem a te hibád, csak éppen a te neved sincs benne.
Szakmai feltételezés. Az agentikus böngészők, amelyek a felhasználó saját fiókjával lépnek be, látják a zárt oldalt. Az így látott tartalom valószínűleg az adott felhasználó munkamenetében marad, és nem kerül be nyilvános keresőindexbe, de erre egyik szolgáltató sem ad részletes, teljes körű leírást.
Mi maradjon biztosan zárva?
Zárva marad minden, ami közvetlen üzleti értéket ad, bizalmas, vagy személyes adatot tartalmaz. Ide tartoznak a szerkeszthető sablonok, a számolótáblák, a kalkulátorok mögötti adatbázisok, az ügyfélspecifikus riportok és a szerződéses anyagok.
Öt kérdés segít eldönteni egy-egy elem sorsát.
- Ezért fizetnek, vagy ezért maradnak nálad? Ha igen, a kész eszköz zárva marad.
- Van benne személyes vagy ügyféladat? Ha igen, ez már nem marketingdöntés, a GDPR és a szerződés dönt helyetted.
- Azonnal használható kész eszköz? Egy letölthető táblázat vagy sablon kiváltja a veled való munkát, egy magyarázat viszont inkább hozzád vezet.
- Gyorsan elavul? Ha egy régi verzió nyilvános idézése kárt okozhat (például jogszabályi határértékeknél), inkább zárt, rendszeresen frissített helyen legyen.
- Van rá jogi vagy licenckorlát? A harmadik féltől licencelt adat szinte mindig zárva marad.
Miből érdemes nyilvános kivonatot csinálni?
A fogalmakból, a módszertanból és a gyakori kérdésekre adott válaszokból. Ezekből áll össze egy AI-válasz, és a nyilvánosságuk a zárt eszköz értékét általában nem csökkenti. Az a tudás, hogy mit kell csinálni, és az az eszköz, amivel gyorsan megcsinálod, két külön dolog.
Egy egyszerű szétválogatás segít.
- Nyilvános lehet a fogalom definíciója, a lépések sorrendje, a képlet elve és a változók jelentése, a tipikus hibák, a döntési szempontok, és egy kitöltött minta fiktív adatokkal.
- Zárt marad a szerkeszthető fájl, a kalkulátor a saját adatbázissal, a benchmark számok, az ügyfélre szabott eredmény, és minden, ami a te konkrét munkafolyamatodat pótolja.
Saját tapasztalat. Az a félelem, hogy „ha leírjuk a módszert, nem lesz szükség ránk”, ritkán igazolódik. Aki elolvassa a lépéseket, jellemzően rájön, mennyi munka van benne, és pont ezért keresi a kész eszközt vagy a szakembert.
Hogyan épül fel a nyitott réteg a zárt anyag fölött?
Három szintből áll, ezek a nyilvános fogalomtár és módszertan, a részben nyitott minta és a zárt eszköztár. A nyilvános oldalak válaszolnak a kérdésre, a minta megmutatja az eredményt, a zárt rész pedig időt spórol.
Egy általános minta
Vegyünk egy képzelt, általános példát. Egy HR-tanácsadó cég portálján bérsáv-kalkulátor és munkakörileírás-sablonok vannak, csak ügyfeleknek.
- Nyilvános fogalomoldalak. Mi a bérsáv, miben különbözik a bérkategóriától, milyen elemekből áll egy munkaköri leírás. Minden oldal két-három mondatos, önmagában idézhető definícióval indul.
- Nyilvános módszertan. Hogyan épít fel egy cég bérsávrendszert lépésről lépésre, milyen adatokra van szüksége, melyek a leggyakoribb hibák. A képlet elve szerepel, a piaci adat nem.
- Nyilvános minta. Egy fiktív munkakör kitöltött leírása és egy egyszerűsített számítási példa kerek számokkal, jól láthatóan illusztrációként jelölve.
- Zárt eszköztár. A szerkeszthető sablonok, a kalkulátor a piaci adatbázissal, a verziókövetett frissítések és az ügyfélre szabott riport.
Lépésről lépésre a saját anyagodon
- Készíts leltárt a zárt tartalomról (URL, típus, használati gyakoriság a portál statisztikájából).
- Minden elemnél döntsd el, hogy tudás vagy eszköz. A tudásból lehet kivonat, az eszköz zárva marad.
- Gyűjtsd össze a valódi kérdéseket az ügyfélszolgálati jegyekből, az értékesítési hívásokból és a portál belső keresőjéből.
- Írd meg a kivonatokat kérdés-alapú címekkel, a szakasz elején tömör válasszal.
- Minden nyilvános oldalról vezessen egyértelmű belső link a zárt eszköz felé, és írd oda, mit kap, aki regisztrál.
- Adj stabil URL-t a nyilvános oldalaknak, és ne költöztesd őket később.
- Mérd, hogy idézik-e őket, és hoznak-e regisztrációt.
Saját tapasztalat. Gyakori, hogy a nyilvános kivonat elkészül, de a CDN vagy a botvédelmi szabály az ismeretlen robotokat egységesen letiltja, így az AI-crawlerek a nyitott réteget sem érik el. Élesítés után nézd meg a szervernaplóban, hogy az OAI-SearchBot, a PerplexityBot és a Bingbot 200-as választ kap-e a nyilvános URL-ekre, és hogy a robots.txt csak a portál útvonalát zárja ki.
Hogyan jelöld a részben zárt tartalmat, hogy ne számítson álcázásnak?
Ha a Googlebot több szöveget kap, mint a be nem jelentkezett látogató, jelöld a zárt részt strukturált adattal. Enélkül a Google álcázásnak (cloaking) értelmezheti a különbséget.
Hivatalosan igazolt. A Google a fizetős és regisztrációs tartalomhoz az isAccessibleForFree tulajdonságot és a hasPart elemet ajánlja, a zárt blokkot CSS-osztállyal azonosítva. Egy egyszerű JSON-LD példa így néz ki.
{"@context": "https://schema.org", "@type": "Article", "headline": "Bérsávrendszer felépítése", "isAccessibleForFree": false, "hasPart": {"@type": "WebPageElement", "isAccessibleForFree": false, "cssSelector": ".zart-tartalom"}}
Erre csak akkor van szükség, ha a robot ténylegesen megkapja a zárt szöveget. Ha a zárt rész hitelesítés nélkül soha nem hagyja el a szervert, nincs mit jelölni.
Hivatalosan igazolt. A Google-Extended robots.txt token a Gemini modellek tanítását szabályozza, a Google Keresésben való megjelenést nem befolyásolja. Aki tehát a Googlebotnak kiszolgálja a zárt szöveget, számoljon vele, hogy az a keresési funkciókban felhasználható.
Szakmai feltételezés. Más AI-szolgáltatók robotjai ezt a jelölést jó eséllyel nem értelmezik ugyanígy, ezért a nekik kiszolgált szöveget tekintsd nyilvánosnak.
Mit csinálj, ha a zárt tartalom egy része véletlenül kikerült és indexelődött?
Először zárd el a forrást, utána kérj ideiglenes eltávolítást, és csak ezután nyúlj a robots.txt-hez. Ha a robots.txt-ben rögtön letiltod az oldalt, a robot nem látja a noindex utasítást, és az URL a találatok között maradhat.
- Mérd fel a kárt. Nézd meg a Search Console Oldalak jelentését, keress rá
site:operátorral a portál útvonalára, és a szervernaplóban ellenőrizd, mely robotok (Googlebot, Bingbot, OAI-SearchBot, GPTBot, PerplexityBot) töltötték le az érintett URL-eket. - Zárd el a forrást. Tedd hitelesítés mögé, vagy töröld, és a szerver adjon 404-es vagy 410-es választ. A Google szerint a tartós megoldás a törlés, a jelszavas védelem vagy a noindex, az eltávolító eszköz ezeket nem pótolja (hivatalosan igazolt).
- Ha az oldalnak elérhetőnek kell maradnia, csak ne legyen az indexben, használj
noindexrobots meta taget vagyX-Robots-TagHTTP-fejlécet. A robots.txt ne tiltsa az URL-t, amíg a robot újra nem járt rajta. - Kérj ideiglenes eltávolítást. A Search Console Eltávolítások eszköze nagyjából hat hónapra rejti el az URL-t a Google találatai közül (hivatalosan igazolt). A Bing Webmaster Tools saját tartalomeltávolító eszközt kínál.
- Kezeld a fájlokat is. PDF-re és táblázatra nem tehetsz meta taget, ezért szerveroldali fejléc kell. Nginx alatt ez például így néz ki.
location ^~ /portal/fajlok/ { add_header X-Robots-Tag "noindex, nofollow" always; }A tartós megoldás itt is a hitelesítés. - Ha személyes adat is kikerült, az adatvédelmi incidens szabályai élnek. A GDPR 33. cikke szerint a kockázattal járó incidenst főszabályként 72 órán belül be kell jelenteni a felügyeleti hatóságnak (hivatalosan igazolt). Ebbe a lépésbe azonnal vond be az adatvédelmi felelőst.
- Tárd fel az okot, különben újra megtörténik. A leggyakoribb okokat a következő szakasz sorolja.
Szakmai feltételezés. Amit egy modell tanítóadatként már feldolgozott, azt utólag jó eséllyel nem tudod visszavonni. A keresésre épülő AI-válaszok viszont az indexből dolgoznak, így ott az eltávolítás hatása idővel megjelenik. Saját tapasztalat szerint ez napoktól néhány hétig tart, szolgáltatónként eltérően.
Milyen technikai hibák miatt szivárog ki leggyakrabban a zárt anyag?
Legtöbbször a feltöltött fájlok közvetlen URL-je, a nyitva hagyott tesztkörnyezet és a csak látszólagos, böngészőoldali zárás a hibás. Ezeket élesítés előtt és utána negyedévente érdemes végignézni (saját tapasztalat).
- Nyilvános fájl-URL. A portál oldala zárt, de a letölthető PDF a médiatárban hitelesítés nélkül elérhető, és egyetlen belinkelés elég, hogy a robot megtalálja.
- Oldaltérkép. A CMS automatikusan felveszi a sitemapbe a portál oldalait vagy a csatolmányokat.
- Tesztkörnyezet. A staging vagy fejlesztői domain jelszó nélkül fut, és egy elfelejtett link elviszi oda a robotot.
- Böngészőoldali zárás. A teljes szöveg benne van a HTML-ben, csak egy CSS-réteg vagy JavaScript takarja. A robot így is látja, és strukturált adat nélkül ez álcázásnak is tűnhet.
- Megosztási linkek. Tokenes előnézeti vagy felhőtárhelyes linkek, amelyek fórumokra, levelezőlistákra kerülnek.
- Belső kereső. Ha a portál keresője nyilvános URL-eken ad vissza szövegrészleteket, azok is indexelődhetnek.
Hogyan méred, hogy működik-e a nyitott réteg?
Figyeld, hogy megjelennek-e a nyilvános oldalak az AI-válaszokban, és hogy hoznak-e regisztrációt vagy portálbelépést. Az egyik a láthatóságot méri, a másik azt, hogy az üzleti érték megmaradt-e.
- Állíts össze egy fix kérdéslistát a témádra, és havonta futtasd le ugyanazokat a kérdéseket a nagyobb AI-asszisztensekben.
- A szervernaplóban kövesd, hogy az AI-robotok letöltik-e az új nyilvános oldalakat.
- Az analitikában figyeld az AI-szolgáltatásokból (például chatgpt.com, perplexity.ai) érkező hivatkozó forgalmat.
- Mérd a nyilvános oldalakról induló regisztrációkat, és vesd össze a portál aktív használatával.
Szakmai feltételezés. Egy jól megírt fogalomoldal idézése sem garantált, az AI-válaszok forrásválasztása szolgáltatónként és időben is változik. A nyitott réteg esélyt ad a megjelenésre, ami zárt tartalomnál nincs.
Mi legyen az ellenőrzőlistán élesítés előtt?
- Minden zárt elem be van sorolva (zárt, kivonat, nyilvános minta).
- A nyilvános oldalak az elején önálló, idézhető választ adnak.
- A zárt fájlok hitelesítés nélkül nem tölthetők le, ezt kijelentkezve, privát ablakban is kipróbáltad.
- A portál oldalai nincsenek benne a sitemapben.
- A tesztkörnyezet jelszóval védett.
- Ha a Googlebot zárt szöveget kap, a strukturált adat jelöli.
- A nyilvános oldalakról egyértelmű út vezet a regisztrációhoz.
- Van kijelölt felelős és leírt lépéssor arra az esetre, ha valami kiszivárog.
Források és további olvasnivalók
- Google Search Central, Előfizetéses és fizetőfalas tartalom strukturált adatai
- Google Search Central, Robots meta tag és X-Robots-Tag specifikáció
- Google Search Central, A Google robotjai és lekérői (Google-Extended)
- Google Search Console súgó, Eltávolítások eszköz
- OpenAI dokumentáció, Overview of OpenAI Crawlers
- Schema.org, CreativeWork (isAccessibleForFree, hasPart) és WebPageElement
- IETF RFC 9309, Robots Exclusion Protocol
- Bing Webmaster Tools súgó, Tartalomeltávolítás
- (EU) 2016/679 rendelet (GDPR)
Gyakori kérdések
Látják a ChatGPT és a Google AI-funkciói a jelszóval védett tartalmat?
Nem. A keresőrobotok és az AI-crawlerek nem jelentkeznek be, ezért a csak hitelesítéssel elérhető oldalakat nem töltik le, nem indexelik és nem idézik.
Nem vesztem el az ügyfeleimet, ha nyilvánosan leírom a módszertant?
Ritkán. A módszertan azt mutatja meg, mit kell csinálni, a zárt sablon és kalkulátor pedig időt spórol. Aki elolvassa a lépéseket, jellemzően látja, mennyi munka van benne, és ezért keresi a kész eszközt.
Mikor kell a paywall strukturált adatot használni?
Akkor, ha a Googlebot ténylegesen több szöveget kap, mint a be nem jelentkezett látogató. Ilyenkor az isAccessibleForFree és a hasPart jelölés segít, hogy a Google ne értelmezze álcázásnak a különbséget.
Elég a robots.txt-ben letiltani a kiszivárgott oldalt?
Nem. A robots.txt a letöltést tiltja, az indexelést nem, és ha a robot nem fér hozzá az oldalhoz, a noindex utasítást sem látja. Előbb hitelesítés vagy törlés kell, utána ideiglenes eltávolítás.
Meddig hatásos a Search Console Eltávolítások eszköze?
Nagyjából hat hónapig rejti el az URL-t a Google találatai közül. A tartós megoldás a tartalom törlése, jelszavas védelme vagy a noindex.
Kivehető egy AI-modellből a már feldolgozott zárt tartalom?
Szakmai feltételezés szerint a tanítóadatba került szöveg utólag jó eséllyel nem vonható vissza. A keresésre épülő AI-válaszok viszont az indexből dolgoznak, ott az eltávolítás idővel érvényesül.
Források és további olvasnivalók
Ezen az oldalon a hivatalosan igazolt információt elsődleges forrásokból építjük fel; a saját tapasztalatot és a szakmai becslést mindig külön jelöljük a szövegben.