Există un fișier pe site-ul tău pe care probabil nu l-ai deschis niciodată. Are între 5 și 20 de linii, stă în rădăcina domeniului și, până de curând, era treaba exclusivă a developerilor. Se numește robots.txt.

Problema e simplă: acest fișier decide acum cine are voie să citească și să folosească conținutul tău. Nu vorbesc doar despre Googlebot, care indexează pagini pentru rezultatele din search. Vorbesc despre cele 30+ crawlere AI care accesează site-ul tău zilnic, fiecare cu un scop diferit: unele te indexează, altele te citează în răspunsuri, altele îți iau textul ca să antreneze modele de limbaj.

Dacă nu ai verificat robots.txt în ultimele 6 luni, ai luat deja o decizie. Doar că n-ai luat-o tu.

Nu mai e vorba doar despre Googlebot

Timp de 20 de ani, robots.txt era un fișier simplu. Aveai Googlebot, Bingbot, câteva crawlere de nișă. Le spuneai ce pot indexa și gata. Un developer adăuga câteva linii la deploy, nimeni nu se mai gândea la ele, și toată lumea era mulțumită.

Acum, pe lângă crawlerele clasice de search, site-ul tău primește vizite de la GPTBot (OpenAI), ClaudeBot (Anthropic), Bytespider (ByteDance), CCBot (Common Crawl), Google-Extended și încă cel puțin 20 de agenți automatizați. Conform raportului Imperva Bad Bot 2024, 49.6% din tot traficul web e generat de boți. Iar proporția crawlerelor AI crește vizibil de la un trimestru la altul.

Diferența critică: un crawler de search te ajută să fii găsit. Un crawler de tip AI agent îți folosește conținutul ca sursă de răspunsuri, în timp real. Un crawler de AI training îți ia conținutul și îl transformă în materie primă pentru modele de limbaj. Fără atribuire, fără link-back, fără trafic.

Toate trei cer acces prin același fișier. Și dacă nu faci distincția explicit, le tratezi pe toate identic.

Trei categorii de crawlere, trei decizii diferite

Din experiența noastră la difrnt. cu audituri tehnice și configurări de site-uri, am ajuns la un framework de lucru simplu. Împărțim crawlerele în trei categorii, fiecare cu o logică de acces diferită:

Search (Googlebot, Bingbot, Yandex): acces complet. Vrei să fii indexat, vrei să apari în rezultatele organice. Nu restricționezi nimic, eventual doar paginile cu conținut duplicat sau zonele administrative.

AI Agents (ChatGPT browsing, Perplexity, Google AI Overviews): acces selectiv. Aceste crawlere folosesc conținutul tău în timp real, ca sursă pentru răspunsuri. Dacă blochezi accesul, dispari din răspunsurile AI. Dacă permiți totul, riști ca utilizatorul să primească răspunsul complet fără să mai ajungă pe site-ul tău. E un compromis care depinde de modelul tău de business: dacă monetizezi prin trafic, gândește-te bine. Dacă monetizezi prin autoritate, deschide porțile.

Training (GPTBot în modul training, CCBot, Bytespider): acces de evaluat cu grijă. Aceste crawlere colectează conținut pentru a antrena modele de limbaj. Nu primești trafic direct în schimb. Dar există un argument pe termen lung: un model antrenat pe conținutul tău ar putea să te recomande mai frecvent în răspunsuri. Cât valorează asta concret, e greu de cuantificat astăzi.

Problema reală e că robots.txt nu face distincția asta suficient de granular. Poți bloca un user-agent complet, dar nu poți spune "permite browsing-ul, blochează training-ul" pentru același crawler. Google-Extended, de exemplu, controlează și AI training și AI Overviews. Blochezi unul, le blochezi pe amândouă. Și asta e o decizie cu impact real asupra vizibilității tale.

Ce nu face robots.txt (și ce presupun toți că face)

Robots.txt e un protocol bazat pe bună-voință. Nu e un firewall. Nu e un contract legal. E o convenție pe care crawlerele o respectă voluntar.

Conform unui studiu Originality.ai, aproximativ 35% din crawlerele AI nu respectă directivele din robots.txt. Asta înseamnă că poți pune "Disallow" pentru orice bot AI, și tot vei avea crawlere care îți accesează conținutul. Fișierul declară ce vrei, dar nu garantează că se întâmplă.

De aceea, la clienții pe care îi gestionăm, robots.txt e doar primul strat. Pe lângă el, recomandăm câteva practici concrete:

Monitorizare activă a server logs: verifici exact ce crawlere accesează site-ul, cât de des și ce pagini citesc. Majoritatea proprietarilor de site-uri nu au făcut niciodată acest exercițiu. E ca și cum ai avea o ușă deschisă fără să știi cine intră.

Reguli la nivel de edge: Cloudflare, AWS CloudFront, Vercel, toate oferă opțiuni de filtrare a traficului înainte ca acesta să ajungă la server. Acolo aplici blocaje reale, nu doar indicații pe care crawlerele le pot ignora.

Revizuire trimestrială: crawlere noi apar constant, iar cele existente își schimbă user-agent-ul. Un robots.txt neactualizat poate fie să blocheze accesul pe care l-ai vrea, fie să permită exact ce nu vrei.

Documentarea deciziilor: ca orice decizie de business, trebuie să existe un "de ce" în spatele fiecărei reguli. Peste 6 luni, nimeni nu-și va mai aminti logica din spatele unei linii adăugate într-un commit de vineri seara.

Când un fișier text ajunge subiect de strategie

Luna trecută am avut conversații complet opuse cu doi clienți.

Primul, un e-commerce cu peste 40.000 de produse, a vrut să blocheze tot training-ul AI dar să permită AI Overviews. Logica: "Vreau să apar în răspunsuri, dar nu vreau ca modelele AI să copieze descrierile mele de produse și să le ofere competitorilor." Problema: blocarea Google-Extended elimina ambele funcții. A trebuit să aleagă, și a ales vizibilitatea. Dar a fost o discuție de o oră, cu argumente pro și contra, nu un commit de 5 secunde.

Al doilea, un publisher de conținut B2B, a vrut exact inversul: "Vreau ca AI-ul să fie antrenat pe conținutul nostru. Vrem să devenim sursa pe care o citează." Au deschis accesul complet și au investit în structured data ca să maximizeze vizibilitatea în răspunsurile AI.

Ambele decizii sunt corecte. Ambele au implicat echipe de marketing, management și tehnic. Și ambele au plecat de la o întrebare pe care fiecare business ar trebui să și-o pună: cine vrem să aibă acces la conținutul nostru, și în ce condiții?

Robots.txt nu mai e un artefact tehnic. E o politică de acces la conținut. Iar în 2026, această politică e la fel de importantă ca strategia ta de SEO sau bugetul de content marketing. Dacă n-ai discutat-o în echipă, probabil că ai o politică implicită pe care n-ai ales-o conștient.

Deschide fișierul. Citește-l. Și pune-ți o singură întrebare: asta am vrut?