Hreflang: ce este, când ai nevoie și cum îl implementezi corect
Dacă administrezi un site cu versiuni în mai multe limbi sau pentru mai multe țări, ai dat probabil peste situații…
Citește articolul
Dacă ai ajuns aici, probabil te-ai săturat de rapoartele din Search Console care îți arată „Discovered – currently not indexed” fără să-ți spună de ce. Sau ai un site mare și suspectezi că Googlebot pierde timpul prin colțuri inutile, în timp ce paginile importante stau neaccesate săptămâni întregi.
Analiza log-urilor e singura metodă prin care vezi exact ce face Googlebot pe site-ul tău. Nu ce zice Google că face. Nu ce simulează crawlerele third-party. Ce face efectiv, la nivel de request server.
Asta nu vezi în Search Console. Vezi un raport agregat, frumos. Logurile îți dau realitatea brută.
Fiecare request către serverul tău – de la un user real, de la Googlebot, de la Bingbot sau de la un scraper random – lasă o linie în log. Arată cam așa:
66.249.66.1 – – [12/Nov/2024:08:23:11 +0000] „GET /produs/pantofi-sport HTTP/1.1” 200 14523 „-” „Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)”
Ai IP-ul, data, URL-ul cerut, codul HTTP returnat, dimensiunea răspunsului și user-agentul. Pentru analiza SEO, te interesează doar request-urile de la boții de motoare de căutare – mai ales Googlebot.
Depinde de hosting:
Realist: pe shared hosting ieftin, log-urile sunt rotite agresiv (uneori zilnic) și pierzi date. Dacă vrei analiză serioasă, configurează un sistem de arhivare. Minim 30 de zile, ideal 90.
Aici greșesc mulți. Un user-agent „Googlebot” poate fi orice scraper care minte. Trebuie să faci reverse DNS lookup pe IP.
Pași simpli:
Dacă nu se verifică, e bot fals. În practică, 5-15% din traficul „Googlebot” pe un site mediu e fake. Tool-uri ca Screaming Frog Log File Analyser, Botify sau Oncrawl fac asta automat. Pentru analize ad-hoc, un script Python de 20 de linii rezolvă problema.
Grupează URL-urile pe șabloane: /produs/*, /categorie/*, /blog/*, /tag/*, etc. Apoi vezi câte requesturi primește fiecare grup. Dacă Googlebot face 60% din requesturi pe paginile de tag-uri și 5% pe produse, ai o problemă serioasă de prioritizare.
Homepage-ul ar trebui crawl-uit zilnic, dacă nu de mai multe ori pe zi. Categoriile principale – la fel. Produse / articole noi – în 1-3 zile de la publicare. Dacă o pagină importantă nu e accesată de 30+ zile, fie ai probleme de internal linking, fie autoritatea site-ului e prea mică.
Aici găsești surprize neplăcute:
Pentru site-uri sub 10.000 de URL-uri, crawl budget-ul rar e o problemă. Pentru e-commerce cu 100.000+ de produse, devine critic. Verifică ce procent din requesturile Googlebot merg spre URL-uri cu valoare zero: filtre combinate (?color=red&size=42&sort=price), paginări adânci (page 87 din blog), URL-uri canonicalizate dar tot crawl-uite.
Pe un site mare prost configurat, am văzut 70-80% din crawl pierdut pe astfel de URL-uri. După cleanup cu robots.txt și canonical corect, paginile importante au început să fie crawl-uite de 5-10 ori mai des.
Nu ai nevoie de software scump pentru început:
Logurile fără acțiune sunt doar date. Câteva intervenții tipice după o analiză:
Pentru site-urile noi sau cu autoritate scăzută, problema reală nu e crawl budget-ul. E lipsa semnalelor de autoritate care să facă Google să vină mai des. Acolo intervine partea de off-page – advertoriale contextuale și menționări în publicații relevante care cresc crawl rate-ul pe tot site-ul, nu doar pe pagina linkuită.
Pentru site-uri mici (sub 1.000 de pagini): la 3-6 luni sau când faci modificări structurale mari.
Pentru site-uri medii (1.000-50.000): lunar, cu rapoarte agregate săptămânale dacă ai resurse.
Pentru site-uri mari (50.000+): monitorizare continuă, alerte automate pe schimbări bruște de pattern.
Pe scurt, dacă ai sărit până aici: log-urile sunt singura sursă obiectivă despre ce face Googlebot pe site-ul tău. Search Console e util, dar îți dă o versiune filtrată. Pentru orice site care depinde de SEO și are peste câteva mii de pagini, analiza log-urilor nu mai e opțională – e diferența dintre a ghici și a ști.
Creezi contul în câteva minute, alegi prima publicație și vezi cum funcționează procesul real. Fără abonament, fără volum minim, fără să te legi de nimic.