#
llms.txt
llms.txt è un file Markdown nella root web che offre ai sistemi IA una guida compatta ai contenuti pubblici più importanti di un sito.
Può indicare pagine prioritarie, policy, prodotti, documentazione e URL di riferimento. Non obbliga i crawler a obbedire, ma fornisce un passaggio più chiaro.
#
robots.txt per IA
robots.txt definisce quali crawler possono recuperare un sito web o aree specifiche del sito.
Per i sistemi IA è il file tecnico centrale per consentire, limitare o bloccare GPTBot, ClaudeBot, Google-Extended e PerplexityBot. Rende le regole leggibili dalle macchine, ma non è consulenza legale.
#
GPTBot
GPTBot è un crawler OpenAI che può recuperare contenuti web pubblicamente raggiungibili per sistemi IA.
I proprietari di siti di solito ne controllano l’accesso tramite robots.txt. KI-Console verifica se il sito testato è tecnicamente leggibile per questo bot.
#
ClaudeBot
ClaudeBot è un crawler Anthropic che può recuperare contenuti web pubblicamente raggiungibili per sistemi IA legati a Claude.
Il suo accesso può essere consentito o bloccato in robots.txt come quello di altri crawler nominati. Un sito visibile dovrebbe rendere esplicita questa scelta invece di dipendere da default casuali.
#
Google-Extended
Google-Extended è un controllo robots.txt di Google per l’uso dei contenuti in determinati prodotti IA.
È diverso da Googlebot per il crawl di ricerca classica. I proprietari di siti lo usano per compiere una scelta tecnica su certi usi IA da parte di Google.
#
PerplexityBot
PerplexityBot è un crawler di Perplexity che può recuperare pagine web per sistemi di risposta e scoperta IA.
Il suo stato robots.txt è un segnale della possibilità che un sito venga scoperto e citato in esperienze collegate a Perplexity. L’accesso non garantisce citazioni o posizionamento nelle risposte.
#
AI Readiness Score
L’AI Readiness Score riassume i segnali tecnici che influenzano la capacità dei crawler IA di leggere e comprendere un sito web.
Non è una promessa di ranking. Aiuta i team a individuare rapidamente blocchi crawler, file di scoperta mancanti e lacune nei dati strutturati.
#
GEO (Generative Engine Optimization)
GEO descrive l’ottimizzazione di contenuti e segnali tecnici per le risposte nei sistemi di ricerca generativa e IA.
Include contenuti crawlable, fonti chiare, dati strutturati e affermazioni precise. GEO completa la SEO, non la sostituisce.
#
IndexNow
IndexNow è un protocollo che consente ai siti di notificare attivamente ai motori di ricerca gli URL modificati.
Può accelerare la scoperta di pagine nuove o aggiornate, ma non garantisce l’indicizzazione. Per la visibilità IA è un segnale di freschezza aggiuntivo.
#
Crawler IA
Un crawler IA è un bot che recupera contenuti web per ricerca IA, training o sistemi di risposta live.
Vendor diversi usano nomi user-agent e scopi di crawl diversi. La visibilità inizia riconoscendo questi bot e controllandone l’accesso in modo pulito.
#
sitemap.xml
sitemap.xml è un file XML che elenca gli URL importanti di un sito web per i crawler.
Aiuta motori di ricerca e sistemi vicini all’IA a scoprire più velocemente le pagine rilevanti. Una sitemap non sostituisce i link interni, ma migliora la reperibilità tecnica.