Nexux Intelligence
Glosario AEO

¿Qué es Common Crawl y por qué importa CCBot?

Common Crawl es una organización sin ánimo de lucro que rastrea la web pública desde 2008 y publica el resultado como un dataset abierto y gratuito; su robot se llama CCBot. Ese dataset es una de las fuentes principales con las que se entrenan los grandes modelos de lenguaje, incluidos los de OpenAI, Anthropic o Meta. La consecuencia práctica para una marca es directa: si el robots.txt de su web bloquea a CCBot, el contenido no entra en el dataset y las futuras versiones de los modelos tendrán menos información —o ninguna— sobre la empresa, que dependerá exclusivamente de la búsqueda en vivo para aparecer en respuestas. Permitir CCBot no supone carga significativa para el servidor y es una de las comprobaciones estándar de la auditoría técnica AEO, junto al resto de crawlers de IA y la existencia de llms.txt y datos estructurados.

¿Quieres saber si la IA menciona a tu empresa cuando alguien pregunta por tu sector?

Solicitar auditoría gratuita →