> ## Documentation Index
> Fetch the complete documentation index at: https://docs.bestchatbot.io/llms.txt
> Use this file to discover all available pages before exploring further.

# Anadir URLs

> Scrapea contenido de webs para anadirlo a tu base de conocimiento.

# Anadir URLs

La pestana **Links** del Document Manager te permite anadir contenido web a tu base de conocimiento. En lugar de copiar y pegar de paginas web, BestChatBot scrapea el contenido por ti.

<Frame>
  <iframe className="w-full aspect-video rounded-xl" src="https://www.youtube.com/embed/B-Iy7NfHv5E" title="Video: convierte tu web en un agente IA para tu negocio (auto-actualizable)" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowFullScreen />
</Frame>

## Metodos de scraping

BestChatBot ofrece tres formas de anadir contenido web:

<CardGroup cols={3}>
  <Card title="URL directa" icon="link">
    Pega una URL de una sola pagina. El bot scrapea solo esa pagina.
  </Card>

  <Card title="Sitemap" icon="sitemap">
    Da una URL de sitemap y BestChatBot descubre todas las paginas automaticamente.
  </Card>

  <Card title="Crawl" icon="spider">
    Introduce una URL inicial y BestChatBot recorre el sitio siguiendo enlaces para descubrir paginas.
  </Card>
</CardGroup>

## Como anadir URLs

<Steps>
  <Step title="Abre Document Manager">
    Ve a **Document Manager** en el sidebar del dashboard y cambia a la pestana **Links**.
  </Step>

  <Step title="Elige tu metodo">
    Selecciona **URL directa**, **Sitemap** o **Crawl**.
  </Step>

  <Step title="Introduce la URL">
    Pega la URL en el campo. Por ejemplo:

    * **Directa:** `https://tusitio.com/faq`
    * **Sitemap:** `https://tusitio.com/sitemap.xml`
    * **Crawl:** `https://tusitio.com/docs`
  </Step>

  <Step title="Configura filtros de URL (opcional)">
    Acota que paginas se anaden usando patrones de URL. Las opciones dependen del metodo:

    * **Crawl** — abre **Advanced options** para fijar **Include paths** y **Exclude paths**. Solo se conservan las paginas que coinciden con un patron de inclusion; las que coinciden con uno de exclusion se descartan.
    * **Sitemap** — fija un unico **URL Pattern** para quedarte solo con las entradas que coinciden. Dejalo vacio para importar todas las URLs del sitemap.

    Los patrones usan comodines tipo glob (`*`) y se comparan contra la ruta de la pagina. Por ejemplo, `docs/*` conserva todo bajo `/docs`, y `*/blog/*` coincide con cualquier ruta de blog.

    <Note>Introduce **un patron por campo**. Para apuntar a varias secciones distintas, lanza scrapeos separados.</Note>
  </Step>

  <Step title="Empieza el scrapeo">
    Pulsa el boton para iniciar el scrapeo. Veras el progreso a medida que se descubren y procesan paginas.

    <Note>El tiempo depende del numero de paginas. Una sola tarda segundos; un crawl completo puede tardar varios minutos.</Note>
  </Step>

  <Step title="Reconstruye la base de conocimiento">
    Tras terminar el scrapeo, recuerda **Reconstruir base de conocimiento** para que el bot use el contenido nuevo.

    <Warning>Los cambios en tus URLs (scrapeos nuevos o eliminaciones) **no se aplican** hasta que reconstruyes. El bot sigue usando la version anterior hasta entonces.</Warning>
  </Step>
</Steps>

<Frame>
  <img src="https://mintcdn.com/bestchatbot/97kdRjnWT0Lew0EI/images/add-urls-screen.png?fit=max&auto=format&n=97kdRjnWT0Lew0EI&q=85&s=3ad4c984a8cc50aee3607707d6613c3c" alt="Pestana Links con opciones Crawl, URL Directa y Sitemap y URLs scrapeadas" width="1404" height="740" data-path="images/add-urls-screen.png" />
</Frame>

## Limites de paginas scrapeadas

Cada plan incluye un numero de paginas que puedes anadir desde URLs. Cada URL de tu base de conocimiento cuenta para este limite, ya sea anadida como URL directa, descubierta desde un sitemap o encontrada durante un crawl.

| Plan     | Paginas scrapeadas |
| -------- | ------------------ |
| Free     | 5                  |
| Starter  | 30                 |
| Pro      | 75                 |
| Business | 150                |

<Tip>Usa **URL directa** para tus paginas mas importantes primero. Deja el crawl para cuando necesites cobertura total.</Tip>

## Gestionar contenido scrapeado

Las paginas scrapeadas aparecen junto con documentos subidos en tu base de conocimiento. Puedes:

* Ver la URL y la fecha de scrapeo
* Borrar paginas scrapeadas individuales
* Re-scrapear una URL para obtener contenido actualizado

<Frame>
  <img src="https://mintcdn.com/bestchatbot/YGTok5EETDkINur7/images/child-urls.png?fit=max&auto=format&n=YGTok5EETDkINur7&q=85&s=f9c672671b6cdd8067e4d9a1b8710449" alt="Una fuente crawleada expandida mostrando las child URLs descubiertas, cada una en estado pendiente" width="2169" height="1221" data-path="images/child-urls.png" />
</Frame>

## Proximos pasos

<CardGroup cols={2}>
  <Card title="Reconstruir base de conocimiento" icon="rotate" href="/es/knowledge-base/rebuild">
    Procesa tu contenido nuevo.
  </Card>

  <Card title="Subir documentos" icon="file-arrow-up" href="/es/knowledge-base/upload-documents">
    Anade archivos PDF, DOCX, TXT o MD.
  </Card>
</CardGroup>
