---
url: https://docs.oakxgen.ai/zh-Hant-TW/guide/connections/web-crawler-connection.md
description: 網站連線不是存一份網頁副本，而是讓 AI 需要的時候即時去抓，所以對方改了內容不會有過期問題。這篇說明探索範圍怎麼設，以及探索回來的頁面怎麼篩選要開放哪些。
---

新增連線選**網站**，用來掛上一個網站、探索站內有哪些頁面，勾選要開放給 AI 的頁面。

**這跟知識庫的〈匯入網站〉不一樣**：知識庫匯入是把網頁內容存一份副本進知識庫；
這裡**不存副本**，agent 用到時才即時去抓當下的內容，所以對方網站改了，AI 下一句
話就是照新的講，但相對地每次呼叫都要花時間即時抓取。哪個網站該用哪一種，看你
要的是「反應即時」還是「查詢快、不受對方網站當下狀態影響」。

## 探索範圍怎麼設

**起始網址**——從這個網址開始找。想只收某一區的內容，把網址填到那一層，
例如 `https://example.com/docs`。

**探索範圍**——二選一：

* **整個網域**——會跟著站內任何連結跑，不限起始網址底下的路徑。
* **限這個路徑底下**——只收起始網址底下的頁面，不會跑到網域其他區塊。

**探索深度**——從首頁往外點幾層，範圍 1 到 5。2 層通常就涵蓋主要頁面，
數字越大探索越久、頁數也可能暴增。

**探索頁數上限**——一次探索最多列出幾頁，最多 500。

**排除路徑**——一行一條，路徑裡含有這些字就跳過，例如 `/tag`、`/search`。

## 按下「探索網頁」之後

系統會照上面的設定去爬，爬到的每一頁變成一顆動作。探索回來動輒上百頁，所以畫面
不是平鋪列出來，而是**依網址路徑第一段分堆**（例如 `/docs/...` 一堆、`/blog/...`
一堆），可以整堆一起開關，也有關鍵字搜尋可以篩選。

**網頁動作沒有可編輯的參數**——它就是那個網址本身，不像 HTTP／資料庫的動作可以
改方法、路徑或 SQL，能調整的只有要不要開放（開關）。

## 幾件值得知道的事

**探索是一次性快照。** 對方網站之後新增了頁面，要回來重新按一次**探索網頁**才會
出現在清單裡。

**改了起始網址要重新探索。** 畫面會提醒「網址已經改過，底下列的還是舊站台探索
回來的東西」，在重新探索之前那些舊頁面不會自動失效，但已經不是你現在想要的網站了。

**不建議一次全開。** 探索到的頁面數量一多，全部開放等於把整個網站塞進 AI 的工具
清單，AI 反而更容易選錯頁面，建議只開放真的會被查到的那幾類。
