Skip to content

AI 要答官網的最新公告:網站連線即時抓 vs 知識庫匯入存副本

這篇用 OakMega 官網示範一個常見需求:AI 回答「最近發了什麼文章」時要用網站上當下的內容,不能用上次匯入的舊副本;回答「公司有哪些團隊」這類不常變的內容時,則查知識庫裡整理好的副本。完成後,你可以在對話裡分別看到 AI 即時抓網頁和查知識庫的紀錄。

開始前 ​

你需要能管理工具庫、知識庫,以及建立 Skill Agent 的工作區權限,還要有一筆可供 agent 使用的AI 引擎。本例使用公開網站 https://oakmega.com:部落格列表頁 /blog 大約每週有新文章,「關於我們」頁 /about-us 則很少變動。換成你自己的官網時,先確認頁面不需要登入就能開啟。

先分清楚這個例子裡每個設定在哪裡、負責什麼,後面才看得懂 AI 為什麼會走不同的路。

項目在哪裡設定在這個例子的作用
網站連線工具庫 → 新增連線 → 網站「官網部落格(示範)」:探索 oakmega.com 的頁面,只開放部落格列表、最新三篇文章與媒體中心
知識庫文件知識庫 → 資料夾 → 新增文件 → 匯入網站「示範:官網穩定內容」資料夾,存一份整理過的「關於我們」
Skill AgentAI 代理的知識與工具分頁「官網消息助理(示範)」:資料源掛資料夾、可用動作掛五個網頁,允許自由連外保持關閉
對話對話問最新文章、文章內容、公司團隊,查看工具呼叫紀錄與參考

網站連線和知識庫匯入,差在哪裡 ​

兩種做法都讓 AI 讀得到網頁,差別在「內容存在哪裡」。下表依前後端程式碼與這次實測整理,比較兩條路在更新、速度與維護上的差異。

比較項目工具庫的網站連線知識庫的匯入網站
存不存副本不存正文。每個開放的頁面是一個網頁動作,AI 呼叫時才去抓那個網址存。按儲存時把內容欄位的文字存成文件,切塊並學習
更新時效原網頁改了,下一次抓取就讀到新內容;同一頁抓過後可能沿用 15 分鐘內的快取原網頁改了,副本不會跟著變。編輯頁顯示的是已存文字,不會重新抓原網站
查詢速度沒命中快取時要等原網站回應並轉成文字,速度和可用性受對方網站影響查的是已學習的切塊,不必等原網站
適合的內容列表頁、公告、最新消息這類常更新的頁面公司簡介、服務說明這類不常變、值得先整理正文的頁面
什麼時候要重做網站新增了網址時要重新按探索網頁、開啟新頁面並儲存,再回 agent 加入動作;只是既有頁面內容更新則不用原網頁內容更新時,要自己編輯文件內容,或重新匯入一份
對話裡怎麼佐證回覆上方出現呼叫的網頁名稱;網頁動作不會產生參考清單回覆上方出現「語意搜尋知識庫」紀錄,下方參考列出文件標題

重點在最後兩列:網站連線讓「內容」保持最新,但「有哪些頁面可抓」是探索當下決定的;知識庫則是內容和頁面都停在你匯入的那一刻。

建立網站連線並探索頁面 ​

  1. 在工具庫按新增連線,選網站。
  2. 連線名稱填「官網部落格(示範)」,描述寫清楚用途,例如「OakMega 官網的部落格與媒體中心。問到最新文章、近期公告或最近發布的消息時,即時抓這些頁面回答。」連線名稱會出現在每個網頁動作給 AI 的說明裡,取一個看得出用途的名字。
  3. 在網站設定填站台網址 https://oakmega.com/blog,探索範圍保留整個網域。
  4. 追蹤層數改成 1,頁面上限改成 150,排除路徑填 /category。
  5. 按測試連線確認首頁讀得到,再切到左側的網頁,按探索網頁。

下面的動畫示範在網站設定依序填入站台網址、追蹤層數、頁面上限與排除路徑。

為什麼這樣設:

  • 追蹤層數 1:部落格列表頁本身就連到每一篇文章,往外點一層就涵蓋所有文章頁。層數越多,探索越久、頁數也越容易暴增。
  • 頁面上限 150:這次探索到 146 頁,其中 blog 一堆有 117 頁。上限設太小,排在後面的頁面會被截掉。
  • 整個網域而不是限這個路徑底下:本例還想開放 /newsroom(媒體中心),它不在 /blog 底下。只要部落格的話,選限這個路徑底下更精準。
  • 排除路徑 /category:分類頁和列表頁內容重複,而且這次實測時頁面標題全都是「OakMega」,看不出差別,所以先排除。欄位裡淡色的 /tag、/search 只是提示文字,不是預設值;沒填就不會排除任何路徑。

探索會依設定實際去爬網站,頁數多時要等一段時間。後端每次探索最多跑 45 秒,時間到就回傳目前已找到的頁面,所以大型網站一次可能列不完整。探索出來的頁面預設全部關閉,要自己開啟。

依路徑分堆,只開放公告相關頁面 ​

探索結果依網址路徑的第一段分堆,例如 about-us、blog、newsroom 各一堆,網站首頁歸在首頁層。每一堆前面的勾選框可以整堆開關,上方的搜尋框可依頁面名稱或網址篩選。

  1. 在網頁的搜尋框輸入關鍵字縮小範圍,例如 blog 或 ceo-insights。
  2. 開啟部落格列表頁 https://oakmega.com/blog,以及最新的三篇文章頁。
  3. 搜尋 newsroom,開啟媒體中心頁。
  4. 確認右上角顯示已選 5 / 146 頁,按儲存。

下圖是儲存後重新打開連線的網頁分頁:右上角是已選 5 / 146 頁,blog 這一堆的勾選框是半選狀態,表示只開了其中幾頁;列表頁的開關是紫色。

網站連線的網頁分頁,探索結果依網址路徑分堆,部落格列表頁已開啟

下面的動畫示範在搜尋框輸入 ceo-insights,清單只剩網址或名稱含這串字的頁面,可以看到最新兩篇 CEO Insights 已開啟、較舊的維持關閉。

為什麼一定要開列表頁:每個網頁動作的網址在探索當下就固定了,AI 不能自己改去抓別的網址。之後網站新增文章時,新文章頁不會自動出現在清單裡;但 /blog 這一頁每次都是即時抓的,新文章的標題和日期會出現在抓回來的內容中。所以「最近發了什麼」靠列表頁就答得出來,要讀新文章的全文才需要重新探索。

為什麼不整堆全開:117 頁全開,等於讓 AI 從上百個工具裡挑,容易選錯;而且每個網頁動作給 AI 判斷的只有連線名稱、頁面名稱和網址。只開會被問到的那幾類就好。

把穩定內容匯入知識庫 ​

公司簡介這種不常變的內容,存一份整理過的副本更適合:不必每次等原網站,還能先刪掉導覽列和表單等雜訊。

  1. 在知識庫按新增資料夾,名稱填「示範:官網穩定內容」。
  2. 進入資料夾,按新增文件,選匯入網站。
  3. 網址填 https://oakmega.com/about-us,按匯入。
  4. 檢查文件標題、參考連結與內容。抓回來的內容包含整排產品選單、聯絡表單欄位與頁尾,把它們刪掉,只留使命、成果數字與團隊分工。
  5. 段落長度、重疊長度保留 500/100,按儲存。

下圖是整理後、儲存前的畫面:參考連結是原網頁網址,之後 AI 引用這份文件時,參考會連到這裡;內容只剩整理過的正文。

匯入網站的編輯畫面,文件標題、參考連結與整理過的內容

儲存後回到資料夾,等文件狀態變成可檢索再讓 agent 查詢。下圖顯示這份文件已可檢索,切成 3 塊。

知識庫資料夾內的匯入文件,狀態為可檢索,切塊數 3

建立 Skill Agent,同時掛上兩種來源 ​

  1. 在AI 代理按新增代理,選 Skill Agent,AI Agent 名稱填「官網消息助理(示範)」。
  2. 在系統提示詞寫清楚分工:問最新、最近的文章或消息時,先抓部落格列表頁,以抓到的日期與標題為準,需要內文再抓文章頁;問公司簡介、團隊分工時查知識庫;回答附上日期與網址;抓不到或查不到時直接說明,不要用推測補上。
  3. 選擇AI 引擎,切到知識與工具。
  4. 按新增資料源,類型選資料夾,選「示範:官網穩定內容」,按視窗裡的新增資料源。
  5. 在可用動作按加入動作,在「官網部落格(示範)」那組按全選,再按視窗裡的加入動作。
  6. 確認允許自由連外保持關閉(新建 Skill Agent 時預設就是關閉),按右上角的儲存。

下面的動畫示範打開加入動作視窗,對「官網部落格(示範)」按全選後加入,五個網頁出現在可用動作列表。

下圖是儲存後的知識與工具:資料源是「示範:官網穩定內容」資料夾,可用動作是五個來自「官網部落格(示範)」的網頁,最下方的允許自由連外是關閉的。

官網消息助理的知識與工具分頁,資料夾資料源、五個網頁動作與已關閉的允許自由連外

為什麼要保持關閉允許自由連外:新建的 Skill Agent 預設就是關閉;如果打開,AI 可以自行決定抓任意網頁,不受上面的工具列表限制。那樣它可能自己去抓官網,看起來也能答,但你在網站連線開關哪些頁面就失去意義,對話裡也看不出它到底讀了哪一頁。保持關閉,AI 就只能用你設定好的網頁動作和資料源。沿用既有 agent 時,記得檢查這個開關。

在對話中確認 AI 用了哪一邊 ​

  1. 打開對話,按新增對話,選「官網消息助理(示範)」。
  2. 問:「OakMega 部落格最近發布的三篇文章是什麼?請列出日期與網址。」
  3. 在同一段對話接著問:「最新那一篇在講什麼?請用三點摘要。」
  4. 再問:「OakMega 有哪些團隊?各自負責什麼?」
  5. 每題都看回覆上方的綠色勾選紀錄,以及回覆下方有沒有參考。

第一題的回覆上方只有一筆紀錄,名稱是部落格列表頁的頁面標題,表示 AI 抓了 /blog 這一頁,再從裡面整理出三篇文章的日期與連結。下圖是 2026 年 10 月 4 日的結果,日期和標題與當天官網列表一致。

對話中問最新三篇文章,回覆上方顯示抓取部落格列表頁的紀錄

第二題的紀錄換成最新那篇文章的頁面標題,表示 AI 這次改抓文章頁本身,摘要內容來自全文,最後附上原文連結與日期。

對話中問最新文章內容,回覆上方顯示抓取該文章頁的紀錄

第三題的紀錄是「語意搜尋知識庫」,回覆下方的參考列出「關於我們|OakMega Social CRM」。這題沒有去抓網站,而是查知識庫裡存的副本。

對話中問公司團隊,回覆上方顯示語意搜尋知識庫,下方參考列出關於我們文件

三題在 2026 年 10 月 4 日的實測結果整理如下:

問題實測時 AI 使用的來源要核對的界線
最近發布的三篇文章?網頁動作:部落格列表頁列表頁沒列出的文章 AI 就不知道;日期以抓取當下的列表為準
最新那一篇在講什麼?網頁動作:該篇文章頁只有已開啟、已加入 agent 的文章頁才抓得到全文
有哪些團隊、各自負責什麼?語意搜尋知識庫,參考為「關於我們」回答來自匯入當時整理的副本;官網改了不會自動反映

運作原理:AI 怎麼判斷走哪一邊 ​

每個網頁動作在 AI 眼中是一個工具:工具名稱取自網址路徑,工具說明由連線名稱、頁面名稱和網址組成,例如「[官網部落格(示範)] OakMega Blog|…:https://oakmega.com/blog」。知識庫資料夾則是另一個查詢工具。網頁動作本身沒有可寫的說明,AI 只能從這幾項和系統提示詞判斷該呼叫哪個,所以系統提示詞裡「最新消息抓列表頁、公司介紹查知識庫」這種分工寫得越明確,越不容易走錯;連線名稱取得清楚也有幫助。

探索是一次性快照,抓取才是即時的。 這兩件事要分開看:

情況會怎樣要做什麼
已開啟的頁面內容更新了下一次抓取就讀到新內容(可能沿用 15 分鐘內的快取)不用做任何事
網站新增了一篇文章(新網址)列表頁抓得到它的標題與日期,但清單裡沒有這篇的網頁動作回連線按探索網頁,開啟新頁面並儲存,再到 agent 的加入動作加進去並儲存
重新探索時,舊頁面已經找不到清單會移除它,按儲存後該頁面動作才真正刪除確認提示裡的網址是否真的下架
重新探索時,頁面仍在沿用原本的開關狀態,頁面名稱換成這次抓到的標題(按儲存後生效);agent 上已加入的動作仍在,名稱跟著更新不用做任何事
重新探索找到新頁面新頁面預設關閉只開需要的頁面

最容易漏的是最後一步:連線裡開啟新頁面還不夠,agent 綁的是一個個動作,新頁面要再到 agent 的加入動作加進去並儲存,AI 才叫得到它。

常見問題 ​

找到 146 個頁面 ​

這是按探索網頁成功後的提示,數字是這次探索到的頁面數。這時還沒有存檔,而且新找到的頁面預設全部關閉:開啟需要的頁面後按儲存,才會生效。

底下列的是「https://oakmega.com/blog」探索回來的結果。網址已經改過,重新探索才會換成新的。 ​

改了站台網址但還沒重新探索時會出現這段提醒,引號裡是上次探索用的網址。底下的清單仍是舊站台的頁面,按探索網頁才會換成新網址的結果。

遠端已無這些工具,已從清單移除,儲存後生效: ​

重新探索時,上次清單裡的某些網址這次沒找到,冒號後面會列出這些網址。按儲存後它們才會真正刪除;如果頁面其實還在,可能是被頁面上限截掉、超過探索時間,或網站暫時沒有回應,可以調整設定後再探索一次,確認無誤再儲存。

AI 回答的最新文章不是今天官網上的 ​

先看回覆上方有沒有網頁動作的紀錄。沒有紀錄,代表這次沒有去抓網站:確認系統提示詞要求先抓列表頁、列表頁已開啟並加入 agent。有紀錄卻還是舊的,可能是 15 分鐘內的快取,稍後再問一次。如果問的是某篇新文章的內文,記得那篇要重新探索並加入 agent 才抓得到。

延伸閱讀 ​