Skip to content

客人傳圖片給 SCRM AI:AI 看得懂什麼、有哪些限制

看完這篇,你可以判斷客人傳來的圖片 AI 看不看得到,並在上線前用後台試聊先測一次。

開始前 ​

  • 這個功能不用開關,SCRM AI(Channel agent)一律會把客人傳的圖片交給 AI 看。
  • 看不看得懂,取決於這顆 agent 用的 AI 引擎:OpenAI 與 Anthropic 的模型會真的看圖;不支援看圖的模型只會看到「(圖片)」這幾個字,見下方表格。AI 引擎的設定見AI 引擎。

在後台先試一次 ​

後台對話頁選 SCRM AI 試聊時,附上的圖片會走跟正式流量一樣的處理流程,所以可以先在這裡確認 AI 讀得出你預期的內容。

  1. 到側邊欄的對話,在請選擇 AI Agent選要測試的 SCRM AI。
  2. 按輸入框左下角的附加圖片選一張客人常傳的圖,例如預約單、商品照片;也可以直接拖曳或按 Ctrl+V 貼上。
  3. 輸入客人會問的話,按 Enter 送出。
  4. 對照原圖檢查 AI 的回答,數字、日期這類細節特別要核對。

下面的動畫示範在「示範:診所預約客服」附上一張虛構的預約提醒卡,輸入「這是我的預約卡,看診是哪一天幾點?當天要帶什麼?」後送出。

下圖是 AI 的回答:它從圖片讀出「2026 年 10 月 20 日(星期二)下午 2:30」,並提醒帶健保卡、提早 15 分鐘報到,都跟卡片上寫的一致(2026-10-06 實測,引擎是 OpenAI gpt-6-luna)。

後台試聊:客人附上示範診所預約提醒卡並提問,AI 回答看診日期時間與攜帶物品

後台試聊跟正式流量有兩個差別:試聊不會等客人把話講完(回覆節奏的等待不會模擬),一則訊息最多 4 張圖;正式流量則是一輪最多 3 張,見下一節。

AI 怎麼看客人傳的圖 ​

客人在 LINE 傳來圖片時,系統把它跟前後幾秒內傳的文字併成同一輪,一起交給 AI。

規則說明
一輪最多幾張3 張。客人連傳很多張時,只有前 3 張會給 AI 看
之前傳過的圖最近 2 張還會一起給 AI 看,讓它能回答「剛剛那張」;更早的只剩「(傳了一張圖片)」這幾個字
跟文字一起傳依服務時間與回覆節奏的等待設定,前後幾秒內的圖與文字會合成一題
誰會看圖回答問題的那一步會看圖;判斷要走哪個場景、要不要轉真人、表單要填哪個欄位時,只看得到「(傳了一張圖片)」
貼圖、語音、影片、檔案不會看內容,只會看到「(傳了一張貼圖)」「(傳了一段語音)」這類文字

不同 AI 引擎看圖的能力不一樣:

AI 引擎看得到圖嗎限制
OpenAI看得到由 OpenAI 直接讀取圖片網址
Anthropic看得到只支援 JPG、PNG、GIF、WebP,單張 4.5 MB 以內;讀不到時 AI 會看到「(圖片無法載入)」
其他不支援看圖的模型看不到只看到「(圖片)」,AI 會照文字回答

各通訊平台目前的支援情況:

通訊平台客人傳的圖
SCRM(LINE、Messenger 等)AI 會看圖
通用 WebhookAI 會看圖;messages 裡放 {"type": "image", "url": "..."}
Telegram、Google Chat目前只會當成「(傳了一張圖片)」文字

看圖的費用算在一般對話裡:正式流量算在 Channel 正式流量,後台試聊算在後台試聊(Channel),不會另外扣「圖片轉文字」,見AI 用量。

常見問題 ​

AI 回答「看不到圖片」或答非所問 ​

先確認 agent 的 AI 引擎支援看圖。是 Anthropic 的話,再確認圖片是 JPG、PNG、GIF 或 WebP,而且不超過 4.5 MB。

客人傳圖後就被轉真人,或進錯場景 ​

判斷場景與轉真人時,AI 只看得到「(傳了一張圖片)」,看不到圖片內容。客人只傳圖、沒有文字時,常會落到預設場景。可以把預設場景設成引導客人用一句話說明需求,客人補上文字後,下一輪就會依文字分到正確的場景,見場景說明要怎麼寫。

系統日誌看不到客人傳的圖 ​

系統日誌只記文字,圖片會顯示成「(傳了一張圖片)」;要看原圖,請到 SCRM 的聊天室查看。

延伸閱讀 ​