Skip to content

AI 模型、AI Chat、AI Agent 有什麼差異?

模型負責想,Chat 主要跟你對話,Agent 會拿工具幫你做事

上一篇提到,Pocketool 不是輸入一句 Prompt 就自己長出來的。

我也常說「這個交給 AI」,講起來很輕鬆,但真的開始做之後,才發現有很多細節要注意。有時 AI 只回我一段建議,有時它已經打開專案、改完檔案,順便跑了一輪測試。都叫 AI,做事方式卻差很多。

要看懂這個差異,先把三個很常混在一起的名詞拆開:AI 模型、AI Chat 和 AI Agent。

卡斯伯拿著平板,Guardian Agent 打開裝有網頁、檔案與終端機工具的工具箱

先看結果,不用急著背名詞

先不要管背後用了哪個模型,我們直接看同一句需求會得到什麼結果。

假設你說:「幫網站加一個聯絡表單。」

在以對話為主的 Chat 裡,AI 可能會告訴你要準備姓名、信箱和留言欄位,接著提供一段範例程式,再提醒你送出後要顯示成功訊息。它可以把做法講得很完整,但工作通常會停在對話裡。

接下來,你還是得自己找到專案、建立檔案、貼上程式、處理錯誤,再打開網頁確認表單能不能送出。如果你不知道那段程式該放在哪裡,可能第一步就會卡住。

ChatGPT 根據使用者要求,在聊天畫面中直接提供一段文字回答

Chat 很適合解釋、討論與提供做法,結果通常直接留在對話裡。

換成能操作專案的 Agent,事情會多走幾步。它可以先讀取專案,確認網站用了什麼技術、表單元件放在哪裡,以及專案原本怎麼處理按鈕和錯誤訊息。

確認完現況後,它才修改檔案、執行測試或建置,失敗就根據錯誤繼續修。最後交回來的不是一段等你複製的程式,而是修改過的檔案、執行結果,以及可以直接打開檢查的畫面。

Codex App 讀取專案檔案、修改程式,並在同一個畫面呈現變更紀錄與成果預覽

Agent 可以在專案裡採取行動,但最後的修改內容仍然要由人檢查。

所以這一段不是在比較誰回答得比較漂亮,而是在看 AI 最後把工作做到哪裡:Chat 多半協助你想清楚與取得做法;Agent 則可以繼續進入環境,把做法實際執行出來。

三個名詞,各自負責什麼?

這篇為了方便理解,把以對話為主的使用方式稱為 AI Chat;把能朝目標執行多個步驟、使用工具的工作方式稱為 AI Agent

它們不是三套互相競爭的產品。AI 模型是底層能力,Chat 和 Agent 則是你使用這份能力的不同方式。

名詞你可以先這樣記主要工作
AI 模型負責想理解內容、推理與產生回答
AI Chat主要跟你對話回答問題、討論、整理與提供建議
AI Agent拿工具幫你做事朝目標執行多個步驟,再把結果交回來

AI 模型提供理解與推理能力,AI Chat 以對話回答問題,AI Agent 使用工具完成任務

AI 模型負責理解你說的話、整理資訊、推理並產生下一段內容。不過模型本身不知道你的專案放在哪裡,也不能自己打開電腦裡的檔案。

AI Chat 把模型放進對話介面。你問一個問題,它根據目前看到的內容回答;你覺得不清楚,就再補充資訊繼續問。這很適合學習觀念、討論方向、整理內容,或在真正動手以前先把需求說清楚。

AI Agent 則在模型之外再接上工具與工作環境。它不只產生回答,還能根據任務決定下一步:先讀哪個檔案、要修改什麼、該執行哪個測試,以及看到錯誤後要怎麼繼續。

例如同樣遇到一個網站錯誤,Chat 可以幫你解讀錯誤訊息;Agent 則能進一步找到發生錯誤的檔案、修改程式,再執行一次測試。模型可能相同,差別在於它能不能取得現場資訊並採取行動。

這條界線不是畫得死死的。現在的 Chat 也可能搜尋網頁、讀取附件或使用工具;重點不是按鈕叫什麼,而是這次工作最後停在「回答你」,還是繼續把任務做完。

同一個模型,為什麼有時特別會做事?

這是最容易搞混的地方:明明選的是同一個模型,為什麼放在不同工具裡,有時只能回答問題,有時卻像是多了一雙手?

因為模型只負責判斷下一步,真正能不能執行,還要看外面的應用程式替它準備了什麼。常見的差異有四個:

  • 資料:它能不能看到你的檔案、需求和專案規則。
  • 工具:它能不能修改檔案、執行指令或打開瀏覽器。
  • 權限:哪些事情可以直接做,哪些事情要先問你。
  • 流程:做完一步後,能不能看到結果再繼續調整。

AI 模型接上資料、工具、權限與執行流程後,成為能讀取、修改、測試並回報結果的 Agent

如果模型只看得到你貼上的一段錯誤訊息,它只能根據這段文字猜問題可能在哪裡。即使回答聽起來很有道理,也可能和專案實際使用的套件、檔案結構或設定完全不同。

如果應用程式同時把專案檔案、開發規則和測試工具提供給它,模型就能先確認現況,再決定要讀哪裡、改哪裡。修改後的測試結果又會回到模型,它才能知道剛才的方法有沒有成功。

所以同一個模型放在不同工具裡,表現可能完全不一樣。不是它突然變聰明,而是這次終於看得到現場、拿得到工具,也能根據執行結果繼續處理。

至於這些資料與工具是怎麼接進來的,我們會留到 Day 3 的 Harness 再拆開說。

我該用 Chat 還是 Agent?

不用看到 Agent 就覺得每個問題都該交給它。先看你現在需要的是「想清楚」,還是「直接動手」。

目前想做的事比較適合
問問題、學觀念、比較選項Chat
腦力激盪、整理需求、確認方向Chat
讀取專案、修改檔案、執行測試Agent
完成一個有明確成果的多步驟任務Agent

如果方向還很模糊,我通常先用 Chat 討論。比如「我想做一個報名工具」,可以先把使用者、需要的欄位和操作流程聊清楚;等到需求變成「請在這個專案加入報名表,送出後把資料存起來」,再交給 Agent 動手。

反過來說,如果需求只有一句「全部幫我做好」,即使 Agent 有能力改檔案,也可能很有效率地做出一套和你想像不同的東西。工具變強之後,方向說清楚反而更重要。

有些任務也會在兩種方式之間來回:先用 Chat 整理方向,交給 Agent 實作,再回頭根據畫面與測試結果討論下一步。重點不是從頭到尾只能選一個,而是知道目前這一步需要什麼。

OpenAI 官方文件目前也把 Chat 定位在問答、腦力激盪與比較選項;需要除錯、執行測試或實作功能時,則建議使用 Codex。[1]

這個系列會用哪一套工具?

後面的文章會以 ChatGPT Desktop 與 Codex 示範。不是因為所有人都必須選同一套,而是接下來會同時用到對話、圖片、檔案、瀏覽器和程式專案,用同一個操作環境比較容易一路跟著做。

前面遇到不懂的名詞,可以先透過對話問清楚;需要整理資料或製作內容時,可以把來源交給 AI 處理;真正開始做網站後,再讓 Codex 進入專案修改檔案與執行測試。不同階段需要的工作方式並不一樣。

Claude、Codex 該怎麼選,價格與方案又差多少,我還是會整理,但會另外放在專門的單元。這一篇先把模型、Chat 與 Agent 的關係弄清楚。

下一個問題是:模型本身又沒有手,Agent 到底怎麼讀檔案、跑終端機,還能接上其他服務?Day 3 就來看把這些能力接起來的 AI Harness。


  1. OpenAI Docs,Use ChatGPT↩︎

內容持續更新,歡迎透過社群回饋建議。