購物車

什麼是電腦操作代理?不靠 API 的企業自動化

2026-08-10

什麼是電腦操作代理?不靠 API 的企業自動化

一家香港物流集團在一月批出自動化項目預算。到六月,項目停滯。模型運作正常,問題出在別處:團隊每日使用的貨運系統寫於 2004 年,沒有 API,供應商開價六位數、需時七個月才能加建接口。AI 根本無處可接。

AI 能夠理解的範圍,與 AI 能夠實際操作的範圍之間存在落差。這道落差,是香港企業自動化項目最常見的死因。而在 2026 年,有一類工具正式進入生產階段,針對的正是這個問題。


什麼是電腦操作代理?

電腦操作代理(computer-use agent)是一種以人類方式操作軟件的 AI 系統:它觀看螢幕、判斷點擊位置、輸入文字、捲動頁面,再讀取結果。它不需要 API,也不需要整合項目。只要一個人能夠透過瀏覽器或桌面應用完成的流程,電腦操作代理就可以嘗試。

商業上真正關鍵的分別在於介面。其他所有企業 AI 整合方式,都要求目標系統開放結構化的接入點。電腦操作代理則直接把使用者介面本身當作整合層。

這一項特性,改變了哪些系統屬於可觸及範圍。終端機模擬器、以 Citrix 發佈的應用程式、政府電子申報平台、老舊 ERP 前端,以及 API 覆蓋率極低的 SaaS 產品,全部無需供應商參與即可成為候選。


為什麼電腦操作代理在 2026 年成為企業議題?

因為它不再是預覽版本。微軟於 2026 年 5 月 13 日將 Copilot Studio 的電腦操作代理正式推出(general availability),覆蓋所有商業版 Power Platform 地區。正式推出,意味著討論從研究展示轉移到採購清單。

正式版本內置了企業買家在第一次會議就會追問的控制項。根據微軟 Copilot Studio 的公告,功能包括 Azure Key Vault 憑證儲存、Microsoft Purview 審計日誌,以及可配置的人手覆核環節,推理引擎則提供 OpenAI 的電腦操作模型與 Claude Sonnet 4.5。

2026 年內,其他供應商亦沿相近路線推進。對香港的營運主管而言,重點不在於哪一家勝出,而在於一項過去被歸類為實驗性質的能力,如今已附帶支援合約、審計軌跡與按步計價的價目。


電腦操作代理實際如何運作?

它運行一個感知循環。代理擷取當前畫面,具視覺能力的模型解讀畫面內容,代理選定一個動作並執行,然後再次擷取畫面以驗證結果。循環持續,直至任務完成或被防護機制中止。

這解釋了為何此技術按步收費而非按座位收費。每一次循環都是一個可計價的推理單位;一項需要人手點擊四十次的任務,成本大約是一次點擊任務的四十倍。

這同時解釋了它的可靠性特徵。由於代理依據所見畫面進行推理,而非依循錄製的座標,按鈕移位或表單改版通常不會造成中斷。相反,一個本身含糊的畫面,會導致錯誤的判斷,而不是一次乾淨的報錯。

對營運總監而言,實際後果是:故障形態不是會觸發告警的系統崩潰,而是一個看似合理、卻執行在錯誤位置的動作。因此,驗證機制的設計,比選用哪個模型更重要。


電腦操作代理與 RPA 有何分別?

傳統機械人流程自動化(RPA)依循錄製腳本,綁定特定選擇器或螢幕座標。電腦操作代理則在執行當下解讀畫面,再決定下一步。介面一改,RPA 即斷;代理能夠適應,但可能推理錯誤。

兩者的經濟結構因此不同。RPA 單次執行成本低,維護成本高。針對長期營運 RPA 項目的業界分析普遍指出,持續成本的大部分來自介面改動,而非新增業務邏輯。

電腦操作代理剛好相反。由於每一步都消耗模型推理,單次執行成本明顯較高;但維護成本下降,因為沒有選擇器庫需要在供應商每次改版後修補。

正確的企業結論不是取代。對於高流量、穩定、結構化的流程,RPA 仍然更便宜、更可預測。代理的價值在於流量較低、例外情況多、變動頻繁的工作,而這恰恰是香港大多數後勤部門從未自動化過的一類。


應該先把哪些流程交給電腦操作代理?

套用四項測試。流程必須受限於螢幕(沒有可行的 API)、可驗證(機器能確認結果)、可逆轉(出錯可以還原),以及有邊界(單次執行有明確終點)。四項之中任何一項不符,就不是好的首選。

受限於螢幕這項測試,保護的是商業理據。如果已有乾淨的 API,一般整合會更便宜、更可靠;此時選用代理,等於為零回報付出溢價。

可驗證這項測試,是最多企業略過的一項。將供應商發票輸入舊有會計前端屬於可驗證,因為入帳記錄可以讀回並比對。一封需要判斷力的客戶電郵,則不屬於此類。

可逆轉與有邊界兩項,界定的是波及範圍。把資料重新輸入待審核佇列是可逆轉的;提交法定申報則不是,應該置於人手審批關卡之後,而非交由代理自主處理。

按此評分,香港最強的首批候選流程通常是同樣四類:在老舊營運系統與現代財務平台之間重複輸入資料、從銀行或船公司平台擷取結單、在政府網站查核牌照與許可狀態,以及在兩個從未整合的系統之間進行對帳。


電腦操作代理的運行成本是多少?

定價按用量計算,單位是步數而非座位。在 Copilot Studio,電腦操作按代理動作費率計費;針對其信用額模式的公開分析顯示,在標準預付價目下,單一步驟成本約為 0.04 美元,而預付信用額承諾可壓低實際費率。

這個數字必須配合步數才有意義。一次四十步的對帳作業,推理成本約為 1.6 美元。每日執行兩次、全年計算,屬於四位數港元級別的年度支出項。

令財務團隊意外的成本,不是成功的執行,而是重試。代理在第三十五步失敗後重新開始,會再次消耗前面三十五步;因此,不可靠的流程,成本是名義價格的數倍。

編列預算時應據此調整:計算每次成功完成的成本,而非每步成本,並在承諾用量之前,要求任何試點提供實測成功率。


企業部署電腦操作代理時,通常錯在哪裡?

五種失敗模式解釋了大部分停滯項目:選中一個沒有機器可核對結果的流程;沿用共用的員工登入帳號;略過影子模式期;量度活動量而非完成率;以及把所有代理當成需要完全相同的管治強度。

憑證上的錯誤,破壞力最大,也最常見。把員工帳號交給代理,會摧毀責任歸屬、破壞職務分工,並令日後任何審計都無法回答。代理需要自己的身分,並僅限於任務所需的最少畫面範圍。

管治上的錯誤則較為隱蔽。Gartner 於 2026 年 5 月警告,對所有 AI 代理套用劃一管治,本身就會導致企業代理失敗;失敗集中出現於未能區分「代理能夠採取的行動」與「代理獲授予的存取範圍」的組織。

代價已在組合層面被量化。Gartner 於 2026 年 2 月的分析預測,超過 40% 的代理式 AI 項目將於 2027 年底前被取消,原因歸於落地執行、管治與未經證實的商業價值,而非模型能力不足。


投入生產前,電腦操作代理需要哪些控制?

六項,而且在香港受規管環境下沒有商量餘地:專屬的非人類身分、範圍受限的存取權、完整的動作級審計日誌、不可逆步驟的人手審批關卡、明確的中止條件,以及一位為輸出負責的具名負責人。

--- 專屬身分。代理以自身身分驗證,絕不冒用員工帳號,令每一個動作都可追溯。

--- 範圍受限的存取權。權限只覆蓋任務所需畫面,將誤讀畫面造成的損害封頂。

--- 動作級審計日誌。每一次點擊、輸入與讀取的資料欄位都被記錄,因為私隱專員查詢或內部審計要求提交的,正是這條軌跡。

--- 人手審批關卡。付款、提交與刪除等步驟一律暫停等待人手確認,無論代理過往表現多好。

--- 中止條件。代理在重試達到設定次數後,或遇到任何無法辨識的畫面時停止,而非自行發揮。

--- 具名負責人。由個人而非委員會核准代理範圍,並每週檢視其例外日誌。

香港還有一項特定考量。當受限於螢幕的流程涉及個人資料時,代理是代你讀取及處理該等資料,私隱專員公署就工作場所使用 AI 的指引,對它的適用方式與對一名員工完全相同。設計審計軌跡時,應假設有一天你必須把它交出來。


未來 30 天應該如何開始?

執行一次為期四週的結構化評估,而非一次採購程序。第一週,盤點受限於螢幕的流程,並按四項測試評分。第二週,選定其中一項並建立量度機制。第三及第四週,以影子模式運行代理並收集數據。

影子模式是區分存活項目與第六個月被取消項目的關鍵紀律。代理在沒有寫入權限的情況下執行任務,同時由一名同事完成相同工作,兩份輸出每日比對。

唯一重要的指標,是無需人手修正的完成率。一個能夠乾淨完成 70% 執行的代理,是實質節省。一個完成 95% 步驟、但每次執行都需要覆核的代理,只是把工作搬了位置,並沒有把它移除。

在試點開始之前,就把通過或不通過的門檻寫下來,並讓財務負責人在場。根據 Deloitte 於 2026 年初發表的企業生成式 AI 現狀研究,供應商提供的代理約需 38 天達致首次價值,自建方案則約需 94 天;因此四週評估屬於務實安排,而非樂觀假設。

相關決策框架,可參考 UD 的文章:企業如何量度 AI 是否真正見效AI 代理的非人類身分,以及企業 AI 自建與採購的抉擇


策略要點

電腦操作代理不會令你的舊有系統變得現代化。它令這些系統變得可觸及,而對大多數香港企業而言,這正是十年來真正卡住自動化的那道限制。

2026 年能夠從中取得價值的組織,不是預算最大的一批,而是選對可驗證、可逆轉流程、為每個代理配置獨立身分、並量度完成率而非活動量的一批。

這些工作並不耀眼,回報卻在其中。懂AI,更懂你 UD相伴,AI不冷。

由 UD 企業 AI 團隊審閱。


準備好找出你的第一個自動化切入點?

掌握框架是一回事,在自己的營運中找出真正通過四項測試的流程,是另一回事。UD 在香港企業系統內耕耘 28 年,手把手帶你完成每一步,由準備度評估、流程評分,到部署、控制設計與成效量度。