CompactRAG:把知識庫預先拆成「問答對」,讓複雜問答又快又平又準
2026-08-28![]()
你間公司的 AI 問答系統,是否又慢、又燒錢、又常常答不中要點?尤其是那些要串連幾份文件才答得到的複雜問題,AI 往往要來回檢索好多次,既貴又慢。2026 年出現一個新方法叫 CompactRAG,換了一個思路:把知識庫預先離線拆成一堆「問答對」,問題一來就直接對上答案。本文用生意角度拆解它是什麼、為何又快又平又準,以及導入時要注意什麼。
為什麼傳統 RAG 又慢又貴?
傳統 RAG(檢索增強生成)在你每次提問時,才即場去知識庫檢索相關段落、逐段閱讀、再推理作答。遇到「多跳」問題,也就是要串連多份文件、經過多步推理才答得到的問題,它往往要來回檢索與推理很多次。每一次都消耗 token 與時間,於是變得又慢又貴,答案也容易在中途出錯。
什麼是 CompactRAG?
CompactRAG 是 2026 年提出的一種檢索方法,核心是把「即場才拆解問題」改為「預先拆解知識」。它在離線階段,先把整個語料庫轉換成大量「原子問答對」,也就是一問一答的最小知識單位。當使用者提問時,系統不再從頭慢慢檢索推理,而是直接對上已經整理好的答案,大幅減少線上運算。
核心思路:離線拆成「原子問答對」
所謂原子問答對,是把每一小塊知識預先寫成一條清晰的「問題加答案」。這個拆解與整理的重活,全部在離線階段做好,不佔用使用者等待的時間。等於你先把功課做齊,把一份份文件消化成即用的答案卡;當問題來到,AI 只需把問題對上正確的卡,而不必臨場重新消化整個知識庫。
為什麼多跳問題只需約兩次呼叫?
因為複雜的推理已經預先濃縮進問答對裡,CompactRAG 能以大約兩次大型語言模型呼叫,解決多跳問題,而且不論需要多少步推理。傳統做法每多一跳就要多幾次來回;CompactRAG 把步數與呼叫次數脫鉤,這正是它在成本與速度上的關鍵優勢,對高流量的問答場景尤其明顯。
三大好處:快、平、準
CompactRAG 的好處相當實在。快:重活在離線做好,線上即問即答。平:呼叫次數大幅減少,token 成本下降。準:預先整理減少了臨場推理,答案更穩定,也較少在中途「迷路」。對需要即時回應大量查詢的企業而言,這三點直接關係到使用體驗與營運成本。
與傳統 RAG 的分別
兩者最大的分別在於「何時做重活」。傳統 RAG 把檢索與推理留到使用者提問的那一刻;CompactRAG 則把大部分工作提前到離線階段完成。前者靈活但每次都貴、都慢;後者需要先投入離線整理,但之後每次查詢都又快又平。選擇哪一種,取決於你的查詢量與對速度、成本的要求。
適用場景
CompactRAG 最適合「要準、要快、又高流量」的問答場景:客服知識庫、內部文件問答、產品 FAQ、政策與流程查詢。這些場景的問題種類相對可預期,知識庫也相對穩定,正好發揮「預先拆解、即問即答」的優勢。相反,若知識每日大幅變動、問題極度發散,就要衡量離線整理的更新成本。
導入注意事項
導入前有兩點要留意。其一,知識更新:問答對是預先整理的,當來源文件更新,需要有機制重新生成受影響的問答對,否則會答舊資料。其二,離線成本:把整個知識庫轉成問答對本身需要運算與時間,屬一次性或定期投入,適合查詢量足夠大、值得攤分成本的情況。先評估更新頻率與查詢量,再決定投入規模。
常見錯誤
最常見的三個錯誤是:一,把 CompactRAG 當成萬能,連極度發散或需要即時最新資料的問題都硬套,結果答舊料;二,問答對拆得太粗,一條塞太多資訊,失去「原子」的精準;三,忽略更新機制,令知識庫與問答對脫節。避開這三點,CompactRAG 就能長期又快又準地服務你的查詢。想要 CompactRAG 的落地做法與檢查清單?歡迎前往 ai.ud.hk 了解更多 UD 的 AI 員工方案,看看如何把它落地到你的問答系統。
懂AI,更懂你|UD相伴,AI不冷