13 個字就能操控你的 AI 深度研究報告
2026-08-04什麼是深度研究污染?
深度研究污染是指有人在 AI 研究代理慣常抓取的公開用戶生成頁面上加入一段文字,使代理最終產出的報告重複攻擊者的說法。康奈爾科技學院(Cornell Tech)的研究人員把這種手法命名為 WARP,即網頁代理檢索污染。整個過程不需要接觸 AI 系統本身。
關鍵在於攻擊者不需要什麼。不需要模型權限,不需要 API key,不需要知道你的具體提問字句,也不需要新建網站或購買網域。
他只需要在一個本來已經有排名、而且代理本來已經會抓取的頁面上補一段短文字。一則 Reddit 留言就足夠。
這與你平時被訓練去防範的失敗模式並不相同。幻覺引用指向一條根本不存在的網址;被污染的引用卻指向一條真實網址,落在真實的高權重論壇上,串連著一整條真人討論。你點進去,一切看起來都正常。
13 個字如何操控一個 AI 研究代理?
研究人員先偵查哪些用戶生成頁面會被代理穩定抓取,然後在其中一頁補上大約 13 個字的指定文字,再重跑一組相關查詢。代理產出的報告開始偏向那段植入內容,條件提及率介乎 38% 至 51%。
以下是這篇研究的核心事實,你可以自行核對,不必只相信本文的轉述。
研究事實摘錄
--- 論文:Deep-Research Agents Can Be Poisoned via User-Generated Content,arXiv 2605.24245,2026 年 5 月 22 日發布
--- 作者:Tingwei Zhang、Harold Triedman、Vitaly Shmatikov,Cornell Tech
--- 攻擊名稱:WARP(Web Agent Retrieval Poisoning)
--- 受測開源代理:STORM、Co-STORM、OmniThink
--- 植入內容規模:在一個既有用戶生成頁面上補約 13 個字
--- 報告效果:在一組相關查詢中,條件提及率 38% 至 51%
--- 攻擊者所需條件:能在代理本來就會抓取的頁面留言,僅此而已
請留意「一組相關查詢」這個說法。攻擊者不需要猜中你的提問方式。他污染的是整個主題,而任何合理措辭的同類問題,最終都會經過同樣那幾頁。
2026 年 6 月,Search Engine Land 與 404 Media 分別作了獨立報導,兩者都把實際風險定義為商業層面而非學術層面:把買家推向某個產品,或者推離某個競爭對手。
為什麼「核對引用來源」已經不夠?
核對引用能抓出偽造來源,卻抓不出一個真實但內容本身就是為了被檢索而寫的來源。如果你點開連結,看見一條活生生的討論帖便打勾放行,你只證明了那一頁存在,並沒有證明那個說法得到任何可信者支持。
大部分從業者的核查習慣只有兩種,而兩種在這裡都會失效。
第一種是在二十條引用中抽查兩三條。污染是機率性攻擊。如果植入說法會在大約一半的相關報告中出現,你抽中那唯一關鍵段落的機會其實很低。
第二種是相信代理自身的語氣。深度研究輸出讀起來像顧問公司的簡報。有條理的結構只是排版選擇,不是證據;被污染的說法會繼承與有據可查的說法完全相同的權威語調。
這件事在 2026 年比一年前更重要,原因很實際。深度研究模式現在已經是許多工作的預設答案介面,不再是嘗鮮功能。報告會被貼進簡報、引用在客戶郵件裡、用來支撐預算申請,而下游看到的人往往從未看過涉及了哪些來源。
當一個說法被重新排版成一張投影片,它就不再像檢索結果,而像你團隊親口斷言的事實。那一刻,一句植入的句子開始變得昂貴。
另外還有更廣的可靠性背景:一項針對約 250 萬篇論文、共 1.11 億條參考文獻的審計指出,僅 2025 年的論文中就有數萬條屬於幻覺、實際不存在的引用。偽造與污染是兩個不同的問題,一套核查流程必須同時攔住兩者。
如何在 10 分鐘內核實一份深度研究報告?
先按後果排序,只針對真正承重的說法,並且核查來源的類型而非來源是否存在。四個步驟:標出會左右決策的說法、把每個引用分類為一手或用戶生成、在排除用戶生成內容的條件下重跑同一問題、比較兩次輸出中消失了哪些說法。
步驟一:標出會改變你決定的說法
一份二十頁報告通常只有三、四個說法真正改變你下一步的行動:一個價格、一個上限、一個具名供應商推薦、一個法規期限。把它們標出來,其餘暫時不管。
步驟二:把支撐這些說法的來源分類
分成兩桶。一手來源包括供應商文件、官方定價頁、監管申報、更新日誌、已發表論文。用戶生成來源包括 Reddit、Quora、論壇、留言區、社群維基、聚合式清單文章。
一個會左右決策的說法若只靠用戶生成來源支撐,那不算已核實。那是一則加了註腳的傳聞。
步驟三:排除用戶生成內容後重跑同一問題
這一步幾乎沒有人做,卻正是暴露污染的關鍵。要求它再做一次同樣的研究,但限定一手來源。兩次都存活的說法大致可信;只在無限制那次出現的說法,就是你該深挖的地方。
步驟四:所有商業數字回到供應商官方頁面
價格、使用上限、試用條款、功能是否可用,供應商的即時頁面是唯一算數的來源。花三十秒核對,永遠勝過讀一段語氣肯定的摘要。
用哪一條提示可以讓 AI 審核自己的報告?
把報告貼回模型,要求它為自己的證據分類,而不是為結論辯護。以下這條提示正是這樣設計的。它會產出一張你能在一分鐘內掃完的表格,並且明確禁止模型重新論證原本的答案。
立即試用這條提示
--- 你正在審核一份研究報告的檢索污染風險,不是改寫它。不要重述或維護報告的結論。
--- 以下是我生成的研究報告。針對每一個會改變商業決策的說法,輸出表格一列,欄位包括:說法、來源類型(官方文件/已發表研究/新聞/用戶生成)、來源網址、風險(高/中/低)。
--- 只要一個會左右決策的說法僅由論壇、Reddit、留言串、社群維基或聚合式清單文章支撐,風險一律標為高。
--- 表格之後另外列出:(1)所有你無法追溯到具體網址的說法;(2)所有我應該回供應商官方頁面確認的商業數字,例如價格、使用上限、試用條款。
--- 最後用一句話指出:若哪一個說法其實是被植入的,會造成最大損失。
--- 以下是報告:[貼上報告]
最後一項指令才是真正有用的部分。它強迫模型排序,而不是丟出一堵免責聲明,並且直接告訴你剩下五分鐘該花在哪裡。
如果你想理解為什麼這類約束能如此穩定地改變輸出品質,那正是我們在情境工程一文中拆解的同一套機制。
這套核查流程會在哪裡失效?
它會在四個可預期的地方失效。知道這四點,決定了你會長期沿用這套流程,還是一星期後就放棄。
模型不一定看得見自己的檢索軌跡。有些工具會列出所有抓取過的網址,有些只顯示經過整理的子集。如果一份二十頁報告的來源清單整齊得可疑,就把這次審核視為部分完成,而非全面完成。
排除用戶生成內容會犧牲真實訊號。論壇確實是了解一個工具在每天使用三個月之後表現如何的最佳來源。目的不是封殺它們,而是不讓它們默默獨自承擔一個決策。
自我審核缺乏對抗性。模型評改自己的產出,沒有動機去挖得夠深。用另一個模型來審核撰寫報告的那個模型,是一項小改動,卻能明顯提高攔截率。
攻擊面不只是 Reddit。任何可由用戶編輯、又有良好排名的頁面都算。社群維基、問答網站、評論區、GitHub 討論、高權重媒體下方的留言串,全部屬於同一類。
接下來 20 分鐘該測什麼?
找出你最近一份真正據以行動的深度研究報告,套用上面那條審核提示,數一數有多少個左右決策的說法只能追溯到用戶生成頁面。大部分從業者至少會找到一個。這個數字告訴你,你現有流程有多依賴信任。
然後做更不舒服的那個版本。請任何 AI 助手推薦你所在類別的供應商,看它倚重哪些來源。如果一條你從未見過的論壇討論在替你做決定,那條討論已經成為你競爭格局的一部分。
這些都不代表深度研究不值得用。它把一星期的桌面研究壓縮成二十分鐘,這筆交易依然非常划算。它只是說,你省下的二十分鐘不該全部用來慶祝。
懂AI的冷,更懂你的難 UD 同行28年,讓科技成為有溫度的陪伴。
本文由 UD AI 團隊審閱。
🔍 看清 AI 到底怎樣說你
如果一個陌生人的論壇留言就能左右 AI 的答案,那你更值得知道 AI 現在怎樣描述你自己的品牌與內容。UD 的 AEO Auditor 會檢查答案引擎如何讀取、引用與推薦你的頁面。當你準備把一套可信的研究流程建立起來,UD 團隊手把手帶你完成每一步,從來源政策、提示模板到最終覆核。