購物車

別再用提示技巧:改寫 AI 規格書

2026-09-03

別再用提示技巧:改寫 AI 規格書


什麼是 AI 規格書?為何提示技巧不再管用?

AI 規格書是一份你交給模型的書面工作簡報,而非一句聰明的提示語。它明確寫出目標、讀者對象、輸出格式、評分標準,以及模型不確定時應該怎樣處理。它是一份職位說明書,不是一句咒語。

它比技巧有效的原因並不浪漫:現時的推理模型在內部已經自動完成舊技巧試圖從外部強加的工作。

沃頓商學院生成式 AI 實驗室一直在直接測試這件事。他們的《Prompting Science Report 1》發現,流行的提示格式技巧所帶來的提升,一旦把整份題庫的結果匯總計算,就會消失。在個別題目上效果是真實的,放大到規模層面就只是雜訊。

該系列的共同作者 Ethan Mollick 在 2026 年 7 月講得更直接:提示技巧已經不再有太大價值,現在真正重要的技能,是清楚界定目標、輸出、評分標準與測試方法。那是管理工作,不是文字雕琢。

 

專家角色設定和「一步一步思考」真的有效嗎?

在現時的模型上,基本上沒有效。沃頓的《Prompting Science Report 4》以 GPQA Diamond 及 MMLU-Pro 測試六個模型,把專家角色設定與「不設角色」對照,結果找不到一致的準確度提升。錯配的角色設定有時甚至令表現變差。至於低知識水平的角色,例如要求模型以小朋友的身份回答,則穩定地降低準確度。

「一步一步思考」的情況也類似。在內建推理能力的模型上,它增加了延遲,卻沒有帶來相應的質量提升,因為模型本來就會推理。

角色設定過去偷偷做的事,其實是替你補上語境。「你是一位資深 B2B 文案」隱含了讀者對象、語氣、篇幅和一套行文慣例。當你把這些直接寫出來,你就拿到了同樣的好處,而不需要依賴模型自己猜。

所以實際做法不是刪掉「你是行銷專家」然後祈禱,而是用那句話原本代表的四五項具體條件去取代它。

 

一份可用的 AI 規格書包含哪五個部分?

可用的規格書有五個部分:要完成的任務、讀者與語境、輸出契約、評分標準,以及不確定處理規則。缺少任何一項,模型都會用一個平均值的猜測去補位,而這正是輸出品質不穩定的來源。

一、任務

--- 用一句話寫出成果,而非活動本身。「產出一篇 300 字的 LinkedIn 貼文,令人力資源經理願意下載薪酬基準報告」比「寫一篇關於報告的 LinkedIn 貼文」有用得多。

二、讀者與語境

--- 誰會讀、他們已經知道什麼、他們對什麼抱懷疑,以及有哪些事實是模型不可以自行虛構的。這一欄就是你貼上真實素材的位置,而不是信任模型的記憶。

三、輸出契約

--- 篇幅、結構、格式,以及不准出現的東西。禁止事項與要求同樣重要:不要點列、不要設問句、不要破折號、不要結尾總結段。

四、評分標準

--- 一份好答案必須通過的三至五項測試。這是幾乎所有人都會略過的部分,而它正是令輸出穩定的關鍵。把你評改新同事初稿時會用的標準寫出來即可。

五、不確定處理規則

--- 模型不知道時該怎麼辦。「如果某個數字不在我貼上的素材裡,請寫上[需要來源],不要估算」這一句,把幻覺風險轉換成一個看得見的待辦事項。

 

一份完整的 AI 規格書實際是什麼樣子?

以下是一份完整的規格書,你可以直接貼進 ChatGPT、Claude 或 Gemini,大約兩分鐘就能改成自己的版本。它刻意寫得平淡。規格書有效,是因為它枯燥而完整,不是因為它聰明。

立即試用這份規格書:

任務
產出[一篇 900 字文章],目的是[令香港的營運經理願意預約一次流程檢視]。成功的定義是[讀者會把它轉發給自己的上司]。

讀者
讀者是[香港 20 至 200 人公司的營運經理]。他們已經知道[什麼是流程自動化]。他們懷疑[供應商聲稱十倍節省的說法]。他們不知道[如何界定第一個項目的範圍]。

輸出契約
--- 篇幅:850 至 950 字
--- 結構:5 個章節,每節標題都是一個問句
--- 每節開首先用兩句直接回答該問題
--- 格式:純段落,每段最多 3 行
--- 不准使用:點列、破折號、設問句,以及「賦能」、「解鎖」、「格局」這些字詞
--- 不要以總結段作結

評分標準
一份合格初稿必須全部通過:
--- 每項論述都附有數字、具名來源或具體情境
--- 讀者今天就可以按第 3 節行動,不需要再問我問題
--- 沒有任何一句,在客戶引用回來時會令我尷尬
--- 刪掉任何一段都會失去真實資訊

不確定處理規則
如果某個統計數字、價格或日期不在下方素材中,請寫上[需要來源]而不要估算。不要從相鄰事實推論數字。

流程
開始寫之前,先列出 5 個章節標題並等我確認。我確認後再寫初稿,然後按評分標準自行評分,並告訴我哪一項最弱。

素材
[在此貼上你的筆記、會議記錄、數據或現有文案]

最後兩欄是大多數人漏掉的。流程那一欄把一次長篇猜測拆成兩個短檢查點。自行評分那一句則出奇地有效,因為模型必須用你的標準重讀自己的初稿,而不是用它自己的標準。

 

如何把一份規格書重用一整個月?

把規格書存成檔案,不要存成對話訊息。讀者、輸出契約與評分標準三欄在同類型輸出中完全不變,每次只需要換任務句和素材,於是一段 15 分鐘的提示語拉鋸,變成 90 秒的貼上動作。

然後把不變的部分放在模型會自動讀取的位置。ChatGPT Projects、Claude Projects 和 Gemini Gems 都支援附加在工作區的長期指令。把讀者、輸出契約和評分標準貼進去一次,該工作區內每一段新對話都會預先載入。

版本管理的習慣比工具更重要。當初稿出錯,不要去改初稿,而是把缺少的規則補進規格書檔案,然後重新執行。大約六輪之後,規格書就不再帶來意外,而且這個改善是永久的,不會困在單一段對話裡。

這樣做同時令你的指令遠離對話中會退化的部分。長對話會逐漸失去對最早指令的忠誠度,這種失效模式在這篇關於 context rot 的分析中有詳細說明。把規格書放在專案指令中,或在新對話開首重新貼一次,就能直接繞過這個問題。

 

AI 規格書會在哪些情況失效?

規格書有四種可預測的失效方式:寫得太長、標準互相矛盾、過度限制創意工作,以及被當成一次寫完就不再修改的文件。四者都可以修正,而預先知道它們,可以省下一星期的困惑。

過長

--- 指令一旦超過大約 600 字,模型對你各項規則的權重就會變得不均。如果你的規格書正在膨脹超過這個長度,你很可能是在同一份文件裡界定兩種不同輸出,應該拆成兩份。

標準互相矛盾

--- 「要全面」加上「最多 400 字」是一組衝突,模型會靜靜地二選一。把你的標準當成一整套來讀,然後刪掉那條在真實截稿壓力下你會犧牲的規則。

過度限制創意工作

--- 規格書非常適合重複產出,對構思階段卻有實際傷害。當你想要二十個古怪角度,一份嚴密的輸出契約只會給你同一個安全角度的二十種變體。發散階段用寬鬆簡報,直到落筆撰稿才切換成規格書。

當成已完成的文件

--- 一份寫完就不再修訂的規格書,會隨着你的產品、讀者以至模型本身改變而過時。尤其推理深度在多個模型上現時已可調整,這改變了規格書需要就「思考力度」交代什麼。UD 早前關於自適應思考的一篇文章,說明了這個旋鈕如何與指令遵循互相影響。

 

如何在二十分鐘內測試這套做法?

挑選你最常產出的那一種內容,然後把同一項任務跑兩次:一次用你平時的提示語,一次用上面的五部分規格書。用你自己的評分標準去比較兩份初稿,而不是靠感覺。差距通常在第一次嘗試就已經明顯。

通常會出現兩件事。規格書版本的初稿需要修改的地方更少,這正是重點。而寫評分標準這個動作,會迫使你把一直隱隱帶在身上的標準說清楚,副作用是你給人類同事的簡報也會變好。

這就是提示工程演變的老實總結。巧妙措辭的年代已經過去,取代它的,是在開口要求之前先清楚說明「好」的樣子這種平凡紀律。它沒那麼有趣,卻可靠得多。

懂AI的冷,更懂你的難 UD 同行28年,讓科技成為有溫度的陪伴。

本文由 UD AI 團隊審閱。

 

看清你的 AI 技能實際站在哪一級

寫規格書是 AI 技能的其中一級。上面還有好幾級,而大部分人都分不清自己站在哪裡。
UD 免費的 AI IQ 測試用 15 條題目評估你的實戰知識,並指出下一步最值得補上的具體缺口。UD 團隊手把手帶你完成每一步,由解讀測試結果,到建立補強最弱一環的工作流程。