你請 AI 把活動邀請信「改得更有質感」。第二版換了標題,第三版刪掉報名資訊,第四版又把你原本喜歡的開場改回公關稿語氣。每一版都像有做事,卻沒有人說得出哪一版更接近完成。
這種來回通常不是 AI 少收到一個厲害的提示,而是回饋沒有可觀察的差異,也沒有固定不動的範圍。「自然一點」「專業一點」「更有溫度」都能有十種解釋;模型只好同時改語氣、長度、結構與用字,下一輪又失去比較基準。
把改稿當成小型評估,比繼續疊形容詞有效。OpenAI 的評估指引指出,生成式 AI 對相同輸入可能給出不同輸出,因此要用結構化測試;比較兩個選項、分類或按明確條件評分,通常比要求開放式判斷可靠。這不代表一般讀者要建一套測試平台,而是要把「我覺得不對」改寫成另一個人也看得見的差異。
一張回饋卡只回答三件事
先把回饋拆成保留、改動、邊界。
「保留」是目前已經成立的部分。例如日期、地點、報名連結與第一句不動。「改動」只指定一個本輪要改善的差異,例如把中段從 90 字縮成 45 字,並以一個參加者會遇到的場景取代三句抽象口號。「邊界」則說明不能為了完成改動而犧牲什麼:不得新增活動承諾、不得改費用,也不要把未確認的講者經歷寫成事實。
這三格比「請再精簡一點」多了一個關鍵:AI 知道哪裡算完成,也知道哪些地方碰了反而是退步。Anthropic 的評估文件同樣把好的成功條件寫成具體、可衡量、可達成且符合用途,並提醒多數任務需要同時看幾個面向。實務上不必一次塞滿十項;本輪先選一個主要差異,再把事實與權限列為硬邊界。
用四步把改稿收斂
順序很重要。先保存基準,再決定差異;否則每一輪都只能憑印象追著最新版跑。
以邀請信為例,不要說「B 比較有溫度」。可以說:「選 B,因為前兩句直接說出參加者會帶走什麼,而且維持 45 字內;保留 A 的日期句。兩版都把免費諮詢寫成保證,這句不要採用。」現在下一輪有可執行的差異,也留下被拒絕的原因。
每次只比較一個主要面向,不表示其他品質不重要。它只是避免同時改五件事後,無法知道改善來自哪裡。先收斂結構,再處理語氣;先確認事實,再修節奏。若兩個條件互相衝突,例如既要補完整背景又要求字數減半,就先讓人決定優先序,不要叫 AI 猜。
把分歧留成規則,不要當雜訊丟掉
兩位同事對同一句話看法不同時,常見做法是請 AI 「折衷」。結果通常兩邊都不像。Google 的 People + AI Guidebook 提醒,標註者意見不一致不一定只是雜訊;分歧可能暴露工具、流程、指示或資料策略本身的問題。
因此先問分歧屬於哪一種。若一方重視品牌語氣、另一方重視法規揭露,這不是選字偏好,而是兩條不同責任。把法規內容列為硬邊界,再由品牌負責人處理語氣。若只是「熱情」的程度不同,就各自挑一個可接受與不可接受的句子,說明可觀察差異,再決定適用情境。
留下小型改稿紀錄也很重要:基準版、這輪條件、A/B 選擇、拒絕理由、合併後版本。NIST AI RMF Playbook 的 Measure 2.1 要求記錄測試集、指標與工具細節,以建立可重複且一致的評估。一般工作文件不需要照搬完整治理流程,但同一個道理成立:沒有版本與判準,團隊下週只會重新爭論一次。
什麼時候該停止叫 AI 再改
達到這輪條件、沒有破壞保留項,就先停。不要因為 AI 還能產生第五版,就把選擇本身當成進度。
遇到三種情況也要停下來交給人:來源事實彼此衝突;品牌、法規或主管要求沒有明確優先序;改動會形成價格、合約、醫療、招募或對外承諾。AI 可以標出衝突與差異,不能替有責任的人核准。若文件含客戶資料或內部策略,只在組織核准的工具與權限範圍內處理,先移除不必要的個資。
這套方法也能接到可交接的 AI 摘要結構:選了哪個版本、依據什麼、留下哪些限制,都應跟成品一起走。若第一版已經做了很多但責任歸屬不清,也可搭配AI 交出第一版後的完工判斷;一篇處理回饋如何收斂,另一篇處理誰要承接與驗收。
AI 整理卡
請從你目前已獲授權讀取的工作區開始,維持唯讀,不要覆寫、重新命名、移動或刪除任何檔案。先找出這項文稿/簡報/設計說明的最新版與前一版;若找不到可靠版本關係,列出候選路徑、修改時間與缺少資訊後停止。比較兩版,分成「刻意改動」「未解決問題」「非預期漂移」,並引用短片段或位置作證。把現有回饋中的抽象詞改寫成一張回饋卡:必須保留的內容、本輪唯一可觀察的修改條件、不可跨越的事實/權限/承諾邊界。接著提出 A 與 B 兩個最小候選,只修改指定區域;逐一說明候選如何滿足條件及可能代價。不要自行選定、不要合併,也不要擴大修改範圍。最後列出需要我做的 A/B/都不選決定,以及一個明確停止條件,等我確認後再繼續。
四格看懂:回饋先分類,才不會一起亂改

- 設計師面前散著一疊外觀相近的回饋單;確認修改、待釐清問題與不得變動的限制全混在一起。
- 她把整疊都當成同一種指令交給 AI,小機器做出一張精緻,卻把配色、花朵、邊框與版面全改掉的邀請卡。
- 她收回回饋單,分進綠色確認盤、放著放大鏡的黃色待確認盤,以及上鎖的紅色限制盤。
- 她只把綠色確認單交給 AI;成品僅改中央緞帶顏色,待確認與限制兩盤仍留在桌上。
修改衣服時,裁縫會先用別針標出這次要收哪一道縫,不會因為袖口鬆了就順手換領型、布料與顏色。給 AI 回饋也一樣:先固定衣服,再移動一根別針。
參考來源
- OpenAI Developers:Evaluation best practices — https://platform.openai.com/docs/guides/evaluation-best-practices [accessed: 2026-07-29]
- Anthropic Claude Platform Docs:Define success criteria and build evaluations — https://docs.anthropic.com/en/docs/build-with-claude/develop-tests [accessed: 2026-07-29]
- Google People + AI Research:People + AI Guidebook — Patterns — https://pair.withgoogle.com/guidebook-v2/patterns [updated: 2021-05-18]
- NIST AI Resource Center:AI RMF Playbook — Measure — https://airc.nist.gov/airmf-resources/playbook/measure [accessed: 2026-07-29]



