工程團隊最怕的,不是 AI 沒把程式跑快,而是它交出看似更好的版本,團隊卻說不清這個「比較好」是否符合上線限制。要讓判斷能由機器執行,仍得先準備起始程式,以及由客戶端執行、結果可重現的評估器。Google Cloud 在 2026 年 7 月宣布 AlphaEvolve 於 Gemini Enterprise Agent Platform 正式提供使用,並把這套流程整理成定義、衡量、優化與套用。這則消息值得工程團隊先問的,不是「能快多少」,而是我們能不能把「比較好」寫成機器可執行、又不會漏掉上線限制的判定?

如果答案只有「跑快一點、品質不要變差」,搜尋系統仍不知道哪些行為不能犧牲。它可能找到漂亮的分數,也可能只是利用評估器沒寫到的缺口。InfoQ 對這項服務的報導同樣指出,它適合成功條件可量測、可自動化的問題;報導也提醒,供應商公布的成效不是獨立基準,而且搜尋可能鑽評估規則的漏洞。

先寫一份能執行的評估契約

一個可交給自動搜尋的目標,至少要回答五件事。基準固定比較起點與測試環境;指標把改善方向變成可計算的分數;硬性限制列出即使分數更高也不能破壞的正確性、可重現性、資源與介面要求;停止條件規定預算、時間或連續無改善次數;最後還要有一位具名的人,負責閱讀差異、檢查證據並決定是否放行。

這五項不是讓規格看起來完整,而是避免評分與真實需求分家。Klarna Engineering 的實作紀錄提到,工程師先界定可改動範圍、指標與不可妥協的限制;當確定性限制漏寫時,搜尋曾得到速度快卻無法部署的路徑。該團隊也記錄過連續 631 次評估沒有改善,顯示停止條件不能等到算力耗盡才臨時決定。

這個目標該進哪一條路?

結果能否客觀計分,限制也能自動檢查?。客觀計分,限制可自動檢查:可開始—固定範圍與預算,人工審查,不自動部署。可計分,採否條件仍靠經驗:先補評估器—把一項拒絕理由寫成測試。涉及模糊判斷,失敗代價攔不住:不適合—AI 只整理,人做決定並負責
結果能否客觀計分,限制也能自動檢查?
客觀計分,限制可自動檢查
可開始—固定範圍與預算,人工審查,不自動部署
可計分,採否條件仍靠經驗
先補評估器—把一項拒絕理由寫成測試
涉及模糊判斷,失敗代價攔不住
不適合—AI 只整理,人做決定並負責
  1. 結果能否客觀計分,限制也能自動檢查?
  2. 客觀計分,限制可自動檢查可開始—固定範圍與預算,人工審查,不自動部署
  3. 可計分,採否條件仍靠經驗先補評估器—把一項拒絕理由寫成測試
  4. 涉及模糊判斷,失敗代價攔不住不適合—AI 只整理,人做決定並負責

這個分支刻意把「能不能自動評分」放在「要用哪個模型」之前。若團隊連候選修改由誰理解、誰承擔都說不清楚,可以先用程式碼變更的所有權檢查補上責任邊界;至於搜尋途中要在哪些位置停下來看證據,可參考程式代理的人工作業檢查點

廣告

評估器過關,仍不等於可以上線

評估器回答的是候選程式是否符合已編碼的條件。它不會自動證明需求完整,也不能替組織承擔發布決定。每次執行都應保留起始版本、環境、分數、限制檢查、停止原因與候選差異;具名負責人要看過這些證據,必要時再做安全、維運與產品層面的檢查。

今天不必建立一套通用平台。只挑一個邊界清楚的優化目標,寫下基準、指標、硬性限制、停止條件與放行人。任何一欄寫不出來,都不是催 AI 多產幾個版本,而是先把那一欄補成可驗證的契約。

AI 整理卡

請從你目前可存取的工作區、程式庫、測試紀錄或效能資料開始,先做唯讀探索,不要修改程式、設定或部署狀態。自行找出一個邊界清楚、可能適合自動優化的程式目標,引用你看到的直接證據,並把已觀察事實與推論分開。接著整理它的現行基準、可計算指標、不可違反的正確性/確定性/資源限制、預算或連續無改善的停止條件,以及負責審查與放行的人;缺少的內容標成「待確認」。若必要 context 無法讀取,只問一個最精準的存取或背景問題,不要要求我先整理資料包。最後只判定為「可開始」「先補評估器」或「不適合自動搜尋」,說明最關鍵的一項證據,並給出一個今天能完成、可撤回且不會直接部署的下一步。任何高分候選都必須由具名負責人查看差異與限制檢查後才可進入發布流程。

先縮小範圍,再讓結果通過檢查

四格漫畫:園丁從小區試種、發現範圍失控,到停手劃定邊界,最後只完成一塊試驗田。

  1. 園丁先在一小塊田裡比較幾株幼苗,工作範圍原本清楚可控。
  2. 幼苗與試種範圍向外擴張,園丁停下來察看失控的規模。
  3. 他放慢動作,用木樁和繩索重新圍出唯一要完成的試驗區。
  4. 圍定的幼苗已長得穩定,其餘田地保持未動,留待之後再決定。
廣告

Share

分享這篇微課

如果這篇剛好解開一個工作卡點,可以分享給也在判斷 AI 怎麼用的人。

參考來源

Google Cloud:AlphaEvolve is available for everyone — https://cloud.google.com/blog/products/ai-machine-learning/alphaevolve-is-available-for-everyone(2026-07-09)

InfoQ:Google’s AlphaEvolve Reaches General Availability with Evolutionary Code Optimization as a Service — https://www.infoq.com/news/2026/07/alphaevolve-generally-available/(2026-07-19)

Klarna Engineering:Beyond Prompting: How Algorithmic Evolution Doubled our Training Speed — https://medium.com/klarna-engineering/beyond-prompting-how-algorithmic-evolution-doubled-our-training-speed-8f874af3080d(2026-03-30)