普通人的第一個AI工作流5:AI總在同一個地方出錯?給工作流建立一份錯誤日誌
整理版優先睇
建立AI工作流錯誤日誌,將重複出錯變成可複用規則
呢篇文章係「普通人的第一個AI工作流」系列第五篇,作者涵的月想解決一個好常見嘅問題:AI成日喺同一個地方出錯,每次你都要重新提醒、重新修改。作者指出,淨係改答案唔夠,仲要將錯誤變成規則,等下次唔會再犯。佢提出建立一份「錯誤日誌」,同上一篇嘅驗收卡配合用——驗收卡負責判斷今次能不能交付,錯誤日誌就負責令同類錯誤唔好重複。
文章詳細講解錯誤日誌點樣寫,只需要五個核心字段:錯誤現象、發生步驟、可能原因、新規則、複測結果。作者用週報整理做例子,示範點樣由一次具體錯誤,揾出工作流邊度失守,再寫一條可執行、可檢查嘅規則,最後用三個樣本複測。佢強調要分清偶發錯誤同系統性錯誤,唔好諗住乜都加規則,否則會越嚟越亂。
呢篇文章仲提供一個現成嘅錯誤日誌模板,可以直接保存嚟用。作者提醒,錯誤日誌唔應該變成負擔,只記有代表性嘅錯誤,一次只驗證一條規則,規則衝突時先保事實同風險。建立咗呢套日誌,AI工作流就開始有「記憶」,每次失敗都會變成升級嘅線索。下一篇會教點樣將成個工作流保存成可複用模板。
- 錯誤日誌同驗收卡分工:驗收卡攔截今次唔合格結果,錯誤日誌負責令同類錯誤唔再重複。
- 五個核心字段:錯誤現象、發生步驟、可能原因、新規則、複測結果,形成一條改進閉環。
- 分清偶發定系統性錯誤:低風險先觀察,高風險(事實編造、私隱泄露等)即使一次都要即刻加規則。
- 三次複測:原失敗樣本、邊界樣本、新真實樣本,確認新規則唔係淨係答啱一題。
- 保持輕量:只記有代表性錯誤,一次驗證一條規則,並用版本號記錄更新。
AI工作流錯誤日誌模板
包含錯誤現象、錯誤類型、發生步驟、原始依據、可能原因、新規則、3次複測、最終結論、版本變化。可直接複製使用,亦可簡化成五列:錯誤現象|發生步驟|可能原因|新規則|複測結果。
驗收之後,仲要記低錯誤
上一篇,我哋幫AI輸出加咗一道驗收關:事實準確、信息完整、格式合格、風險可控。但驗收只係攔住今次嘅問題,如果AI總係喺同一個地方出錯,你就要諗點樣令佢下次唔好再錯。
只改結果,下一次還可能重來;把錯誤寫成規則,工作流才會升級
錯誤日誌同驗收卡嘅分工係:驗收卡負責判斷『今次能不能交付』,錯誤日誌負責回答『這類錯誤怎樣不再重複』。驗收卡似門口嘅安檢,錯誤日誌更像維修記錄。
驗收卡發現今次邊度錯,錯誤日誌令下次唔好再喺同一個地方跌低
五個核心字段:由現象到複測
建立錯誤日誌唔使複雜表格,最緊要寫低呢五件事,就足以推動一次真正嘅改進。
- 錯誤現象:具體寫低邊度唔啱,例如『把原文中的下週計劃寫入本週完成』,要寫到別人可以復現。現象越具體,後面越容易驗證。
- 發生步驟:用返目標、資料、步驟、格式、驗收呢五嚿積木,揾出工作流喺邊度失守。例如事實被編造,優先檢查資料邊界;計劃同完成混埋一齊,檢查分類步驟。
- 可能原因:寫成暫時假設,唔好猜模型內部,要檢查外部條件。例如原始資料將已完成同下週計劃混埋一段,或者提示詞冇定義狀態。
- 新規則:要可執行、可檢查,唔好寫『認真啲』。例如生成前先標記狀態,只有原文明確完成嘅事至入『本週完成』。
- 複測結果:修改之後要用唔同類型資料再跑幾次,並重新通過驗收卡,先至算真正有效。
錯誤日誌不是一張『AI犯錯清單』,也不是用來抱怨模型不聰明
與其寫『AI太粗心』,不如寫『工作流沒有要求先識別狀態,再生成周報』
1. 生成前,先給每條事項標記狀態:
【已完成】【進行中】【下週計劃】【待確認】。
2. 只有原始資料明確表示已經完成的事項,
才能進入「本週完成」。
3. 「計劃、準備、爭取、暫定、預計」等表述,
不得改寫為已完成或已確定。
4. 無法判斷狀態時,放入【待確認】,禁止猜測。
新規則不是把這次答案直接寫死,而是描述一類情況的處理方法
分清偶發同系統性錯誤,先決定加唔加規則
唔係每次不滿意都要即刻加規則,否則規則堆疊會互相衝突,令流程難以維護。用兩個問題判斷:佢出現得幾唔多?後果重唔重?
規則越堆越多,可能互相沖突,也會讓整個流程越來越難維護
- 低風險小問題:先記錄、觀察會唔會重複,例如『標題不夠有衝擊力』可以多睇幾次。
- 高風險錯誤:事實編造、私隱泄露、對外誤發、不可逆動作,即使一次都要即刻加規則或人工關口。
- 偶發錯誤特徵:只喺一份特殊資料出現、換另一個相似樣本冇復現、唔影響事實行動交付。
- 系統性錯誤特徵:相似輸入重複出現、總喺同一個步驟出錯、唔同任務都暴露同一條邊界問題。
「把暫定日期寫成確定日期」涉及事實狀態,應該立刻修
用3次複測,檢查工作流有冇開始變穩
修改提示詞之後,至少要用三種樣本複測,確認真係有效,而唔係淨係答啱一題。
- 1 原失敗樣本:將啱先出錯嘅原始資料重新運行一次,確認新規則攔得住舊問題。
- 2 邊界樣本:故意放入容易混淆嘅表達,例如『初稿已提交,正式發佈待審批』,睇下AI曉唔曉分狀態。
- 3 新真實樣本:換一份冇參與修改嘅新資料,例如『爭取週五上線,具體時間等客戶確認』,確認規則可複用。
三次輸出都要重新經過驗收卡,尤其檢查事實準確同風險可控。淨係聽AI講『我已遵守規則』唔算數。
三次複測是一項適合個人起步的最小練習,不是生產級可靠性的證明
通過一組測試只能增加對已測試條件的信心,不能證明所有情況都不會出錯
保持輕量,唔好變成負擔
錯誤日誌係幫你減少返工,唔係製造更多記錄工作。下面四個原則可以令佢保持輕量。
- 只記有代表性錯誤:重複出現、影響交付、觸發硬門檻或者值得加入規則嘅問題。
- 一次只驗證一條主要規則:同時改10處,好難知邊條有效。
- 規則衝突時,先保事實同風險:『寫得更有感染力』同『嚴格保留原始狀態』衝突,揀事實;『儘量自動完成』同『對外發送必須人工確認』衝突,揀風險。
- 工具、資料或任務變化後要重新複測:換咗模型、格式、交付對象,原規則唔一定仍然有效。
錯誤日誌不是永久保險單,而是工作流的維護記錄
最後,作者建議做一個15分鐘練習:揾出最近一次冇通過驗收嘅AI輸出,圈出具體錯誤,判斷發生步驟,寫出新規則,用三個樣本複測,通過就保存新版本。
不要浪費一次真實錯誤,它可能正是你的工作流最需要的一條升級線索
上一篇,我哋幫AI輸出加咗一道驗收關。
事實準確、資訊完整、格式合格、風險可控——只要拎住嗰張驗收卡逐項檢查,一份外表靚、實際上冇用嘅結果,就好難再矇混過關。
不過驗收之後,仲有一件更加重要嘅事。
假設你喺週報度寫:“下週計劃:聯絡設計確認兩版頭圖;第一篇暫定8月5日發佈。”AI但佢就整理成:
本週完成 |
你對照返原始資料,發現“下週計劃”被寫成咗“本週完成”,“暫定”都變成咗確定日期。於是你叫AI改正,驗收通過,然後將週報發咗出去。
去到下一個星期,資料度又出現“計劃提交”“爭取週五上線”,AI又將佢哋寫入已完成事項。你唯有重新提醒、重新修改、重新檢查。
如果同一個錯誤要你不斷口頭提醒,即係話你淨係修好今次輸出,仲未修好個工作流。 |
今日,我哋就幫個工作流加一份錯誤日誌:每次驗收失敗,唔只改答案,仲要記低錯誤類型、發生步驟、可能原因、新規則同複測結果。

淨係改結果,下一次都可能重複犯錯;將錯誤寫成規則,個工作流先會升級。
驗收卡同錯誤日誌,分別解決啲乜?
先將兩者嘅分工講清楚。
驗收卡負責判斷“今次可唔可以交貨”;錯誤日誌負責回答“呢類錯誤點樣先至唔會重複”。 |
驗收卡就好似門口嘅安檢:發現事實冇來源、字段漏填或者風險失控,就將結果攔截。錯誤日誌更加似維修記錄:佢唔只寫“邊度壞咗”,仲要揾到工作流入面可以修改嘅位置,並確認修改之後真係有效。
所以,錯誤日誌唔係一張“AI犯錯清單”,亦都唔係用嚟抱怨個模型唔聰明。佢記錄嘅係我哋可以控制嘅工作流條件:資料係咪撈埋一齊、步驟有冇先分類、規則係咪含糊、輸出格式係咪誘導人哋誤判、驗收標準有冇漏咗邊界情況。
驗收卡發現今日邊度錯咗,錯誤日誌令下次唔會再喺同一個地方跌低。 |
一條有用嘅錯誤日誌,只需要5個核心字段
第一次建立錯誤日誌,唔需要做複雜表格。先將下面5件事寫清楚,就足以推動一次真正嘅改進。

由記錄錯誤到三次複測,形成一條可以反覆運行嘅改進閉環
01 錯誤現象:具體邊度唔啱?
唔好淨係寫“內容唔好”“AI理解錯咗”。要寫成其他人可以重現嘅問題,例如:“將原文入面嘅下週計劃寫入本週完成”“將暫定日期改成確定日期”。
現象越具體,後面越容易驗證。因為修改之後,你可以直接檢查:同一個狀態詞再次出現時,佢仲會唔會分錯。
02 發生步驟:工作流喺邊度失守?
返去我哋一路用緊嘅5塊積木:目標、資料、步驟、格式、驗收。錯誤通常唔係無端端出現,而係喺某一塊冇講清楚。
常見錯誤→ 優先檢查嘅位置 |
呢度嘅目的唔係幫模型做心理分析,而係揾到我哋可以修改嘅環節。與其寫“AI太粗心”,不如寫“工作流冇要求先識別狀態,再生成週報”。
03 可能原因:邊條條件造成咗錯誤?
把“原因”寫成一個暫時嘅假設,而唔係確定結論。我哋冇辦法由一次輸出判斷模型內部發生咗乜嘢,但可以檢查外部條件。
今次錯誤可能嚟自3個地方:原始資料將已完成同下週計劃撈埋喺同一段;提示詞淨係話“總結進展”,冇定義狀態;輸出格式得“工作進展”,冇將已完成、進行中同計劃分開。
先揀最直接、最容易驗證嘅原因,補一條規則,再用複測判斷佢有冇效。
04 新規則:下一次要點樣處理?
新規則要可以執行,亦都要可以驗收。好似“認真啲”“唔好犯錯”呢啲提醒冇操作步驟,下一次仍然只能靠運氣。
原本嘅模糊要求 |
注意,新規則唔係將今次答案直接寫死,而係描述一類情況嘅處理方法。佢既可以攔住“下週計劃”,亦都可以處理“爭取上線”“預計發佈”等相似表達。
05 複測結果:規則真係有用咩?
修改提示詞之後重新生成一次,只能證明佢今次改啱咗,唔可以證明工作流已經穩定。至少要用唔同類型嘅資料再行幾次,並重新通過上一篇嘅驗收卡。
將開頭嘅錯誤,完整記一次
下面係一條填好嘅錯誤日誌。你可以見到,佢記錄嘅重點唔係AI講錯咗邊一句,而係今次錯誤點樣變成下一版工作流入面嘅規則。
AI工作流錯誤日誌|示例 |
版本號唔需要專業。對個人工作流嚟講,v1.0表示第一版,補咗一條有效規則就儲存做v1.1,並喺日誌度寫一句改咗啲乜。下次結果突然變差時,你至少知道應該回查邊一次修改。
點樣分清楚偶發錯誤同重複錯誤?
唔係每次都唔滿意,就要即刻幫提示詞加一條新規則。規則越堆越多,可能互相衝突,亦都會令到個流程越來越難維護。
可以用兩個問題判斷:佢出現得頻唔頻密?一旦出現,後果嚴唔嚴重?
低風險嘅小問題,先記錄、觀察會唔會重複;事實捏造、私隱洩漏、對外誤發同不可逆轉動作等高風險錯誤,即使只出現一次,都應該立即增加規則或人工關口。 |
更加似偶發錯誤嘅情況
只係喺一份特殊資料中出現;換一個相似樣本之後冇再出現;錯誤只係個人措辭偏好,唔影響事實、行動同交付。呢陣時可以留喺日誌度,唔使急住擴充主規則。
更加似系統性錯誤嘅情況
喺相似輸入下重複出現;成日喺同一個步驟出錯;唔同任務都暴露同一條邊界唔清;或者雖然只發生一次,後果卻唔可以接受。呢啲錯誤應該進入工作流規則,並加入固定驗收項。
比如,“標題唔夠有衝擊力”可以觀察多幾次;“將暫定日期寫成確定日期”就涉及事實狀態,應該即刻修正。
用3次複測,檢查工作流有冇開始變穩定
對普通人嘅第一個工作流,我建議先做一組最小複測:原失敗樣本、邊界樣本、新真實樣本。

用原失敗樣本、邊界樣本同新真實樣本,檢查新規則係咪淨係識做一道題
第一次:原失敗樣本
將頭先出錯嘅原始資料重新運行一次。目標係確認新規則可以攔住已經發現嘅問題,呢個等於檢查“舊病有冇復發”。
第二次:邊界樣本
特登放入容易混淆嘅表達,例如:“初稿已提交,正式發佈等緊審批。”正確結果應該係“提交初稿”進入已完成,“正式發佈”仍然處於待審批,而唔係將成件事都寫成完成。
第三次:新真實樣本
換一份冇參與修改嘅新資料,例如:“爭取週五上線,具體時間等客戶確認。”如果AI仍然可以保留不確定狀態,證明規則開始有可複用性。
三次輸出都要重新通過上一篇嘅驗收卡,尤其檢查事實準確同風險可控兩項硬門檻。淨係睇AI有冇話“我已遵守規則”,唔算複測。
三次複測係一項適合個人起步嘅最小練習,唔係生產級可靠性嘅證明。佢只可以說明:喺呢3個條件之下,新規則暫時有效。 |
OpenAI關於評測嘅公開文章建議用真實案例同邊界案例去發現系統點樣失敗,並持續記錄輸入、輸出同結果;OpenAI Academy亦都提醒,通過一組測試只能增加對已測試條件嘅信心,唔可以證明所有情況都唔會出錯。個人工作流可以由3個樣本開始,但重要流程應該持續累積更多真實案例,並保留人工複核。
呢份錯誤日誌模板,可以直接保存
佢可以同上一篇嘅通用驗收卡放埋一齊:驗收冇通過時,先修復當前結果;如果問題值得追蹤,再填寫錯誤日誌並更新工作流版本。
AI工作流錯誤日誌 |
如果日誌太長,你都仲可以淨係保留5列:錯誤現象|發生步驟|可能原因|新規則|複測結果。真正重要嘅唔係表格有幾完整,而係錯誤最終有冇進入規則。
唔好畀錯誤日誌變成新嘅負擔
一份好日誌應該幫你減少返工,而唔係製造更多記錄工作。下面4個原則,可以令到佢保持輕量。
淨係記有代表性嘅錯誤
優先記錄重複出現、影響交付、觸發硬門檻或者值得加入規則嘅問題。純粹嘅個人措辭偏好,可以直接修改,唔使全部入日誌。
一次只驗證一條主要規則
同時修改10處,好難知道究竟係邊一條起作用。先處理最嚴重、最常見嘅問題,複測通過之後再繼續。
規則衝突時,先保住事實同風險
如果“寫得更加有感染力”和“嚴格保留原始狀態”發生衝突,優先保留事實;如果“盡量自動完成”和“對外發送必須人工確認”發生衝突,優先保留風險關口。
工具、資料或任務變化之後,重新複測
換咗模型、換咗資料格式、換咗交付對象,原本嘅規則唔一定仍然有效。錯誤日誌唔係永久保險單,而係工作流嘅維護記錄。
今日就做一次15分鐘練習
揾出最近一次冇通過驗收嘅AI輸出,同時準備佢所依據嘅原始資料。然後完成下面5步。
1.圈出一個揾到證據嘅具體錯誤,唔寫“感覺唔好”。
2.判斷佢發生喺目標、資料、步驟、格式定係驗收。
3.寫低一條可以執行、可以檢查嘅新規則。
4.依次用原失敗樣本、邊界樣本同新真實樣本複測。
5.3次都通過,就保存做新版本;冇通過,就繼續修改。
唔好浪費一次真實錯誤。佢可能正正就係你個工作流最需要嘅一條升級線索。 |
寫喺最後
到呢度,你嘅AI工作流已經開始擁有“記憶”。呢個唔係因為AI自動記住你嘅偏好,而係你將真實失敗留低,變成咗下一次必須遵守嘅規則。
驗收卡負責攔住唔合格嘅結果,錯誤日誌負責累積改進經驗。經過幾輪運行,你會逐漸得到一套更加清楚嘅步驟、更加可靠嘅格式同一組經受過真實問題考驗嘅規則。
但呢啲內容好可能仲散落喺唔同聊天、備忘錄同文件入面。每次重新開始任務,你仍然要揾返舊提示詞、複製驗收卡、回憶最新規則,再解釋一次資料應該點樣提供。
下一篇,我哋要將已經行得通嘅工作流“釘裝成冊”:保存做一份下次攞嚟就可以用、換咗人都睇得明嘅模板。 |
第六篇《唔好再從頭解釋:將行得通嘅AI工作流保存成可複用模板》,我會將任務說明、輸入清單、執行步驟、輸出格式、驗收卡同錯誤日誌整理成一個完整嘅“工作流模板包”,再示範點樣命名、更新版本同快速複用。
下一篇預告 |
呢度係涵的月
唔追逐複雜概念,淨係研究普通人點樣將AI真正用入工作同生活
上一篇,我們給AI輸出加上了一道驗收關。
事實準確、信息完整、格式合格、風險可控——只要拿着那張驗收卡逐項檢查,一份外表漂亮、實際不能用的結果,就很難再矇混過關。
但驗收之後,還有一件更重要的事。
假設你在週報裏寫:“下週計劃:聯繫設計確認兩版頭圖;第一篇暫定8月5日發佈。”AI卻把它整理成:
本週完成 |
你對照原始資料,發現“下週計劃”被寫成了“本週完成”,“暫定”也變成了確定日期。於是你讓AI改正,驗收通過,然後把週報發了出去。
到了下一週,資料裏又出現“計劃提交”“爭取週五上線”,AI再次把它們寫進已完成事項。你只好重新提醒、重新修改、重新檢查。
如果同一個錯誤需要你反覆口頭提醒,說明你修好的只是這一次輸出,還沒有修好工作流。 |
今天,我們就給工作流加上一份錯誤日誌:每次驗收失敗,不只改答案,還要留下錯誤類型、發生步驟、可能原因、新規則和複測結果。

只改結果,下一次還可能重來;把錯誤寫成規則,工作流才會升級
驗收卡和錯誤日誌,分別解決什麼?
先把兩者的分工說清楚。
驗收卡負責判斷“這一次能不能交付”;錯誤日誌負責回答“這類錯誤怎樣不再重複”。 |
驗收卡像門口的安檢:發現事實無來源、字段漏填或風險失控,就把結果攔下來。錯誤日誌更像維修記錄:它不僅寫“哪裏壞了”,還要找到工作流中可以修改的位置,並確認修改後真的有效。
所以,錯誤日誌不是一張“AI犯錯清單”,也不是用來抱怨模型不聰明。它記錄的是我們能控制的工作流條件:資料是否混在一起、步驟有沒有先分類、規則是否含糊、輸出格式是否誘導誤判、驗收標準有沒有漏掉邊界情況。
驗收卡發現今天哪裏錯了,錯誤日誌讓下次不再從同一個地方跌倒。 |
一條有用的錯誤日誌,只需要5個核心字段
第一次建立錯誤日誌,不需要做複雜表格。先把下面5件事寫清楚,就足以推動一次真正的改進。

從記錄錯誤到三次複測,形成一條可以反覆運行的改進閉環
01 錯誤現象:具體哪裏不對?
不要只寫“內容不好”“AI理解錯了”。要寫成別人可以復現的問題,例如:“把原文中的下週計劃寫入本週完成”“把暫定日期改成確定日期”。
現象越具體,後面越容易驗證。因為修改之後,你可以直接檢查:同樣的狀態詞再次出現時,它還會不會分錯。
02 發生步驟:工作流在哪裏失守?
回到我們一直使用的5塊積木:目標、資料、步驟、格式、驗收。錯誤通常不是憑空出現,而是在某一塊沒有說清楚。
常見錯誤→ 優先檢查的位置 |
這裏的目的不是給模型做心理分析,而是找到我們能夠修改的環節。與其寫“AI太粗心”,不如寫“工作流沒有要求先識別狀態,再生成周報”。
03 可能原因:哪條條件造成了錯誤?
把“原因”寫成一個暫時的假設,而不是確定結論。我們無法從一次輸出判斷模型內部發生了什麼,但可以檢查外部條件。
這次錯誤可能來自3個地方:原始資料把已完成和下週計劃混在同一段;提示詞只說“總結進展”,沒有定義狀態;輸出格式只有“工作進展”,沒有把已完成、進行中和計劃分開。
先選最直接、最容易驗證的原因,補一條規則,再用複測判斷它是否有效。
04 新規則:下一次必須怎樣處理?
新規則要能被執行,也要能被驗收。像“認真一點”“不要犯錯”這樣的提醒沒有操作步驟,下一次仍然只能靠運氣。
原來的模糊要求 |
注意,新規則不是把這次答案直接寫死,而是描述一類情況的處理方法。它既能攔住“下週計劃”,也能處理“爭取上線”“預計發佈”等相似表達。
05 複測結果:規則真的有用嗎?
修改提示詞之後重新生成一次,只能證明它這次改對了,不能證明工作流已經穩定。至少要用不同類型的資料再跑幾次,並重新通過上一篇的驗收卡。
把開頭的錯誤,完整記一次
下面是一條填好的錯誤日誌。你可以看到,它記錄的重點不是AI說錯了哪句話,而是這次錯誤如何變成下一版工作流裏的規則。
AI工作流錯誤日誌|示例 |
版本號不需要專業。對個人工作流來說,v1.0表示第一版,補了一條有效規則就保存為v1.1,並在日誌裏寫一句改了什麼。下次結果突然變差時,你至少知道應該回查哪次修改。
怎樣分清偶發錯誤和重複錯誤?
不是每次不滿意,都要立刻給提示詞加一條新規則。規則越堆越多,可能互相沖突,也會讓整個流程越來越難維護。
可以用兩個問題判斷:它出現得多不多?一旦出現,後果重不重?
低風險的小問題,先記錄、觀察是否重複;事實編造、隱私泄露、對外誤發和不可逆動作等高風險錯誤,即使只出現一次,也應該立即增加規則或人工關口。 |
更像偶發錯誤的情況
只在一份特殊資料中出現;換一個相似樣本後沒有復現;錯誤只是個人措辭偏好,不影響事實、行動和交付。此時可以先留在日誌裏,不急着擴充主規則。
更像系統性錯誤的情況
在相似輸入下重複出現;總在同一個步驟出錯;不同任務都暴露出同一條邊界不清;或者雖然只發生一次,後果卻不可接受。這樣的錯誤應該進入工作流規則,並加入固定驗收項。
比如,“標題不夠有衝擊力”可以多觀察幾次;“把暫定日期寫成確定日期”則涉及事實狀態,應該立刻修。
用3次複測,檢查工作流有沒有開始變穩
對普通人的第一個工作流,我建議先做一組最小複測:原失敗樣本、邊界樣本、新真實樣本。

用原失敗樣本、邊界樣本和新真實樣本,檢查新規則是否只會做一道題
第一次:原失敗樣本
把剛才出錯的原始資料重新運行一次。目標是確認新規則能攔住已經發現的問題,這相當於檢查“舊病有沒有復發”。
第二次:邊界樣本
故意放入容易混淆的表達,例如:“初稿已提交,正式發佈待審批。”正確結果應該是“提交初稿”進入已完成,“正式發佈”仍處於待審批,而不是把整件事都寫成完成。
第三次:新真實樣本
換一份沒有參與修改的新資料,例如:“爭取週五上線,具體時間等客戶確認。”如果AI仍能保留不確定狀態,說明規則開始具有可複用性。
三次輸出都要重新經過上一篇的驗收卡,尤其檢查事實準確和風險可控兩項硬門檻。只看AI有沒有說“我已遵守規則”,不算複測。
三次複測是一項適合個人起步的最小練習,不是生產級可靠性的證明。它只能說明:在這3個條件下,新規則暫時有效。 |
OpenAI關於評測的公開文章建議用真實案例和邊界案例發現系統怎樣失敗,並持續記錄輸入、輸出與結果;OpenAI Academy也提醒,通過一組測試只能增加對已測試條件的信心,不能證明所有情況都不會出錯。個人工作流可以從3個樣本開始,但重要流程應該持續積累更多真實案例,並保留人工複核。
這份錯誤日誌模板,可以直接保存
它可以和上一篇的通用驗收卡放在一起:驗收沒有通過時,先修復當前結果;如果問題值得追蹤,再填寫錯誤日誌並更新工作流版本。
AI工作流錯誤日誌 |
如果日誌太長,你也可以先只保留5列:錯誤現象|發生步驟|可能原因|新規則|複測結果。真正重要的不是表格有多完整,而是錯誤最終有沒有進入規則。
別讓錯誤日誌變成新的負擔
一份好日誌應該幫助你減少返工,而不是製造更多記錄工作。下面4個原則,可以讓它保持輕量。
只記有代表性的錯誤
優先記錄重複出現、影響交付、觸發硬門檻或值得加入規則的問題。純粹的個人措辭偏好,可以直接修改,不必全部進入日誌。
一次只驗證一條主要規則
同時修改10處,很難知道究竟是哪一條起作用。先處理最嚴重、最常見的問題,複測通過後再繼續。
規則衝突時,先保事實和風險
如果“寫得更有感染力”和“嚴格保留原始狀態”發生衝突,優先保留事實;如果“儘量自動完成”和“對外發送必須人工確認”發生衝突,優先保留風險關口。
工具、資料或任務變化後,重新複測
換了模型、換了資料格式、換了交付對象,原來的規則不一定仍然有效。錯誤日誌不是永久保險單,而是工作流的維護記錄。
今天就做一次15分鐘練習
找出最近一次沒有通過驗收的AI輸出,同時準備它所依據的原始資料。然後完成下面5步。
1.圈出一個能找到證據的具體錯誤,不寫“感覺不好”。
2.判斷它發生在目標、資料、步驟、格式還是驗收。
3.寫下一條可以執行、可以檢查的新規則。
4.依次用原失敗樣本、邊界樣本和新真實樣本複測。
5.3次都通過,就保存為新版本;沒有通過,就繼續修改。
不要浪費一次真實錯誤。它可能正是你的工作流最需要的一條升級線索。 |
寫在最後
到這裏,你的AI工作流已經開始擁有“記憶”。這不是因為AI自動記住了你的偏好,而是你把真實失敗留下來,變成了下一次必須遵守的規則。
驗收卡負責攔住不合格結果,錯誤日誌負責積累改進經驗。經過幾輪運行,你會逐漸得到一套更清楚的步驟、更可靠的格式和一組經受過真實問題檢驗的規則。
但這些內容很可能還散落在不同聊天、備忘錄和文檔裏。每次重新開始任務,你仍要找到舊提示詞、複製驗收卡、回憶最新規則,再解釋一遍資料應該怎樣提供。
下一篇,我們要把已經跑通的工作流“裝訂成冊”:保存為一份下次拿來就能用、換人也看得懂的模板。 |
第六篇《別再從頭解釋:把跑通的AI工作流保存成可複用模板》,我會把任務說明、輸入清單、執行步驟、輸出格式、驗收卡和錯誤日誌整理成一個完整的“工作流模板包”,再示範怎樣命名、更新版本和快速複用。
下一篇預告 |
這裏是涵的月
不追逐複雜概念,只研究普通人如何把AI真正用進工作和生活