• Accuracy-Correction Paradox: 最強的不會修,最弱的反而會
  • Error Depth Hypothesis: 強模型犯的錯更深
  • 偵測率與修正率脫鉤,提示反而有害
  • 第一:偵測率和修正率幾乎無關。
  • 第二:過度聚焦
  • 迭代反思:雙面刃
  • 叫更強的模型來審查呢?
  • FAQ
  • 結語

AI 自我修正的悖論:為什麼它經常讓事情變得更糟?

資工系的Leo-avatar-img
資工系的Leo
人氣格鬥士
2026/07/04 更新2026/07/04 發佈閱讀 8 分鐘

你讓 ChatGPT 寫一段程式,它寫好了,你請它「再檢查一次有沒有 bug」。它很認真地看了一遍,然後說「啊我發現問題了」,接著把你的正確邏輯改成錯的。或者你讓它算一題數學,它算出 42,你叫它確認一下,它改成 37,但原本是對的。

不是你的運氣特別差。過去一年越來越多的研究指向一個結論:

叫 LLM 自我修正,大部分時候不只沒用,還經常把對的搞錯。

而且如果你換另一個更強的模型來幫它 review,那個強模型根本沒有在審查,它只是自己重做了一遍。

2026年1月6號 Yin Li 發表了一篇討論單一模型自我修正悖論的論文(Decomposing LLM Self-Correction: The Accuracy-Correction Paradox and Error Depth Hypothesis)。2026 年四月 CMU 團隊接續發表Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines,討論「兩個模型接力」時第二個模型究竟在幹嘛。

Accuracy-Correction Paradox:
最強的不會修,最弱的反而會

論文用 GSM8K-Complex,一組高難度數學題庫(500 題,每題至少 4 個運算步驟),測試了三款模型:DeepSeek(強)、Claude(中)、GPT-3.5(弱)。結果如下:

  • DeepSeek(94% 準確率):內在修正率只有 16.7%
  • GPT-3.5(66% 準確率):內在修正率 26.8%
  • Claude(70% 準確率):內在修正率 29.1%

最需要修正的模型(因為它犯最多錯),修正率反而是最強模型的 1.6 倍。這叫 Accuracy-Correction Paradox。

Error Depth Hypothesis:
強模型犯的錯更深

為什麼會這樣?論文分析了錯誤類型分佈,發現 GPT-3.5 高達 62% 的錯誤是純粹的計算失誤,像是數字加錯、乘錯,回頭檢查很容易發現。但 DeepSeek 的錯誤只有 22% 是計算錯,其餘 77% 是邏輯錯誤和題意理解錯誤,整個解題方向就有問題,或者CoT中藏了一個細微漏洞。這種錯連模型自己都很難抓出來。

這就是 Error Depth Hypothesis:

強模型並非比較不會修正錯誤,它會犯的錯本身就是比較難修的錯誤。
Paradox 的根源不在修正能力,在錯誤的本質。

偵測率與修正率脫鉤,提示反而有害

論文還有兩個關鍵發現。

第一:偵測率和修正率幾乎無關。

Claude 只能正確偵測 10% 的錯誤,但直接要求它修正時,成功率反而有 29%,它擁有修正自己沒發現錯誤的能力。GPT-3.5 偵測率高達 82%,但修正率只有 27%。

第二:過度聚焦

當研究人員讓模型自己定位錯誤在哪一步,然後把這個資訊當提示餵回去時,所有模型的修正率都下降了(GPT-3.5 從 26.8% 掉到 15.5%,Claude 從 29.1% 掉到 12.8%)。被引導到特定步驟後,模型會過度聚焦在那裡,反而忽略了其他地方可能也有錯。

迭代反思:雙面刃

迭代反思(反覆檢查多輪)對偵測弱的模型幫助最大,Claude 從 29% 提升到三輪後的 61%,GPT-3.5 提升到 68%。但 Snorkel AI 隨後發現一個嚴重問題,對簡單任務(準確率 ≥75%),迭代五輪讓準確率從 98.1% 掉到 56.9%;對困難任務(<35%)才有效。簡單任務上模型會為了找錯而幻想出錯誤,稱為「腐蝕性批評(corrosive critique)」。

叫更強的模型來審查呢?

如果問題不在「自己修自己」,那換一個更強的模型來 review 呢?CMU 團隊在 2026 年四月用一個精巧的四條件實驗回答了這個問題。

他們設計了四個條件:

  • x₁ 弱模型直接回答(基準線)
  • x₂ 強模型 review 弱模型真實草稿(你以為的效果)
  • x₃ 強模型直接回答不看草稿(強模型自己多強)
  • x₄ 強模型收到語意空白的格式殼(review 框架的效益)。

然後把 x₂ 的增益拆成三塊:Re-solving(強模型自己做,跟草稿無關)、Scaffold(框架效益)、Content(弱模型草稿的實際貢獻)。

在往下看之前,你認為表現應該如何?

在選擇題任務(GPQA Diamond、Humanity's Last Exam)上,content effect 完全不顯著,強模型根本沒有在看弱模型的推理,它只是自己重做了一遍。反而直接問強模型還比標準審查流程高(89.9% vs 87.4%)。

在程式碼任務(LiveCodeBench,1054 題競賽級題目)上更極端。weak-draft content 顯著為負(−3.1pp ∼ −7.9pp)。強模型收到空殼 scaffold 時表現最好(87%),收到弱模型寫的真實程式碼時反而更差(83.9%)。問題越難,content 傷害越大,從 Easy 的 −0.6pp 一路掉到 Hard 的 −5.1pp。

原因在於程式碼是逐步展開的成品,不是抽象推理。當弱模型寫了一個脆弱的 parser 或錯誤的邊界處理,強模型在 review 時會被卡在那個區域性的實作細節裡(artifact-level anchoring),很難跳出重來。空殼 scaffold 雖然沒有演算法邏輯,但提供了一個語法正確、形狀像程式碼的空物件,讓強模型進入「補完模式」而不是「修正模式」。

角色反轉實驗也證實了這點:

讓強模型寫草稿、弱 model 去 review,content effect 就翻正了。問題就在草稿品質。

FAQ

Q:那以後都不能叫 AI 檢查自己的答案了?

A:可以但有策略。簡單任務不要重複檢查;困難任務叫它「重新從頭思考」;如果找外部模型 review,先確認那個模型直接回答的表現。

Q:為什麼弱草稿對 code 有害、對選擇題沒差?

A:選擇題答案空間小,強模型可忽略弱推理直接猜;寫程式會被脆弱的實作細節卡住(artifact-level anchoring)。

Q:偵測和修正是同一回事嗎?

A:不是。Claude 只能抓到 10% 的錯誤但能修正 29%,GPT-3.5 抓到 82% 但只修正 27%。兩者完全獨立。

Q:叫 AI 修改多次會不會越來越準?

A:視任務難度。簡單任務迭代大幅衰退(98.1% → 56.9%);困難任務前幾次有效但邊際效益遞減。先小規模測試看看趨勢。

結語

自我修正不是一個預設有用的功能。第二遍的增益主要來自模型自身能力,而不是「修正」這個動作的價值。
  1. 簡單任務不要迭代。準確率高的任務迭代只會引發腐蝕性批評。
  2. 叫它「重新思考」而不是「檢查錯誤」。給定位提示反而降低修正率。
  3. 不要讓強 model review 弱 model 的程式碼。弱草稿的 content 有害,空殼 scaffold 都比真實爛程式碼好。
  4. 對選擇題直接問最強的模型就好。review 流程不會比直接回答更好,還有 chance 把對的改錯。
  5. 外部驗證永遠比內在修正可靠。能跑程式碼就跑,能查資料庫就查,不要讓 AI 空轉。
    #LLM#方格創作島#ChatGPT#AI#論文#Prompt#模型#2026年#Gemini#方格新手
資工系的Leo-avatar-img
資工系的Leo和其他 3 人喜歡這篇
小小贊助,大大鼓勵!!小小贊助,大大鼓勵!!
留言
avatar-img


留言分享你的想法!
上一篇
AI 為什麼寧可亂猜,也不肯老實說「我不知道」?
下一篇
你越篤定,AI 越附和你?用「問句」取代「主張」就能打破諂媚
avatar-img
來自資工系的創作園地
16會員
28內容數
你好,我是正在就讀國立資工系的大學生,在這裡可以帶技術小白的你,使用下課或是下班的時間,了解世界的AI趨勢
來自資工系的創作園地的其他內容
2026/07/01
AI 為什麼寧可亂猜,也不肯老實說「我不知道」?
許多人疑惑,為何 AI 總愛掰答案,即使面對不確定的問題也一本正經地胡說八道?一篇 OpenAI 的研究揭示,這並非模型缺陷,而是現行的訓練與評測機制,獎勵猜答案而非承認未知。本文將深入解析 AI 寧可亂猜的根源,探討評測方式的結構性問題,以及這對我們理解 AI、甚至選擇 AI 模型所帶來的啟示。
Thumbnail
2026/07/01
AI 為什麼寧可亂猜,也不肯老實說「我不知道」?
許多人疑惑,為何 AI 總愛掰答案,即使面對不確定的問題也一本正經地胡說八道?一篇 OpenAI 的研究揭示,這並非模型缺陷,而是現行的訓練與評測機制,獎勵猜答案而非承認未知。本文將深入解析 AI 寧可亂猜的根源,探討評測方式的結構性問題,以及這對我們理解 AI、甚至選擇 AI 模型所帶來的啟示。
Thumbnail
2026/06/25
AI 的思考過程可以相信嗎?拆解 Chain-of-Thought 為什麼有用、什麼時候在騙你
CoT是 AI 推理模型的核心,但多篇研究指出,CoT 經常只是「看起來」像在推理,實際上模型可能早就繞過思考過程直接偷看答案。這篇文章從 2022 年到 2026 年的六篇關鍵論文,帶你看懂 CoT 為什麼有用、什麼時候會騙人,以及這對你的日常使用代表什麼。
Thumbnail
2026/06/25
AI 的思考過程可以相信嗎?拆解 Chain-of-Thought 為什麼有用、什麼時候在騙你
CoT是 AI 推理模型的核心,但多篇研究指出,CoT 經常只是「看起來」像在推理,實際上模型可能早就繞過思考過程直接偷看答案。這篇文章從 2022 年到 2026 年的六篇關鍵論文,帶你看懂 CoT 為什麼有用、什麼時候會騙人,以及這對你的日常使用代表什麼。
Thumbnail
2026/06/24
多個 AI Agent 怎麼一起工作?A2A 協定讓它們自己溝通
多個 AI Agent 怎麼合作?A2A 協定讓它們彼此發現、溝通、委派任務。說明 A2A 的核心機制與 MCP 的互補關係。
Thumbnail
2026/06/24
多個 AI Agent 怎麼一起工作?A2A 協定讓它們自己溝通
多個 AI Agent 怎麼合作?A2A 協定讓它們彼此發現、溝通、委派任務。說明 A2A 的核心機制與 MCP 的互補關係。
Thumbnail
看更多
#方格新手 的其他內容
Thumbnail
#方格新手 看過來!讓我們帶你上手
目前共 38286 篇
avatar-avatar
Somewhere between
一座沒有指針的鐘,等待簽證的人
avatar-avatar
原來如此
暑假不知道做什麼?也許,一個暑假的出走會讓你看見不同的自己
avatar-avatar
墨語|用文字表達心裡話
為什麼已讀不回?迴避型依戀解析:理解背後的 8 個原因與 4 種情境
你可能也想看
Thumbnail
avatar-avatar
陳奕潣的沙龍
把 Colab 變成你的 LLM API Server
把 Colab 包成 LLM API server:透過 vLLM 或 llama.cpp 啟動 OpenAI-compatible endpoint,搭配 Cloudflare Tunnel 對外存取,適合開發時快速測試 LLM app、agent workflow 或 SDK 串接。
#Agent#GoogleColab#AI工具
2026/06/13
Thumbnail
avatar-avatar
陳奕潣的沙龍
把 Colab 變成你的 LLM API Server
把 Colab 包成 LLM API server:透過 vLLM 或 llama.cpp 啟動 OpenAI-compatible endpoint,搭配 Cloudflare Tunnel 對外存取,適合開發時快速測試 LLM app、agent workflow 或 SDK 串接。
#Agent#GoogleColab#AI工具
2026/06/13
Thumbnail
avatar-avatar
AI 工程師的 LLM 筆記
LLM 為什麼突然開竅了?從「不能用」到「很好用」的轉變
也許大部分的人聽過甚至用過 ChatGPT ,也可能看過 DeepSeek 的崛起影響了世界等等的報導,但有沒有想過它們到底為什麼突然能派上用場?從早期只能補字的小模型,到如今能進行翻譯、推理甚至聊天,這篇針對「湧現能力」與「上下文學習」來說明LLM 從「不能用」到「很好用」的轉變。
#大型語言模型#LLM#EmergentAbilities
2025/08/18
Thumbnail
avatar-avatar
AI 工程師的 LLM 筆記
LLM 為什麼突然開竅了?從「不能用」到「很好用」的轉變
也許大部分的人聽過甚至用過 ChatGPT ,也可能看過 DeepSeek 的崛起影響了世界等等的報導,但有沒有想過它們到底為什麼突然能派上用場?從早期只能補字的小模型,到如今能進行翻譯、推理甚至聊天,這篇針對「湧現能力」與「上下文學習」來說明LLM 從「不能用」到「很好用」的轉變。
#大型語言模型#LLM#EmergentAbilities
2025/08/18
Thumbnail
avatar-avatar
Kyle的人文與科技
從 LLM 到人生:活出你的最佳路徑!
LLM 的 Beam Search 就像人生選擇:用有限資源保留多種可能,勇敢取捨與調整,才能走出屬於自己的最佳路徑。
#人生#資源#分數
2025/07/30
Thumbnail
avatar-avatar
Kyle的人文與科技
從 LLM 到人生:活出你的最佳路徑!
LLM 的 Beam Search 就像人生選擇:用有限資源保留多種可能,勇敢取捨與調整,才能走出屬於自己的最佳路徑。
#人生#資源#分數
2025/07/30
Thumbnail
avatar-avatar
RYAN爸爸理財誌
不再有AI幻覺的財經查詢網站-MM AI超強功能!
「不再有AI幻覺的查詢工具」 財經M平方是我最常使用的工具, 但現在居然推出了AI功能, 而且功能強大又詳實, 趕快來看看我的體驗!
#投資#查詢#數據
2026/06/30
Thumbnail
avatar-avatar
RYAN爸爸理財誌
不再有AI幻覺的財經查詢網站-MM AI超強功能!
「不再有AI幻覺的查詢工具」 財經M平方是我最常使用的工具, 但現在居然推出了AI功能, 而且功能強大又詳實, 趕快來看看我的體驗!
#投資#查詢#數據
2026/06/30
Thumbnail
avatar-avatar
方格子 vocus 官方沙龍
【不斷更新】主題活動懶人包:今天想寫什麼?找到你的賽道,讓創作被看見!
從社會時事、人氣 IP 作品、生活分享、議題辯論⋯⋯透過各種徵文活動,讓我們一起在vocus找到創作的靈感!主題徵文不僅可以呈現每位創作者獨一無二的想法,讓我們一起交流、深度挖掘內容,也大大提升被選入方格精選的機會,讓創作內容更容易被搜尋與看見!現在就讓我們一起看看進行中的主題徵文有哪些吧💗
#vocus#分享#創作
2026/01/23
Thumbnail
avatar-avatar
方格子 vocus 官方沙龍
【不斷更新】主題活動懶人包:今天想寫什麼?找到你的賽道,讓創作被看見!
從社會時事、人氣 IP 作品、生活分享、議題辯論⋯⋯透過各種徵文活動,讓我們一起在vocus找到創作的靈感!主題徵文不僅可以呈現每位創作者獨一無二的想法,讓我們一起交流、深度挖掘內容,也大大提升被選入方格精選的機會,讓創作內容更容易被搜尋與看見!現在就讓我們一起看看進行中的主題徵文有哪些吧💗
#vocus#分享#創作
2026/01/23
Thumbnail
avatar-avatar
李弘基的沙龍
🤖💻 AI日報 6.21:Fable 5禁令第9天、Shazeer轉戰OpenAI、SpaceX 600億收購Cur
5 分鐘閱讀 · AI系統架構師每日精選 關注方向: 代理安全 · AI人才戰爭 · AI程式設計生態
#方格新手#Agent#llm
2026/06/21
Thumbnail
avatar-avatar
李弘基的沙龍
🤖💻 AI日報 6.21:Fable 5禁令第9天、Shazeer轉戰OpenAI、SpaceX 600億收購Cur
5 分鐘閱讀 · AI系統架構師每日精選 關注方向: 代理安全 · AI人才戰爭 · AI程式設計生態
#方格新手#Agent#llm
2026/06/21
Thumbnail
avatar-avatar
李弘基的沙龍
💻 AI日報 6.22:Codex Record & Replay、AWS Agent服務、12個LLM發布
5 分鐘閱讀 · AI系統架構師每日精選 關注方向: AI編碼自動化 · 企業Agent基礎設施 · 模型格局變化
#Agent#llm#ai
2026/06/22
Thumbnail
avatar-avatar
李弘基的沙龍
💻 AI日報 6.22:Codex Record & Replay、AWS Agent服務、12個LLM發布
5 分鐘閱讀 · AI系統架構師每日精選 關注方向: AI編碼自動化 · 企業Agent基礎設施 · 模型格局變化
#Agent#llm#ai
2026/06/22
Thumbnail
avatar-avatar
釀電影,啜一口電影的美好。
釀藝評|瓦吉.穆阿瓦「血誓四部曲」:《海之邊》的葬送──直到憂鬱與幽靈變成空白的布幕
本文嘗試深入瓦吉.穆阿瓦「血誓四部曲」開卷,《海之邊》(Littoral)之文本核心,帶領讀者跟隨主角威弗里德與五位因戰亂受創的年輕人,踏上為亡父尋找安葬之地的海邊旅程,透過一場海邊的葬送,向著母親與海洋洄游的自我縫合。直到憂鬱與幽靈退去,生者與死者終能在空白的布幕上,重新承載並述說屬於自己的故事。
#釀電影#釀藝評#臺北藝術節
2026/06/11
Thumbnail
avatar-avatar
釀電影,啜一口電影的美好。
釀藝評|瓦吉.穆阿瓦「血誓四部曲」:《海之邊》的葬送──直到憂鬱與幽靈變成空白的布幕
本文嘗試深入瓦吉.穆阿瓦「血誓四部曲」開卷,《海之邊》(Littoral)之文本核心,帶領讀者跟隨主角威弗里德與五位因戰亂受創的年輕人,踏上為亡父尋找安葬之地的海邊旅程,透過一場海邊的葬送,向著母親與海洋洄游的自我縫合。直到憂鬱與幽靈退去,生者與死者終能在空白的布幕上,重新承載並述說屬於自己的故事。
#釀電影#釀藝評#臺北藝術節
2026/06/11
Thumbnail
avatar-avatar
李弘基的沙龍
AI 做的東西太醜?Taste開源專案正在教它什麼是「品味」
你有沒有發現,讓 AI 生成的網頁和應用,看起來總像「同一個媽生的」?深色背景、紫色漸層、三張並列卡片、Inter 字型……這不是你的錯覺。這是一個開源專案試圖解決的問題。它叫 Taste Skill,正在教 AI 什麼是真正的設計品味。
#方格新手#llm#設計
2026/06/27
Thumbnail
avatar-avatar
李弘基的沙龍
AI 做的東西太醜?Taste開源專案正在教它什麼是「品味」
你有沒有發現,讓 AI 生成的網頁和應用,看起來總像「同一個媽生的」?深色背景、紫色漸層、三張並列卡片、Inter 字型……這不是你的錯覺。這是一個開源專案試圖解決的問題。它叫 Taste Skill,正在教 AI 什麼是真正的設計品味。
#方格新手#llm#設計
2026/06/27
Thumbnail
avatar-avatar
李弘基的沙龍
🤖💻 AI日報 6.20:DeepMind人才流失、AA-Briefcase基準、OpenAI收購Astral
AI人才戰白熱化:Transformer論文合著者Noam Shazeer和AlphaFold諾獎得主John Jumper在48小時內先後離開Google DeepMind投奔競對。 新基準測試AA-Briefcase顯示,Claude Fable 5在真實知識工作中僅能解決3%的任務。
#llm#Anthropic#Agent
2026/06/20
Thumbnail
avatar-avatar
李弘基的沙龍
🤖💻 AI日報 6.20:DeepMind人才流失、AA-Briefcase基準、OpenAI收購Astral
AI人才戰白熱化:Transformer論文合著者Noam Shazeer和AlphaFold諾獎得主John Jumper在48小時內先後離開Google DeepMind投奔競對。 新基準測試AA-Briefcase顯示,Claude Fable 5在真實知識工作中僅能解決3%的任務。
#llm#Anthropic#Agent
2026/06/20
Thumbnail
avatar-avatar
小人物職場
如果你有頭期款,是該買房還是買股 ?
買房新手總是面對許多疑惑,面對房價高漲、利率變動、或是股市近期創新高,究竟該何時出手?本文提供簡易判斷表,並透過「財經M平方」的四個總體經濟指標,分析市場價格、供給需求、負擔能力及政策資金環境,協助你做出更明智的投資決策。
#財經M平方#投資#國際
2026/07/01
Thumbnail
avatar-avatar
小人物職場
如果你有頭期款,是該買房還是買股 ?
買房新手總是面對許多疑惑,面對房價高漲、利率變動、或是股市近期創新高,究竟該何時出手?本文提供簡易判斷表,並透過「財經M平方」的四個總體經濟指標,分析市場價格、供給需求、負擔能力及政策資金環境,協助你做出更明智的投資決策。
#財經M平方#投資#國際
2026/07/01
Thumbnail
avatar-avatar
英特來糗
淺談大型語言模型(LLM)原理:從原理到訓練解析
本文以淺顯易懂的問答方式,解釋大型語言模型(LLM)的原理、訓練過程及相關概念,例如預訓練、監督式學習、增強式學習、對齊等。內容主要參考臺大李宏毅教授的 YouTube 課程,並加入個人理解與說明。
#科技#AI#人工智慧
2025/04/07
Thumbnail
avatar-avatar
英特來糗
淺談大型語言模型(LLM)原理:從原理到訓練解析
本文以淺顯易懂的問答方式,解釋大型語言模型(LLM)的原理、訓練過程及相關概念,例如預訓練、監督式學習、增強式學習、對齊等。內容主要參考臺大李宏毅教授的 YouTube 課程,並加入個人理解與說明。
#科技#AI#人工智慧
2025/04/07
追蹤感興趣的內容從 Google News 追蹤更多 vocus 的最新精選內容追蹤 Google News
With love fromLogoImage
在 App 內開啟自由調整字體大小

不想錯過來自資工系的創作園地的內容?註冊會員,進一步互動並接收最新通知
來自資工系的創作園地你好,我是正在就讀國立資工系的大學生,在這裡可以帶技術小白的你,使用下課或是下班的時間,了解世界的AI趨勢
或以 Email 註冊
註冊即表示您同意 服務條款 與 隱私權政策
已經有帳號?登入