AI泡沫真正的危機:不是AI沒用,而是它看起來像會思考,卻可能把錯誤放大到全世界

Written by

·

AI 泡沫真正危險的地方,可能不是人工智慧最後被證明「沒有用」,而是市場把一種非常強大的軟體工具,誤認成了一個會思考、會記憶、會自我修正,甚至可以取代完整人類員工的「新智慧」。

這兩件事差非常多。

今天的生成式 AI 確實能寫文章、整理資料、翻譯、寫程式、做摘要、查詢文件、產生圖片,甚至處理以前要操作十幾個軟體才能完成的工作。這些都是真實的技術進步。

但「能產生像答案的東西」,和「能可靠地知道答案是不是對的」,是兩種完全不同的能力。

AI 最大的危險,不一定是它太聰明;而是它非常擅長讓人以為它真的知道自己在做什麼。

AI泡沫不是AI沒用,而是市場高估了它是什麼

談「AI泡沫」時,最容易犯的錯,是把問題簡化成兩個極端:

  • AI會徹底改變世界,所以現在所有投資都合理。
  • AI會泡沫化,所以AI根本沒有價值。

其實這兩句都可能錯。

網路泡沫破裂,不代表網路沒有價值;鐵路泡沫破裂,也不代表鐵路沒有改變世界。泡沫真正代表的是:市場對未來收益的期待,跑得比技術真正能產生的經濟價值還快。

AI現在面臨的最大風險正是如此。企業與資本市場正在用「取代大量知識工作者」、「一個人變十個人」、「幾乎所有工作都能被Agent自動完成」的故事,替極高的晶片、資料中心、能源、債務與估值支出合理化。

但這個故事成立,需要一個非常重要的前提:

AI不只要能做事,還必須能可靠地知道自己有沒有做錯。

而這正是今天主流大型語言模型最不穩定的地方。

AI到底會不會思考?真正問題是它缺乏可靠的自我校正

說「AI完全不會思考」在哲學上很容易陷入文字戰。因為現代推理模型確實能進行多步推導、規劃、程式除錯、數學證明與工具操作。若把「思考」定義得非常寬,它當然具有某些類似推理的行為。

但對企業與使用者真正重要的,不是哲學上要不要把它叫做思考,而是:

  • 它是否知道自己不知道?
  • 它是否能穩定辨識自己剛才推理錯了?
  • 被糾正一次後,下一次是否能可靠避免相同錯誤?
  • 它是否有持續的工作記憶,知道上星期、昨天、十分鐘前為什麼失敗?
  • 當資料互相衝突時,它是否知道哪一項需要重新查證?

在這些真正決定「可不可以把工作交出去」的能力上,現有AI仍然非常不穩定。

Stanford 2025 AI Index 直接指出,即使鏈式推理與test-time compute大幅提升模型表現,複雜推理仍然是問題。模型對算術、規劃及存在可證明正確答案的邏輯問題,仍無法可靠解決,這會直接限制它在高風險用途上的可信度。

會奧數卻可能不會看時間:AI的鋸齒型智能

AI最反直覺的特性之一,是它的能力不是像人的考試分數那樣平滑增加。

Stanford 2026 AI Index 特別用 jagged intelligence(鋸齒型智能) 描述這個現象:最先進模型已經能在國際數學奧林匹亞競賽等級的問題取得金牌級成績,卻仍可能無法可靠地完成「看時間」這種一般人認為遠比奧數簡單的工作。

這件事情對企業非常致命。

因為人的直覺會認為:如果一個人會做極難的數學,那他應該也能完成更簡單的日期判斷、條件比較、流程檢查與資料一致性驗證。

但AI不是這樣。

AI不是「總體70分」;而可能是某一題99分、隔壁一題20分,而且你事前不知道哪一題會突然掉到20分。

這才是真正危險的地方。

最危險的錯誤:AI不知道自己錯了

一個能力只有70分的人,和一個準確率70%的AI,不是一回事。

人類員工往往具備一個極其重要、卻很容易被忽略的能力:不確定感。

他可能知道:「這不是我的專業」、「這個數字怪怪的」、「我沒找到那份文件」、「這個地址好像不合理」、「這一筆帳我需要問財務」。

AI最大的問題,並不是它永遠錯,而是它經常可以在錯的情況下,仍然用非常完整、非常流暢、非常有自信的語氣繼續完成任務。

Stanford 2026 AI Index 整理的一項新準確性測試甚至顯示,26個頂尖模型的幻覺率範圍可從 22%一路到94%。同一類模型在錯誤資訊以不同方式呈現時,準確率甚至可能大幅崩落。

真正可怕的不是「AI答錯一題」。真正可怕的是:

  • 它找不到資料,卻認為搜尋已完成。
  • 它漏掉關鍵條件,卻認為流程已驗證。
  • 它把A公司的資料套到B公司,卻繼續寫出完整報告。
  • 它引用了次要來源,卻忽略更直接的官方資料。
  • 它在第一步犯錯,後面十步全部建立在錯誤前提上。

很多問題直到最後結果「爆炸」時,人類才發現前面早就錯了。

辦公室裡大型 AI 泡泡出現裂痕,多個螢幕顯示錯誤警告,象徵 AI 錯誤與驗證成本

為什麼AI可以把同一個錯誤犯幾十次、幾百次

人類學習的一個重要特徵,是錯誤會逐漸變成經驗。

一個員工如果因為「日期格式轉錯」被主管罵過三次,他通常會形成長期心理標記:以後遇到這類資料要特別注意。

但大型語言模型本身沒有天然、持續、可靠的個人工作記憶。模型參數不是因為你今天糾正一次,就立刻永久更新;新的對話、Agent執行或context重新建立後,過去的錯誤經驗必須另外被重新提供。

因此,AI很容易出現一種對人而言極度荒謬的現象:

明明昨天才被指出同一個錯,今天又犯;再提醒一次,下一輪又犯。

這不必然代表模型「故意不聽」,而是因為它的運作方式本來就不像一名具備持續人生經驗的員工。

MD、RAG、向量資料庫:為什麼「AI記憶術」沒有解決核心問題

所以現在很多人開始教各種「讓AI有記憶」的方法:

  • 把規則寫進MD。
  • 建立system prompt。
  • 建立memory檔案。
  • 把舊對話丟進向量資料庫。
  • 使用RAG。
  • 建立Skill或Agent instruction。
  • 每次任務前要求AI讀取規則。

這些方法不是沒有用,而是它們解決的是「資訊保存與重新提供」問題,不是把模型變成真正擁有持續記憶、自我反省與責任感的思考者。

一個最簡單的現實是:

資料存在 ≠ AI有檢索到。
檢索到 ≠ 有真正使用。
使用了 ≠ 正確理解。
理解了 ≠ 一定遵守。
這次遵守 ≠ 下一次仍然遵守。

2024年一篇整理RAG工程問題的研究,直接列出七類常見失敗點,包括檢索不到正確內容、找錯文件、context不足或過量,以及LLM即使拿到資料仍無法正確回答。另一篇Mindful-RAG研究同樣指出:即使外部知識圖譜中已經包含必要事實,LLM仍可能因為沒有抓對問題意圖與上下文而答錯。

更現實的是,任何商用AI都不能每一次任務把使用者過去所有檔案、所有聊天、所有規則全部重新讀一遍。那會帶來巨大的token成本、延遲與context污染。

所以真正的系統一定會做選擇:要讀哪些、不讀哪些、抓幾筆、壓縮多少、要不要重新查詢。

也就是說,「記憶」本身又變成另一個可能出錯的AI流程。

AI不一定是助手:驗證成本可能吃掉生產力

很多AI商業故事都用一句很漂亮的話:

「AI不是取代你,而是使用AI的人會取代你。」

這句話在某些工作成立,但不能當成普遍定律。

因為真正的工作成本,不是只有「生成一個答案需要幾分鐘」,還包括:

  • 檢查來源。
  • 核對數字。
  • 確認有沒有漏條件。
  • 驗證AI是否讀到正確文件。
  • 重新跑計算。
  • 找出AI是否把兩個概念混在一起。
  • 確認結論沒有建立在錯誤前提上。

對一般寫作、摘要、腦力激盪、格式轉換來說,這些成本可能很低,所以AI帶來巨大效益。

但對分析、財務、法務、採購、客服、醫療、工程與任何「錯一個關鍵條件就可能讓整件事失效」的工作而言,驗證成本可能非常高。

甚至會出現一個非常荒謬的流程:

  1. AI用30秒完成一份分析。
  2. 員工花20分鐘確認AI到底用了哪些資料。
  3. 再花20分鐘找出一個錯誤前提。
  4. 要求AI重做。
  5. AI修掉A錯誤,卻又產生B錯誤。
  6. 最後員工乾脆自己重新做一遍。

如果這種情況大量存在,「AI幫你省時間」就會變成一個極度依賴工作類型的命題,而不是必然發生的事。

企業最大的誤判:70分AI不會自然變成100分員工

企業最容易犯的錯,不是認為AI現在只有70分,而是認為:

「只要模型再進步一點,70分的AI工具就會慢慢變成100分的員工。」

但AI與員工的差距,不只是20分、30分的準確率差距,而是錯誤結構完全不同。

Harvard Business School與BCG針對758名顧問進行的實驗,就是一個非常好的例子。在AI能力範圍內的創意任務上,使用GPT-4的人速度提升超過25%,成果品質提升超過40%;但在AI能力邊界之外的商業問題分析上,使用AI的人反而表現更差。

BCG公布的結果甚至顯示,處理不適合AI的商業問題時,使用者表現比完全不用AI的人低約23%。而且即使事前已經提醒受試者AI可能在這種問題上推理錯誤,很多人仍然會接受AI給出的誤導答案。

這正是AI的危險:

不是AI永遠只有70分,而是你不知道今天這個任務,它到底是95分、70分還是突然只剩20分。

企業若把這種工具直接當成員工,最後可能不是:

AI做70%,人補30%。

而是:

AI先做100%,人類再重新檢查這100%到底有多少是真的。

搜尋系統加入AI之後,還會出現另一個容易被忽略的問題:AI不只是「幫你找答案」,它開始替你決定哪些資料值得被看見。

傳統搜尋比較像:

A、B、C、D四個結果放在你面前,由人自己判斷。

AI搜尋則愈來愈像:

「我幫你判斷了,答案應該是B。」

問題是,如果B本來就是錯的,AI不只提供錯誤資訊,還可能讓真正正確的A、C、D被埋到使用者根本不會看到的位置。

Google自己也一直在處理Maps上的錯誤商家資料。Google公布,2025年就阻擋了約7,900萬次不準確或未驗證的Business Profile修改,並移除超過1,300萬個虛假商家檔案。

這不能直接證明「Google Maps是因為AI才變差」,但它證明了一件更重要的事:地點資料本身就是一個高度混亂、會被誤標、會被惡意修改的資料環境。

當AI再多加一層自動理解、分類與摘要,使用者就更依賴演算法替自己判斷「這個地方到底是什麼」。搜尋加油站卻跑出機車行、正確地點被錯誤商家資訊蓋掉,這類錯誤對一般人而言可能幾秒就能從常識判斷不合理,但自動系統卻可能照樣排序、推薦與傳播。

這也是生成式搜尋與AI助手共同的風險:找不到資料時,它未必停下來;它可能直接在不完整資料上做完結論。

客服導入AI為什麼特別危險

客服是企業最喜歡自動化的領域之一,因為問題重複、文字量大,看起來非常適合LLM。

但客服同時也是AI錯誤最容易直接傷害消費者的地方。

如果客服AI把退貨規則講錯、把退款期限講錯、把保固條款套錯商品、把A客戶資料混到B客戶,真正承擔後果的不是模型,而是企業。

於是企業最後通常仍要設置:

  • 知識庫維護。
  • 人工抽查。
  • 高風險問題轉人工。
  • 錯誤回報。
  • 政策更新後重新測試。
  • 客服對AI答案再次確認。

如果客服人員最後仍必須重新檢查AI答案,那麼AI不一定是「少一個客服」,更可能變成「每個客服旁邊多了一個需要監督、卻會講得很有自信的實習生」。

未來可能不是更聰明的世界,而是更多錯誤的AI世界

大部分AI敘事,都把未來描述成一條單向上升的曲線:

AI愈來愈聰明 → 自動化更多工作 → 生產力爆炸 → 世界變得更有效率。

但另一種未來同樣可能發生:

  1. 企業大量使用AI產生內容。
  2. 搜尋引擎開始讀取更多AI生成資料。
  3. 下一代AI再從這些內容摘要與回答。
  4. 錯誤資料被重新改寫成新的「答案」。
  5. Agent把錯誤答案直接寫進CRM、報告、文件與決策流程。
  6. 人類因為自動化程度提高,反而更晚才看到錯誤。

最後形成的不是「超智慧世界」,而可能是:

超大量、超快速、超有自信的錯誤世界。

以前一名員工一天可能犯三個錯。

一個Agent可以在幾分鐘內執行幾十個動作。這代表它也可以把同一個錯誤在幾分鐘內複製到幾十個地方。

傳統軟體最重要的優點之一,是規則通常是確定的。程式寫成「符合A條件就執行B」,它只要沒有bug,明天通常還是照樣執行。

LLM則是機率系統。真正危險的並不是「它有5%錯誤率」,而是:

你不知道那5%會在哪一天、哪一個步驟、哪一個客戶、哪一個數字上突然出現。

AI可以上戰場,但不能替人類承擔責任

有人會說:AI已經可以控制無人機、分析衛星影像、辨識目標、做軍事規劃,怎麼能說它只是一個工具?

正因如此,戰場反而最能說明AI的真正邊界。

AI可以幫你:

  • 導航。
  • 辨識影像。
  • 追蹤目標。
  • 整合情報。
  • 控制無人載具。
  • 建議可能的攻擊選項。

但「這個人到底是不是平民」、「情報是否足夠可靠」、「這一擊是否符合比例原則」、「錯殺後誰負責」,不是一句機率最高的答案就能結束。

AI不會因為錯殺平民坐牢,也不會向家屬道歉,不會被撤職,不會承擔政治責任。

因此AI可以操作戰爭工具,但它無法成為人類社會真正的責任主體。

AI真正最可能取代的,首先是軟體,不是人類本身

如果把所有「AI像人」的宣傳拿掉,今天AI最確定、最巨大、也最有價值的革命,其實可能非常單純:

AI正在成為所有軟體上面的一層自然語言介面。

以前要學:

  • Excel函數。
  • SQL語法。
  • Photoshop介面。
  • CRM操作。
  • BI報表。
  • ERP功能。
  • 搜尋語法。
  • 各種自動化工具。

未來可能只要說:

「把上個月所有退貨客戶找出來,按照原因分類,畫成圖表,再寄給主管。」

AI真正強大的地方,是把「人必須學會怎麼操作軟體」,變成「人只要告訴軟體自己要什麼」。

這會對SaaS、搜尋、BI、文書、設計工具、客服系統與大量工作流程軟體造成巨大衝擊。

這當然是一場大革命。

但「取代一大堆軟體介面」和「取代完整人類員工」,根本不是同一個命題。

如果AI最後最大的歷史意義,是把傳統軟體全面重新做一遍,那會創造巨大價值,但可能遠低於今天某些市場敘事所期待的「幾乎所有白領工作都將自動化」。

當7,250億美元資本支出追逐一個仍不可靠的系統

這也是為什麼AI泡沫問題不能只談模型能力,還必須談錢。

Reuters 2026年8月報導,Google、Microsoft、Meta等主要hyperscaler的AI相關基礎建設支出,2026年預計合計達約7,250億美元

同一時間,美國科技企業為AI基礎建設大量發債。Reuters另一篇報導指出,2026年AI相關企業債發行量已達約2,200億美元,相較前一年約125億美元大幅增加,債券投資人也開始要求更高的風險補償。

這些投資不代表泡沫必然破裂。AI雲端、晶片與資料中心確實有真實需求,甚至目前部分市場仍供不應求。

真正要問的是:

AI最後創造的可持續利潤,是否足以支撐今天這種等級的資本支出、債務與估值?

如果企業最後發現:AI確實能讓軟體更好用,卻沒有辦法像預期那樣大規模取代員工;每個高風險流程仍然需要人類審核;每個Agent仍需要測試、監控與例外處理,那生產力提升仍然存在,但可能沒有資本市場故事講得那麼巨大。

結論:AI革命是真的,AI泡沫也可以同時是真的

AI真正的危險不是「完全沒有能力」。

恰恰相反,它就是因為能力太強、語言太自然、結果太像人類作品,才讓人更容易忘記它真正的限制。

人類會把:

  • 語言流暢,誤認成真正理解。
  • 一次成功,誤認成穩定能力。
  • 外部資料庫,誤認成真正記憶。
  • 多步推理,誤認成可靠自我檢查。
  • 自動執行,誤認成可以承擔責任。

而企業再把這些誤解乘上資料中心、GPU、電力、公司估值與數千億美元資本支出。

AI泡沫真正可能爆炸的原因,不是AI毫無價值,而是市場把「更好的軟體工具」估值成了「新的智慧物種」。

AI未來也許真的會讓一個人完成以前兩三個人的工作。

但另一個同樣值得警惕的未來是:

一個人加AI,可以做更多事情,同時也必須處理以前根本不存在的大量AI錯誤。

如果AI最後證明自己最擅長的是取代軟體介面、加速重複工作、降低操作門檻,而不是可靠取代人類的判斷、記憶、自省與責任,那麼:

AI革命仍然是真的。

但AI產業今天的估值與想像,也完全可能同時是一個巨大的泡沫。

資料來源

  1. Stanford HAI:2026 AI Index-Responsible AI(26個頂尖模型幻覺率、AI事故與治理)
  2. Stanford HAI:2026 AI Index-Technical Performance(jagged intelligence、模型評測)
  3. Stanford HAI:2025 AI Index-Technical Performance(複雜推理、規劃與高風險應用限制)
  4. BCG:How People Can Create—and Destroy—Value with Generative AI(758名顧問實驗、能力邊界內外的生產力差異)
  5. Harvard Business School AI Institute:Navigating the Jagged Technological Frontier
  6. Barnett et al.:Seven Failure Points When Engineering a Retrieval Augmented Generation System
  7. Agrawal et al.:Mindful-RAG: A Study of Points of Failure in Retrieval Augmented Generation
  8. Google:New ways we’re protecting businesses on Maps(Maps商家資料錯誤與詐騙防治規模)
  9. Reuters:Europe AI data centres seek cheaper, quicker energy and land(2026 hyperscaler AI基礎建設支出)
  10. Reuters:US corporate AI debt surge tests investor limits as fatigue emerges(AI企業債與投資人風險承受度)

發表迴響

探索更多來自 ReKnowledge元點知識 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀