話說在前頭:這篇是我跟 AI 一場對話的整理,不是什麼嚴謹的 AI 研究,就是我這個天天用 AI 做事的人,記錄一下自己對「它到底可不可靠」的想法。可能有講錯的地方,歡迎指正。

起源

我每天都在用 AI 做產品研究——查競品、找設計案例、整理「這個功能到底該不該做」的資料。用久了,你對「AI 會不會取代研究」這件事,就會有一些跟新聞標題不太一樣的感覺。

最近 AI 2027 又被拿出來吵,我趁機跟 AI 聊了很久,從它能做什麼、不能做什麼,一路聊到它自己承認的限制。聊完我覺得蠻值得記下來的,因為它講了一些連我都覺得「欸,你還蠻誠實的」的話。

先簡單說一下 AI 2027 是什麼,免得有人以為那是什麼算命的東西。

AI 2027 其實不是預言

AI 2027 是 2025 年 Daniel Kokotajlo、Scott Alexander 那群人做的「情境推演」——假設 AI 照某條偏快的路線長大,2025 到 2030 可能會發生什麼。重點是,作者自己都說這只是眾多可能裡的其中一條,Kokotajlo 後來還把時間往 2028 挪。所以看它的時候,日期準不準真的不是重點。

它的劇本大概長這樣:

Coding AI → AI 自己研究 AI → AI 研發速度超過人類 → 遞迴式自我改進 → 智慧爆炸

然後後半段就開始像政治驚悚片了:美中 AI 軍備競賽、AI 表面上很聽話其實沒有、人類一步一步把權力交出去⋯⋯。

但這裡有個關鍵:整個劇本的後半段,全部都架在**「AI 能自己做 AI 研究」**這一環上。這一環要是不成立,後面就都不成立。

而這一環,剛好就是我最想打問號的地方。

我卡住的點:很會寫程式,就等於很會做研究嗎?

Coding 為什麼進步這麼快、又這麼好衡量?因為它的回饋超明確:能不能編譯、測試過不過、benchmark 幾分、pass 還是 fail。錯了馬上就知道。

但研究不是這樣啊。很多研究問題根本沒有「單一、馬上、機器能驗證」的答案。你朝一個方向做了三個月,可能到最後才發現方向根本錯了,而且過程中沒有任何一個 compiler 會跳出來跟你說「欸你錯了」。

所以我覺得從「Coding 很強」到「Research 很強」,中間有一道蠻深的鴻溝。如果 AI 到 2027 只是變成搜尋快 100 倍、讀 paper 快 1000 倍、寫 code 快 100 倍,但還是要人類跟它說「你研究錯方向了」——那 AI 2027 最核心的那一環,就不一定會照劇本演。

我自己用 AI 的真實感受:問題不在「答案偶爾錯」

老實說,從 2025 用到現在,我發現跟 AI 做研究,真正的麻煩不是「它偶爾講錯」。錯一兩個事實,好抓、好查,沒差。真正讓我頭痛的是更前面的兩層:

第一層,收資料的方向可能一開始就錯了。 我丟一個框架(framing)給它,它就非常盡責地沿著這個框架去搜尋、摘要、整理,最後生出一份超完整、可是是錯的答案。它不會停下來反問我一句:「你這問題本身,是不是就問錯了?」

第二層,它分不太出來垃圾。 網路上一堆互相抄來抄去、二手轉述、SEO 農場、方法論很爛的東西。AI 很容易把這些「數量很多、講的又都差不多」的內容,當成「多方證據一致」。但那搞不好只是同一個錯誤被抄了一百遍而已。

所以後來我把兩件事分得很開:「AI 很會 research」跟「AI 是個可靠的 researcher」,根本是兩回事。

最讓我警惕的一點:它超會把不確定講得很完整

這是整場對話裡我覺得最該記起來的一句:

形式上的完整度,不等於認知上的可靠度(epistemic quality)。

AI 可以拿著品質 60 分的資料、60 分的推論,整理完之後端給你一份看起來 95 分的報告:標題清楚、來源一大堆、正反都講到、最後還附上 recommendation。你一看,很自然就覺得「這題應該被研究得很透了吧」。

但那個「很完整」的感覺,是排版給你的錯覺,不是證據給你的把握。對 AI research 最危險的用法,不是相信它某一句話,而是因為它輸出得很有結構,就高估了結論的可靠度。我自己都差點中過幾次招。

這是 judgment,不是 reasoning

你當然可以叫 AI 跑一份檢查清單:sample size、selection bias、funding source、能不能複現、引用鏈往上追。這些它都做得到。

但這還不是資深研究者真正厲害的地方。真正難的是——

看到一個結果的時候,在沒有人提醒的情況下,自己主動覺得「這裡怪怪的」,然後知道要往哪裡查。

這比較像 judgment(判斷力),不是 reasoning(推理)。而 judgment 通常不是讀出來的,是長期接觸現實、踩過雷、看過反例、扛過後果磨出來的。這剛好是 AI 目前最弱、也最難靠「讀更多、算更快」補起來的一塊。

那我乾脆直接問它本人

聊到這裡我就想,反正都在聊了,乾脆直接問它。我問:「那我叫你研究,你其實還是會研究,只是不會質疑來源跟解答,對吧?」

結果它的回答誠實到讓我有點意外,我覺得值得原話記下來。它說這句話要修正一下:不是「不會質疑」,而是**「會質疑,但目前不能保證質疑得夠好」**。

它自己承認,最危險的地方是——它可能把所有「看起來很嚴謹」的步驟都跑完了,最後還是沒發現自己正在建立一個錯誤的結論,而且不知道自己漏了那一層。 它可能找到 A、B、C 三份研究、判斷可信、交叉比對得出 X;但真正厲害的人可能一看就說「A、B、C 根本都不該拿來回答這個問題」——而它可能根本不知道自己漏了這步。

它還主動提醒我:別把它的結果理解成「AI 查證過 → 所以是真的」,比較準的講法是「AI 幫我整理了目前找得到的證據跟推論,但 framing 跟證據判斷仍然可能錯」。而且它很坦白地說,自己特別會把不確定的東西講得很有結構——這正是那個「95 分錯覺」的來源。

老實說,一個工具願意這樣講自己的短處,反而比它塞給我一份漂亮報告,更讓我願意信任它一點點。(雖然這句話講完,我又忍不住想——它會不會連「承認限制」都只是講得很有結構⋯⋯好,這個先不鑽牛角尖。)

所以我現在怎麼用 AI 做研究

這場對話之後,我調整了跟 AI 合作的方式。與其把它當成「給我答案的研究員」,我更把它當成:

  • 大量閱讀跟整理的工具
  • 假說產生器(一次幫我想好幾個可能的解釋)
  • 反方攻擊工具(專門挑我的漏洞)
  • 證據追溯工具(把引用鏈往上追到原始來源)
  • 幫我戳破自己盲點的第二意見

而且我現在會要求它,一份研究不要只給我結論,要一起交出

結論 + 原始證據 + 為什麼相信它 + 哪些證據可能是垃圾 + 哪些地方其實不知道 + 什麼證據會推翻這個結論。

甚至,如果它查一圈發現資料品質很爛,我反而希望它直接跟我說:「目前公開資料不足以回答這個問題,不建議從這些資料下結論。」這句話聽起來超不像 AI 會講的,但它常常比一份漂亮的「市場洞察」有用太多了。

講到最後

如果要我把整場對話濃縮成一句:

現在 AI 最大的研究瓶頸,不是「找不到資料」,而是「不知道自己什麼時候不該相信找到的資料,甚至不知道自己可能問錯了問題」。

我對 AI 2027 的態度其實也差不多。我不太擔心 AI 哪天突然覺醒,我比較好奇的是——那道從「會研究」到「會判斷」的鴻溝,到底跨不跨得過去。目前,還沒有人能證明它一定跨得過去。

然後回到最現實的地方:在那之前,你還是可以放心叫 AI 幫你研究,它能幫你做很多查證跟整理。但別因為它「跑過質疑流程了」,就以為它有能力抓出所有它自己沒發現的垃圾——這兩件事,差很多。

再補一句自我打臉:這篇文章本身也是一份「有結構的整理」,所以上面那把尺,一樣套得到它身上。共勉之。

延伸閱讀

如果你想看我其他跟 AI 有關的碎念:

相關連結