▷ 教練力知識星系 · 全部星頁 · 研究庫 · 《教練力》 · AndAction

研究庫 · AI 產業

獨立(非廠商)生產力與白領職業衝擊

AI 產業研究 — 獨立(非廠商)生產力與白領職業衝擊

層級:證據清單(第三波・專收中立第三方實證,用來平衡廠商自利宣稱)|查證日:2026-09-10|status:活檔

廠商宣稱與獨立證據之間,往往有一道系統性的落差;這道落差正是書稿的立論起點。 最清楚的一組對照是:GitHub 自家研究說 Copilot 讓人「快 55%」,但獨立第三方 METR 用 RCT 一量,資深開發者反而慢 19%,而且本人不太感覺得到(自估快 20%)。價值通常不在工具,在你有沒有把它

本檔定位:專收獨立、中立、非 AI 廠商的生產力與職業衝擊實證——NBER、頂刊 RCT、大學經濟學者、政府勞動統計、METR 等。目的是給書稿一面對照鏡:當 OpenAI/Anthropic/Microsoft 等廠商宣稱「AI 大幅提升生產力」時,這些沒有「賣自家 AI」利益動機的來源,到底證實了什麼、推翻了什麼。

為什麼需要這一檔:廠商的數字(GitHub「快 55%」、Copilot「省 2 小時」)大多來自自家、短期、任務級、且常是「自陳感受」。獨立研究一旦用隨機對照(RCT)+客觀產出或行政薪資資料+差異中差異去量,常出現三種落差:① 任務級提升真實但被高估、甚至為負(METR);② 個別有效 ≠ 公司整體有效(生產力悖論);③ 短期感受 ≠ 長期就業/薪資效果(Danish 零效果)。這份落差本身,就是書稿「判斷力/自我支持系統」的最強現實論據。

嚴謹分級:每筆標「類型」(學術 RCT/行政資料準實驗/年度追蹤/元分析/觀點論述)與「可信度」,並明標效果量與樣本。絕不編造;本批所有來源 2026-06-23 用 WebSearch/WebFetch 實際點開查證。查不到標〔待查證〕。正反兩面都列。

另見(不重抄):

  • METR 19% 慢、Stanford《Canaries》entry-level −13%、生產力悖論 80%、《Generative AI at Work》客服 +14% → 已逐筆建檔於 職場-01-工作重組與技能價值.md(D 區)與 AI產業-05-研究中心與指數.md。本檔對這四筆只「另見」並補它們的方法論限制與外推邊界,把重心放在新的職業級獨立研究(法律、寫作、顧問的 RCT;Danish/Yale 的勞動經濟;MIT NANDA 企業失敗率;生產力 J 曲線)。
  • 廠商自家數據(GitHub、Copilot、Anthropic Economic Index)→ AI產業-04-Microsoft-GitHub.md、AI產業-02-Anthropic.md。

核心論點(本檔要幫書稿站穩的幾條主張)

  1. 廠商宣稱與獨立證據之間,往往有一道系統性的落差;這道落差正是書稿的立論起點。 最清楚的一組對照是:GitHub 自家研究說 Copilot 讓人「快 55%」,但獨立第三方 METR 用 RCT 一量,資深開發者反而**慢 19%**,而且本人不太感覺得到(自估快 20%)。價值通常不在工具,在你有沒有把它放進對的判斷迴路。

  2. 「個別任務有效」與「組織整體有效」是兩件事(生產力悖論/聚合悖論)。 任務級 RCT 反覆量到 14–55% 的提升,但 80%+ 企業回報零生產力提升、95% 企業的生成式 AI 試點未產生可衡量的財務回報。差別多半不在模型強弱,而在有沒有把方法、流程、人的能力一起重組。這正是書稿「先 workflow 後工具、先把自己的方法顯性化」要長的東西。

  3. AI 比較像一台「拉平器」:對新手與低技能的人放大最多,對資深專家放大最少,有時甚至是負的。 客服 +14%(新手 +34%、資深近 0);寫作品質的提升集中在原本較弱的人;法律分析速度大增,品質提升卻「微小且不一致」。這幾筆放在一起,指向同一件事:通用技能正在被 AI 變得便宜、被拉平;真正值錢的是 AI 抬不動的那塊(資深判斷、默會知識、關係)。這一點支持書稿 W1「把自己獨有的那塊聽深」。

  4. 就業與薪資的「全面崩塌」還沒發生,但「選擇性擠壓」是真的。 丹麥兩萬五千人的行政資料:對薪資與工時是「精準的零效果」;Yale Budget Lab:ChatGPT 上市 33 個月內,職業結構沒有可辨識的崩塌。不過 entry-level 高曝險職位(年輕的軟體與客服)就業相對下降約 13–19%(見 3-3,最新一版為 19%)。書稿要的通常是「方向級轉變」這種穩健的說法,不是「明天全被取代」的恐慌;這批反證,其實是在保護書的可信度。

  5. 「鋸齒邊界(jagged frontier)」:AI 在邊界內大幅增益,在邊界外反而讓人變差。 同一批顧問、難度看起來相近的任務,AI 在界線內幫得上忙,在界線外幫倒忙(正確率低 19%)。所以關鍵能力往往不是「會不會用 AI」,而是「知道哪條界線可以交、哪條不能交」。這一點直接支持 W5「判斷不外包」。


證據清單

一、廠商宣稱 vs 獨立證實/推翻(最核心的對照組)

1-1 | METR《Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity》— 資深開發者用 AI 反而慢 19%(最反直覺的獨立 RCT)

  • 年份:2025-07|機構:METR(Model Evaluation & Threat Research,獨立非營利評估機構)
  • 效果量與樣本:RCT,16 名熟練開源開發者、246 個真實 issue(平均每題約 2 小時,開發者對該專案平均 5 年經驗)。允許用 AI(主要 Cursor Pro + Claude 3.5/3.7 Sonnet,當時前沿模型)時,完成時間增加 19%,也就是 AI 把他們拖慢了。感知與現實的落差:事前預期加速 24%,事後即使被拖慢,仍**自估快了 20%**;經濟學專家預測會快 39%、ML 專家預測快 38%,兩邊都把方向猜反了。(以上數字 2026-09-10 經 arXiv:2507.09089 摘要逐項核得。)
  • 怎麼平衡廠商:這一筆正面對上 GitHub 自家的「快 55%」(另見 AI產業-04)。同一件事(寫程式),廠商的自陳研究說大幅加速,獨立 RCT 加上客觀計時卻說反而變慢,而且當事人自己感覺不到。要說明「自陳感受不太可靠、得看客觀產出」,這大概是最乾淨的一組對照。
  • 支持書稿哪論點:支持「價值通常不在工具,而在判斷迴路」「自我感覺 ≠ 真實效果,所以要回顧、要校準」。
  • 作者明示的外推限制(誠實納入):作者明文聲明本研究不證明「AI 不會加速多數開發者」;結果僅限這群熟練開源開發者與成熟 repo,不外推到其他人、其他領域、未來模型;且可能存在「50 小時以上才浮現的學習效果」。樣本僅 16 人。
  • URL:https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/ | arXiv:https://arxiv.org/abs/2507.09089
  • 類型:學術 RCT(獨立第三方)|可信度:★★★★☆(方法極乾淨,但樣本小、族群窄、模型世代特定,外推須謹慎)
  • 另見:職場-01 D2 已有此筆;本檔補上「作者外推限制」與「vs GitHub 廠商宣稱」的對照角度。

註:METR 另於 2026-02 發布實驗設計更新(承認原設計的學習曲線與選樣議題、正在改良),不否定原結論但提醒勿過度外推。URL:https://metr.org/blog/2026-02-24-uplift-update/

1-2 | Brynjolfsson, Li & Raymond《Generative AI at Work》— 客服 +14%,但全部紅利在新手

  • 年份:2023(NBER w31161;後刊 QJE)|機構:Stanford Digital Economy Lab / MIT / NBER(學術,非廠商)
  • 效果量與樣本:5,179 名客服專員、AI 對話助手交錯導入。每小時解決問題數平均 +14%;新手/低技能 +34%,資深/高技能影響極小。同時提升顧客情緒、降低離職。機制:把高手的隱性做法擴散給新手。(2026-09-10 經 NBER w31161 摘要核得:「5,179 customer support agents」「by 14% on average」「a 34% improvement for novice and low-skilled workers but with minimal impact on experienced and highly skilled workers」「improves customer sentiment, increases employee retention」。)
  • 怎麼平衡廠商:這是獨立學者做的真實職場準實驗,數字(+14%)反而比廠商保守,而且揭露了一個關鍵限制:紅利高度不均,集中在新手。廠商常拿「平均提升」當廣告,這一筆告訴你,對資深的人幾乎沒什麼用。
  • 支持書稿哪論點:支持「AI 像拉平器,把通用能力變得便宜」「資深的人真正值錢的地方,是 AI 抬不動的判斷與默會知識」。
  • URL:https://www.nber.org/papers/w31161 | Stanford:https://digitaleconomy.stanford.edu/publication/generative-ai-at-work/
  • 類型:學術準實驗(大樣本)|可信度:★★★★★
  • 另見:AI產業-05 2-1 已建檔;本檔保留作為「拉平效應」職業級主錨。

二、白領職業級 RCT(顧問/寫作/法律;獨立、預註冊、客觀評分)

2-1 | Dell'Acqua, Mollick et al.《Navigating the Jagged Technological Frontier》— BCG 顧問 758 人 RCT:邊界內多完成 12.2%、快 25.1%,邊界外正確率低 19%

  • 年份:2023 首發(SSRN);2026-03 正式刊於 Organization Science|機構:Harvard / Wharton / MIT Sloan / Warwick(學術主導,與 BCG 合作但獨立學者設計與分析)
  • 效果量與樣本:預註冊 RCT,758 名知識工作者(BCG 顧問),隨機分成不用 AI/用 GPT-4/用 GPT-4 加提示工程說明三組。邊界內任務(18 項適合 AI 的知識工作,從創意到分析):多完成 12.2% 的任務、平均快 25.1%,品質也顯著較好。邊界外任務(一項看似相似、但 AI 不擅長的複雜管理題):用 AI 的顧問產出正確解的機率比不用的人低 19%。AI 很有把握地給了錯答案,顧問往往就照單收下。(2026-09-10 經 Organization Science 37, 403–423 摘要核得:「completing 12.2% more tasks and completing them 25.1% more quickly」「19% less likely to produce correct solutions」。檔內原寫的「完成率 +12.5%」與「品質評分 +40%」已修正:12.2% 才是摘要數字;40% 出自 2023 年 SSRN 工作論文版,期刊版摘要只寫「significantly improved quality」,引用時請標版本。)
  • 怎麼平衡廠商:廠商多半只報「邊界內」的漂亮數字;這一筆用同一群人、難度看起來相近的兩類任務,量出 AI 可能在你沒注意到的地方讓你變差。「鋸齒邊界」這個概念本身,大概就是對「AI 全面提升」這種說法最有力的修正。
  • 支持書稿哪論點:這是 W5「判斷不外包」最直接的實證:關鍵能力在於辨認哪條界線可以交給 AI、哪條不能。它也支持 W2「先有自己的方法」,有自己的方法,比較不會被 AI 帶著走錯。
  • URL:https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4573321 | 期刊:https://pubsonline.informs.org/doi/10.1287/orsc.2025.21838
  • 類型:學術預註冊 RCT|可信度:★★★★★

2-2 | Noy & Zhang《Experimental evidence on the productivity effects of generative AI》— 中階白領寫作時間 −40%、品質 +18%,且縮小不均

  • 年份:2023-07(Science)|機構:MIT(學術)
  • 效果量與樣本:預註冊線上 RCT,453 名大學學歷專業人士(含經理、HR、行銷、顧問、資料分析、撥款寫手),做職業相關寫作任務。用 ChatGPT 者時間 −40%(−0.8 SD)、品質 +18%(+0.4 SD);勞動者之間的不均下降(原本較弱的人提升最多)。(2026-09-10 經 Science 381, 187–192 摘要核得:「453 college-educated professionals」「The average time taken decreased by 40% and output quality rose by 18%」「Inequality between workers decreased」;兩個 SD 值出自全文,摘要未載。)
  • 怎麼平衡廠商:這一筆支持「AI 確實提升白領寫作生產力」。本檔照實列正面證據,不是只挑反證。但它同時揭露了拉平效應(紅利集中在較弱的人),與 1-2 的客服一致:對已經很強的人,邊際幫助有限。
  • 支持書稿哪論點:支持「通用的寫作能力正在被 AI 變得便宜、被拉平,所以你真正值錢的地方,要往 AI 抬不動的那邊移」。
  • URL:https://www.science.org/doi/10.1126/science.adh2586 | PDF:https://economics.mit.edu/sites/default/files/inline-files/Noy_Zhang_1.pdf
  • 類型:學術預註冊 RCT|可信度:★★★★★

2-3 | Schwarcz, Choi et al. — 法律工作 RCT:速度大增、品質提升「微小且不一致」(再到 2025 工具世代轉為顯著)

  • 年份:2023–2025(多篇)|機構:University of Minnesota / Michigan 法學院(學術)
  • 效果量與樣本:
    • 早期(GPT-4,法學生 RCT):對法律分析品質僅微幅且不一致提升,但速度大且一致增加。意涵:AI 讓你更快,不必然讓你更好。
    • 2025 新世代工具(Vincent AI、o1-preview):在律師真實任務上,生產力提升約 38%–115%(Vincent)/34%–140%(o1-preview),複雜起草任務效果最強,且這一波首次顯示「能持續且顯著提升品質」。〔待查證〕(2026-09-10 檔內兩個網址:SSRN 403、lawnext 報導未重抓,這組數字未能回源核對。)
  • 怎麼平衡廠商:它呈現的是真實的時間演進:早期工具「快,但沒有更好」,這是對廠商「AI 提升品質」說法的修正;要到 2025 這一世代,才在受控條件下量到品質提升。所以書稿引用時最好標清模型世代,別把舊結論當成永久成立。
  • 支持書稿哪論點:支持「速度 ≠ 品質,要分開看」「AI 進步很快,判斷標準也得持續校準(W6 回顧迴路)」。
  • URL:https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4626276 | 2025 報導:https://www.lawnext.com/2025/03/another-new-study-of-legal-ai-shows-some-models-can-significantly-improve-work-quality-and-efficiency.html
  • 類型:學術 RCT(多波)|可信度:★★★★☆(律師樣本任務數有限;2025 數字部分含工具商合作,相對打折)

三、獨立勞動經濟:薪資、就業、職業結構(行政資料/政府統計)

3-1 | Humlum & Vestergaard《Large Language Models, Small Labor Market Effects》— 丹麥 2.5 萬人、7,000 家公司:薪資與工時「精準的零效果」

  • 年份:2025-05(NBER)|機構:University of Chicago / University of Copenhagen(學術,行政資料)
  • 效果量與樣本:串接行政薪資紀錄,25,000+ 員工、7,000 家丹麥公司、2023–2024。差異中差異估出對薪資與工時是「精準的零效果」,可以排除大於 2% 的效果。即使換成密集使用者、早期採用者、重金投資的職場、自陳大有收穫的人、彈性薪資與早職涯工作,零效果依舊成立。同時觀察到任務重組(新增內容生成、AI 監督、AI 整合等任務)。〔待查證〕(2026-09-10 標題與作者經 Crossref 核得〈Large Language Models, Small Labor Market Effects〉Humlum & Vestergaard;但檔內的 SSRN 頁 403,樣本數與「排除大於 2%」未能回源核對。)
  • 怎麼平衡廠商:這大概是對「AI 正在改變薪資與就業」最有力的獨立反證。廠商與媒體講的是顛覆,但串接真實薪資的準實驗說:兩年內,對個人收入與工時,幾乎什麼都沒動。
  • 支持書稿哪論點:支持「這是方向級的轉變,不是時程級的恐慌」「不打恐懼牌」;也支持「AI 先改變的是任務組成,不是直接砍薪砍工時」。所以重點通常落在重組你的工作內容(W4 建系統)。
  • URL:https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5250742 | 報導:https://fortune.com/2025/05/18/ai-chatbots-study-impact-earnings-hours-worked-any-occupation/
  • 類型:學術準實驗(行政資料)|可信度:★★★★★

3-2 | Yale Budget Lab《Tracking the Impact of AI on the Labor Market》— ChatGPT 上市 33 個月,職業結構無可辨識崩塌

  • 年份:2025-10 起持續更新(最新 CPS 11/12 月更新)|機構:The Budget Lab at Yale(學術政策智庫,用政府 CPS 資料)
  • 效果量與樣本:用職業/產業結構相異度(dissimilarity)+按 AI 曝險分位的失業/就業+使用率追蹤。結論:ChatGPT 上市後 33 個月,經濟體層級看不到可辨識的全面崩塌;職業結構的變化速率沒有超出歷史常態;高曝險職業的失業時長也沒有惡化。作者明說「這不預測未來」。〔待查證〕(2026-09-10 該頁 WebFetch 回傳內容被截斷,未能取到可引的原文段落。)
  • 怎麼平衡廠商:面對「AI 正在大規模消滅工作」這種恐慌敘事,它提供了政府資料層級的冷靜對照。Yale 另外點出一個「AI-washing」的風險:企業可能拿 AI 當大裁員的說法,但資料目前並不支持 AI 是主因。
  • 支持書稿哪論點:支持「全面崩塌還沒發生,衝擊是選擇性的」,讓書站在穩健的位置,而不是危言聳聽。
  • 作者:Martha Gimbel, Molly Kinder, Joshua Kendall, Maddie Lee
  • URL:https://budgetlab.yale.edu/research/tracking-impact-ai-labor-market | 報導:https://fortune.com/2026/02/02/ai-labor-market-yale-budget-lab-ai-washing/
  • 類型:政府資料年度追蹤(中立智庫)|可信度:★★★★★

3-3 | Stanford《Canaries in the Coal Mine?》— 但 entry-level 高曝險職位 −13%(選擇性擠壓的最強實證)

  • 年份:2025(Stanford Digital Economy Lab)|機構:Brynjolfsson, Chandar, Chen(學術,ADP 行政薪資)
  • 效果量與樣本:ADP 行政薪資資料(檔內原記 2,500 萬名員工;2026-09-10 該頁寫的是「high-frequency administrative payroll data from ADP covering millions of U.S. workers through June 2026」)。生成式 AI 普及以來,最高曝險職業的 22–25 歲早職涯工作者,就業相對低於曝險較低的同儕(已控公司層級衝擊):檔內原引 2025-11 版為約 13%;2026-09-10 重查該頁,資料延伸到 2026 年 6 月後,數字已更新為 19%(原句「employment of young workers (ages 22–25) in AI-exposed occupations now stands 19% below where it would be had it kept pace with that of their less-exposed peers」)。同一頁說資深工作者沒有出現同樣的落差,而不是「年長者反而 +6~9%」,後者本輪未能核到,〔待查證〕。衝擊集中在 AI「取代人類任務」的領域;在 AI 主要是互補的職業,就業持平或上升。調整走的是「少雇用」而不是「降薪」(原句「adjustment is occurring through employment rather than base compensation」)。
  • 怎麼平衡廠商/平衡 3-1、3-2:它與丹麥、Yale 的「總體零效果」形成一組必要的張力:總體看不到,不代表特定族群(年輕、入門、可編碼的知識工作)沒被擠壓。三筆並列,才是比較誠實的全貌。
  • 支持書稿哪論點:支持「通用的入門技能正在貶值,逼你盤點 AI 抬不動的獨有價值」「默會知識與經驗是一層緩衝」。
  • URL:https://digitaleconomy.stanford.edu/publications/canaries-in-the-coal-mine/ | PDF:https://digitaleconomy.stanford.edu/app/uploads/2025/11/CanariesintheCoalMine_Nov25.pdf
  • 類型:學術準實驗(行政資料)|可信度:★★★★★
  • 另見:職場-01 C2、AI產業-05 2-2 已建檔;本檔保留作「選擇性 vs 全面」對照的第三角。

四、生產力悖論:個別有效 ≠ 公司有效(聚合層級)

4-1 | Bloom et al.(NBER)— 近 6,000 名高管:80%+ 企業回報 AI 對就業/生產力零影響

  • 年份:2025–2026(NBER 工作論文)|機構:Nicholas Bloom(Stanford)等,跨美英德澳調查
  • 效果量與樣本:調查近 6,000 名高管。80%+ 企業回報過去三年 AI 對就業或生產力零影響,儘管廣泛採用、投入數十億。約 70% 公司在用,但高管每週只花約 1.5 小時用 AI,四分之一完全沒用。Bloom 引 Solow 悖論:「電腦時代無處不在,唯獨不在生產力統計裡」;重大技術通常要十年以上,總體效果才看得出來。〔待查證〕(2026-09-10 檔內來源為 Fortune 報導頁,本輪未重抓,數字未回源核對。)
  • 怎麼平衡廠商:廠商與顧問報告講的是「AI 革命已經實現」;這一筆用大樣本的高管調查說:對絕大多數公司,三年了還沒發生。落差多半不在技術,而在組織轉型還沒做完。
  • 支持書稿哪論點:支持「個別任務有效 ≠ 整體有效,差別在有沒有把方法、流程、人一起重組」「先 workflow 後工具」。
  • URL:https://fortune.com/2026/02/17/ai-productivity-paradox-ceo-study-robert-solow-information-technology-age/ | ILO 聚合悖論:https://www.ilo.org/publications/aggregation-paradox-ai-why-do-micro-economic-productivity-gains-ai
  • 類型:學術調查(大樣本)|可信度:★★★★☆(自陳調查,但樣本大、跨四國、作者權威)
  • 另見:職場-01 D1 已有此筆;本檔補上 Bloom/Solow 悖論的學理框架與「vs 廠商宣稱」角度。

4-2 | MIT NANDA《The GenAI Divide: State of AI in Business 2025》— 95% 企業生成式 AI 試點未產生可衡量財務回報

  • 年份:2025-08|機構:MIT NANDA initiative(學術)
  • 效果量與樣本:150 場領導訪談+350 名員工調查+300 個公開 AI 部署分析。約 95% 企業的生成式 AI 試點未帶來可衡量的 P&L 回報,只有約 5% 達到快速的營收加速。核心結論:問題多半不在模型弱,而在組織導入的方式。向專業廠商採購並建立夥伴關係,成功率約 67%,自建只有約三分之一。〔待查證〕(2026-09-10 檔內報告 PDF 連結 403,數字未能回源核對。)
  • 怎麼平衡廠商:這是對「買了 AI 就有 ROI」最直接的修正。不過它自己也要反向打個折:這份報告同樣被拿來推「買廠商方案比自建好」。引用時取「95% 失敗」這個獨立觀察就好,對「該買誰」的建議保持中性。
  • 支持書稿哪論點:支持「工具不會自動產生價值,要重組方法與流程」;也呼應 BCG 的「喜悅悖論」(另見 職場-01)。
  • URL:https://fortune.com/2025/08/18/mit-report-95-percent-generative-ai-pilots-at-companies-failing-cfo/ | 報告:https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf
  • 類型:學術/業界混合調查|可信度:★★★☆☆(影響力大但方法細節有限,引用標清為「調查級」而非「行政資料」)

4-3 | Brynjolfsson, Rock & Syverson《The Productivity J-Curve》— 為什麼「現在沒看到」不代表「沒效果」(學理框架)

  • 年份:2018 首發(NBER w25148);J 曲線於 2025–2026 被廣泛用來解釋 AI 悖論|機構:MIT / Stanford / NBER(學術)
  • 關鍵發現:通用技術(GPT)導入初期,因為要先投入無形的組織與流程重組成本,量到的生產力會先下降後上升,形成一條 J 曲線。對照:2020–2025 美國非農勞動生產力年均只有約 1.5%(正是 AI 大量部署期)〔待查證〕;多數公司到 2026 仍卡在「買了技術、但組織轉型還沒做完」的階段。(2026-09-10 經 Crossref 核得書目:NBER w25148,Brynjolfsson, Rock & Syverson,2018-10;1.5% 這個對照數字非該論文內容,未回源核對。)
  • 怎麼平衡廠商:它給生產力悖論一個中性的學理解釋:既不替廠商開脫(「再等等就好」),也不站到末日派那邊(「AI 沒用」),而是指出價值要靠人去重組流程才釋放得出來。
  • 支持書稿哪論點:直接支持書稿的核心:真正的工作是重組(你的 workflow、你的方法),不是換工具。個人層級的「J 曲線」,就是先慢下來把自己的系統建好,後面才換得到放大。
  • URL:https://www.nber.org/system/files/working_papers/w25148/w25148.pdf
  • 類型:學術理論+實證|可信度:★★★★★

缺口與反證

  • 缺口 1:目前還沒有「教練/自我支持系統」情境的獨立生產力 RCT。所有職業級的實證集中在客服、軟體、寫作、顧問、法律,還沒有人量過「用 AI 做自我支持或教練式反思」的生產力與效果。這正是 AndAction 與本書可以填的空白(呼應 專題-AI與人的關係 的同名缺口)。
  • 缺口 2:多數 RCT 是「短期、單次任務」。METR 已自承可能有 50 小時後才浮現的學習效果;長期、縱貫的職業級獨立 RCT 仍稀少。引用「任務級提升」時要標「短期」。
  • 缺口 3:外推邊界。METR 僅 16 名熟練開源開發者、特定模型世代;BCG/Noy-Zhang 是受控任務非真實長期工作;Danish/Yale 是「截至 2024–2025」的快照,不預測未來。皆不可外推成「所有人、所有 AI、永遠如此」。
  • 缺口 4:模型世代漂移很快。法律研究從「快但沒更好」(GPT-4)到「品質顯著提升」(2025 工具),只隔約兩年。任何「AI 做不到 X」的結論都有保鮮期,書稿引用時要標年份與模型世代,並在 W6 養成「定期重驗」的習慣。
  • 內建反證(刻意保留):本檔同時收了「AI 確實有效」的正面 RCT(Noy-Zhang 時間 −40%、客服 +14%、2025 法律工具 +34~140%)與「沒那麼神、甚至更糟」的反證(METR 慢 19%、生產力悖論 80%、丹麥的零效果、鋸齒邊界外正確率低 19%)。兩面並存正是本檔的價值:它讓書談的是「把 AI 用對、長出康健的判斷迴路」,而不是「AI 萬能」或「AI 危險」的單選題。

重驗提醒:本檔多筆為 2025–2026 快照(Yale 持續更新、METR 已出設計修正、法律工具世代更替快)。下次重驗優先更新:① Yale Budget Lab 最新 CPS;② METR 後續 uplift 實驗結果;③ Bloom 企業悖論論文是否正式發表;④ 是否出現首個「自我支持/教練 × AI」的獨立 RCT(填缺口 1)。

對應的星座:證據星座

coaching-book 研究庫 AI產業 獨立研究 職業衝擊 生產力悖論

本頁為《教練力實踐》研究庫的公開文字版;〔待查證〕標記為研究員原注,表示該筆尚未鎖定一手來源。