▷ 教練力知識星系 · 全部星頁 · 研究庫 · 《教練力》 · AndAction

研究庫 · AI 產業

Microsoft 與 GitHub 對「AI 與職場、生產力」的研究

AI產業-04 Microsoft 與 GitHub 對「AI 與職場、生產力」的研究

層級:證據子檔|查證日:2026-09-10|status:活檔

生產力宣稱要打折看,而且要把獨立反證放在旁邊:賣方(GitHub/Microsoft)的「55% 更快」「26% 更多產出」是真實的受控研究,但任務是人造的、樣本特定、對自家有利;同一時期,獨立的 RCT(METR)在真實開發情境下,反而測到資深者慢 19%。引用任何一邊,通常都需要把另一邊放在旁邊

由《教練力實踐》證據研究員(v1)維護。本檔用 WebSearch/WebFetch 於 2026-06-23 實際點開查證,每筆標年份、機構、類型與可信度。 絕不編造研究/數據/作者/報告名;查不到標〔待查證〕。 本檔的核心張力=「廠商自家生產力宣稱 vs 獨立反證」:GitHub/Microsoft 是 AI 工具的賣方,其「55% 更快」「26% 更多產出」是真實研究但對自家有利、要打折看;本檔務必把獨立 RCT 反證(METR 2025 資深開發者反而慢 19%)與信任落差(Stack Overflow)並陳,不可只引廠商數字。 與既有 AIcoach 研究庫互補:那邊 產業報告/科技平台 已收微軟 Frontier Firm 與 GitHub vs METR 的對照骨架;本檔聚焦把這幾筆逐筆查證到精確數字、補上 Microsoft Research 認知研究與 LinkedIn 技能數據,相關處標「另見」,不重抄。 調性提醒:不打技術樂觀牌、也不打恐懼牌。同一批近兩年研究同時顯示「短期任務級提升真實存在」與「資深者/真實情境下反而變慢、且自己沒察覺」——分清「廠商宣稱 vs 獨立證實」、「任務級 vs 總體級」、「感覺更快 vs 實際更快」。


核心論點(這檔能幫書站穩哪一塊)

  1. 生產力宣稱要打折看,而且要把獨立反證放在旁邊:賣方(GitHub/Microsoft)的「55% 更快」「26% 更多產出」是真實的受控研究,但任務是人造的、樣本特定、對自家有利;同一時期,**獨立的 RCT(METR)在真實開發情境下,反而測到資深者慢 19%**。引用任何一邊,通常都需要把另一邊放在旁邊。
  2. 「感覺更快」不等於「實際更快」:METR 最清楚的一個發現是知覺落差。開發者事前預期會快 24%,事後仍以為自己快了 20%,實際上卻慢了 19%。這一筆可以直接支持本書「判斷不外包、要校準對 AI 的信任」的說法:人對 AI 效能的感受,往往是系統性失準的。
  3. 越信任 AI,批判思考越少;越信任自己,批判思考越多(Microsoft×CMU CHI 2025):AI 把知識工作從「執行」轉向「監督與驗證」,但這份監督通常只在人本身有底氣的時候才會發生。這呼應教練力講的「先有一個值得信任的自己」。
  4. 採用衝得很快,信任反而下滑(Stack Overflow 2025):用 AI 的開發者升到 84%,信任卻掉到 29%,46% 的人主動不信任它的準確性。採用度、有效性、信任,是三件不同的事。
  5. AI 做不到的那一塊,價值反而變高(Microsoft WTI/LinkedIn):產能缺口很大(80% 工作者沒時間沒精力)、70% 工作技能五年內會改變,但被點名為「非協商」的核心能力是分析思考、複雜問題解決。人的判斷力,看起來是在升值的。

這幾點都可以支持《教練力實踐》的核心主張:當賣方用「更有生產力」推著人把判斷交出去的時候,真正值錢的,往往反而是那個沒把判斷交出去、還自己在判斷的你。


證據清單

A. Microsoft Work Trend Index:「Frontier Firm」與產能缺口(機構級調查)

A1. 2025 Work Trend Index:Frontier Firm 誕生與產能缺口

  • 年份:2025(調查期 2025-02-06 至 2025-03-24)
  • 作者/機構:Microsoft(WorkLab)+ LinkedIn;獨立研究商 Edelman Data x Intelligence 執行
  • 關鍵發現:80% 全球工作者表示缺乏完成工作的時間或精力,同時 53% 領導者說生產力必須提升。這道「產能缺口(capacity gap)」是全報告主軸。82% 領導者相信未來 12–18 個月會用「數位勞動力(AI agents)」來補。提出「Frontier Firm」概念:全組織部署 AI、用 agent、視 agent 為 ROI 關鍵的公司;其工作者 71% 說公司在「茁壯」(全球僅 39%)、55% 說能承接更多工作(全球 25%)。
  • 樣本:31,000 名知識工作者、31 個國家/市場、20 分鐘線上問卷。
  • 支持論點:⑤ AI 做不到的那一塊價值變高(產能缺口可以當「為什麼是現在」的開場)。
  • 類型:機構調查(科技平台+其旗下 LinkedIn)
  • 可信度:中高(樣本大、跨國、近期;但 Microsoft 是 AI 賣方,「該用 AI 補產能」對自家有利,當態度與趨勢數據用、不當成效實證)
  • URL:https://www.microsoft.com/en-us/worklab/work-trend-index/2025-the-year-the-frontier-firm-is-born
  • 查證日:2026-06-23

A2. AI 採用的「領導者 vs 員工」落差(同報告)

  • 年份:2025
  • 作者/機構:Microsoft Work Trend Index 2025
  • 關鍵發現:對 AI agent 的熟悉度,領導者 67% vs 員工 40%;經常使用 AI,領導者 69% vs 員工 45%;認為 AI 是職涯加速器,79% vs 67%;每天省下 1 小時以上,29% vs 20%。提出「agent boss(agent 老闆)」新角色:員工建構、委派、管理 AI agent。
  • 支持論點:⑤(採用不均,而且「會用 agent」被框成新職能);可對照③(監督式工作的興起)。
  • 類型:機構調查
  • 可信度:中高(同 A1 的打折提醒)
  • URL:https://blogs.microsoft.com/blog/2025/04/23/the-2025-annual-work-trend-index-the-frontier-firm-is-born/
  • 查證日:2026-06-23

另見 AIcoach 研究庫 產業報告/科技平台(已收微軟 Frontier Firm「產能缺口 80%」骨架);本檔補到精確的領導者/員工分項與樣本方法。


B. Microsoft Research:AI 對認知、批判思考、生產力的研究

B1.(最重要)GenAI 與知識工作者的批判思考(CHI 2025)

此筆與 AIcoach 研究庫 專題-AI與人的關係/03-認知外包 中 Lee et al.(CHI 2025)為同一筆;本檔補上「Microsoft×CMU、319 人 936 案例」精確出處,供書專案直接引用。

B2. Microsoft Research《New Future of Work》年度綜述(背景依據)

  • 年份:2025(年度報告,每年更新)
  • 作者/機構:Microsoft Research
  • 關鍵發現:把 LLM 對知識工作的影響定位為「認知工作經濟學」的轉移——大幅壓低產出(文字、程式碼、摘要)的邊際成本,並收斂該年度多篇內部研究(含 B1 的批判思考線)。〔待查證〕(2026-09-10 查證:下方網址實際是〈Tools for Thought at CHI 2025〉部落格,內容是四篇 CHI 論文的介紹,未見「認知工作經濟學/邊際成本」的論述;《New Future of Work Report 2025》本體未能直取)
  • 支持論點:⑤(執行成本大幅下降是怎麼發生的);④(採用與真正有幫助之間的落差)。
  • 類型:機構年度綜述(科技平台研究部門)
  • 可信度:中高(方法嚴謹綜述,但廠商自家研究、對自家有利要打折)
  • URL:https://www.microsoft.com/en-us/research/blog/the-future-of-ai-in-knowledge-work-tools-for-thought-at-chi-2025/
  • 查證日:2026-06-23
  • 備註:《New Future of Work Report 2025》PDF 連結另見 AIcoach 研究庫 職場-01(A1)。

C. GitHub Copilot 生產力宣稱:⚠️ 賣方數據,要對照 D 的反證

C1. GitHub 官方受控實驗:「快 55%」

  • 年份:2022 發布、2023 學術化(arXiv 2302.06590)
  • 作者/機構:GitHub(Sida Peng 等),論文《The Impact of AI on Developer Productivity: Evidence from GitHub Copilot》
  • 關鍵發現:受控實驗,95 名開發者(45 人用 Copilot、50 人對照)用 JavaScript 寫一個 HTTP server。用 Copilot 組**快 55%**(平均 1 小時 11 分 vs 對照組 2 小時 41 分;95% CI 21–89%,P=.0017),完成率 78% vs 70%。
  • 支持論點:①(賣方宣稱的「上限」基準,要和 D1 一起出現)。
  • 類型:廠商受控實驗
  • 可信度:⚠️ 中(須打折):任務人造(單一標準化練習、不是真實 codebase)、樣本小、GitHub 自家研究有強烈利益動機;「55%」是最常被引用也最容易被斷章取義的數字,引用時務必標來源與任務性質。
  • URL:https://github.blog/news-insights/research/research-quantifying-github-copilots-impact-on-developer-productivity-and-happiness/
  • 論文:https://arxiv.org/abs/2302.06590
  • 查證日:2026-06-23

C2. 企業情境 RCT:「多 26% 產出」(Microsoft/Accenture/Fortune 100)

  • 年份:2024(arXiv,MIT/Princeton/Wharton/Microsoft)
  • 作者/機構:Microsoft、MIT、Princeton、Wharton 研究者;三場 RCT
  • 關鍵發現:橫跨 4,867 名開發者(Microsoft、Accenture、一家匿名 Fortune 100 電子製造商)三場 RCT,用 Copilot 組每週完成的 pull request 多 26.08%;經驗較淺者得益更多。〔待查證〕(2026-09-10 查證:下方網址只呈現 Accenture 單場的數字,未見三場合併的總樣本與百分比)
  • 支持論點:①(賣方宣稱的企業級版本,比 C1 接近真實情境,但仍偏利益方)。
  • 類型:廠商參與之 RCT(含獨立學者,較 C1 嚴謹)
  • 可信度:⚠️ 中高(仍須打折):RCT 設計、樣本大、有外部學者,比 C1 可信;但 Microsoft 是共同作者,而且「PR 數量」是產出的代理指標,不等於價值或品質(量增 ≠ 質增)。
  • URL:https://github.blog/news-insights/research/research-quantifying-github-copilots-impact-in-the-enterprise-with-accenture/
  • 查證日:2026-06-23

D.(關鍵反證)獨立證據:真實情境下資深者反而變慢、而且自己沒察覺

D1.(本檔最重要的反證)METR:資深開源開發者用 AI 反而慢 19%

  • 年份:2025(METR,2025-07 發布;arXiv 2507.09089)
  • 作者/機構:METR(Model Evaluation & Threat Research,獨立非營利研究機構,非 AI 賣方)
  • 關鍵發現:RCT,16 名資深開源開發者在自己熟悉的大型 repo(平均 22k+ stars、百萬行程式碼)上完成 246 個真實 issue。被允許用 AI 工具(主要 Cursor Pro+Claude 3.5/3.7 Sonnet)時,完成任務反而多花 19% 時間(變慢)。知覺落差最關鍵:開發者事前預期會**快 24%,事後仍以為自己快了 20%**;實際慢了 19%,自己卻沒有察覺。
  • 支持論點:①(廠商宣稱的直接獨立反證);②(「感覺更快 ≠ 實際更快」最清楚的證據)。
  • 類型:獨立 RCT(真實 codebase、真實 issue,外部效度高於 C1)
  • 可信度:高(設計嚴謹、利益中立;作者自己誠實標了限制:樣本小、只有 16 人、只有資深者加上熟悉的成熟 repo、只有當時的模型,不宣稱可以推廣到多數開發者或未來模型)。也正因為作者誠實,這筆最適合拿來說「在這個特定但真實的情境裡,賣方的數字會反轉」,不宜推廣成「AI 一律讓人變慢」。
  • URL:https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
  • 論文:https://arxiv.org/pdf/2507.09089
  • 查證日:2026-06-23
  • 後續:METR 於 2026-02 發布更新,調整實驗設計續研究此題(https://metr.org/blog/2026-02-24-uplift-update/)——標示此題仍在演進、非定論。

D2. Stack Overflow 開發者調查 2025:用得更多、信得更少

  • 年份:2025(調查發布於 2025 年底;Stack Overflow Developer Survey 2025)
  • 作者/機構:Stack Overflow(獨立於 AI 賣方的開發者社群)
  • 關鍵發現:使用 AI 工具的開發者升到 84%,但信任卻掉到 29%(2024 為更高);主動不信任其準確性者 46% > 信任者 33%,僅 3% 表示「高度信任」。最大挫折是「AI 給的答案幾乎對、但就是不太對」(66%),第二大挫折是除錯 AI 程式碼更耗時(45%)。在「未來即使 AI 很強,何時仍會找真人」中,「當我不信任 AI 的答案」排第一(75%)。
  • 支持論點:④ 採用衝得很快但信任下滑(採用度 ≠ 有效 ≠ 信任);也支持「人的驗證仍然少不了」。
  • 類型:大型業界調查(獨立、樣本數萬)
  • 可信度:高(樣本大、獨立、連年可比;自陳態度數據,非成效實證——當「信任落差」證據用,不當「AI 沒用」證據)
  • URL:https://survey.stackoverflow.co/2025/ai/
  • 趨勢分析:https://stackoverflow.blog/2025/12/29/developers-remain-willing-but-reluctant-to-use-ai-the-2025-developer-survey-results-are-here/
  • 查證日:2026-06-23

E. LinkedIn(Microsoft 旗下):技能變化與學習數據

E1. 70% 工作技能將在 2030 前改變

  • 年份:2025(LinkedIn 2025 Workplace Learning Report/Work Change Report;資料截至 2024-09 LinkedIn 會員活動)
  • 作者/機構:LinkedIn(Microsoft 旗下)
  • 關鍵發現:到 2030 年,多數工作所用技能的 70% 將改變,AI 是催化劑(演算法:結合職缺與個人檔案所列技能,加上歷史變動與 AI 可替代性推估)。被點名為「非協商」的核心能力是分析思考、主動學習、複雜問題解決——分析思考仍是雇主第一核心技能(七成公司視為必備)。AI literacy 成為成長最快技能之一。〔待查證〕(2026-09-10 查證:70% 一句在 Work Change Report 頁面核對相符;「非協商」三項能力、七成公司、AI literacy 成長最快,在所列兩個 LinkedIn 頁面都沒看到,CNBC 頁面打不開)
  • 支持論點:⑤ 技能重組得很快,但升值的通常是 AI 做不到的判斷與問題解決能力。
  • 類型:機構報告+平台行為數據(Economic Graph)
  • 可信度:中高(LinkedIn 獨家數據、規模大;只是 LinkedIn=Microsoft 旗下而且賣學習產品,「該再培訓」對自家有利,當趨勢數據用)
  • URL:https://economicgraph.linkedin.com/research/work-change-report
  • 報告頁:https://learning.linkedin.com/resources/workplace-learning-report
  • 二手佐證(CNBC):https://www.cnbc.com/2025/05/13/by-2030-70-percent-of-skills-used-in-most-jobs-will-change-says-linkedin-.html
  • 查證日:2026-06-23

另見 AIcoach 研究庫 產業報告/科技平台(已收 LinkedIn 70% 技能改變骨架);本檔補上方法與「分析思考非協商」分項。


缺口與反證(生產力宣稱 vs 獨立證實)

  • 最大的缺口,是「廠商宣稱 vs 獨立證實」之間的鴻溝:GitHub/Microsoft(賣方)測到大幅提升(C1 55%、C2 26%),唯一的獨立、真實情境 RCT(D1 METR)卻測到資深者變慢 19%。目前還沒有「賣方與獨立方在同一個真實情境、用同一個指標」的對照研究;兩邊的任務、樣本、指標都不同,不能直接相減,只能把張力並陳。
  • 指標的缺口:賣方多半用「速度/PR 數量/完成率」這類產出的代理指標,很少有人測程式碼品質、可維護性、長期技術債(已有 arXiv 預印本開始探討「AI 助手對可維護性的下游影響」,但還不是定論〔此線待持續查證〕)。量增不等於質增。
  • 知覺的缺口(最值得寫進書):METR 證明人對 AI 效能的主觀感受與客觀表現是脫鉤的。所以,大量「我用 AI 變快了」的自陳(包括部分調查)可能系統性高估了。引用任何「使用者覺得更有生產力」的數據時,都需要標明那是感受,不是實測。
  • 可推廣性的缺口:D1 只有 16 人、只有資深者加上熟悉的成熟 repo、只有 2025 上半年的模型;METR 作者自己就強調不可推廣。反過來,C 系列的「新手得益更多」也提示效果因人而異(資深與新手可能相反)。書稿不宜把任何一邊講成普世定律。
  • 賣方利益的缺口:本檔 A、B2、C、E 的產出方(Microsoft、GitHub、LinkedIn)都是 AI 或學習產品的賣方,數據對自家有利,要打折看;只有 B1(與 CMU 合作,發現反而對自家產品不利,提醒「AI 會削弱批判思考」)與 D(METR、Stack Overflow,獨立方)的利益比較中立,可信度相對高。

對應的星座:證據星座

coaching-book 研究庫 AI產業 Microsoft GitHub 生產力宣稱

本頁為《教練力實踐》研究庫的公開文字版;〔待查證〕標記為研究員原注,表示該筆尚未鎖定一手來源。