電腦科學

一種語言若不能影響你思考程式設計的方式,就不值得學習。

Alan Perlis (1982)

軟體工程

17 July 2026

資深開發者覺得 AI 讓自己更快,實際卻量到更慢——真正的發現,以及它並不是什麼 AI 程式開發判決

METR 的一項隨機對照試驗,讓 16 名資深開源開發者在自己熟悉的程式碼庫中完成 246 個真實工作項目;每個任務隨機決定是否允許使用 2025 年初的 AI 工具(Cursor Pro 加 Claude 3.5/3.7 Sonnet)。開發者原本預期 AI 能把完成時間縮短約 24%;結果反而增加了 19%。更有意思的是,做完後他們仍相信 AI 讓自己快了約 20%。這個「感覺與量測之間的落差」是研究最銳利、也最穩健的核心。但樣本只有 16 人、情境很窄,而且只是固定在 2025 年初工具狀態的一張快照;作者明確表示,這不能證明 AI 對多數開發者沒有幫助,而他們自己 2026 年的後續研究已經傾向顯示加速,雖然也有自己的限制。

cryptography

9 July 2026

一個密碼學證明可以通過讓缺失的模擬器難以被證明來隱藏其秘密

零知識證明允許某人證明一個陳述而不揭示見證。經典理論說,在完整意義上,你無法用一條消息、無需可信設置和完美可靠性來做到這一點。Rahul Ilango的論文沒有使這種不可能性消失。它改變了目標:不再要求模擬器確實存在,而是要求沒有選定的證明系統能夠高效地證明模擬器不存在。在重要的證明複雜性和密碼學假設下,這足以逐屬性地恢復零知識的可證偽、博弈式後果。重點不是一個即插即用的互聯網原語。它是將數學不可證明性轉化為密碼學掩護的一種證明論方法。

medical AI

5 July 2026

醫療AI可以在平均意義上是私密的,但仍然暴露特定的患者——尤其是那些最缺乏代表性的人

一個被稱為「保護隱私」的醫療AI模型通常基於一個平均數字。這項研究認為,這一數字是錯誤的檢驗標準。作者研究成員身份推斷攻擊——即揭示特定人的記錄是否在模型訓練數據中,從而可能洩露其患有特定疾病——在七個醫療數據集(影像、心電圖、電子記錄)和眾多模型上逐患者測量風險,而非匯總測量。模式是:在平均意義上看起來安全的模型,仍然可以讓攻擊者以近乎完美的準確率識別特定個體(攻擊AUC ≥ 0.95);被暴露的系統性地來自代表性不足的群體(少數族裔、罕見疾病、異常影像);且隨著模型的擴大而惡化。作者並非主張放棄醫療AI——他們主張逐患者測量隱私、控制模型訪問並使用差分隱私。令人不適的核心:「平均意義上是私密的」並非隱私保證,而它所辜負的患者已是那些最缺乏保護的人。

artificial intelligence

5 July 2026

教繪圖AI看著畫布作畫

生成向量圖形的語言模型一直在盲畫——寫出繪圖命令,卻從未看見結果。一種新方法讓模型逐筆看著自己的畫布被填滿,而誠實的轉折是,簡單地賦予它眼睛反而讓結果變差:模型必須經過再訓練,學會怎樣使用視覺回饋。回報是一個能追平或略微勝過使用最多二十倍資料訓練的對手的模型——這是在單一基準上得到的真實、謹慎的結果,不是一場革命。

clinical AI

5 July 2026

一個AI代理在模擬器中獨立處理了完整患者病例——基於歷史病歷

MIRA是一種新型醫療AI:它不是回答單一問題,而是在模擬醫院病歷中處理整個病例——採集病史、開具並解讀檢查、做出診斷、書寫醫囑。在來自公共資料庫的574個回顧性病例上,橫跨八種預選診斷,作者報告它在診斷準確率上超越了醫生,並做出了基本符合指南、用藥安全的決定。這句話中的每一個限定詞都承載分量:它在沙盒中運行,基於歷史病歷,僅限文本;其優勢大多來自檢驗結果清晰的疾病;它開具的血液檢查大約是醫生的兩倍;若干結局是以原始病歷記錄的內容為標準來打分的。真正的進步是一個橫跨整個工作流程的代理——而非證明一台機器現在診斷得比醫生更好。作者自己承認:泛化能力、安全性和治理仍需要前瞻性真實世界研究。

robotics

25 June 2026

大型機器人「基礎模型」真的更好嗎?一個謹慎的回答——答案是肯定的,但幅度有限,而大多數研究無法判斷

豐田研究所訓練了「大型行為模型」——在約 1,700 小時多樣化操作資料上預訓練的機器人策略——並以不尋常的嚴謹性將其與從零開始的單任務策略進行了對比:盲法、隨機化、大樣本量試驗(約 1,800 次真實世界,47,000+ 次模擬)並採用正式統計檢驗。經過逐任務微調後,大模型平均表現更好,只需原來的約 1/3 至 1/5 任務特定資料,並且在條件變化時更穩健;效能隨預訓練資料量平穩上升。但在沒有微調的情況下,它們並未一致地擊敗單任務模型,若干效應小到只有大樣本量才能揭示,而且一個平凡的資料標準化選擇比架構影響更大。這是對機器人基礎模型方向的有節制支持——並非通用機器人,不是零樣本萬能者,也不是「湧現式的飛躍」——加上一條尖銳的警告:機器人學中的許多研究可能正在測量雜訊。

artificial intelligence

21 June 2026

語言模型為何產生幻覺——而我們的評分方式為何讓它延續

我們所說的「幻覺」,即模型自信地輸出虛假內容,並不是什麼神秘故障:其中一部分是訓練在統計上的副產品,而它們之所以持續存在,是因為主流基準會獎勵自信猜測,卻不會獎勵誠實地說「我不知道」。一項針對四個尖端模型的案例研究表明,把評分規則寫進提示(「開放式評分準則」)可以扭轉這種誘因。