Lukeverstopia
Look AI 一分鐘

AI 日報 — 2026-07-20

每日精選 AI/Tech 新聞,繁體中文整理


📍 今日全焦點

  • 中國冒出「AI 代理手機」 — 手機會自己下單,然後淘寶微信京東把它擋了
  • AI 讀 X 光片:錯得很有自信 — 放射科醫師 0.83,最強模型 0.30
  • AI 員工變成新政治金主 — 捐款密度是 Google、Facebook 的五六倍
  • DeepMind:影片生成模型本來就會看世界 — 一顆模型打六個視覺任務
  • Claude Code 修掉權限繞過漏洞Edit(src/**) 曾經放行整棵樹

今日頭條

欸,如果你的手機可以自己幫你叫車、比價、下單、付錢——你猜誰會第一個不爽?

答案這個週末在上海揭曉了,而且只花了幾天。

先講「所以呢」:「AI 幫你動手做事」這件事,技術上已經到了能上市的程度;真正卡住它的不是模型,是那些不想被繞過的 App。

這個週末的世界人工智慧大會(WAIC,上海)上,至少三家公司同時端出所謂的「agentic phone(代理手機)」——不是多一個語音助理,是手機自己會操作 App 幫你把事情辦完

兩支最受矚目的:

  • 努比亞(Nubia)的 NaviX Ultra,跑的是字節跳動的豆包(Doubao)——中國目前最紅的 AI 聊天工具
  • 上海新創階躍星辰(StepFun)的 STEPX Neo,董事長 Yin Qi(中文名以官方公布為準)說已經跟支付寶、滴滴等平台建立「深度合作」,可以一站式處理訂票、日常購物、在地生活、辦公和影片剪輯

聽起來很美好。然後現實來了。

「代理手機」真的普及的話,是一場革命——但它同時會把控制權,從那些 App 手上拿走。

而 App 們的反應很快。

豆包助理上線沒幾天,阿里巴巴、騰訊、京東就出手限制它存取自家平台字節跳動自己也在某些情況下把這個功能關掉了——包括牽涉到「付款」的時候。

小露的看法:這一段才是今天真正的新聞。

過去兩年,「AI agent」的討論幾乎都停在能力層面——它夠不夠聰明、會不會點錯、能不能記住上下文。上海這個週末給了一個不太一樣的答案:能力早就不是瓶頸了,權限才是。

想一下這個畫面:一支手機自己打開淘寶、比完價、下單、付款,全程沒有人看到任何一則廣告、沒有點進任何一個推薦位、沒有被演算法推坑買別的東西。

對電商平台來說,這不是「使用者體驗變好了」,這是「我的商業模式被繞過去了」。 廣告、推薦、動線設計、衝動購物——平台賺錢的地方,全部長在「人類會親手滑手機」這個假設上面。

所以他們封鎖 agent,一點都不意外。真正值得注意的是字節跳動自己也關了付款這一段——連做 agent 的人,都還沒想好「AI 自己刷卡刷錯了算誰的」。

這件事跟台灣有關嗎?有,而且比你想的近。 現在檯面上的 AI 手機、AI 瀏覽器、AI 購物助理,全部都會撞到同一堵牆:平台方願不願意讓機器人進門。這一輪的勝負,比較不會在模型排行榜上分出來,比較可能在條款、API 授權、和法院裡分出來。

來源:Philstar / AFP — Pocket-size AI: Powerful phones star at China show | Digital Journal — Pocket-size AI: Powerful phones star at China show | The News — Pocket-sized AI-powered phones take center stage at China show


新聞摘要

AI 讀 X 光片,錯的時候「特別有自信」——新基準用一個指標把這件事量出來

這則不是「AI 比不上醫師」的老調。重點是它答錯的時候,語氣跟答對時一模一樣。

一份名為 RadLE 2.0(Radiology's Last Exam,放射科的最後一場考試)的新基準,這兩天在社群和專業圈被大量討論。它跟一般醫療 benchmark 最大的差別是:它不只量「答對率」,還量「模型知不知道自己該閉嘴」。

RadLE 2.0 拆成五個分數,主指標叫 信心加權指數(Confidence Weighted Index),另外還有可靠度、準確度、安全性,以及一個很有畫面的——「交班準備度(Handover Readiness)」:你敢不敢把這張片子交給它判讀。

成績攤開來是這樣:

  • 具專科證照的放射科醫師:0.83
  • 住院醫師(受訓中):0.45
  • 最強的 AIGPT-5 為 0.30、Gemini 2.5 Pro 為 0.29

也就是說,目前最前沿的多模態模型,讀片能力連受訓中的住院醫師都還沒追上。

但真正讓人皺眉的是「信心」那一欄。 相關研究(MD Anderson 癌症中心)也指出同一個現象:模型產出完全錯誤的判讀時,語氣照樣斬釘截鐵。 更誇張的是另一組實驗——在完全沒有給圖片的情況下,前沿模型還是能「描述影像細節」;一旦明白告訴它「你沒有圖,用猜的」,表現反而掉下來。

白話講:它不知道自己沒看到東西。

怎麼看:這件事的實務含意比分數本身重要。如果一個工具會用同樣堅定的語氣講對的話和錯的話,那使用者就沒有辦法靠「它聽起來有多確定」來過濾風險——而人類判斷可不可信,八成靠的就是這個。

對一般人最直接的一句不要把手機拍的 X 光片、超音波、健檢報告丟給聊天機器人,然後把它的回答當診斷。 它會給你一個聽起來很專業的答案,而你沒有任何線索分辨那是對的還是掰的。(這是研究結果,不是醫療建議;身體的事還是找醫生。)

來源:CRASH Lab — Radiology's Last Exam (RadLE) 2.0 Technical Report | CRASH Lab — Can AI read a chest X-ray as well as a radiologist? | Futurism — Frontier AI Models Are Doing Something Absolutely Bizarre When Asked to Diagnose Medical X-Rays


AI 公司的員工,正在變成美國政治的新金主階級——而且比上一代科技人更齊心

這則的數字很有意思:不是「捐了多少」最驚人,是「多少比例的人在捐」。

7/18,舊金山在地媒體 The San Francisco Standard 做了一份選舉獻金分析,把 Anthropic 和 OpenAI 員工這一輪的政治捐款,跟過去三個「科技 IPO 世代」(Airbnb、Google、Facebook)拿來對照。

結論是:捐得更快、更多、而且更整齊。

  • 每 1,000 名 Anthropic 員工裡約有 59 人這一輪有捐款——大約是 Airbnb 的三倍、Facebook 或 Google 的五到六倍
  • Anthropic 員工目前已投入聯邦選舉約 383 萬美元(約新台幣 1.24 億)
  • 經通膨調整後,捐款額是前幾代科技 IPO 世代的三倍以上

「整齊」是這樣看出來的:去年秋天,28 位員工(Anthropic 20 位、OpenAI 8 位)在同一天,一起捐給主張 AI 安全立法的國會參選人 Alex Bores,合計 17.3 萬美元(約新台幣 560 萬)。 同一天、同一個人、同一個議題。

而金字塔頂端玩的是另一個量級OpenAI 總裁 Greg Brockman 個人開出兩筆各 1,250 萬美元(約新台幣 4 億)的超級政治行動委員會(super PAC)捐款——一筆給反監管的 Leading the Future,一筆給親川普的 MAGA Inc

怎麼看:這裡面有一個很明顯的張力。

基層員工的錢在往「AI 安全立法」流,高層的錢在往「反監管」流。 同一家公司,兩個方向。

而另一個訊號是地理的:捐款人中列舊金山為居住地的比例,Anthropic 是 59%、OpenAI 是 42%,遠高於 Airbnb 當年的 34%、Google 的 18%、Facebook 的 14%。這代表這批人不只在下注全國政治,也在下注自己住的城市。

把它接到最近的線上看:Anthropic 的 IPO 進程還在跑、《大美國 AI 法》還在徵集意見、各州 AI 立法凍結條款吵得正兇。 在這種時候,「誰的錢站哪一邊」本身就是產業新聞。(這是產業觀察,不評論任何政治立場。)

來源:The San Francisco Standard — AI's new political donor class is already outspending Big Tech's last one | Transformer — AI safety's 'hard money' may be its secret weapon in the midterms


DeepMind 的主張:影片生成模型裡面,早就裝著電腦視覺一直在找的那個「世界模型」

如果這個說法站得住,那意思是——過去幾年大家覺得只是拿來做梗圖的影片模型,其實一直在偷偷學物理。

Google DeepMind 提出 GenCeption,論文標題直接把結論寫在上面:《影片生成模型是通用視覺學習器》(Video Generation Models are General-Purpose Vision Learners)。這兩天英文科技媒體開始集中討論它的含意。

它做了什麼:把一個預訓練好的文字生影片擴散模型,改造成單次前饋(feed-forward)的感知模型——白話講,把原本要來回跑很多步、很慢的「生成」流程,壓成一次就出答案的「辨識」流程。

然後這一顆模型,用文字指令就能切換去做六種傳統上各自要專用模型的視覺任務:深度估計、表面法線、相機姿態、指涉式分割、3D 關鍵點、4D 定位。

成績:在這一整套任務上達到 SOTA(state-of-the-art,該領域最佳水準)多項匹敵甚至超越那些專門為單一任務訓練的模型,而且用的訓練資料明顯更少。它還展現了幾個很吃「理解」的能力:sim-to-real(在模擬環境學、到真實世界能用)、處理畫面中多個同類物件、以及應付從沒看過的東西。

底座是誰阿里巴巴通義實驗室 2025 年 2 月開源的 WAN 2.1,一個 140 億參數的文字生影片擴散 Transformer。

怎麼看:這篇的核心論點值得記一下——DeepMind 在說,「影片生成」對視覺,就像「預測下一個字」對語言。

當年沒有人覺得「猜下一個字」是通往通用語言能力的路,結果它是。 這篇的賭注是:要準確生成一段影片,模型就非得學會物體怎麼移動、光怎麼打、遮住的東西還在不在——那些正是電腦視覺一直想要、卻很難直接教的東西。

對做機器人和自駕的人來說,這條線特別重要:它們最缺的就是「便宜的世界模型」。如果影片模型真的能當視覺通才用,那訓練資料的成本結構會整個變。 這目前是一篇研究主張,不是已成定論的產業共識——值得追,但先別當結論用。

來源:GenCeption — Video Generation Models are General-Purpose Vision Learners(專案頁) | arXiv 2607.09024 | TechTimes — Video Generation Pre-Training Unifies Six Vision Tasks, Beats Specialists on Less Data


Claude Code 修掉一個權限繞過漏洞:你以為只放行 src/,其實整棵樹都放行了

這則很短,但如果你在用 Claude Code 跑自動化,今天請先更新。

7/18,Anthropic 在 Claude Code 的更新中修掉兩個權限相關的問題,都屬於「你設了規則,但規則沒照你想的那樣生效」這一類:

  1. 單段的目錄萬用規則失效:像 Edit(src/**) 這種允許規則,原本會自動放行整棵目錄樹底下任何位置的 src 寫入,而不是只限當前工作目錄底下那一個。你以為圈了一小塊,實際圈的範圍大得多。
  2. Windows PowerShell 5.1 的權限檢查可被繞過:在 PowerShell 5.1 session 裡跑的指令,權限檢查有機會被繞掉。

同一批更新還包含:更嚴的權限檢查、更安全的 Bash / PowerShell 處理、背景 session 清理、以及遠端和 plugin 的穩定性改善,另外新增了 EndConversation 工具長時間任務的進度心跳(progress heartbeats)。還有一個行為調整:/verify/code-review 改成只有被明確叫到才會跑,Claude 不會再自己主動觸發它們。

怎麼看allowlist(允許清單)最危險的失效方式,不是「擋太多」,是「你以為它擋住了」。

這跟這個月另一條線是同一件事的兩面——最近的供應鏈攻擊已經開始針對 AI 編碼工具下手:有攻擊把帶零寬字元隱藏指令的 CLAUDE.md.cursorrules 塞進套件裡,等開發者用 Cursor 或 Claude Code 打開專案,助理讀到設定檔就自己跑起「安全掃描」,把本機的祕密外傳。

兩件事疊起來的結論很單純當你把「動手權」交給一個 agent,那份權限設定檔就是你的防線——它值得你像看防火牆規則一樣認真看一遍。

來源:Claude Code 官方 changelog | Releasebot — Claude Code Updates by Anthropic, July 2026 | Upwind — Large-scale npm / PyPI supply chain campaign


值得關注

  • 今天(7/20)就是 Claude 新制上路日,Max 和 Pro 是兩種完全不同的處境:昨天報過的 Fable 5 新方案今天生效——Max / Team Premium 永久內建但只給週用量上限的 50%Pro / Team Standard 改走用量點數,官方一次性送 100 美元(約新台幣 3,250 元),燒完照 API 價計費(輸入 $10、輸出 $50 / 每百萬 token)同一天,Claude Code 週用量上限的 50% 加成也結束了——兩件事疊在一起,重度使用者今天登入請先確認一下實際額度。(後續:接 7/19 報過的 Fable 5 定價)
  • AI 文字偵測器正在被「模仿文風」這招破防Epoch AI 測了三個主流偵測器(Pangram、GPTZero、Originality.ai),發現當 AI 被要求模仿某位特定作者的文風時,最多有 18% 的 AI 生成段落完全沒被抓到。這對學術、新聞、出版界都是壞消息——「用工具驗一下是不是 AI 寫的」這條防線,可靠度正在下降。 這條線值得追,因為它會直接影響學校和期刊的政策怎麼訂。
  • 7/27 的 Kimi K3 權重釋出,是這個月最後一個硬日期Moonshot 承諾的完整權重釋出日還沒到。 上週它已經在 Arena.ai 的前端程式競技場拿到第一(76% 對戰勝率,壓過 Fable 5),Terminal-Bench 2.1 拿 88.3,但在綜合的 Text Arena 只排第九——是個很明確的「程式與 agent 特化型」選手。到 7/27 才會知道兩件事:權重是不是真的全放,以及社群實測跟官方數字差多少。
  • 「AI 怎麼影響初階白領職缺」的說法正在轉向《金融時報》 這兩天一篇分析指出,專業服務業(顧問、法律、金融)對 AI 的反應不是單純砍掉基層職缺,而是重新設計招募、訓練和職場文化——把初階職位改造成「學習實驗室」,訓練那些 AI 取代不了的能力(策略思考、模式辨識、關係建立)。但同一份觀察也指出,用了 AI 工具的公司,確實在放慢 22~25 歲這個年齡層的招募速度。 兩件事同時成立,值得繼續追。