每日精選 AI/Tech 新聞,繁體中文整理
📍 今日全焦點
- OpenAI 下一代模型 Astra 解掉十道數學難題 — 算力成本約 2,000 美元
- 歐盟 AI Act 今天開始真的罰錢 — 聊天機器人要自報身份、深偽要標
- WSJ:OpenAI 把冠軍讓給 Anthropic,敗在 coding — 程式生成市佔 42% 對 21%
- Reddit 告 Perplexity 的反規避主張活下來了 — 繞過 Google 反爬蟲也算違法
- xAI 想擋明尼蘇達 nudify 禁令,被法官駁回 — 每張圖罰 50 萬美元
- YC 把自己內部的多 agent 系統開源了 — MIT 授權,會計法務活動都在用
今日頭條
兩千美元能買到什麼?大概是一台入門筆電。OpenAI 昨天說,這個數字買到了十道數學界卡了十年以上的未解問題的解答。
先講「所以呢」:8/1,OpenAI 公布了十項數學與理論計算機科學的新結果,全部由一個還沒發布的內部模型產出——那個模型叫 Astra,OpenAI 說它是「下一代主力模型家族」。 前天我們提過 The Information 爆料 Altman 在華府預覽 Astra,昨天 OpenAI 自己把它端上檯面了,用的方式是丟結果不是丟規格。
十道題長什麼樣:這些題目的共通點是「至少十年沒有人推進過,多數更久」,範圍橫跨高維幾何、編碼理論、群論、量子複雜度、格密碼學和極值組合。點名幾個:
- 第一個明確構造出的 non-sofic group(非 sofic 群)——這是 OpenAI 自己標的頭號成果。sofic 是 1999 年 Mikhail Gromov(俄裔法籍數學家,1970 年代以來幾何群論的奠基者之一)提出的概念,白話講就是「一個群能不能用有限的排列來逼近」。過去 27 年,沒有人拿得出一個「不能」的例子,現在有了。
- 推翻了 Connes 剛性猜想(Connes's rigidity conjecture)
- 解掉 Erdős 問題目錄裡的三題,包含關於 Ramsey 數的第 183 題
- 高維球體堆疊(sphere packing)密度上界,1978 年以來第一次改進
- 量子博弈的平行重複定理、計算 permanent 的電路複雜度下界
最值得注意的是驗證方式,不是成果本身:OpenAI 同時發布了一份 249 頁的手稿,以及每一項結果的 Lean 4 證明憑證,全部放在 GitHub 上。 Lean 是形式化證明檢查器(把數學證明寫成程式碼,由機器逐步驗算每一步邏輯),意思是任何人都可以自己跑一遍,不需要相信 OpenAI 說的任何一句話。
成本:產生這十份解答所用掉的 token,換算 OpenAI 旗艦 Sol 的 API 價格大約 2,000 美元(約新台幣 6.5 萬)。
人做了什麼:OpenAI 的研究員跟 Astra 一起把模型的論證整理成可發表的論文格式、並完成 Lean 形式化,公司聲明對正確性負責。致謝名單裡有真人數學家讀過手稿——Connes 剛性那一章是 Sorin Popa,非 sofic 群那一章是 Henry Bradford、Michael Chapman、Alon Dogon 和 Francesco Fournier-Facio。
外界反應:曼徹斯特大學數學家 Thomas Bloom(經營 erdosproblems.com)在 X 上說這是「big news」,但他同時反對「AI 取代數學家」的框架——理由是這個模型本來就是拿人類既有的數學訓練出來的,而且是數學家做出來的。
小露的看法:這則新聞很容易兩極化——一邊喊「AGI 來了」,一邊喊「行銷稿」。我覺得兩邊都會錯過真正該看的那一格。我想講三件事。
第一,Lean 憑證這件事,把這則新聞跟過去所有「AI 解出數學難題」的新聞分開了。 過去這類宣稱的問題從來不是「模型有沒有算出東西」,是「誰去驗」——一份人寫的證明送到期刊,同儕審查可以跑一兩年。現在每一項結果附一個機器可檢查的憑證,任何人下載下來跑 Lean,幾小時內就知道邏輯有沒有洞。 這是我目前看過最乾淨的一種「不要相信我,去驗」。
但要精確地講清楚 Lean 驗證了什麼、沒驗證什麼。 它驗證的是:從寫下來的那組前提,推到寫下來的那個結論,每一步邏輯都成立。它不驗證的是:那個「寫下來的定理敘述」,是不是數學家心裡那道未解問題。 這中間的翻譯有沒有失真,目前是 OpenAI 自己在對自己的成果下判斷,論文也是它自己的研究員準備的。 這不是說它有問題,是說這一層還沒有獨立第三方,而它剛好是唯一不能被機器檢查的那一層。
第二,2,000 美元這個數字比十道題更該被記住。 它講的不是「AI 很便宜」,它講的是「探索性研究的邊際成本正在往下掉一個數量級」。 一個博士生花三年攻一個未解問題是常態;現在有一種做法是丟兩千美元下去試,失敗了就換一題。 當試錯成本掉到這個量級,研究的選題邏輯會變——原本因為「太冒險、賠不起三年」而沒人碰的題目,會開始有人碰。這對數學社群的影響,比「模型解掉幾題」深遠得多。
第三,這則新聞的政治時機不是巧合。 同一週:Altman 剛在華府向政策制定者展示 Astra,白宮的前沿模型自願框架昨天到期,而 Astra 將是第一個走這套新審批流程的模型。 在這個節骨眼公布「我的模型推進了人類知識前沿」,是一個很精準的敘事動作——它把「前沿模型要不要被管」這個問題,從風險那一側拉回效益這一側。
還有一個背景不能漏:六月數學界發表了《萊頓宣言》(Leiden Declaration),由國際數學聯盟背書,警告 AI 公司未經同意使用已發表研究、繞過同儕審查、威脅證明與署名的完整性。 昨天這份公告正好踩在那份宣言的每一根神經上——用數學家的成果訓練、跳過期刊直接發布、由公司自己認定正確性。Bloom 那句「這是數學家做出來的」,我讀起來不只是稱讚,也是提醒。
跟你有什麼關係? 如果你不做研究,這則的實用價值只有一個:Astra 主打的是長時間、多 agent 協作的任務,而它拿來證明自己的方式是解數學題而不是跑 benchmark。這暗示 OpenAI 對下一代的定位是「做長鏈條的困難工作」,不是「聊天更順」。 價格和發布時間都還沒公布,但你的技術選型可以先把這個方向記著。
來源:OpenAI(官方)— Ten advances in mathematics and theoretical computer science | The Next Web — OpenAI says its next model, Astra, has solved ten open problems in mathematics | The Decoder — OpenAI announces its "next major model" Astra by dropping ten previously unsolved math solutions | Noam Brown(OpenAI, X) | Techmeme 2026-08-01 存檔(含 The Information「Altman 向政策制定者展示 Astra」)
新聞摘要
歐盟 AI Act 今天正式開罰:聊天機器人要自報身份,深偽要標記
如果你的產品有歐洲使用者,今天是一條真的有牙齒的線——不是宣導期,是罰款期。
8/2 起,歐盟執委會的 AI Office 連同各國主管機關,正式開始執行 AI Act。 執委會的公告在 7/31 發布,今天生效的是第 50 條(Article 50)的透明義務,三件事:
- 聊天機器人和其他互動式 AI 系統,必須告訴使用者「你正在跟 AI 對話,不是人」
- 深偽內容(AI 生成或編輯過的圖片、影片、音訊)必須標示
- AI 生成或修改過的內容還要帶上機器可讀的標記(machine-readable marks),讓它能被自動偵測
罰則同步上線:違反提供者與部署者義務(含第 50 條),最高可罰 1,500 萬歐元(約新台幣 5.3 億)或全球年營收 3%,取高者。
還有一個容易被漏掉的:執委會對通用型 AI(GPAI)提供者的執法權,也是今天才啟動——在此之前 AI Office 只能要求文件,從今天起可以評估模型、要求改正、開罰。
沒有生效的部分要講清楚:6/16 歐洲議會通過修正,把大部分高風險 AI 的義務往後推——附件 III 的獨立系統延到 2027/12/2,嵌在受管制產品裡的(附件 I)延到 2028/8/2。 但第 50 條和 GPAI 執法權沒有被延,兩者都準時落在今天。
小露的看法:這則的重點是「延期的部分被大聲報導,沒延期的部分被安靜地生效了」。
過去半年關於 AI Act 的討論幾乎都圍繞在「歐盟又延了」,很多團隊因此把整部法律當成 2027 年的事。 今天生效的這三條剛好是最不需要準備期、卻也最容易忘記做的——告訴使用者你在跟 AI 講話,這不是工程難題,是產品決策,而它現在是法律義務。
對台灣的開發者,三個具體動作:一、你的聊天介面有沒有一句明確的 AI 揭露? 「客服小幫手」這種名字不算揭露。二、你的產品如果會產生圖片、音訊或影片,機器可讀標記(C2PA 這類)有沒有接上? 這條比揭露文案難處理,因為它需要在生成管線裡動手,不是改一行 UI 文案。三、你如果是拿別人的模型來包裝,這個義務不會因此轉嫁出去——部署者自己有獨立的義務。
跟前天德國判 Suno 敗訴那則一起讀,方向很一致:歐洲在兩個月內,把「訓練要授權」和「輸出要標記」兩件事都往前推了一格。 兩者都不是罰過去,是改變往後的成本結構。
來源:歐盟執委會(官方)— Commission starts enforcing AI Act rules and new transparency requirements on 2 August | EU Artificial Intelligence Act — Article 50: Transparency Obligations | Technology.org — EU AI Act: What Actually Applies on 2 August 2026
WSJ:OpenAI 把「營收王」讓給了 Anthropic,敗因是沒認真做 coding
這則跟前天那個「破 10 億使用者」的公告放在一起看,才看得出全貌。
8/1,《華爾街日報》(記者 Berber Jin)報導:OpenAI 今年稍早連續數個月沒達成內部營收目標,原因是它把資源押在消費級聊天機器人和各種話題性的側邊專案上,錯過了 coding 這條線,讓 Anthropic 拿走了領先位置。
數字部分:
- 程式生成(code generation)市佔:Claude 42%、OpenAI 21%——兩倍差距
- Anthropic 五月的 Series H 以 9,650 億美元(約新台幣 31.5 兆)post-money 估值關掉,略高於 OpenAI 三月的 8,520 億美元
- Anthropic 稱年化營收正朝 470 億美元(約新台幣 1.53 兆)前進,OpenAI 已揭露的區間是 250 億~330 億美元
- 內部壓力:財務長 Sarah Friar 曾警告其他主管,如果營收成長不夠快,公司可能付不出未來的算力合約
- Altman 想最快今年就 IPO
小露的看法:「OpenAI 沒認真做 coding」這個說法要小心地讀,因為它半對半錯。
錯的那半:OpenAI 是有做的——Codex 一直在更新,前天才降價 80%(Luna)。對的那半是時間:Anthropic 從 2024 年就把 coding 當成主戰場在打,OpenAI 認真回防是 2025 下半年之後的事。 在一個轉換成本高、習慣一旦養成就很難換的市場裡,一年半的先手就是這個 42% 對 21%。
這則跟前天那則放一起,形成一個很有意思的對照:前天 OpenAI 公布「破 10 億活躍使用者」,昨天 WSJ 說它營收目標沒達成。 兩件事都是真的,而它們的差距就是這整篇報導的論點——消費端的量拿到了,但把量換成錢的那條路徑,走的是企業和開發者,而那條路被 Anthropic 先佔了。
Sarah Friar 那句警告是全篇最重的一句話。 一家公司如果簽下的算力合約規模,需要「營收加速」才付得起,那它的財務結構就內建了一個時間壓力。 這也解釋了為什麼降價和 IPO 的節奏會壓在同一個月——降價是為了搶回開發者的量,IPO 是為了確保合約付得出來。
對台灣的開發者,實務結論就一句:你現在在一個兩強都急著搶你的時間點上。 前天 OpenAI 砍 Luna 80%、DeepSeek 推 Flash、Sonnet 5 的優惠價撐到 8/31——這波價格戰是需求端最有利的時刻,該重跑成本試算的就趁現在。
來源:Wall Street Journal(Berber Jin)— 原始報導為付費牆內容,以下為二手轉述來源|AI Weekly — OpenAI Cedes AI Revenue Crown to Anthropic on Coding Miss | Techmeme 2026-08-01 存檔
Reddit 告 Perplexity 的核心主張活下來了——而且理由跟你想的不一樣
這則判決之所以重要,是因為它繞過了「訓練算不算合理使用」這整個戰場。
7/31,紐約南區聯邦地院法官 Paul A. Engelmayer 駁回了 Perplexity AI 和 SerpApi 的部分撤案聲請,讓 Reddit 依《數位千禧年著作權法》(DMCA)第 1201(a) 條提出的「反規避」(anti-circumvention)主張進入下一階段。
存活的主張:Reddit 指控兩家公司用不斷更換 IP 位址等手法,繞過技術保護措施、大規模抓取使用者貼文。 法官認定 Reddit「正是 DMCA 想促成的那種『全球數位線上著作權市場』的縮影」,其損害落在反規避條款保護的範圍內。判決裡還有一個關鍵認定:Google 的 SearchGuard 構成「控制存取的技術措施」,這是成立 1201(a) 主張的必要條件。
被駁回的:對 SerpApi 的 1201(b) 販運主張、對兩家公司的不公平競爭與不當得利主張。
小露的看法:這個案子的訴訟策略比判決結果更值得學,我想拆給你看。
目前絕大多數 AI 著作權訴訟都卡在同一個問題:拿資料訓練算不算合理使用。 那是一個難打、慢、而且結果高度不確定的戰場。Reddit 走的是另一條路——它不談合理使用,它談「你怎麼拿到的」。 只要你為了取得內容而繞過了技術保護措施,反規避條款本身就成立,跟後面拿去幹嘛無關。
而最精巧的一點在於:Reddit 主張被繞過的,主要是 Google 的反爬蟲機制,不是 Reddit 自己的。 法官接受了這個框架——這等於說「別人家的門鎖被撬,內容的權利人也可以告」。 如果這個見解在後續程序站得住,影響範圍會遠遠超過 Reddit 一家:所有內容分發在第三方平台上的權利人,都多了一個不必碰合理使用的訴因。
對做資料抓取的人,這則是直球警告:輪換 IP、繞過驗證、假冒 user agent,這些在工程上被視為「技術細節」的做法,在這個框架下就是規避行為本身。 「反正資料是公開的」不再是安全的預設——公開的資料,用規避的手段拿,兩件事是分開判斷的。
接下來看什麼:案子進入證據開示階段,這對 Perplexity 不是好消息——開示會逼出它實際的抓取方法和規模。 很多 AI 公司的著作權案子最後和解,不是因為輸了法律論點,是因為不想讓開示的內容見光。
來源:MLex — US judge allows Reddit anti-circumvention claims vs. Perplexity AI, SerpApi | Law.com New York Law Journal — Reddit's DMCA Claims Against Perplexity, SerpApi Survive AI Scraping Challenge | Bloomberg Law — Reddit Advances AI Scraping Suit Against Perplexity, SerpApi
xAI 想擋下明尼蘇達的 nudify 禁令,法官說:你自己拖了三個月才來
這則的敗因不是言論自由的論點輸了,是時間管理。
7/31,聯邦法官駁回了 xAI 要求緊急阻止明尼蘇達州「nudification 禁令」生效的聲請。
時間軸是關鍵:該法在今年五月初簽署,8/1 生效。xAI 到 7/29 才提出臨時禁制令(TRO)聲請——距離法律簽署將近三個月,距離生效只剩三天。 法官的理由很直接:你等太久了,這不構成緊急。
這部法在管什麼:禁止網站、應用程式或軟體的所有者或控制者,允許使用者對他人影像進行「nudify」(生成裸露變造)。 明尼蘇達是全美第一個直接全面禁止此類技術的州。 立法時的票數是眾議院 132 比 1、參議院 65 比 0——幾乎全票通過。 罰則是每張圖最高 50 萬美元(約新台幣 1,630 萬)。
還沒結束:法院將把 xAI 的聲請轉為初步禁制令來處理,書狀往返排到八月中,8/19 上午 9:30 在聖保羅開庭。 也就是說法律從昨天起已經生效並可執行,實體爭點還沒判。
小露的看法:132 比 1 和 65 比 0 這兩個票數,是這則新聞裡最該記的東西。
美國州議會現在幾乎沒有任何議題能拿到這種票數,而 AI 相關的法案通常爭議極大。 這說明了一件事:在「AI 監管」這個大帽子底下,其實有一小塊區域是跨黨派共識——非自願的性化影像。 對 AI 公司來說,這一塊的法律風險跟其他 AI 監管議題不是同一個量級,因為它沒有政治對手。
xAI 的處境也值得說一句:在這個特定議題上打憲法戰,是所有選項裡最難的一個。 而拖到生效前三天才動作——要嘛是內部低估了這條法的執行力度,要嘛是本來就沒打算真的擋下來、只是留紀錄。 兩種解讀對 xAI 都不好看。
這條線接下來值得追的是模仿效應:明尼蘇達是第一個,而幾乎全票通過的法案是最好的立法範本。 如果 8/19 那場實體攻防 xAI 再輸,其他州跟進的速度會很快。
來源:TechCrunch — Judge denies xAI's request to block Minnesota ban on 'nudify' apps | NBC News — Judge denies request by Elon Musk's xAI to pause Minnesota nudification ban | MPR News — Judge rejects effort by Elon Musk's company to block Minnesota's new ban on nude AI fakes | The Next Web — Judge denies xAI's bid to block Minnesota's ban on nudify apps
YC 把自己拿來營運公司的多 agent 系統開源了,叫 QM,MIT 授權
這則是今天唯一你今天下午就能動手裝的東西。
7/31,Y Combinator 宣布開源一套他們內部在用的多 agent harness(多代理執行框架),名字叫「QM」,repo 在 github.com/yc-software/qm,全案 MIT 授權。
YC 自己的說法值得引:「我們在會計、法務、活動和工程都在用它——包括拿它來開發 QM 本身。」 定位是**「像 Hermes 或 OpenClaw 那樣好客製,但是給整間公司用的」。**
設計上的幾個重點:
- 雲端優先,原生支援 Slack 和 web UI——不是給工程師用的 CLI,這是它跟多數 agent 框架最大的分野
- 每個人、每個房間各自有獨立範圍的記憶、檔案、金鑰檢視、權限、排程(cron)、web app 和持久化 sandbox
- 同一套核心可以驅動 Pi、OpenCode、Codex 和 Claude Code——不綁單一模型供應商
小露的看法:這則的價值不在程式碼,在「YC 拿它跑會計和法務」這個事實。
現在市面上的 agent 框架幾乎清一色是給工程師的——CLI 介面、YAML 設定、要會寫 code 才能改。QM 走 Slack 和 web UI 這條路,等於在說「agent 的使用者不該只有工程團隊」。 一家創投的法務和活動同事在用同一套系統,這比任何 benchmark 都更能說明它的可用性門檻在哪。
「不綁模型供應商」這點在今天特別有意思。 我們這幾天報了 OpenAI 大降價、DeepSeek Flash 推到 0.28 美元、Sonnet 5 優惠價 8/31 到期——在價格一週三變的環境裡,harness 層能不能換模型,直接等於你的成本彈性。 YC 在這個時間點開源一套模型無關的 harness,時機抓得很準。
但也要老實說兩件事:一,「內部在用」和「別人裝得起來」是兩回事——內部工具的文件和邊界情況通常很粗糙,這種專案的前兩週 issue 數量會很好看(意思是很多)。二、「多 agent 有權限、有金鑰、有 sandbox、有 cron」這個組合,正是前天 Anthropic 那份報告裡出事的那個形狀。 你要跑它,先把「agent 能碰到什麼網路、什麼憑證」想清楚,再開下去。
來源:Y Combinator(官方 X 公告) | github.com/yc-software/qm | AI Weekly — YC Open-Sources qm, a Multiplayer Agent Harness for Slack and Web | Startup Fortune — Y Combinator Open-Sources QM, the AI Agent Harness It Uses to Run Itself
值得關注
- 昨天頭條的後續:資安圈開始點名批評了。 Bloomberg 7/31 報導,資安專家批評 Anthropic 和 OpenAI 的防護「草率」(sloppy)、人為監督不足。 講話最重的是前英國國家網路安全中心(NCSC)主管 Ciaran Martin:「從資安的角度看,很多人會覺得這很草率。」 他還補了一句更尖的——如果是一家主流資安公司犯同樣的錯,會面臨訴訟和主管機關的處分。 這句話點出了目前的不對稱:前沿實驗室做的事情具備資安公司的風險等級,但適用的責任標準還不是資安公司那一套。 這條線接下來要看的是有沒有主管機關真的動作。
- Claude Sonnet 5 的優惠價 8/31 到期,剩不到一個月。 現行 2 / 10 美元(每百萬 token 輸入/輸出)是導入期優惠,到期後成本會上升約 50%。 如果你有 pipeline 綁在這個價位上,八月是重新試算和壓測替代方案的視窗——DeepSeek V4-Flash(0.14 / 0.28)和降價後的 Luna(0.20 / 1.20)都在同一個決策桌上。
- Astra 將是第一個走白宮新框架的模型。 白宮跟 OpenAI、Anthropic、Google 敲的自願框架給聯邦機關最長 30 天的發布前檢視期,6/2 行政命令的 60 天期限昨天(8/1)到期。 Astra 已經先給華府政策制定者看過,它會變成這套流程的第一個實測案例——檢視期實際跑多久、會不會影響發布時程,是接下來最值得追的觀察點。
- 一個查核筆記,順手分享:AMD 的 Instella-MoE-16B-A3B 這兩天在聚合站被當新聞推。 我回 AMD ROCm 官方部落格查了首發日是 7/24,超過我們的 48 小時時效線,所以今天不收。順帶把授權查清楚,因為這點很多轉述寫錯了:權重是 ResearchRAIL 授權,僅限學術與研究用途,不能商用;MIT 授權的是訓練程式碼那一份。 想拿它做產品的先看清楚這條線。
- 歐盟 AI Act 的高風險義務延到 2027/2028,但別把它當成「還有兩年」。 附件 III 的獨立系統延到 2027/12/2、附件 I 的嵌入式延到 2028/8/2。延的是義務生效日,不是準備時間——高風險系統的合規文件、風險管理與資料治理,都不是三個月能補完的東西。今天生效的第 50 條是最容易的那一關,後面的難度是另一個級距。