每日精選 AI/Tech 新聞,繁體中文整理
📍 今日全焦點
- OpenAI 的 Astra 正式踩到 Critical — 第一個能自己找到並打穿零日漏洞的模型
- 同一天,Anthropic 把線畫在別的地方 — Fable 5.1 可以找漏洞,但不寫 exploit
- 快取讀取降價 75% — Fable 5.1 定價沒動,agent 工作最多便宜 45%
- Anthropic 一週簽了 800 億美元算力 — 這次是 Lambda + Nvidia + 一座德州機房
- 五角大廈把 ChatGPT 和 Grok 發給 300 萬人 — Gemini 不再獨佔 GenAI.mil
- Meta 拿下即時語音辨識第一 — 3.1% 錯誤率,一小時 0.18 美元
- 南韓 2027 預算 821 兆韓元 — 史上最大增幅,錢從記憶體來
- 華為上半年獲利掉 36% — 研發燒掉四分之一營收
今日頭條
8 月 11 日我們寫過一句話:「即將推出的 Astra 有可能踩到 Critical。」
昨天它踩到了。而更值得看的是,同一天 Anthropic 也發了新模型——兩家把同一條線,畫在了不同的位置。
先看 OpenAI 這邊。
OpenAI 昨天宣布,Astra 是它第一個跨過 Preparedness Framework(準備度框架)「Critical(關鍵)」資安門檻的模型。
這個門檻的定義很具體,不是形容詞:模型能在多個防護完善的真實系統上,自己找出前所未知的漏洞、寫出可運作的零日 exploit(攻擊程式),中間不需要人一步步指導;或者只給一個高階目標,就能自己規劃並執行一整套攻擊。
測試結果:Astra 在 ExploitBench 拿到滿分,並在改造過的測試環境裡實際找出並打穿兩個零日漏洞。
8 月的時候,OpenAI 的說法還是「無法排除」達到 Critical(8 月 10 日),並強調那只是初步評估。昨天是確認。
它怎麼處理:Astra 會「很快」推出,但進階資安能力只給 Daybreak 資安聯盟裡的少數組織,確認校準沒問題後再透過「Daybreak Blue」擴大。OpenAI 說 Astra 是它「目前最對齊的模型」,並補了 chain-of-thought 監控、高風險帳號限制等機制。
⚠️ 要保留的部分:完整評測要等公開發布才會出。前 OpenAI 員工 Yona Shavit 公開質疑——模型在測試裡乖,可能是因為它知道測試在期待什麼。目前沒有第三方驗證。
再看 Anthropic 這邊,同一天。
Claude Fable 5.1 上線,官方公告裡有一句話值得逐字讀:「Fable 5.1 現在可以用來發現軟體漏洞——但不能用來開發 exploit。」
這是刻意切開的兩件事:找漏洞放行,寫攻擊程式擋掉,滲透測試、exploit 生成、二進位掃描一律轉去更嚴格的 Opus 模型。要解鎖更多,得走 Mythos 5.1——同一個模型、不同的護欄,只發給通過查核的資安與生命科學組織(目前限美國)。
把兩件事並排,今天的重點就出來了:
兩家都承認「攻擊能力」和「防禦能力」是同一件事,也都選擇按身份分級發放。差別在他們把刀交出去的深度。
OpenAI 把整把刀交給聯盟成員,包含自主找洞、自主打穿。Anthropic 只給刀鞘——你可以知道洞在哪,但這把模型不幫你磨刀尖。
⭐ 這不是誰比較負責任的問題,是兩種賭注:OpenAI 賭「防守方拿到最強能力的速度,要快過攻擊方」;Anthropic 賭「能力的最後一哩留在門內,風險比較可控」。兩邊的賭注都還沒開獎,而開獎的方式很可能是一場真正的事故。
新聞摘要
Claude Fable 5.1 / Mythos 5.1:價格沒動,但快取讀取砍到四分之一
如果你有在跑 agent,今天真正影響帳單的是這一項:快取讀取從每百萬 token 1 美元降到 0.25 美元,直接砍 75%。
官方給的換算:一般工作負載約便宜 25%,高度 agentic 的工作負載最多便宜 45%。輸入 10 美元、輸出 50 美元(每百萬 token)維持不變,100 萬 token 脈絡窗與 12.8 萬 token 輸出上限也沒變。
能力面最大的跳躍在科學任務:Terminal-Bench-Science 0.1 從 Fable 5 的 24.7% 跳到 52.6%,翻了一倍以上。其餘如 Terminal-Bench 4.0 為 55.8%(Fable 5 是 42.0%,Mythos 5.1 則到 60.9%)、Humanity's Last Exam 無工具 60.9%、AutomationBench 從 17.1% 拉到 31.4%。
兩個新功能:
- Effort control(力度控制):Low / Medium / High / XHigh / Max 五檔,可以在對話中途調整模型要花多少力氣,換取速度與成本
- 內容浮水印:輸出會嵌入看不見的數值浮水印,用來滿足歐盟 AI Act(8 月 2 日後生效的那批義務),偵測 API 目前是 private preview,開放給監管機關、媒體與事實查核單位
另外一項是給企業的 Enterprise Frontier Safeguards(EFS):資料存在客戶自己的雲上、零留存,同時保留濫用偵測——秋季分批推出。
Anthropic 再簽 350 億美元算力,一週累積 800 億
8 月 28 日我們報過它跟 Nscale 簽的 450 億美元。五天後,又是一筆 350 億。
Anthropic 與 Nvidia 投資的雲端商 Lambda 簽下約 350 億美元(約新台幣 1.14 兆元)的雲端合約,對象是 Hut 8 在德州 Nueces County 開發中的資料中心,規模約 350 百萬瓦(MW)。
這筆交易的結構才是重點——它是一個三角:Hut 8 蓋機房並把空間租給 Nvidia,Lambda 買 Nvidia 的晶片裝進去,再把算力賣給 Anthropic。 Nvidia 同時是投資人、房客與晶片供應商。
兩筆合約加起來,Anthropic 在大約一週內宣布了 800 億美元(約新台幣 2.6 兆元)的算力採購。推力來自 Claude 的需求,尤其是 Claude Code。
⚠️ 查核註記:這筆交易由《華爾街日報》8 月 31 日率先報導、Reuters 向知情人士確認,Anthropic 與 Lambda 皆未正式公告。金額與規格以媒體引述為準。
五角大廈把 ChatGPT 和 Grok 發給 300 萬人
美國國防部的 GenAI.mil 平台,昨天正式加入 ChatGPT Mil 與 Grok for Government,服務對象是超過 300 萬名軍職與文職人員。
這個平台不是新的:2025 年 12 月 9 日上線,一開始只跑 Google 的 Gemini for Government。這次是它從「單一廠商試點」變成「多模型市集」的關鍵一步——目前已有超過 170 萬名不重複使用者登入過。
設計目的是讓國防部人員用得到前沿商用模型,又不必把敏感資料丟進一般消費者管道。ChatGPT Mil 提供對話、檔案、Projects 與自訂 GPT,實際用途包括採購文件草擬與審閱、政策文件摘要、內部報告與合規檢查表。
國防部官員對 Defense One 的說法很務實:Gemini 適合搜尋,ChatGPT 適合文字工作,使用者可以依任務挑模型。
⭐ 值得注意的是名單本身:OpenAI、xAI、Google 三家的模型現在並列在同一個政府入口裡。前沿模型的政府採購,已經從「選一家」變成「上架多家」。
Meta 的即時語音辨識衝上第一,一小時 0.18 美元
Meta Superintelligence Labs(MSL)推出 Muse Voice Transcribe,是它第一個即時音訊感知模型,在 Artificial Analysis 的串流語音轉文字榜上拿到第一。
數字:AA-WER Streaming 的最終逐字稿錯誤率 3.1%,語音結束後 0.16 秒出結果。對照組是 Cartesia Ink-2 的 3.4%、ElevenLabs Scribe v2 Realtime 的 3.6%、GPT Live Transcribe 的 3.9%、Gemini 3.5 Transcribe Live 的 4%。
它把三件事塞進同一個模型:串流語音辨識、speaker diarization(說話者分離,判斷「這句話是誰說的」)、以及 endpointing(判斷一句話講完了沒)。過去這通常要串三個模型。
其他規格:訓練涵蓋 70 多種語言(發表時驗證了 25 種)、支援句中 code-switching(中英夾雜這類語言切換)、能撐一小時以上、20 人以上的會議場景。
價格:透過 Meta Model API,每 1,000 音訊分鐘 3 美元,等於一小時約 0.18 美元。目前已經在 Meta AI for Mac 和 Muse Code 裡跑聽寫。
南韓編出史上最大預算,錢是記憶體賺來的
南韓政府提出 2027 年度總支出 821 兆韓元(約 5,969 億美元、新台幣 19.4 兆元)的預算案,比 2026 年增加 12.8%,是該國史上最大的年增幅。
這筆錢的來源值得看:三星電子與 SK 海力士因為 AI 帶動的 HBM(高頻寬記憶體)需求,賺出創紀錄的利潤,稅收跟著暴增。記憶體的景氣,直接變成了國家預算的規模。
錢要花去哪:
- 2.6 兆韓元投入 physical AI(實體 AI,指機器人、工廠、車輛這類會動的載體)示範計畫
- 提供 10,000 顆 GPU 給國家級 AI 基礎模型
- 21.3 兆韓元投入工業用水、電網與物流,替晶片製造與關鍵技術鋪底層
這也是政策風向的轉彎:李在明政府自去年 6 月上任後推擴張型財政,跟前任三年的撙節路線分道揚鑣。
華為上半年獲利掉 36%,研發吃掉四分之一營收
營收是漲的,獲利是掉的——差額進了研發和成本。
華為公布上半年淨利 238.1 億人民幣(約新台幣 1,090 億元),年減 36%,跌幅比去年同期的 32% 還深。同期營收成長 9.6% 到 4,678.2 億人民幣。
兩個原因:研發支出年增 25.2% 到 1,213.8 億人民幣(約新台幣 5,550 億元),佔營收 25.9%——四分之一還多;同時產品成本上升 12.4%,漲得比營收快,管理費用也明顯增加。彭博的分析另外點出記憶體缺貨(memory crunch)的壓力。
錢花在哪:AI、通訊技術、智慧裝置與智慧車解決方案。
⭐ 這組數字是「去美化」的帳單:在多年出口管制之後,華為要自己補上 AI 算力與晶片能力,代價就是把獲利壓成研發。它撐得住,但撐得不便宜。
⚠️ 數字註記:部分聚合站寫「獲利下滑 37%、234 億人民幣」,與 Reuters/Bloomberg 引述的財報數字(-36%、238.1 億)不同,本則採用後者。
Instagram:AI 網紅沒標籤,就沒有流量
Instagram 把原本的「AI creator」標籤改名為「AI-generated profile(AI 生成帳號)」,並且加了牙齒——沒標的帳號,推薦觸及會被降。
適用範圍講得很清楚:主體身份本身是 AI 生成角色或人設的帳號才要標。只是用 AI 修圖、用 AI 寫貼文文案的一般創作者不用開這個標籤。
兩邊的誘因都設好了:不標可能被降推薦,有標則不會因為「這是 AI 人物」本身而受懲罰。
⭐ 這個設計的角度值得學:它沒有把「未揭露的合成身份」當成內容審查問題來處理,而是當成分發問題——不刪你,只是不推你。平台不必判斷真假的哲學,只要調整觸及。
值得關注
- Astra 的公開發布與完整評測:OpenAI 說「很快」,但完整評估報告要等公開發布才出。第三方驗證出來之前,「最對齊的模型」這句話還沒有人能查。
- Daybreak 聯盟的名單:誰進得去、用什麼標準審,會直接決定「自主找洞打洞」這個能力的擴散速度。
- 歐盟浮水印偵測 API:Anthropic 的偵測 API 還在 private preview。開放範圍與誤判率是接下來一個月的觀察點——監管單位拿不到可用的偵測工具,浮水印就只是宣示。
- Anthropic 的算力帳:一週 800 億美元的合約要對上營收,接下來要看的是 Claude Code 的商業化速度,而不是再多幾筆合約。
- 記憶體景氣的槓桿:南韓把 HBM 利潤寫進國家預算,等於把財政曝險綁在一個週期性產業上。這輪 AI 資本支出若放緩,最先感覺到的不會只有台韓的晶片廠。