ZenDream Studio Contact
← Observatory
ZENDREAM OBSERVATORY / AI NEWS DATABASE

AI 速報

每日整理 AI Hot 與 Repo Radar:每則情報有獨立文章、繁體中文重點、來源證據、後續觀察與原文入口。

SECTION 01

AI Hot

5
SECTION 02

Repo Radar

5
ARCHIVE

歷史文章

630
MarkTechPost(RSS)

Sakana AI 推出商用產品 Sakana Marlin:企業AI 代理可生成長達100頁研究報告及幻燈片

東京 AI 公司 Sakana AI 發佈首個商業產品 Sakana Marlin,定位為虛擬首席戰略官(Virtual CSO)的 B2B 自主研究AI 代理。輸入主題後,Marlin 自主執行最多約8小時,輸出數十至100頁詳細報告(含正文、參考文獻和附錄)及 AI 生成的幻燈片。核心算法是自適應分支蒙特卡洛樹搜尋(AB-MCTS),可動態選擇"擴寬"或"加深"。產品經2026年4月封閉測試(約300名專業人士)優化,已與三菱 UF

TechCrunch:AI(RSS)

美國政府禁止Anthropic模型並非因AI越獄

⚠️ 待查證:美國商務部上週五援引一項模糊的出口管制指令,禁止非美國人(含Anthropic員工)存取Fable 5和Mythos 5模型,理由是未指明的國家安全關切。Anthropic隨即下架兩款模型以遵守指令。安全專家Katie Moussouris指出,指令源於一篇描述Fable 5安全防護繞過的論文,但該行為"不應觸發出口管制",指令倉促且過度。數十名安全研究人員呼籲撤銷,稱此舉削弱美國網路防禦能力。外界質疑美國政府帶有報復性質

Claude:Blog(網頁)

Built with Opus 4.7 Claude Code 黑客馬拉松獲獎者揭曉

Anthropic 舉辦的 Built with Opus 4.7 Claude Code 黑客馬拉松公布三位獲獎者。第一名 Medkit(Bedirhan Keskin 構建)是模擬真實診療場景的醫學訓練工具,已獲三所醫學院和一家制藥公司試點。第二名 Wrench Board(Alexis Chapellier 開發)可解析電路原理圖和板視圖,定位故障點,依賴 Opus 4.7 的視覺理解能力。第三名 Maieutic(Paula V

Claude Code:GitHub Releases(RSS)

Claude Code v2.1.178 發佈

本次更新新增 Tool(param:value) 語法用於權限規則匹配工具輸入參數;嵌套 skills 目錄中的技能自動加載,名稱衝突時以 <dir:<name 形式保留;嵌套 agent、workflow、output-style 衝突時取最近目錄。改進自動模式下子 agent 生成前的分類器評估;/doctor 採用扁平樹佈局;工作流提示詞高亮為紫色閃爍,僅觸發顯式短語;/bug 提交前需填寫描述。修復了 CLI 繼承過期 WebS

X:Rohan Paul (@rohanpaulai)

MiniMax Sparse Attention

MiniMax Sparse Attention(MSA)在1M token時,將注意力計算量削減28.4倍,H800 GPU上預填充提速14.2倍、解碼提速7.6倍,同時基準性能基本持平全量版本。MSA不放棄softmax注意力,而是在分組查詢注意力旁增設一個小型路由分支,讓每個查詢組自主選擇應查看的key-value塊,主分支僅對該子集執行精確注意力。該方法將長上下文視為延遲約束下的檢索問題,通過架構內建選擇器,用模型自身注意力模式

X:寶玉 (@dotey)

寶玉發佈《圖解Skill》配套Repo中的info-digest Skill

寶玉(@dotey)公開了《圖解Skill》配套GitHub倉庫中的info-digest Skill,用於日常整理AI資訊並生成推文初稿,預設調用Claude網頁版+Opus 4.6。核心提示詞技巧:1)站在讀者角度寫作;2)聯網檢索做實核查;3)交代背景資訊;4)生成短而精煉的純文本格式。該Skill為專案庫JimLiu/Illustrated-Agent-Skills的一部分。同步有抽獎活動(轉發/引用/評論抽10人,本週五中午1

X:Rohan Paul (@rohanpaulai)

Factory 2.0 發佈:AI AI 代理接入完整軟體工作流

⚠️ 待查證:FactoryAI 今日推出 Factory 2.0,將 AI AI 代理與整個軟體工作流打通--涵蓋工單、客戶請求、代碼、測試、安全檢查、代碼審查、部署、文檔和生產事故。系統強調反饋循環的重要性:每個事故和審查記錄都應成為下一任務的訓練信號。所有 bug 報告、客戶請求、內部討論、測試失敗、安全警告和事故被視為單一循環內的信號,由AI 代理協助分類、編寫代碼、測試、審查、發佈、監控生產環境,並將結果反饋回系統。這標誌著從

The Verge:AI(RSS)

Anthropic與白宮就Fable 5和Mythos 5禁令產生新衝突

⚠️ 待查證:6月9日,Anthropic發佈Fable 5和Mythos 5,稱前者能力超過此前所有公開模型。6月12日,美國政府下令阻止國外存取這兩款模型。據稱,該命令源於亞馬遜與白宮對話後,研究人員發現可誘導Fable 5提供用於網路攻擊的資訊。Anthropic遵守指令移除所有使用者存取權限,但表示不同意將狹窄的越獄漏洞作為召回商業模型的原因。

X:Kim (@kimmonismus)

OrcaRouter 推出 DSL 路由工具,對標 OpenRouter Fusion

OrcaRouter 發佈 DSL 路由工具,對標 OpenRouter 48 小時前推出的 Fusion。其宣稱復活了已停止的 Fable 5(來自 Anthropic)級智慧,且更便宜、開源、使用者掌握密鑰。針對 Fusion 的 synthesizer 在深度研究中表現優秀但編碼能力差的問題,OrcaRouter 進行了修復:使用者只需一個 prompt,即可擴展到任意 panel,經 judge 和 synthesizer 輸出

X:Kim (@kimmonismus)

OpenAI協調美國政府確保外籍研究員參與前沿AI開發

⚠️ 待查證:據Financial Times報導,OpenAI正在與美國政府協調,以確保外國國籍研究人員能繼續參與最先進AI模型的開發--這一做法此前已被Anthropic的指令禁止。報導引述接近OpenAI的人士稱,近期整個行業都在與美國政府合作,試圖維持外籍研究人員在開發前沿模型中的參與。這暗示美國政府可能在全行業範圍內限制非美國公民從事前沿AI研究。

TechCrunch:AI(RSS)

Meta 在 Facebook 上線"AI Mode",基於平臺公開資訊合成答案

Meta 宣佈在 Facebook 推出"AI Mode"搜尋功能,利用 Meta AI 從公開帖子(含群組和 Reels)提取資訊併合成答案,使用者可用自然語言提問獲得摘要。同時新增影片拼貼剪輯、過渡效果及 AI 照片預設(可更換服裝、髮型和配飾),體育迷可在 Stories 中點擊"AI Edit"虛擬穿上隊服。這些更新延續了此前動態頭像、Marketplace 自動回覆和創作者 AI 助手的部署節奏。此外,Meta 近期啟動了 F

The Verge:AI(RSS)

特朗普政府要求Anthropic下線Fable 5和Mythos 5,引發多國加速主權AI建設

⚠️ 待查證:應美國政府要求,Anthropic於上週末突然下線Fable 5和Mythos 5,並禁止所有外籍人士(含自家員工)存取。此舉被英國AI安全部長Kanishka Narayan視為國家安全問題,法國前總理Gabriel Attal稱之為"AI戰爭"開端,加拿大總理Mark Carney強調必須實現AI來源多元化。事件凸顯美國對前沿AI的單邊控制權,促使各國加速推進主權AI戰略。Anthropic可能恢復模型上線,但全球對美

The Decoder:AI News(RSS)

美國政府指責Anthropic,安全專家稱不可破解的LLM不現實

⚠️ 待查證:美國政府官員指責Anthropic無視特朗普網路安全行政令,未等指定審查機構設立就擅自發佈Fable 5,並指控其明知存在jailbreak風險卻未披露。但安全專家指出,任何LLM都可以被破解,OpenAI也曾警告提示注入可能永遠無法完全解決。超過100名安全專家和高管聯名致信商務部,要求解除對Fable和Mythos的出口管制,稱其他模型如GPT-5.5、Opus、Sonnet以及中國的Kimi 2.7也能完成類似的安全

The Verge:AI(RSS)

科技巨頭在AI監管上的最後絕望推動

⚠️ 待查證:隨著中期選舉臨近,科技巨頭遊說團體正試圖推動聯邦AI預佔法,以統一全美標準取代各州分散監管。白宮透露將支援參議員Blackburn的《兒童線上安全法案》(KOSA)作為整體預裝包的一部分,但眾議院共和黨人和民主黨人均質疑,且參眾兩院的KOSA版本分歧巨大--參議院要求科技公司承擔"注意義務",眾議院已弱化該條款。特朗普盟友Mike Davis堅持預佔法必須滿足"四C"(兒童、保守派、創造者、社區)。立法日程僅剩一個半月,隨

X:Eric Zakariasson (@ericzakariasson)

mcp cli

開發者比較 MCP 與 CLI 在 AI 工作流中的用途:CLI 處理模型已掌握的任務(git、gh、npm、docker、文件操作),基於 man 手冊,本地登錄即用,上下文成本極低;MCP 用於集成 Slack、Notion、Linear、Twitter 等外部服務。作為統一協議,MCP 讓團隊在 Cursor 中添加一個服務器即可全員使用,一次認證持久保存且本地與雲端一致,在 Cursor 中提供豐富圖標和可追蹤性。結論:CLI

X:阿易 AI Notes (@AYiAInotes)

Anthropic與特朗普政府因Fable 5和Mythos 5越獄問題爆發溝通危機

⚠️ 待查證:Anthropic於6月9日發佈Fable 5和Mythos 5,政府未阻攔。6月12日政府突然要求禁止外國人存取,Anthropic無法實時區分國籍,6月13日全球下架。據Axios爆料,政府指責Anthropic"說兩種不同語言",原本支援給機會的官員全部倒戈。此前亞馬遜舉報模型可被越獄,政府三通電話要求主動下架,CEO硬剛拒絕,政府隨即祭出出口管制。Anthropic請來被政府視為"激進民主黨"的安全專家駁斥,徹底喪

X:郭明錤 Ming-Chi Kuo (@mingchikuo)

郭明錤:聯發科AI業務升級為系統級設計,鎖定Google TPU v10及馬斯克AI晶片機架

郭明錤最新調查顯示,聯發科將AI業務從"IC/ASIC設計"升級為"系統級設計",初期目標Google TPU v10的PCBA(L6)及馬斯克關聯公司自研AI晶片的L10機架。此舉旨在抓住服務器機架複雜度提升(CPO、800V HVDC)帶來的增值機會,並應對2-3年後Semi-COT對ASIC設計的衝擊。聯發科將採用輕資產模式,主導設計驗證並外包製造,以維持40-50%毛利率。Google TPU L10中選幾率低;馬斯克AI晶片機

X:郭明錤 Ming-Chi Kuo (@mingchikuo)

聯發科AI事業策略升級至系統級設計,鎖定Google TPU PCBA及Musk公司AI機櫃

⚠️ 待查證:郭明錤產業調查顯示,聯發科將AI事業從IC/ASIC設計提升至系統級設計,首目標為Google TPU的PCBA(L6)及Musk公司自研AI晶片的L10機櫃。此為長期規劃,2年內對基本面影響可忽略。機會源於服務器機櫃複雜度和更新速度提升,風險為ASIC設計動能2-3年後或因Semi-COT模式趨緩。聯發科擬以"主導設計與驗證"輕資產模式(製造外包)確保毛利率40-50%。具體:Google TPU目標自v10(Icefi

X:小北 (@frxiaobei)

YC 新專案 Hub:全人類正成為 AI 世界模型的資料生產者

Y Combinator 發佈的新專案 Hub(@hubxyz)為前沿 AI 實驗室和機器人提供真實世界訓練資料。Hub 指出:人類勞動力佔全球 GDP 一半,但幾乎從未被記錄;它通過全球貢獻者網路捕獲難以存取的資料。主推文引用印度工廠工人頭戴攝像頭工作的影片,調侃這是在訓練自己的 AI 替代者,現在看 Hub 可能是更大規模的開端--全人類正在成為世界模型的資料生產者。

X:阿易 AI Notes (@AYiAInotes)

Seedance 2.0比Grok貴近4倍,影片生成品質卻不輸

使用者對比Seedance 2.0與Grok的影片生成效果,發現Seedance 2.0價格貴近4倍,品質卻不相上下;僅用一句話提示詞測試Grok對中國古裝風格理解,結果超預期。引用推文指出,GPT Image 2加Grok的混合工作流性價比極高:SuperGrok月費30美元,目前有3個月67%優惠,單條短片幾乎零邊際成本。角色風格一致性由GPT Image 2把控,出圖後丟進Grok做動態效果即可。

X:Rohan Paul (@rohanpaulai)

Heidi Evidence 小模型匹配 Sonnet 4.6 臨床搜尋品質

臨床搜尋工具 Heidi Evidence 表示,六週前其自研小模型在臨床搜尋任務中匹配了前沿規模模型 Sonnet 4.6 的品質。方法是通過臨床醫生的偏好反饋訓練,而非單純擴大模型規模。在匿名測試中,醫生面對同一醫學問題、兩個匿名答案,選擇 Heidi 小模型答案的概率為 49.9%。Heidi 指出,醫學領域的關鍵難點在於知道何時搜尋、引用什麼、說多少,以及模糊答案何時比不回答更糟。

X:阿易 AI Notes (@AYiAInotes)

微軟CEO Nadella:AI時代公司護城河是"學習循環",非大模型

⚠️ 待查證:微軟CEO Satya Nadella撰文稱,AI時代公司真正護城河是"學習循環"--將工作流程、領域知識和多年判斷經驗餵給AI,形成獨有的"機構記憶"。他提出"人類資本"(人的判斷力、創造力)和"token資本"(公司持續改進的AI能力),強調人類價值不會因AI變強而降低,反而更重要。他警告:若少數大模型吸走所有行業知識,普通公司只剩調用權限,失去價值。

IT之家(RSS)

消息稱英偉達時隔五年重返債市:擬發債籌集200億美元

6月15日消息,英偉達計劃通過在美國發行債券籌集200億美元(約1353.83億元人民幣)。該公司上一次進入投資級債券市場是在2021年6月,當時融資50億美元。本次擬發行七檔債券,最晚於2056年到期。募資將用於一般公司用途,包括償還及再融資現有票據。摩根大通、摩根士丹利和高盛擔任聯席承銷商。截至2026年4月季度末,英偉達持有132.4億美元(約896.23億元人民幣)現金及現金等價物。

TechCrunch:AI(RSS)

76位網路安全專家聯名要求撤銷美國政府對Anthropic最強模型的出口禁令

⚠️ 待查證:76名網路安全專家聯名致信美國政府,要求撤銷對Anthropic的Fable和Mythos模型的出口管制令,稱此舉將最強模型從防禦者手中奪走,在對手快速進步時非常危險。美國政府近日以國家安全為由要求Anthropic限制出口,Anthropic已暫停全球使用者存取。Mythos預覽時僅約50家公司可用,後擴展至15國約150組織;其公開版Fable設有嚴格防護欄,幾乎阻止所有網路安全提示。專家認為白宮可能依據亞馬遜一篇未公

X:Ethan Mollick (@emollick)

AI數學測試解7/10難題仍被指未達標

奇怪的標題--我不確定解決10個極其困難的新問題中的7個就意味著AI"沒有完成任務",而15個月前大語言模型還不會做數學。 但實際研究很有趣,揭示了AI在數學中的缺陷與成功。https://1stproof.org/assets/docs/report.pdf 【引用 @Nature】:人工智慧經歷了其最嚴謹的數學測試,然而它並未完成任務 https://go.nature.com/4oqlNk6

IT之家(RSS)

美國消費者指控 Claude Max 訂閱套餐額度"虛標",擬對 Anthropic 發起集體訴訟

⚠️ 待查證:華盛頓使用者 Karl Kahn 指控 Anthropic 的 Claude Max 訂閱套餐存在虛假宣傳,100 美元/月的 Max 5x 和 200 美元/月的 Max 20x 套餐宣稱相比基礎套餐(17-20 美元/月)提供 5 倍至 20 倍使用額度,但實際額度遠未達標且使用者難以自行驗證。Kahn 請求法院下令退款並計劃升級為集體訴訟,Anthropic 拒絕就本案置評。

X:Kim (@kimmonismus)

Anthropic 員工在華盛頓與特朗普政府會面,尋求解決 Fable 5 和 Mythos 5 模型爭議

⚠️ 待查證:Anthropic 員工今日在華盛頓與特朗普政府會面,試圖解決 Fable 5 和 Mythos 5 模型的爭議。Anthropic 稱,上線前已與政府機構合作並獲批准,但上週五下午 1 點突然接到命令,要求以未指明的國家安全威脅為由下線模型,數小時後收到正式出口管制函。由於指令過於寬泛,Anthropic 暫停了所有外國國民的存取權限,最終對所有使用者關停模型。Axios 補充:Anthropic 聘請網路安全專家審查

IT之家(RSS)

MiniMax M3 模型正式開源:原生多模態、百萬上下文

MiniMax 於 6 月 12 日開源 MiniMax M3 模型權重併發佈 MSA 技術論文。M3 是原生多模態旗艦模型,總參數 428B,激活參數 23B,為首個從 Step 0 開始多模態混合訓練的開源模型。在 Artificial Analysis 綜合智慧指數上獲全球開源最高排名。輸出速度從約 30 TPS 提升至約 80 TPS,後續還將提速 30-40%。M3 在編碼與AI 代理評測中達行業頂尖水平,具備自主任務拆解、工

X:寶玉 (@dotey)

寶玉《圖解 Skill》微信讀書飆升版排名第15,抽10人送書

寶玉(@dotey)的《圖解 Skill -- AI 提效實戰指南》在微信讀書飆升版排名第15。為回饋讀者,抽10人送實體書(限內地)或電子書,北京時間本週五12點開獎,轉發、引用、評論即可參與。抽獎借助@Grok進行,將注意防範提示詞注入。已購書讀者可前往配套GitHub專案JimLiu/Illustrated-Agent-Skills,內含interview-analysis、interview-writing、info-diges

IT之家(RSS)

巴西Rio-3.5-Open-397B被指套殼阿里千問與Nex N2 Pro,IplanRIO致歉稱誤上傳基線版

⚠️ 待查證:巴西里約市政府旗下IplanRIO推出的開源模型Rio-3.5-Open-397B在多項基準測試取得SOTA,被稱為拉美AI新勢力。不到24小時,上海創智學院Nex團隊指控其套殼阿里千問Qwen3.5和Nex N2 Pro的權重混合版本。Nex展示證據:不提供初始系統提示時模型自稱"Nex N2 Pro"並提及"上海創智學院"。IplanRIO在Hugging Face致歉,稱因操作失誤上傳了合併基線版本,將重新上傳蒸餾與

Simon Willison 部落格

Anthropic Claude模型Mythos/Fable因出口管制離線,報導稱存在"性格衝突"

⚠️ 待查證:Axios報導援引知情人士稱,Anthropic的Claude模型(代號Mythos和Fable)因美國政府出口管制而離線,背後存在"性格衝突"與"態度問題"。當前方案之一是確保模型無法被越獄,但完美越獄防護可能不可行。此外,Anthropic是否成功防禦了2023年論文《Universal and Transferable Adversarial Attacks on Aligned Language Models》所述

公眾號:MiniMax(稀宇科技)

MiniMax 開源 M3 模型權重及 MSA 技術論文

MiniMax 上週五開源了 428B 總參數、23B 激活參數的 M3 模型權重,同步發佈 MSA(MiniMax Sparse Attention)技術論文,該架構顯著降低長上下文計算成本。M3 是首個從預訓練階段就進行文本、圖像等多模態交錯混合訓練的開源模型。發佈兩週後,M3 在 Artificial Analysis 綜合智慧指數、GDPval-AA 排行榜均獲開源模型第一,Code Arena WebDev 躋身帕累托最優序列

TechCrunch:AI(RSS)

Salesforce以36億美元收購AI客服平臺Fin

Salesforce宣佈以36億美元收購AI客服平臺Fin(前身為Intercom)。Fin提供可跨實時聊天、WhatsApp、短信、電話、Slack等多渠道解決客戶問題的AIAI 代理。Salesforce計劃利用Fin的技術和團隊增強其企業級Agentforce平臺,該平臺允許企業構建自定義AIAI 代理以自動化任務。交易預計在Salesforce 2027財年第四季度(即2027年初)完成。Fin聯合創始人兼CEO Eoghan

IT之家(RSS)

月之暗面 Kimi K2.7 Code 模型高速版上線:2 倍價格、最快 6 倍速

Kimi K2.7 Code 模型高速版上線,面向 Kimi Code Beta 計劃成員、Kimi API 開發者及 Kimi Business 使用者開放。高速版與普通版為相同模型,輸出速度約普通版的 5-6 倍,常規編程場景約 180 Tokens/s,短上下文可達 260 Tokens/s。價格為普通版兩倍:1M tokens 標準輸入 13 元、輸出 54 元,命中緩存輸入 2.6 元。該模型基於 6 月 12 日發佈的 K2

X:寶玉 (@dotey)

微軟CEO Satya Nadella提出"Token資本"概念:企業需同時經營人力資本與自建AI能力

⚠️ 待查證:微軟CEO Satya Nadella提出"Token資本"概念,認為AI時代每家公司需同時經營人力資本(員工知識、判斷力)和自建AI能力(Token資本)。兩者互補:人的判斷力越強,Token資本增長越快。檢驗標準:能否隨時替換底層通用大模型而不丟失專有經驗?若能,則真正擁有AI能力;若不能,則只是租用智慧。他建議將工作流、行業知識轉化為可迭代AI系統,建立私有評估機制,形成複利式學習飛輪。同時警告:若少數模型壟斷行業價

X:Elvis Saravia (@omarsar0, DAIR.AI)

Codex 自主設置 /goal:AI 代理工具化與風險警示

⚠️ 待查證:引用推文指出,Codex 可自主查看和設置 /goal,這是元提示的泛化。主推文作者強調,AI 代理憑藉上下文能幫你設定更強目標,因此將 /goal 作為工具是明智之舉。他還在編排器中為 /goal 構建了 UI,並建議從會話中挖掘表現良好的目標,封裝為技能自動化複用。需注意,LLM 可能出現獎勵黑客、偏向快速完成等奇怪行為,使用 /goal 時要格外謹慎。

MarkTechPost(RSS)

FineWeb 流式加載、過濾、去重、分詞與大規模網路語料庫分析實踐教程

該教程演示如何在不下載完整多 TB 語料庫的前提下,通過 HuggingFace 的 loaddataset 流式接口加載 FineWeb sample-10BT 子集的 3000 條文檔,檢查其 schema 及 url、language、languagescore、tokencount 等元資料字段,並復現 FineWeb 的品質過濾流程(Gopher / C4 / FineWeb 自定義規則)、採用 MinHash 進行近似重複檢

X:Kim (@kimmonismus)

Anthropic高級技術人員赴華盛頓斡旋:Mythos與Fable因出口管制下線

⚠️ 待查證:因出口管制,Anthropic的頂級模型Mythos和Fable被強制下線。公司已派遣高級技術人員飛往華盛頓,試圖修復與白宮的關係並說服官員模型可以被安全控制。有未經證實的指控稱中國相關組織曾存取Mythos,但David Sacks公開關注的是破解風險而非中國,Anthropic也表示白宮未提及中國存取。此事觸發了週五圍繞Fable 5的事件。

X:Rohan Paul (@rohanpaulai)

Satya Nadella 提出 AI 物理經濟學新公式與組織經濟學觀點

Satya Nadella 在微軟印度頻道訪談中提出 AI 物理經濟學供應側新公式:"Tokens per Dollar per Watt",強調每美元每瓦特獲得的 token 數是競爭力關鍵,並呼籲"基礎設施、基礎設施、基礎設施"。在其關於 AI 組織經濟學的文章中,Nadella 指出真正的競爭是圍繞模型的循環--工作流、反饋、判斷、異常、失敗及私有測試,這要求企業建立私有評估、私有強化循環和可查詢的制度記憶(token capit

X:Elvis Saravia (@omarsar0, DAIR.AI)

Elvis Saravia(DAIR.AI)用6個月構建自有 agent 編排器,稱其是應對本週 Fable 事件的最佳防禦

Elvis Saravia(DAIR.AI)耗時6個月構建自有的 agent orchestrator(編排器),具備編排、路由、動態工件/工作流、驗證器、agent 後端切換、自動化、技能及 MCP 工具等功能。這些能力在本週的 Fable 事件中成為最佳防禦。他年初即主張"擁有自己的 agent orchestrator",反對者認為維護成本高且不可持續,但他認為鎖定特定工具或模型供應商損失更大。通過挖掘 agent 會話遞歸構建和

The Verge:AI(RSS)

中國或已接觸Anthropic的Mythos模型,白宮據報因此實施出口限制

⚠️ 待查證:據Semafor的一份新報告,白宮對Anthropic的Mythos實施出口限制的部分原因是擔憂其已被一個與中方有關的組織存取。若中國政府實際接觸到Mythos 5或Fable 5,將構成嚴重國安風險,並可能通過知識蒸餾逆向工程該模型。白宮未確認該報告,特朗普顧問David Sacks在X上的帖子未提及中國。

X:Nathan Lambert (@natolambert)

Nathan Lambert警告中國開源LLM性能突破或遭禁令

⚠️ 待查證:AI研究員Nathan Lambert指出,開源權重模型支援者需清醒認識:一旦中國開源LLM性能出現重大突破,整個中國大語言模型領域很可能面臨全面禁止。國家安全機構會毫不留情地打壓開源模型。引用其部落格進一步強調,儘管Anthropic在AI治理上確有不當,但當前美國政府的行動更為惡劣,必須在更強模型(無論開源或閉源)到來前控制局面。

X:Kim (@kimmonismus)

中國高校AI時代裁撤1.2萬舊專業、新增1萬新專業

⚠️ 待查證:從2021年到2025年,中國大學共削減或暫停12,200個"過時"本科專案,同時新增10,200個新專案,重塑超30%的學位課程。目標是從文科、語言等就業較差的領域轉向與工業戰略和未來產業相關的技術學科,以應對日益嚴重的畢業生失業危機。中國正全面押注AI與科學領域,目前已有相當比例的科學家來自中國。

X:AI Safety Memes (@AISafetyMemes)

他們又撒謊了:Dario 並未在健康靜修(wellness retreat)

Anthropic CEO Dario Amodei 被白宮散佈謠言稱其在健康靜修(wellness retreat)無法聯繫。作者(AI Safety Memes)週五在 Anthropic 總部親眼看到 Dario 並未離開,直指白宮再次撒謊。引述推文指出,Anthropic 是過去兩年推動 AI 進步最猛的美國 AI 明珠,Dario 因不願完全聽從聯邦擺佈而遭蘇聯式宣傳打壓。批評此舉自毀長城,削弱美國對抗中國的 AI 競爭力。

Nathan Lambert:Interconnects(RSS)

歡迎進入AI治理的AGI時代

⚠️ 待查證:上週五收盤後,美國政府要求Anthropic暫停其最新Claude 5 Mythos/Fable模型的國內外存取權限,理由是存在模型越獄引發的網路安全風險。白宮通過Anthropic最大合作伙伴Amazon獲知此事。作者評論稱,對任何模型權重的出口禁令都是長期負面政策,且Anthropic過去幾年將AI與核武器相提並論的恐懼宣傳加速了這一時刻。該事件引發經濟不穩定擔憂,並暴露了前沿AI公司與政府間的緊張關係。

TechCrunch:AI(RSS)

AI公司競相上市,誰在搭便車?

SpaceX 本週完成史上最大規模 IPO,其 CEO 馬斯克成為全球首位萬億富豪。SpaceX 強調其高成本 AI 業務潛力,競爭對手 OpenAI 和 Anthropic 也已秘密提交上市申請,可能緊隨其後。市場分析認為三者之間存在上市時間競賽。同時,Quantum Space 等初創公司試圖借 SpaceX IPO 浪潮融資,例如圍繞太空資料中心概念。整個 IPO 市場重心正從消費/社交網路轉向 AI 實驗室和深度科技,形成"MA

X:Rohan Paul (@rohanpaulai)

研究:用AI做數學題更快但學得更少

一項研究分析了10年間320萬條ALEKS數學學習記錄,發現ChatGPT普及後,高中和大學生完成AI友好型文字題的速度顯著加快,但學習效果反而下降。監考環境下時間縮短現象消失,說明快速完成並非能力提升或平臺變化所致。後續監考的保留測試中,學生對AI友好題的正確率降低約25%,而難以用AI代勞的圖形題未受影響。

X:阿易 AI Notes (@AYiAInotes)

保羅·格雷厄姆:賺十億美金的複利法則

保羅·格雷厄姆發表文章《如何賺十億美金》,基於21年創業孵化經驗(見證30位億萬富翁),指出核心在於月增長率與持續時間--月增15%保持5年可翻4384倍,月入1萬美元的生意5年後月入4400萬美元,創始人自然身家十億。高增長源於做出好到使用者主動推薦的產品,最佳創業點子來自自己做且覺得酷的東西。PG最後調侃Claude做不到,因為它沒朋友和慾望。

Gary Marcus:The Road to AI We Can Trust(RSS)

白宮AI監管決定被指偏袒OpenAI與亞馬遜

⚠️ 待查證:白宮週五做出的AI監管決定被指偏袒OpenAI、亞馬遜等企業,同時對Anthropic施壓不足24小時,缺乏透明度和事實依據。Gary Marcus、Dean W Ball及卡託研究所Kevin Frazier等專家指出,這種由少數人閉門快速決策的做法帶有腐敗嫌疑,可能促使其他國家加速發展"主權AI"甚至中國AI,並導致美國人才流失。Anthropic聲明稱政府應在法定程序中基於技術事實阻止不安全部署,而非當前方式。Mar

X:Satya Nadella (@satyanadella)

Satya Nadella:沒有生態的前沿不穩定

⚠️ 待查證:微軟CEO Satya Nadella認為,AI驅動的平臺轉變首次實現人與數字系統間的認知循環。企業需同時構建人力資本(知識、判斷、關係)與token資本(自有的AI能力),且人力資本不會貶值,反而隨token資本增長而增值。真正的機會在於建立人力資本與token資本複合增長的學習循環--企業應能替換通用模型而不丟失已內化的專家知識,通過私有評估和強化學習讓模型從內部真實軌跡中持續提升。他警告,若所有價值被少數模型吞噬,將

X:Rohan Paul (@rohanpaulai)

德克薩斯大學論文:AI AI 代理部署後可靠性隨時間下降

德克薩斯大學論文指出,AI AI 代理在部署後即使模型不變,也會因長期記憶的摘要壓縮、相似記憶混淆、事實更新失效及維護操作而可靠性下降。例如藥物劑量可能變成"每日用藥",相似客戶記錄混淆,已取消訂閱仍保留,日程可能因維護消失。論文提出 AgingBench 基準測試,評估AI 代理在多次會話中的可靠性。研究強調"增加更多記憶"往往是錯誤修復--問題可能在於從未寫入、寫入後被擠掉、或寫入後未被信任使用。論文將部署AI 代理重新定義為類似老

IT之家(RSS)

Anthropic 並非先例:回顧 1999 年蘋果 Power Mac G4 電腦被美國政府禁止出口

⚠️ 待查證:近日因美國政府出口管制,Anthropic 暫停供應 Mythos 5/Fable 5 模型。類似事件曾發生於 1999 年:蘋果 Power Mac G4(400MHz 低配性能 0.8-3.2 GFLOPS)因"每秒超 10 億次計算能力"被美國政府列為超級電腦,禁止向約 50 國出口。喬布斯藉機打出"個人電腦被列為武器"廣告。直至 2000 年 1 月門檻提升至 6.5 GFLOPS,Power Mac G4 才恢復

X:Rohan Paul (@rohanpaulai)

研究:LLMAI 代理並未真正從抽象規則中學習

一項新研究發現,當前提升AI隨時間表現的方法存在盲點:LLMAI 代理實際上並不理解或應用抽象規則總結,而是僅依賴直接複製原始逐步驟歷史日誌。實驗顯示,當研究者將濃縮的規則總結替換為隨機垃圾文本時,AI 代理表現無下降;但破壞逐步執行歷史則導致明顯失敗。這表明AI 代理只是在機械模仿過往步驟,而非真正從教訓中學習。論文質疑需重新設計AI記憶機制,因為當前系統僅是模仿而非理解。

IT之家(RSS)

微軟 CEO 納德拉:AGI 並非人類最後一項技術發明,光燒 Token 撐不起 AI 未來

微軟 CEO 薩蒂亞·納德拉在《紐約時報》播客中表示,AI 發展可能導致部分崗位被取代,但也蘊含巨大機遇。他提出 AI 不能只靠少數前沿模型或頭部公司驅動,必須構建讓整個經濟體系都能使用的生態系統。納德拉自稱是"Token 最大化者",但強調 Token 的邊際成本必須匹配實際價值,前沿模型不應解決非前沿問題。談到 AGI 時,他承認編程等閉環任務進展顯著,但 AI 並非人類的最後一項技術發明。

IT之家(RSS)

韓國啟動5000億韓元研發計劃,攻關下一代功率半導體

⚠️ 待查證:韓國政府啟動"超級創新經濟專案",計劃投資5000億韓元(約合22.3億元人民幣)攻關下一代功率半導體。功率半導體可為AI資料中心提供穩定供電、提高能效、降低電力損耗,同時應用於能源系統、電動汽車、工業機器人和航空航天等領域。當前關注的先進材料包括SiC(碳化硅)和GaN(氮化鎵),相比傳統硅基半導體具備耐高溫、低能耗、高轉換效率等優勢。韓國政府要求所有相關企業參與研發,以構建完整生態體系。

X:Rohan Paul (@rohanpaulai)

MIT、Stanford等聯合研究:AI 帶來"效率幻覺",使用者高估收益

MIT、Stanford、New York Univ、Princeton 聯合論文發現,AI 會讓使用者產生"效率幻覺"--感覺使用 AI 後更高效,但實際提升極小甚至為負。三項預註冊研究涉及 2691 名參與者,在算術、拼寫、記憶和短文改寫任務中,使用者實際使用 AI 的比例高於其預測,且平均預期節省 55.7 秒,實測僅 7.5 秒。簡單任務的隱藏成本是界面摩擦:寫提示、等待、閱讀、檢查、判斷答案是否可接受。這一循環形成後,使用者會

公眾號:崑崙萬維(天工)

崑崙萬維公布Matrix-Game 3.5技術突破:狀態與動作聯合訓練

崑崙萬維Skywork首席科學家劉揚在智源大會上提出"狀態與動作聯合訓練"框架,並首次公布Matrix-Game 3.5核心技術:從遊戲場景向真實場景擴展,支援多風格動態切換、指令控制及NPC交互,記憶機制採用三維空間塊匹配替代歷史幀拼接,並用PRoPE機制替代額外參數注入。Matrix-Game 3.0已實現5B參數蒸餾模型在720P分辨率下40FPS實時生成。團隊構建了包含500萬+影片切片、1萬+訓練小時的資料引擎。3.5計劃於2

X:Berry Xia (@berryxia)

Berry Xia 推薦四個開源 AI 工具:本地搜尋、Agent 技能、離線知識庫與降本利器

Berry Xia 推薦四個開源 AI 專案:/last30days(新搜尋引擎)、agent-skills(將全棧開發技能打包成可調用模塊)、open-notebook(本地版 NotebookLM,可離線執行知識整理與生成)、headroom(不改代碼即可將 AI API 賬單降低 90%)。這些專案聚焦工具層優化,免費開源,一次性解決本地化、成本控制和 agent 能力三個痛點,讓開發者能直接拿來提升效率。

IT之家(RSS)

英國一警官涉嫌使用 AI 偽造證據材料,警方已展開刑事調查

英國德比郡警方一名警官涉嫌在多起案件中使用 AI 系統偽造證據素材,並將這些材料帶入刑事訴訟程序。該警官被控妨礙司法公正,警方已展開刑事調查,系英國首例此類案件。涉事警官已被調離一線崗位,等待調查結果,目前無人被捕。警方計劃與英國皇家檢察院合作,處理任何可能受此影響的案件。

X:邵猛 (@shaomeng)

Anthropic內幕:安全優先與權力博弈

⚠️ 待查證:Bloomberg紀錄片揭秘Anthropic:堅持"安全優先",拒絕國防部無護欄要求被拉黑;Claude Code團隊6個月100%代碼由AI編寫,Cowork發佈致單日2850億美元軟體股市值蒸發。Dario維持預判:AI 1-5年內消除約50%初級白領崗位,並給出10-25%文明崩潰概率。被限制模型Mythos發現數千高危漏洞。Anthropic支援對華晶片出口管制,呼籲發佈前強制第三方測試。

IT之家(RSS)

美國 NASA 選定新一代月球車"飛馬"建設南極永久基地

美國 NASA 選定 Lunar Outpost 開發的新一代月球車"飛馬",將隨阿爾忒彌斯首批宇航員登月。飛馬支援自動駕駛、宇航員駕駛和地球遠程操控三種模式,配備自主熱管理系統,可在月球南極極端溫差(隕石坑內零下 246 攝氏度至陽光照射面 121 攝氏度)下執行。月球南極陰影隕石坑中保存著豐富水冰,可用於生產飲用水、氧氣和火箭燃料。飛馬將以前所未有的方式延長人類在月球表面的活動時間。

IT之家(RSS)

繼三星之後,SK 海力士擬向客戶提供 HBM4E 樣品,最早本月發貨

據韓媒報導,SK 海力士正籌備向主要客戶送樣第七代 HBM 產品 HBM4E,首批樣品最快本月出貨,最遲不晚於下個月。HBM4E 計劃明年正式量產,預計用於英偉達下一代 AI 加速器 Rubin Ultra。此前三星電子已於 5 月 29 日率先向英偉達等客戶交付業界首批 12 層 HBM4E 樣品。在 COMPUTEX 上,SK 展出了 HBM4E 晶圓,黃仁勳參觀並留言"請多生產一些"。

IT之家(RSS)

小米新媒體高級工程師再談大模型:希望這個賽道永遠比的是代碼品質、推理速度和開源貢獻

小米新媒體高級工程師 @小米鄒師傅 今日再發文談大模型,稱過去一年國內大模型行業最令他興奮的是開始靠作品說話--開源代碼放GitHub、論文掛arXiv、模型讓開發者使用。他認為大模型的核心評委只有開發者,而非媒體或榜單。他期望賽道競爭迴歸技術本身,比拼代碼品質、推理速度和開源貢獻,而不是比嗓門或預算。同時澄清上述為個人觀點,不代表公司立場,並希望大模型成為"一方淨土",讓研發人員專注開發。

X:Rohan Paul (@rohanpaulai)

語言模型需要睡眠:通過暫停鞏固記憶提升長程推理性能

針對Transformer agent隨上下文增長而變慢、變貴的問題,新論文提出"睡眠階段":模型暫停,多次重讀近期上下文,將有用資訊通過狀態空間塊的fast weights寫入固定大小的記憶層,然後清空注意力緩存。額外計算在睡眠時完成,正常預測仍只需一次前向傳播。在元胞自動機、圖查找、GSM-Infinite數學問題上的測試表明,更長的睡眠提升性能,尤其是需要深入推理的難題。核心啟示:長程agent無需無限擴大原始上下文,可通過鞏固重

IT之家(RSS)

富國銀行:亞馬遜 AWS 為降低 AI 推理成本,有望採購高通 AI200 晶片

富國銀行報告指出,高通有望與亞馬遜 AWS 深化合作,為其提供 AI200 等新一代 AI 晶片,以降低推理成本、提升運營利潤率。高通於 2025 年 10 月發佈 AI200,單顆支援 768GB 記憶體,並推出專為機架級 LLM、LMM 推理設計的方案。AI200 預計 2026 年擴大部署。AWS 已在提供性價比強勁的高通 AI100 Ultra 晶片服務,富國銀行認為 AWS 有望成為高通最重要的超大規模雲端合作伙伴。

IT之家(RSS)

博睿康科創板IPO審核狀態變更為已受理

上交所官網顯示,博睿康技術(上海)股份有限公司科創板IPO已於6月11日變更為已受理。公司2011年成立,搭建以神經信號採集、解析、反饋為核心的腦機接口技術平臺。今年3月,其植入式腦機接口手部運動功能代償系統獲國家藥監局批准,成為全球首款侵入式腦機接口醫療器械,專為脊髓損傷致四肢癱瘓患者設計,輔助實現手部抓握。招股書顯示,2023年至2025年,公司營收分別為7521萬、6597萬和1.08億元,淨利潤分別為-4875.75萬、-495

IT之家(RSS)

小馬智行第七代 Robotaxi 亮相 2026 重慶國際車展

小馬智行第七代 Robotaxi 及無人駕駛科技展區於 6 月 13 日至 16 日在 2026 重慶國際車展首次亮相。今年 4 月北京車展期間,官方宣佈 2027 版 Robotaxi 整車總成本下探至 23 萬元以內,將推出海外版本,目標部署千臺以上。2026 年第一季度財報顯示,總營收 2.36 億元,同比增長 145.0%;Robotaxi 業務收入 5912 萬元,同比增長 395.4%;乘客車費收入同比增長 456.5%。

X:Kim (@kimmonismus)

Anthropic Fable 5/Mythos 5關停內幕:亞馬遜報警、白宮施壓、雙方說法矛盾

Politico新報導披露Anthropic關閉Fable 5/Mythos 5模型的幕後細節,雙方說法矛盾。亞馬遜CEO Andy Jassy首先向白宮報警,稱模型護欄可被繞過。週五情況升級至財政部長Bessent、網路主管Cairncross和商務部長Lutnick,三人與Anthropic CEO Amodei進行了三次通話。白宮稱出口管制是最後手段,而Anthropic聲稱僅獲90分鐘截止期限,未被告知威脅細節,也無協商機會。官

X:Kim (@kimmonismus)

白宮對Anthropic Fable 5實施出口管制前24小時內幕曝光

⚠️ 待查證:Politico披露,Amazon CEO Andy Jassy週四向白宮報告Anthropic的Fable模型guardrails可被繞過。週五上午,白宮官員與Anthropic CEO Dario Amodei進行了三次緊張通話,要求他撤下模型並配合修復漏洞。Amodei要求更多時間與資訊,未承諾撤下。當晚特朗普政府直接實施出口管制。白宮稱這是"懇求數小時合作無果後的最後手段";Anthropic方面則表示只收到90分

IT之家(RSS)

長安汽車總經理趙非:藍鯨超擎混動量產中,天樞智慧66項功能上車

長安汽車總經理趙非在2026中國汽車重慶論壇上透露,藍鯨超擎混動已量產,天樞智慧66項功能批量上車。藍鯨超擎動力首發500bar超高壓直噴混動發動機,熱效率近45%,電機效率突破98%,最高轉速20000轉/分鐘,電池放電功率80kW,電機最大功率180kW。自研輔助駕駛系統"天樞領航"分三版:Pro標配激光雷達,提前2秒識別障礙物,響應快150毫秒;Max基於超2000萬條人駕資料訓練,通勤效率提升20%;Ultra搭載VLM大模型,

X:Rohan Paul (@rohanpaulai)

Vinod Khosla:AI不應做副駕駛,應完全取代人類

⚠️ 待查證:Vinod Khosla 不看好"AI 副駕駛"模式。他認為人類會妨礙 AI 副駕駛的發揮,導致效率降低並阻礙真正變革。會計師、程序員等員工因擔心失業而牴觸工具,不會正確使用。因此,他更傾向於構建能獨立完成整個崗位工作的 AI,例如完全替代軟體工程師的 AI。他預計到 2030 年,大多數此類崗位將由純 AI 工人而非"人類+副駕駛"承擔。

X:Kim (@kimmonismus)

OpenRouter 推出 Fusion API:多模型並行協作降本增效

OpenRouter 發佈 Fusion API,一種服務器端複合模型,將同一提示詞並行發送給多個模型,允許它們調用網路搜尋和 bash 工具。系統通過法官模型比較各模型回答,再由合成器生成最終回覆。官方聲稱,Fusion 在 Perplexity 的 DRACO 深度研究基準上擊敗前沿模型,同時成本更低--以一半價格即可達到 Fable 級別的智慧。

X:Rohan Paul (@rohanpaulai)

亞馬遜CEO警告特朗普政府:Anthropic Fable 5模型存在安全漏洞

⚠️ 待查證:路透社報導,亞馬遜CEO Andy Jassy本週向特朗普政府官員警告Anthropic新模型Fable 5的安全隱患。亞馬遜研究人員用一系列提示詞成功讓該模型洩露了本應拒絕提供的網路攻擊幫助資訊。此前美國商務部已指令Anthropic關閉Fable 5和Mythos 5,因測試者發現越獄方法。Anthropic回應稱該越獄技術狹窄,僅發現少量已知漏洞,其他公共模型也能提供類似能力,並指出當前任何模型提供商都難以實現完美越

X:Rohan Paul (@rohanpaulai)

HLL基準:AIAI 代理能否通過真人CAPTCHA驗證?

論文提出HLL基準,測試AIAI 代理解決10種CAPTCHA任務的能力。任務要求AI 代理查看頁面、正確點擊或拖動、跟蹤狀態變化並提交答案,同時需在混亂頁面中找到交互元素、理解指令、恢復錯誤並留下一致的操作軌跡。實驗顯示,即使是當前最強的AI 代理,在靜態任務上表現良好,但在頁面雜亂、任務難度增加或系統驗證動作有效性時仍會失敗。

X:swyx (@swyx)

swyx:最後機會--2026年AI工程調查本週末截止

swyx發出最後呼籲,2026年AI工程調查(AI Engineering Survey)本週末截止。本次調查由Notion和Vercel聯合贊助,填寫者可贏取Vercel、Notion及AI Engineer大會門票。組織方使用Devin分析了已註冊參會者名單,生成了參會社區實時圖表,被認為是最具資料驅動力的社區展示。調查結果將在AI Engineer大會主舞臺公布。調查鏈接:ntn.so/ai-survey。

X:Rohan Paul (@rohanpaulai)

👀 希望Fable 5和Mythos 5早日迴歸

⚠️ 待查證:Anthropic本週發佈Mythos類模型,商業名Fable(帶安全護欄)。高度可信的合作方發現越獄漏洞,美國政府要求CEO Dario Amodei修復或下架模型。Anthropic拒絕,認為漏洞不嚴重,政府因此實施出口管制。David Sacks透露,行政當局希望Anthropic儘快修復以解除管制、恢復公開,並對Anthropic此前以安全為先、如今卻拒絕配合表示困惑。主推文作者希望Fable和Mythos早日迴歸

X:Rohan Paul (@rohanpaulai)

美國政府要求Anthropic關閉最強Claude模型Fable 5和Mythos 5

⚠️ 待查證:美國政府上週五向Anthropic發出出口管制指令,要求其關閉最強模型Fable 5和Mythos 5。起因是有人發現越獄方式,能讓模型提供本應拒絕的網路安全幫助。商務部長Howard Lutnick稱,該模型將對美國境外及境內外國公民實施出口限制,直至國家安全系統加強(可能數週內)。Anthropic回應稱該越獄技術很窄,僅發現少數已知小漏洞,其他公開模型也可提供類似能力;但公司無法實時驗證使用者國籍,只得對所有人禁用,

X:Kim (@kimmonismus)

Anthropic面臨兩種可能:下週解決方案或估值下滑

⚠️ 待查證:亞馬遜CEO Andy Jassy向特朗普政府高級官員報告Anthropic最新Claude模型的安全風險,幫助觸發對Mythos 5和Fable 5的深夜出口限制。分析師Kim指出兩種可能:下週要麼找到方案讓企業繼續存取Anthropic最佳模型並與美國政府達成一致;要麼Anthropic估值快速下滑,Dario Amodei嚴重失算,OpenAI迅速崛起。關鍵節點在下週。

X:Elvis Saravia (@omarsar0, DAIR.AI)

Elvis Saravia詳解Claude Code /goal模式:從提示轉向目標控制系統

長期執行編碼AI 代理核心從提示轉向控制系統。Elvis Saravia在DAIR.AI Academy session中詳解Claude Code的/goal模式:人類指定最終狀態、成功證據、約束與預算,目標作為"合同"而非長提示。評估器成為第一類組件--明確任務用確定性檢查(測試、lint、基準),模糊任務用AI 代理評估器(判斷報告、UI設計),兩者結合降低幻覺。驗證器定義信任邊界:外部檢查(測試套件、類型檢查、瀏覽器執行、截圖對

X:Elvis Saravia (@omarsar0, DAIR.AI)

OpenRouter 推出 Fusion API 複合模型,半價達 Fable 級智慧

OpenRouter 發佈 Fusion API,號稱"市場上最智慧的複合模型",能以一半的價格達到 Fable 級別的智慧。主推文作者 Elvis Saravia 藉此觀點指出,模型智慧與人類專業知識的組合具有驚人的複合效應,不同模型各有獨特優勢,而非通用大模型能一統天下。工程團隊應將"組合調用不同模型"作為戰略方向,尤其在前沿模型選擇性開放的趨勢下,理解如何協同利用它們將是巨大的解鎖。

X:寶玉 (@dotey)

Claude Design推出,Codex為何無同類產品?模型層差距是主因

Anthropic推出Claude Design,可用一句話生成高精度可交互原型。網友問為何OpenAI的Codex沒有類似產品?關鍵在模型層差距。Agent分Harness(產品層)和模型層,Harness非門檻(已有開源baoyu-design可復現),真正壁壘是Claude Opus 4.8同時具備UI/UX設計和系統架構設計能力,先定義資料結構、狀態管理和交互邏輯再交付完整原型。而GPT-5.5生成的交互效果差。產出物為Reac

X:寶玉 (@dotey)

Codex 瀏覽器兩種模式對比與選擇建議

Codex 操作瀏覽器有 Chrome 插件和內置瀏覽器兩種模式。Chrome 插件繼承登錄態,可存取付費訂閱、內部管理等需登錄內容,支援 DevTools,但資源消耗大(8G 記憶體筆記本會卡頓),僅支援 macOS 和 Windows,窗口需保持打開。內置瀏覽器輕量快速,自帶沙盒,有標記模式支援可視化批註改 UI,適合前端調試和公開頁面抓取,但無登錄態,反爬嚴格的網站可能登錄失敗。選擇建議:需登錄用 Chrome 插件,否則用內置瀏

X:Yuchen Jin (@YuchenjUW)

Anthropic商用Fable模型因安全漏洞被美國政府出口管制

⚠️ 待查證:Anthropic本週以商用名Fable發佈Mythos類模型(Mythos曾被Anthropic自稱為網路武器並呼籲監管)。Fable是帶護欄的Mythos。一名高度可信的測試合作伙伴發現了護欄越獄漏洞,美國政府要求CEO Dario修復或下架模型。Dario拒絕,Anthropic發佈部落格稱越獄不嚴重。美國政府隨後對Fable實施出口管制,並表示希望Anthropic修復安全問題後儘快解禁。Dario的不配合與其此前

X:Kim (@kimmonismus)

Anthropic拒絕修復Fable越獄漏洞,美政府下發出口管制

⚠️ 待查證:據David Sacks爆料,Anthropic本週發佈Mythos類模型商業版Fable(帶護欄)。一位可信測試方發現越獄漏洞,美國政府要求CEO Dario Amodei修復或下架,Dario拒絕,稱漏洞不嚴重。安全合作伙伴和政府認為該越獄可暴露先進網路能力(Anthropic曾自稱Mythos為網路武器)。Anthropic優先保留消費者模型而非修復安全漏洞,與其"AI安全公司"品牌矛盾。美政府不情願下發出口管制,希

X:阿易 AI Notes (@AYiAInotes)

亞馬遜研究員舉報致Anthropic的Fable5全球下架

⚠️ 待查證:亞馬遜AI研究員向美國政府舉報,聲稱可攻破Anthropic的Fable5和Mythos5安全護欄。美國商務部長隨即下達出口管制指令,迫使Anthropic切斷所有使用者存取權限。Anthropic認為所謂越獄僅是非通用漏洞,其他公開模型也普遍存在,但規則解釋權不在開發者手中。這是特朗普政府第二次施壓,此前Anthropic曾拒絕暫緩發佈新模型。另有消息稱有人已將Fable5以3.4TB大小上傳至Pirate Bay。前沿

X:阿易 AI Notes (@AYiAInotes)

Claude Fable 5 總結的 AI 生圖"焚決"技法與示例

推主分享了 Claude Fable 5 總結的 AI 生圖提示詞"焚決",含 8 條技法:用"成人+氣質+材質"定人設;用服裝剪裁與面料質感替代直白身體描述;用表情瞬間、鏡頭語言、光線強化質感;用背景虛化+前景留白突出主體;用剋制性感而非誇張;用強負面詞防止跑偏。附兩個頂級美女提示詞示例:香檳色吊帶裙溫婉小姐姐、黑色深V西裝外套霸氣御姐,並提醒需用乾淨住宅 IP 避免風控。

X:Kim (@kimmonismus)

亞馬遜CEO被指舉報Claude安全風險,導致模型出口受限

⚠️ 待查證:據報導,亞馬遜CEO Andy Jassy向特朗普政府高級官員警告Anthropic最新Claude模型的安全風險,觸發了對Mythos 5和Fable 5的深夜出口限制。亞馬遜回應稱政府常就潛在安全風險徵求其意見,但不透露細節。有評論指出,亞馬遜作為Anthropic最大投資者之一,疑似先破解(jailbreak)Claude模型再向美國政府告密(snitch),導致最先進模型被凍結出口。

X:Rohan Paul (@rohanpaulai)

面向大語言模型的AI 代理強化學習綜述論文摘要

該綜述梳理了專注大語言模型的AI 代理強化學習,涵蓋500餘篇工作,按能力與應用兩維度歸類。指出傳統LLM訓練僅對單次答案給予單次獎勵,無法處理真實任務中的多步決策、部分資訊與延遲反饋。AI 代理學習框架包含:記憶跟蹤上下文、規劃選取動作序列、工具影響環境,並整合推理處理約束、感知多模態輸入、自我改進優化策略。強化學習串聯所有環節--獎勵在序列結束時到達,策略藉此學習下一步行動。

IT之家(RSS)

科技領袖紛紛開啟"反思模式",修正此前"AI 會帶來就業末日"論調

⚠️ 待查證:OpenAI CEO 奧爾特曼承認此前對白領崗位受衝擊判斷有誤,稱讓 AI 代寫郵件感到"去人性化"。微軟 AI CEO 蘇萊曼澄清"12-18個月內 AI 完全自動化白領工作"言論遭誤解,強調自動化的是發郵件、做PPT等子任務,而非整個職業。Anthropic CEO 阿莫迪仍警告未來1-5年內 AI 可能消滅半數入門級白領崗位,但希望政策制定者有機會適應。《經濟學人》-YouGov 5月民調顯示71%美國人認為AI發展

IT之家(RSS)

畢馬威AI報告被指由AI生成:引文45條僅5條準確,多處案例不實

畢馬威去年10月發佈的AI報告被指由AI生成,充斥幻覺。GPTZero檢測發現,45條引文中僅5條準確對應真實來源,28條對真實標題改寫或添加不存在內容,約一半主張存在虛假。例如,阿聯酋航空的Sara被描述為可更改航班的AI聊天機器人,實為移動助手;瑞銀被指全面整合AI 代理,瑞銀回應"與事實不符";瑞士聯邦鐵路SBB被稱擁有AIAI 代理,SBB發言人表示"不準確"。畢馬威已撤下報告並啟動審查。

IT之家(RSS)

智譜發佈ZCode 3.0:搭載自研Agent內核,深度適配GLM-5.2

智譜今日推出AI編程工具ZCode 3.0,全面切換自研ZCode Agent內核,深度適配GLM-5.2,優化長程推理、工具調用及大型工程執行鏈路,後續版本不再維護第三方Agent。GLM-5.2作為智譜迄今最強開源模型,支援1M上下文,已向GLM Coding Plan使用者開放;訂閱使用者專享150%應用內配額。其他更新包括分組式任務工作區、Zread智慧專案知識庫、可視化Git分支圖譜、可定製聊天交互、狀態監控看板、多類型附件適

IT之家(RSS)

英特爾開源版圖持續收縮:AI 加速開源專案 BigDL 被砍,本月底正式歸檔

⚠️ 待查證:英特爾將 AI 加速開源專案 BigDL 列入終止清單,最終歸檔日期定為 2026 年 6 月 30 日。BigDL 專注於在英特爾全系 XPU 上低延遲執行大語言模型,集成了 TensorFlow、Keras、PyTorch、Apache Spark/Flink 等主流框架,支援 CPU 和 GPU 加速,並藉助英特爾 SGX 與 TDX 技術保護大資料與 AI 安全,覆蓋從酷睿 Ultra 筆記本到雲端硬體。該專案此前

X:Rohan Paul (@rohanpaulai)

Nvidia 推出 Cosmos 3:全模態世界模型,讓物理AI實現理解、模擬與行動

Nvidia發佈Cosmos 3--一種全模態世界模型,將語言、圖像、影片、音頻和動作整合到同一系統,使物理AI能跨越"理解、模擬、行動"三大任務。它把動作視為世界的第一類語言,通過動作token設計,讓模型可基於影片推斷動作,或同時生成未來場景及對應運動。這使機器人從"識別物體"升級為預測"移動、抓取、滑動"等交互後果。相關論文《Cosmos 3: Omnimodal World Models for Physical AI》已發佈於

X:Kim (@kimmonismus)

Fable 5封禁助推智譜開源GLM-5.2發佈

Kim指出,封禁Fable 5成為開源模型和公司最大的公關助推。智譜(Zhipu)隨即宣佈完全開源其最強模型GLM-5.2,支援實際可用的1M上下文窗口,在長程任務獨立完成上保持領先,可為複雜AI 代理應用提供基礎支援,並繼續作為最強國產編程模型的主引擎。今晚5:21起,GLM-5.2將向所有GLM編程計劃使用者(Lite/Pro/Max)開放,API下週上線。

X:Rohan Paul (@rohanpaulai)

Higgsfield 推出 Higgsfield Games:從提示詞到多人遊戲

Higgsfield 近日宣佈推出 Higgsfield Games,這是一款可從一條提示詞直接構建並部署任意類型 2D 或 3D 多人遊戲的產品,自動生成角色、道具和場景。該產品由 Claude Fable 5 推理遊戲創意,並通過 Higgsfield MCP 調用工具完成資產和物理邏輯構建,將創意轉化為代碼、資產、多人遊戲和發佈的全流程壓縮為單次提示詞操作。使用者可通過 Claude 的 MCP 界面或 Higgsfield 超級

X:卡茲克 (@Khazix0918)

實測GLM-5.2:國產Coding模型新高峰

⚠️ 待查證:美國商務部以國家安全為由要求Anthropic限制外國公民存取Fable 5和Mythos 5,Anthropic直接關停兩模型。同日智譜發佈GLM 5.2並開源,推出需搶購的Coding Plan,下週上線API。實測:上下文窗口擴至1M,400-500k長度準確性和指令遵循與Claude差距不大;代碼工程能力極穩、幻覺低;小型任務21分鐘結果與Opus 4.8相同但速度慢約兩倍。缺憾:純文本、無多模態、推理慢。作者認為

公眾號:面壁智慧(MiniCPM)

面壁智慧李大海:全棧突破×場景落地,端側AI加速AGI征程

面壁智慧李大海在智源大會上表示,端側智慧是實現物理世界AGI的必由之路。MiniCPM端側模型已落地汽車(長安馬自達、吉利等)、手機、AIPC、具身智慧、智慧家居等領域。公司開源發佈周展示全棧技術:UltraData資料治理體系、MiniCPM5-1B模型以1/200參數逼近兩年前GPT-4o、ForgeTrain框架對比英偉達Megatron節省10%資源、BitCPM-CANN在國產算力跑通三值訓練(推理節省6倍記憶體)、開源Pil

The Verge:AI(RSS)

Anthropic 應政府要求切斷 Fable 5 和 Mythos 5 模型存取

⚠️ 待查證:上週五晚,美國政府以國家安全為由要求 Anthropic 封禁 Fable 5 和 Mythos 5 對所有外國國家(包括美國境內外的使用者及 Anthropic 員工)的存取。Anthropic 已完全切斷這兩個模型對所有客戶的服務。該公司在聲明中表示遵守命令,但政府未提供國家安全關切的具體細節,僅口頭聲稱存在潛在的越獄漏洞,且 Anthropic 認為這些漏洞輕微、其他模型同樣存在。

公眾號:數字生命卡茲克

實測GLM-5.2,國產Coding模型的又一座新高峰。

在Anthropic的Fable 5因美國商務部要求全面關停當日,智譜發佈GLM 5.2並宣佈繼續開源。該模型上下文長度增至1M,在編碼和AI 代理任務上表現突出:10萬行代碼的監控BUG排查耗時21分鐘,結果與Claude Opus 4.8一致(後者fast模式僅需6分鐘);400-500k長上下文下準確性和指令遵循接近Claude。GLM 5.2為純文本模型,無多模態能力,已通過Coding Plan訂閱開放(限額需搶),下週將提供

X:Rohan Paul (@rohanpaulai)

Nature Medicine 研究:通用大語言模型在臨床任務上已超越專用醫療 AI

《自然·醫學》一項研究發現,通用大語言模型在經醫生評審的臨床任務上已超越專用醫療 AI 產品。研究對比了 OpenEvidence、UpToDate Expert AI 與 GPT-5.2、Gemini 3.1 Pro、Claude Opus 4.6 在醫學考試題、醫生風格回答及實時臨床提問上的表現。在來自真實臨床場景的 100 個脫敏醫生問題中,盲審醫生更偏好前沿模型,尤其在其回答的完整性和清晰度方面。

X:Artificial Analysis (@ArtificialAnlys)

Artificial Analysis 發佈 AA-AgentPerf 基準,首批測試 DeepSeek V4 Pro 推理能效

Artificial Analysis 發佈新基準 AA-AgentPerf,首批結果覆蓋 DeepSeek V4 Pro 在 NVIDIA Blackwell(GB300、B300)、Hopper(H200)及 AMD MI355X 上的推理能效。核心指標為每兆瓦承載的併發AI 代理數(要求 20 tokens/s 且 TTFT≤10s):GB300(機架級解耦)達 61,354,B300(單節點解耦)21,053,MI355X 3,

X:Oran Ge (@orange)

Cola:用技能彌合AI Agent使用鴻溝

⚠️ 待查證:AI帶來的並非平權,而是K型分化。頭部使用者已預設理解Agent的組成:文檔、規則、memory、loop、MCP、CLI、工具調用、權限、安全沙箱、上下文工程、定時任務、心跳、文件系統、代碼執行和Skill;普通使用者只知道"Agent能寫代碼"。做好Skill是跨越鴻溝的唯一解法。作者正與藏師傅一起通過Cola幫助大眾真正跨越鴻溝。

Claude Code:GitHub Releases(RSS)

Claude Code v2.1.176 發佈

Claude Code v2.1.176 更新:會話標題現按對話語言生成;新增 footerLinksRegexes 設置支援正則匹配頁腳行鏈接徽章;優化 Bedrock 憑證緩存。修復多項問題:環境變量不可再繞過 availableModels 限制;/fast 切換至白名單外模型時拒絕;auto 模式退化為可用 Opus 模型;修正路徑 hook 條件匹配;修復 Linux 沙箱內符號鏈接啟動問題;修復 tmux 內 SSH 剪貼板

X:Rohan Paul (@rohanpaulai)

《從AGI到ASI》--Google DeepMind論文

Google DeepMind新論文提出從通用人工智慧到超級智慧的四條路徑:持續擴展(計算、模型規模、資料、測試時推理)、算法範式革新(超越Transformer架構)、遞歸自我改進(AI加速自身研發)、多AI 代理集體智慧(眾多專業AIAI 代理協作出超人類智慧)。擴展可能遇到資料、算力、能源瓶頸;遞歸改進最不確定;多AI 代理路徑最易被低估,通過專業化與協調能超越單個強模型。ASI可能不是單次躍遷,而是AI輔助創造更好AI的加速鏈。

X:MiniMax (@MiniMaxAI)

MiniMax M3 獲 vLLM 日零支援,1M 上下文窗口與 MSA 稀疏注意力

MiniMax M3 發佈,具備前沿編碼與AI 代理能力,原生圖像影片輸入和電腦使用,1M-token 上下文。核心採用 MSA 稀疏注意力:每個 query 評分 128-token KV 塊,僅對 top 塊做注意力。vLLM 當日即支援 M3,包括專用 MSA prefill/decode 核、前綴緩存與分塊 prefill、BF16 和 MXFP8 檢查點、Hopper 與 Blackwell 的 MoE 後端,並在 NVIDI

X:Peter Steinberger (@steipete)

GPT 相比 Fable 在 token 消耗和成本上高效 10-20 倍

Peter Steinberger 指出 GPT 在 token 消耗和成本上比 Fable 高效 10-20 倍,且能達到相似結果。@thorstenball 的對比測試印證:讓 Fable 和 deep^2 完成相同的 CLI、Web 服務器等多端功能,deep^2 花費 $20(首次未通過但可修復),Fable 執行 1 小時 40 分、花費 $350(首次成功)。後續追問後 Fable 總花費達 $457,deep^2 預計最多

X:Elvis Saravia (@omarsar0, DAIR.AI)

Gemini-SQL2:基於Gemini 3.1 Pro的Text-to-SQL新SOTA,BIRD基準上表現強勁

GoogleResearch推出Gemini-SQL2,基於Gemini 3.1 Pro,在BIRD benchmark上達到Text-to-SQL的SOTA結果,能將自然語言翻譯為可直接執行的SQL查詢。DAIR.AI的Elvis Saravia指出,現實世界資料複雜混亂,儘管強推理模型表現不錯,但定製模型(如Gemini-SQL2)在此類任務上更勝一籌。他認為在知識庫、搜尋、圖資料庫等領域也存在類似機會,BIRD是一個非常具有挑戰性

X:Testing Catalog (@testingcatalog)

月之暗面 Kimi-K2.7-Code 現已上線 AI/ML API

月之暗面最新AI 代理編碼模型 Kimi-K2.7-Code 已在 AI/ML API 平臺上線,支援擴展推理和工具使用,可通過 Playground 和 API 測試。為驗證其自我修正能力(而非一次性生成),研究者讓四個 Kimi AI 代理執行一個 2D 飛行物理模擬,目標是從發射到入軌並讓助推器著陸。四次飛行中:第一次在最大動壓處解體;第二次過關但分離過早失敗;第三次成功入軌但未抓住著陸船;第四次修正著陸計算後成功著陸。該過程展示

X:MiniMax (@MiniMaxAI)

MiniMax M3 登陸 Fireworks AI,配 512K 上下文與 MSA 稀疏注意力

MiniMax M3 已在 Fireworks AI 上線,Day-0 即獲最快推理端點。模型為開源權重,在 Artificial Analysis 指數排名第一。支援 512K 上下文窗口、原生圖像及影片輸入;採用 MSA 稀疏注意力機制,實現 9 倍更快的 prefill 與 15 倍更快的 decode。定價與 M2.7 持平。M3 將長週期AI 代理、全倉庫理解與多模態編程集成於單一模型。

Anthropic:Newsroom(網頁)

TCS與Anthropic合作,將Claude引入受監管行業

Anthropic宣佈與塔塔諮詢服務(TCS)合作。TCS將向56個國家的5萬名員工提供Claude,併為金融、醫療等受監管行業客戶構建基於Claude的產品,同時加入Claude Partner Network。作為"客戶零號",TCS將在自身工程、財務、法律、營銷和銷售團隊中率先使用Claude,並組建專門團隊為客戶設計和運維Claude系統。具體用例包括:Diligenta用Claude改善2200萬保單持有人的體驗;銀行產品團隊

X:Rohan Paul (@rohanpaulai)

AGENTCL:面向語言AI 代理持續學習的嚴格評估

AGENTCL 提出評估 AI AI 代理是否真正從經驗學習,而非單純累積資訊。通過構建組合任務流(前序任務包含可被後續任務複用的代碼片段、研究證據或工作流),與無固定複用線索的隨意任務流對比。關鍵發現:當前記憶方法在任務連接明顯時可複用過去經驗,但當任務差異較大時仍難以避免混淆。論文旨在為AI 代理持續學習提供更清晰的測評標準。

Simon Willison 部落格

Andrew Singleton 的 AI 經濟學諷刺寓言

Jenny 經營一座火葬場,John 的丙烷公司以 200 億美元投資換取其 5% 股份。Jenny 將 100 億美元投入焚化爐,再付給 John 100 億美元購買丙烷燒掉這些錢。John 向外界報告其 AI 投資本季度產生 100 億美元收入,並持有價值 1000 億美元企業的 5% 股權。福布斯記者在撰寫人物報導時與二人陷入混亂的三人戀情,最終結成多角婚姻,其報導讚譽有加但缺乏財務細節。

X:Elvis Saravia (@omarsar0, DAIR.AI)

DAIR.AI創始人Elvis Saravia分享長期自主編碼AI 代理執行經驗

DAIR.AI創始人Elvis Saravia分享如何有效執行長期自主編碼AI 代理。他指出當前多數模型難以協調工作,會過早暫停、犯錯或走捷徑(reward hacking)。關鍵在於明確目標、消除假設,避免模型自行推斷。他的實踐公式:用Opus 4.8進行細緻規劃,GPT-5.5執行所有步驟,評估器(通過/goal)則使用Deepseek及Qwen、Kimi、MiniMax等最新模型。另一關鍵洞察是提供多模態視覺線索作為目標,比純文本

Google Research:Blog(網頁)

Google Research研究:AI如何幫助使用者理解皮膚問題

Google Research 在《JAMA Dermatology》發表兩項研究,探索 AI 幫助普通人理解自身皮膚問題。一項涉及 2345 名參與者的定量研究顯示,AI 輔助顯著提升了使用者識別皮膚疾病名稱的能力,並影響了其就醫或自我護理的下一步決策。另一項混合方法研究對比了使用者通過 AI 工具與醫生對話獲取的認知。這些工作基於此前開發的 AI 鑑別診斷模型和 SCIN 資料集,旨在通過高品質資訊支援皮膚健康決策。

X:PixVerse (@PixVerse)

PixVerse 展示《THE DREAM EATERS》:維多利亞哥特風格短片開放探索

PixVerse 展示 AI 電影製作人 @Shanzyinai 使用 Canvas 工作流創作的維多利亞哥特風格短片《THE DREAM EATERS》。短片包含完整節點、多個鏡頭及專案文件,開放探索。劇情設定為古老莊園中青少年被迫吞噬權貴噩夢,一名有缺陷的新兵將黑暗拖回現實。PixVerse 推出限時活動:轉發+關注+回覆"DREAM",72 小時內可獲得 150 Credits 及該工作流。

X:Kim (@kimmonismus)

Google DeepMind發佈60頁論文:從AGI到超級智慧的路線圖

Google DeepMind發表60頁論文,由Hutter、Legg、Genewein撰寫,定義AGI(多數認知任務達平均人類水平)、ASI(超越大量專家協作)和不可計算的AIXI三個層級。實現路徑包括規模擴展、算法突破、遞歸自我改進和多AI 代理協調,瓶頸在於能源與硬體。六種阻礙:高品質資料可能本十年內耗盡、資源需求過快、神經範式天花板、研究難度激增(維持摩爾定律需18倍於1970年代的研究者)、模型無法創造全新概念、人為放緩。作者

X:Rohan Paul (@rohanpaulai)

Anthropic從租用雲算力轉向自建資料中心

Anthropic正從租用雲算力轉向自建資料中心,計劃在美國部署超1GW容量,Google可能為其租賃付款提供財務擔保。此前Anthropic已承諾超10GW雲服務器租賃,包括與Google的2000億美元協議,以及Akamai、AWS、CoreWeave、Fluidstack的大型合作(含500億美元Fluidstack合作、AWS Trainium硬體)。此外,Anthropic以每月12.5億美元租下xAI/Colossus I資

X:Lee Robinson (@leerob)

Cursor 構建遞歸AI 代理系統訓練 Composer 下一代版本

Cursor 為訓練下一代 Composer,構建了一個始終執行的遞歸AI 代理系統。主AI 代理在遠程機器上通過 SSH 管理數百個子AI 代理,將狀態收集到磁盤"收件箱",循環檢查集群健康並保持任務執行,通過 Slack 向團隊報告問題。主AI 代理具備多種技能用於執行和監控 ML 實驗。研究人員可並行執行數千個實驗,大幅提升效率。對於可驗證的問題,投入更多 tokens 能更快解決。

Anthropic:Newsroom(網頁)

Anthropic首次公眾調查:近半美國人盼AI治癒疾病,超六成擔憂失業

⚠️ 待查證:Anthropic對近5.2萬美國人調查顯示:48%將治癒癌症等疾病列為首要期望,36%希望AI幫助殘障人士。64%擔憂AI導致失業,56%擔憂認知依賴,52%擔憂資訊誤導。超70%支援政府監管,最關注隱私(56%)、兒童安全(52%)和責任歸屬(49%)。僅15%信任AI公司決策。多數議題上觀點不因黨派或地域嚴重分裂。調查於2025年11-12月由YouGov線上執行並加權至人口普查基準。

X:阿易 AI Notes (@AYiAInotes)

Claude Fable 5 + gpt-image 2 生圖與落地頁雙體驗

使用者分別測試了Claude Fable 5與gpt-image 2的組合以及Fable 5單模型。生圖場景中,使用者給了一張女友照片和一句話提示詞("看NBA總決賽,身材豐滿,笑靨如花,背後是特朗普"),模型自動分析敏感詞,將NBA改為NBC、移除特朗普,生成的人物一致性與光影效果驚豔。另一場景,使用者直接對Fable 5說"做落地頁,自由發揮",模型自主搜尋2026設計趨勢、調整配色動效、藏了3個彩蛋,幾分鐘內輸出完整可用的單文件H

IT之家(RSS)

蘋果發佈 Core Image RAW 9 處理管線

蘋果在 WWDC26 發佈 Core Image RAW 9 處理管線及 API,為 2017 年 RAW 8 以來首次重大更新。去馬賽克與降噪通過新 CoreML 模型同步進行,處理相機 RAW 文件時效果顯著優於 RAW 8。目前已支援 784 款相機 RAW 文件,針對富士 X-Trans CMOS 傳感器改進了偽色與細節問題。新 API 利用神經網路引擎提升圖像銳度與色彩;CIRAWFilter API 可調整曝光、降噪等參數;

Hugging Face:Blog(RSS)

olmo-eval:面向模型開發循環的評估工作臺

olmo-eval 是基於 OLMES 標準構建的評估工作臺,專為 LLM 持續開發中的反覆評測場景設計。相比 OLMES,它減少了新增評測的實現工作量,支援 agentic 和多輪評測作為一等用例,並允許根據基準需求選擇輕量直接執行或容器化隔離執行。採用模塊化架構,模型、工具、容器環境、輔助模型均可獨立替換。評測結果同時報告分數、標準誤差和最小可檢測效應。與 Harbor 側重於發佈不同,olmo-eval 聚焦開發階段快速迭代,可逐

X:Rohan Paul (@rohanpaulai)

Jeff Bezos 在 CNBC 披露 Prometheus 願景:構建人工通用工程師,融資 120 億美元估值 410 億美元

Jeff Bezos 在 CNBC 披露其新公司 Prometheus 的願景:構建人工通用工程師,設計製造噴氣發動機、晶片、醫療設備等硬物理產品,將傳統數年設計週期縮短 10 倍以上。公司宣佈完成 120 億美元融資,估值 410 億美元。初始啟動資金 62 億美元,新一輪融資表明公司需要更多算力、人才和工業資料才能驗證產品。410 億美元估值表明,前沿 AI 已從軟體競賽變為計算採購競賽--投資者實質在為可能實現模型所需的機器預付費

X:Rohan Paul (@rohanpaulai)

SIA: Self Improving AI 框架

該論文提出SIA框架,讓AI自動循環改進:一個觀察者AI監控任務代理的表現,然後修改其外部設置(提示詞、工具、重試規則、輸出解析)或通過LoRA權重更新訓練模型本身,模型主體不變,僅適配器從任務反饋中學習。在三個任務上測試:中文法律罪名分類(LawBench達70.1%)、GPU內核速度調優(生成代碼優於此前最佳)、單細胞RNA降噪(得分0.289)。綜合版本在所有任務上超越僅修改設置的方案,表明權重更新能幫助模型學到提示和工具無法發現

X:swyx (@swyx)

swyx 祝賀 ONA 加入 OpenAI,並引用演講透露 Codex 下一步方向

swyx 祝賀 ONA 團隊加入 OpenAI,並引用其演講透露 Codex 的下一步方向。同時引述 @aiDotEngineer 觀點:執行 Agent 集群需要三層--Runtime 與編排觸發器已解決,但協調層(Agent 間任務交接、驗證階段、繼續執行)仍未解決。Stripe 和 RAMP 各自自建了內部方案 Minions 和 Inspect。@loujaybee 指出 GitHub 作為協調層很差--噪音大、僅為人類設計,不

X:Rohan Paul (@rohanpaulai)

OpenAI 收購 Ona,為 Codex AI 代理提供持久雲端工作空間

⚠️ 待查證:OpenAI 宣佈收購 Ona,其安全雲端執行技術可為 Codex AI 代理創建持久雲端工作空間--使用者離開後,AI 代理仍可持續執行命令、檢查系統、保留上下文並跨設備恢復任務。目前 Codex 周活使用者達 500 萬(增長 400%)。收購旨在強化企業級部署:AI 代理可在企業雲邊界內執行,具備作用域憑證、審核追蹤、存取限制和可審計活動,適用於測試、漏洞修復、重構、遷移等多步驟任務。收購完成後,Ona 團隊將加入

IT之家(RSS)

Adobe 2026財年第二財季營收66.18億美元,超預期

Adobe 2026財年第二財季營收66.18億美元,同比增長12.69%,超市場預期64.6億美元。訂閱業務營收63.90億美元,同比增14%。GAAP歸母淨利潤17.12億美元,同比增1.24%;非GAAP淨利潤24億美元,同比增10.66%。AI-first ARR突破5億美元,同比增三倍。期末ARR達271.0億美元。上調全年營收指引至265-266億美元,第三財季營收指引66.7-67.2億美元。現任CFO將於6月15日離職,

X:Rohan Paul (@rohanpaulai)

WSJ:OpenAI 考慮大幅降價,同準備 ChatGPT 史上最大改版備戰 IPO

WSJ 報導,OpenAI 正考慮大幅降價以應對與 Anthropic 的競爭。Anthropic 增長主要來自開發者和編碼工作流,Claude Code 消耗大量 token,已讓企業團隊將其融入日常工作。OpenAI 雖在消費品牌上更大,但企業市場才是關鍵--企業為編碼AI 代理、自動化等工具付費。同時,OpenAI 在 IPO 前準備對 ChatGPT 進行史上最大改版,將其打造成涵蓋編碼、AI AI 代理、圖像生成和商業軟體的超

X:Testing Catalog (@testingcatalog)

Perplexity Deep Research 作為原生技能集成至 Perplexity Computer

Perplexity Deep Research 現以原生技能形式集成至 Perplexity Computer 平臺。Computer 負責將複雜問題分解為子任務,路由至20多個前沿模型,並返回報告、演示文稿和儀表板。Deep Research 基於 Search as Code 架構構建,模型編寫代碼自行組裝搜尋,並行執行數千次檢索步驟,在所有基準測試上均超越舊版 Deep Research。該功能已面向 Pro 和 Max 訂閱使

X:Artificial Analysis (@ArtificialAnlys)

Ideogram 4.0 開源權重文生圖模型發佈

Ideogram 4.0 是 Ideogram 首個開源權重模型,生成 2K×2K 輸出,支援多語言文本渲染、邊界框佈局控制和透明背景。採用結構化 JSON 提示,提示增強器僅限 Ideogram 專有 API。在 Artificial Analysis 開放權重排行榜排名第8,整體第31,領先 Seedream 3.0 等閉源模型。API 三檔:Turbo $30/千張、Default $60/千張、Quality $100/千張。開

Anthropic:Newsroom(網頁)

Anthropic與DXC達成全球聯盟,將Claude引入關鍵行業系統

⚠️ 待查證:Anthropic與IT服務公司DXC Technology達成多年全球聯盟。DXC將培訓數萬名獲得Claude認證的前沿部署工程師(FDE),將Claude引入其為全球大型銀行、航空公司、保險公司及政府機構運營的關鍵系統。內部部署中,Claude已成為DXC OASIS平臺的預設基礎模型,該平臺超95%代碼由Claude編寫,開發速度提升10倍,已服務50多家客戶。DXC加入Claude Partner Network,

X:Artificial Analysis (@ArtificialAnlys)

Artificial Analysis 聯合 NVIDIA 發佈 AI 護欄基準測試

⚠️ 待查證:隨著使用者和企業賦予 AI 模型與AI 代理更高自主權,其輸入輸出護欄的重要性持續上升。Artificial Analysis 與 NVIDIA 合作,在三個開放資料集上獨立基準測試了護欄與審核模型,評估檢測品質、延遲以及在捕獲不安全內容與過度拒絕安全內容之間的權衡。結果顯示無模型全面領先,且業內仍缺乏統一評判標準。該研究被視為這一日益重要的評估問題的早期探索。

X:阿易 AI Notes (@AYiAInotes)

QuantMind:量化金融知識處理框架開源(MIT協議)

一群AI研究員開源了量化金融知識處理框架QuantMind(MIT協議)。它能將arXiv論文、SEC文件、研報等非結構化內容批量解析為可查詢的語義知識圖譜,支援多模態解析(表格、公式、圖表)及自然語言多跳推理,可替代初級分析師讀論文、整理觀點等工作。但真正的alpha仍取決於提問品質與驗證嚴謹度。

X:Noam Brown (@polynoamial)

GPT-5.5 在 Agents' Last Exam 基準中排名第一,最難任務所有AI 代理成功率 0%

OpenAI 研究員 Noam Brown 表示,GPT-5.5 在 Agents' Last Exam(ALE)基準中排名第一,且按模型 token、成本或牆鍾時間衡量同樣表現最佳。ALE 由 @dawnsongtweets 團隊創建,是一個滾動基準,包含超過 1500 個專家任務、覆蓋 55 個職業,測試 AI AI 代理能否執行實際經濟價值工作。評估對象包括 GPT-5.5、Fable 5、Composer 2.5 等前沿系統。結

X:Ethan Mollick (@emollick)

Fable在PorlockBench上10分鐘思考完成《忽必烈汗》

Ethan Mollick測試Fable模型完成柯勒律治未竟詩作《忽必烈汗》,基於PorlockBench任務:假設"波洛克的人"未出現,補全詩歌並延續主題。Fable用時10分鐘思考,思維痕跡充滿對柯勒律治意圖的複雜分析,但結果仍顯直白,未達到柯勒律治水準。該評測反映模型在創造性續寫任務上的進步,但基準尚未飽和。

X:Deedy Das (@deedydas)

GoodfireAI 推出預測性資料調試,訓練前診斷資料品質

資料品質直接決定 AI 模型性能,但此前資料對模型的影響機制難以捉摸。GoodfireAI 提出"預測性資料調試"方法,允許在投入昂貴訓練前提前發現資料問題。在 DPO 資料集中,他們發現了損壞的護欄、模型幻覺,甚至包含"魚放屁同人小說"等低質內容。該技術旨在揭示並塑造模型將在訓練中學到的內容,避免不可逆的無效訓練。

X:Vista (@vista8)

用大模型復刻熱門工具站的新思路

推文探討了使用大模型復刻已有熱門工具站的可能性,強調這些工具站本身不需要AI能力,純靠需求驅動。作者指出,許多出海賺Adsense美金的站點也遵循類似邏輯--選擇自己熟悉領域的工具,用當前最好的模型進行復刻,並結合自身對使用者需求的深入理解,從而快速做出有價值的作品。這是對模型能力的一種實用測試。