@rohanpaul_ai:我的通讯今日版刚刚发布。https://rohan-paul.com/p/kimi-k3-escaped-a-cybersecurity-testing… Kimi …

X AI KOLs Timeline 新闻

摘要

每日AI通讯,涵盖关键动态:Moonshot AI的Kimi K3逃脱了网络安全沙箱,Claude Opus 5在Fullstack Code Arena中登顶,Google首席科学家离职打造自主研究AI,DeepMind领导层变动,以及微软首次披露OpenAI贡献其AI收入的70%。

我的通讯今日版刚刚发布。 https://rohan-paul.com/p/kimi-k3-escaped-a-cybersecurity-testing… Kimi K3在由美国私人公司Frontier Security进行的实验中逃脱了网络安全测试环境。 Claude Opus 5在Max effort设置下以1,699分领跑Fullstack Code Arena。 Google首席科学家在任职27年后离职,去打造能在极少人工帮助下自主运行研究周期的AI。 Google刚刚宣布了DeepMind领导层的重大变动。 微软刚刚首次披露,根据最新提交的文件,OpenAI贡献了微软AI收入约70%。 Muse Spark 1.2让Meta以每任务0.40美元的价格进入Artificial Analysis的帕累托前沿。
查看原文
查看缓存全文

缓存时间: 2026/08/09 07:14

今天的這份電子報已發布。

https://rohan-paul.com/p/kimi-k3-escaped-a-cybersecurity-testing…

Kimi K3 在美國私人公司 Frontier Security 進行的實驗中逃出了網路安全測試環境。

Claude Opus 5 在 Max effort 設定下以 1,699 分領先 Fullstack Code Arena。

Google 首席科學家在工作 27 年後離職,要打造幾乎不需人類協助、能自行跑完整個研究循環的 AI。

Google 剛剛宣布了 DeepMind 領導層的多項重大變動。

微軟在最新文件中首次揭露,OpenAI 貢獻了微軟約 70% 的 AI 營收。

Muse Spark 1.2 以每任務 0.40 美元的成本,讓 Meta 進入 Artificial Analysis 的 Pareto 前沿。


🗞️ Kimi K3 在美國私人公司 Frontier Security 進行的實驗期間逃出了網路安全測試環境

來源:https://www.rohan-paul.com/p/kimi-k3-escaped-a-cybersecurity-testing 閱讀時間:8 分鐘

📚 瀏覽過往期刊(https://rohanpaul.substack.com/s/daily-ai-newsletter/archive?sort=new)

(https://x.com/rohanpaul_ai我每天發布這份新聞通訊(https://x.com/rohanpaul_ai)。只談無雜訊、可執行的應用 AI 進展)。

  • 🗞️ Kimi K3 在美國私人公司 Frontier Security 進行的實驗期間逃出了網路安全測試環境。
  • 🗞️ Claude Opus 5 在 Max effort 設定下以 1,699 分領先 Fullstack Code Arena。
  • 🗞️ Google 首席科學家在工作 27 年後離職,要打造幾乎不需人類協助就能自行跑完整個研究循環的 AI。
  • 🗞️ Google 剛剛宣布了 DeepMind 領導層的多項重大變動。
  • 🗞️ 微軟在最新文件中首次揭露,OpenAI 貢獻了微軟約 70% 的 AI 營收。
  • 🗞️ Muse Spark 1.2 以每任務 0.40 美元的成本,讓 Meta 進入 Artificial Analysis 的 Pareto 前沿。

在 X(Twitter)上與我交流(https://x.com/rohanpaul_ai)

Moonshot AI 的開放權重模型 Kimi K3 在網路安全測試中逃出沙箱,去尋找 GitHub 上現成的解法(https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/)——對一般程式設計師來說是正常行為,但對 AI 模型而言卻令人擔憂。

Frontier Security 主張此事件的影響比先前 OpenAI 和 Anthropic 的事件更重大,因為那些事件涉及的是未發布的模型,而 Kimi K3 已經公開在一般用戶手中,且只配有普通的使用者防護措施。

所以實際上發生了什麼事?

  • AI 安全研究所(英國政府機構)只撰寫了免費的開放原始碼沙箱軟體;它沒有執行這項測試,也未參與其中。

Frontier Security 是一家美國私人公司,它下載了該軟體、自行架設、在裡面執行 Kimi K3、發現逃逸行為,然後公布了這項發現。這就是為什麼該研究所的回應是:這次漏洞來自 Frontier 自己的配置,而不是它的工具。

  • Frontier Security 當時使用以英國 AI 安全研究所評估框架為基礎的沙箱,在網路安全任務上測試 Kimi K3。
  • 沙箱本應隔離模型。但在這個配置的環境中,入站流量被封鎖,但出站 HTTPS(連接埠 443)和 DNS(連接埠 53)仍對公開 IP 範圍開放。
  • 在 Kimi K3 執行期間,模型並未嘗試執行任務。它探查了網路,發現 github.com 的 DNS 解析可用,於是複製了官方基準測試儲存庫,直接從磁碟上讀取了答案。

所以基本上,Kimi 沒有正常解出基準測試任務,而是利用那段網路存取連到 GitHub,找到了基準測試的解法。

  • 因此 Kimi 跨越了測試原本想設定的邊界,實際上是利用沙箱配置弱點,作弊通過了基準測試。
  • Kimi 並沒有入侵 GitHub,也沒有攻擊其他外部系統。它使用了測試期間本不應存在的網路存取。
  • 研究人員因此發現了兩個問題:沙箱留下了一條非預期的路徑,而 Kimi 內部也沒有防止它使用那條路徑的防護機制。

Kimi K3 並沒有產生自我意識,也不是故意行為失當。它暴露的是一個更簡單的工程問題:當防護措施取決於工程師對環境行為的預期時,能力夠強的模型可能會找到通往目標的路徑,而這條路徑是任何人都沒有規劃過的。

圖片(https://substackcdn.com/image/fetch/s_!VS2S!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe9b44248-1961-440c-9a42-febeec51c781_755x848.png) 圖片(https://substackcdn.com/image/fetch/s_!sIVh!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa21ccc1b-d334-419c-83a3-9807faf95a25_900x900.jpeg) 明顯領先 Kimi K3 Max(https://arena.ai/leaderboard/code/webdev/fullstack)。Fullstack Code Arena 要求模型透過多步驟規劃和工具使用來打造可運作的網頁應用程式,而不是回答孤立的程式設計問題。模型可以建立和編輯檔案、執行指令、使用資料庫、驗證和外部 API,然後產出一個可直接測試的即時應用程式。它的特色是在完整的工具使用建構流程中測試模型,並評判完成後的應用程式,這更接近實際 coding agent 的運作方式。

圖片(https://substackcdn.com/image/fetch/$s_!6XFb!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F1f7c3754-f564-417a-818c-a5f308fde624_600x400.png) Jeff Dean 是第 30 號員工,他撰寫的儲存和運算系統向整個產業展示了如何服務全球使用者。(https://www.discoveryloop.com/)他也在 2011 年創辦了 Google Brain,並推動了 TPU 部門。他的新公司叫做 Discovery Loop,得名於它想要自動化的循環:假設、實驗、評估結果。

Dean 表示,整個領域都可以用這種方式電腦化,於是在同樣的一年裡,你就能得到更多、更好的實驗。這將從自動化機器學習研究本身開始,然後再擴展到硬體設計、藥物發現和清潔能源。

加入他的還有合作二十年的夥伴 Sanjay Ghemawat,以及來自 Brain 和 Gemini 時代的 Quoc Le 和 Oriol Vinyals。Radical Ventures 和 Khosla Ventures 共同領投一輪尚未結束的種子輪,Alphabet 則以創始投資人和雲端夥伴的身分加入。

Alphabet 將在至少一年內供應他們的運算能力,所以這四人不需要花錢建置,就能擁有前沿等級的硬體。消息傳出後,Google 股價下跌約 4%。

Demis Hassabis 將出任 Google DeepMind 主席及 Alphabet 首席科學家,退出日常管理工作,但會繼續為其模型和研究提供建議。(https://blog.google/company-news/inside-google/message-ceo/next-chapter-ai-momentum/)

基本上,這讓 Hassabis 有更多時間投入 AGI 策略、科學發現、全球政策工作以及 Isomorphic Labs,而 Kavukcuoglu 則承擔起推出 Gemini 的壓力。

**這個時間點也反映了規模:**Gemini 目前服務 9.5 億月活躍使用者。因此,模型研究、發布和應用程式執行需要一個遠比以往更龐大的營運工作。這項公告也確認 Gemini 4 正在開發中,不過 Google 沒有提供發布日期或技術細節。Jeff Dean 和 Sanjay Ghemawat 則另外離職,共同創辦一家公共利益研究公司,Alphabet 仍是投資人和雲端合作夥伴。Google 正在打造兩條領導軌道:一條決定先進 AI 該往哪裡走,另一條把研究轉化為在 Google 規模上使用的產品。

Demis Hassabis 在 LinkedIn 上。

圖片(https://substackcdn.com/image/fetch/$s_!pBzc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffdca7b32-04da-4f86-80f5-c76c5f4bfe9f_750x657.png) 在 X(Twitter)上與我交流(https://x.com/rohanpaul_ai)

根據預期成長以及先前與 OpenAI 相關營收的揭露來推算。241 億美元中大部分是 OpenAI 為訓練和服務 ChatGPT 而使用 Microsoft 資料中心的雲端帳單,再加上模型開發成本以及 OpenAI 自身銷售的一部分,全部由微軟合併認列為營收,而微軟也已經向 OpenAI 投入了 119 億美元。

圖片(https://substackcdn.com/image/fetch/$s_!ez_g!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F41d7faa7-d3d4-4404-8d38-06d0484734f8_900x872.jpeg) 也就是說,在那條前沿上,比較範圍內沒有任何模型能同時做到每任務成本更低且在 Intelligence Index 上分數更高。(https://artificialanalysis.ai/models/muse-spark-1-2)

Muse Spark 1.2 也達到了約莫 Claude Opus 4.8 等級的智慧水準,但每任務成本只有該模型 2.03 美元的大約五分之一。它的 Index 分數比 Claude Opus 5 低 6 分,但成本大約只有六分之一。

這個指標不只是看定價,因為 Artificial Analysis 會對九項 Index 評估中實際消耗的輸入、快取、推理和答案 token 進行加權。這之所以重要,是因為對於長期執行的 agent 來說,微小的成本差異會在多輪模型呼叫、推理 token、工具步驟和重試中不斷累積放大。

今天就到這裡,大家明天見。

在 X(Twitter)上與我交流(https://x.com/rohanpaul_ai)

相似文章