Anthropic 把 25 萬則對話交給外部研究團隊
Anthropic 讓史丹佛、牛津與 METR 分析 25 萬則真實 Claude 對話,並由帝國理工學院執行獨立隱私稽核,結論與外界既有印象頗有出入。
收錄 AI 研究 相關產品動態與產業觀察,共 16 篇文章。
Anthropic 讓史丹佛、牛津與 METR 分析 25 萬則真實 Claude 對話,並由帝國理工學院執行獨立隱私稽核,結論與外界既有印象頗有出入。
Hume AI 對 11 款主流語音辨識模型的診斷實驗發現,公開榜單分數愈高的模型,愈可能是在複誦資料集本身寫錯的參考文字,而非真的聽得更準。
Prime Intellect公開一份大型測試:18個前沿模型各自跑153次全自主AI研究實驗,最強模型補上82%的人類紀錄差距,但沒有一個模型端出新方法。
Anthropic公布實驗:Claude為15個蛋白質標靶設計結合物,Adaptyv Bio與Twist Bioscience驗證後14個命中可用設計。
BigBang-V1 把合成資料推進到由 AI 出題、解題、驗題與篩選的自演化流程。
Google ATLAS 分析 1465 萬次 Gemini 互動,顯示 AI 使用已廣泛擴散,但工作自動化深度仍有限。
MIT、劍橋、普林斯頓等團隊在 Nature 的研究顯示,人類面對新遊戲時更像是在做快速、淺層、帶目標感的心理模擬,而不是深度搜尋。
Oak Lab為持續學習智能體提出20瓦目標。本文整理已核驗事實,以及它為何不只是單一發布消息。
ICML 2026 把兩個大獎給了擴散模型以繁體中文整理原文重點,保留關鍵數字、產品主張與後續驗證問題。
這起事件說明,競爭已不只在模型或工具本身,而是落到資金、客戶落地與監管應對能力。
OpenAI 現在表示,完全自動化一切不是它想要的未來,說法從全自動 AI 研究員轉向與人類搭配工作。
這位強化學習先驅認為,下一詞預測模型缺少因果、實驗與自我經驗。
DeepMind 最新的數學 AI Aletheia,基於多智能體框架,在 FirstProof 挑戰賽中解出 10 道未發表研究級數學問題中的 6 道,其中 5 道被外部專家評為「可直接發表」。
李飛飛 World Labs 融資攻向空間智能. 本文整理事件重點、戰略背景,以及受影響用戶或企業需要注意的實務風險。
Google 宣布在 Gemini 中推出 Notebooks 功能,將 NotebookLM 直接整合至 Gemini 的主要工作流程,讓用戶能管理個人知識來源並在兩項產品間同步。
Yann LeCun 創辦 AMI Labs,完成 10.3 億美元種子輪融資,估值 35 億美元,為歐洲史上最大種子輪。他將基於 JEPA 架構打造不依賴下一個詞預測的 AI。