ninjahawk/livenerf:持續追蹤模型發布後能力變化的開源基準

livenerf 每天用固定題庫重跑 GPQA、MMLU-Pro、競賽數學,與發布週基準線配對比較,在 10 天窗口內偵測約 3 個百分點的能力退化或提升。

livenerf 每天用固定題庫重跑 GPQA、MMLU-Pro、競賽數學,與發布週基準線配對比較,在 10 天窗口內偵測約 3 個百分點的能力退化或提升。

Nvidia 推出 Open Agent Safety Platform,要把 AI agent 關進容器。CNBC 全文翻譯,加上 Hacker News 討論串 161 則留言的風向整理,網上幾乎一面倒不買帳。

Cal Newport 呼籲國會公開調查 OpenAI 與 Anthropic 的高風險研究、內部安全程序,以及末日主義意識形態如何左右研發節奏;文末附 Hacker News 網友反應與我的看法。

有人用一張顯卡和開源配方,把 Jev 復刻成 0.8B 的本機決策模型:28 毫秒一次判斷、benchmark 總分追平,但推理差距和 Hacker News 上「這不就是分類器嗎」的質疑都寫在第一屏。

作者輸入一句 2010 年代中期的 NBA 迷因,Google AI 概覽給的不是連結,而是一段安慰。原文全文翻譯,加上 Hacker News 741 個讚、395 則留言的反應整理。

Haskell 程式員 turion 的長文翻譯:自己寫、自己規劃、把 agent 當雜役,附論壇 12 則回應與 Hacker News 300 則留言的整理。

華盛頓上訴法院 2 比 1 維持五角大廈把 Anthropic 列為供應鏈風險。全文翻譯,加上 Hacker News 623 則留言的五派觀點整理。

2026 年 9 月 24 日 Show HN 刊出 devdotfast/whiteboard,24 小時 357 分。semantic diff 是最大亮點,「IDE」當天改名 canvas,N+1 source of truth 與 736 MB 是主要質疑。我會追蹤,但不會現在裝。

雪梨補習公司 Dymocks Tutoring 與 Talent 100 五間中心本週末熄燈,執行長叫家長改訂 Gemini 或 ChatGPT。AFR 報導翻譯+Hacker News 131 則留言整理。

義大利參議院在 2026 年 9 月 23 日以 81 …