第三代推理評測的環境到底長什麼樣子
每一個環境都是一款規則未知、分關進行的回合制解謎小遊戲,連過關目標都要自己摸索出來,這篇把規格一次講清楚。
每一個環境都是一款規則未知、分關進行的回合制解謎小遊戲,連過關目標都要自己摸索出來,這篇把規格一次講清楚。

三家 AI 同一早晨接連故障,HN 吵的是連鎖遷移壓垮還是共用承重服務出事,外加 Downdetector 可信度與護城河之死。

GPT-6 Astra 是 OpenAI 最新推出的高智慧、高對齊模型,在電腦操作、程式開發、網路安全、科學研究與專業工作皆達頂尖水準,FrontierMath Tier 4 達 98%、ExploitBench 滿分。本文為官方公告繁體中文翻譯整理。

OpenAI GPT-6 Astra 在 ARC-AGI-3 接近滿分,HN 934 則留言吵的不是分數,是 AGI 到底該怎麼定義。
World Labs 2026-09-01 發表 Atlas omni 世界模型:單一模型同時生成影片、重建 3D、模擬機器人訓練環境。效能數字全部來自官方自測,只開放 early access。

先有口碑、後有名字:ox-alpha 盲測衝上 OpenRouter 用量第一,揭曉是 GLM-5.3-Flash。程式能力約等於 Claude Opus 4.8,價格卻是零頭,本文整理官方跑分、第三方指數與 Reddit、X 社群實測。

核心事件是真的,罰款價目表沒出處。整理《財經》報導中有背書的料,和頭條號加料的部分。

LZ 在高能量區看到 1 個排除不掉的 248 keV 事例,誤報機率約 1/200。整理 Science 原文重點與 HN 81 則留言爭點。
Google 9 月 2 日推出 Gemini 3.8 Flash 與 Flash Cyber:同速度同價格接棒 3.7,推理編碼大躍進;Cyber 版專攻漏洞挖掘與自動修補,僅對可信防禦方開放。整理官方資料與 HN 近 500 則討論的正反交鋒。
Muse Spark 1.2 是 Meta 的 coding-focused update,1M context、與 Muse Code 共訓,MCP Atlas 90.3% 業界第一,contributor /bin/bash.10//bin/bash.20 定價最激進。HN 2026-09-03 登頂 355pts,社群肯定 tool-like 特質但質疑 benchmaxxing 與 harness 耦合。