最近在 GitHub trending 上看到 aipoch/open-science,五天漲了一千多顆星(2,777 → 3,850),主打「開源版 Claude Science」:local-first、model-agnostic 的 AI 科研桌面工作台。我花了點時間把它的 GitHub issues、第三方評測翻了一遍,發現一個有趣的現象:Reddit 零討論、X 零獨立測評,所有的真實聲音都擠在 issues 裡。這篇文章整理我看到的東西。
它是什麼
一句話:Electron 桌面 app(macOS / Windows / Linux),裡面住著 coordinator agent、specialist subagents 和一個 reviewer agent。你開專案、用自然語言描述研究目標,agent 會讀檔、跑 Python / R、調科學資料庫,最後產出綁著 provenance(產地證據)的報告和圖表。
規格上看起來很完整:22 個科學 skills(AlphaFold2、Boltz、ESM、scGPT、文獻回顧、遠端 SSH 算力……)、24 個內建 connectors(PubMed、bioRxiv、ChEMBL、臨床試驗……)、artifact 不可竄改加 checksum、對話可以開分支不丟原文。授權是 Apache-2.0,沒有座位費,模型自己帶——Claude / Codex 訂閱可以直接掛進去。
官方自己宣稱在 BiomniBench-DA Public 50 拿第一(79.05 分)。這個數字先打個問號,後面會講。
真實使用者在 issues 裡怎麼抱怨
我把 open 的 issues 掃了一遍,挑幾個有代表性的:
notebook 會卡死(#1485)。Windows 0.18.0、Claude Code backend 下,notebook_execute 在 GLM 和 DeepSeek 兩個 provider 都卡住,一次等滿 1,800 秒 timeout。連 print("kernel alive") 這種測試 cell 也跑不出來,之後 artifact 的 RPC 憑證還過期。跨 provider 同一個症狀,問題多半出在它自己的 notebook MCP 或 runtime 回收路徑,不在模型那邊。這是核心執行路徑,出問題等於整台車引擎熄火。
headless CLI 回報不可信(#1662)。遠端工作明明成功(exit 0),但 completion 存檔時跟 session 快照 race,CLI 照樣回 exit 1。寫自動化的人看到這個會很痛:exit code 不能信,重試還會把做完的工作再做一遍。
SSH 遠端算力的產出沒有 provenance(#1101)。job 跑完、檔案收割回來、artifact 也 finalize 了,但 producer、執行快照、inputs 全是空,理由寫著 producer-source-unverifiable。等於它主打的「可追溯」在遠端算力這條路上是破的。
Specialist 整包匯入被一個 Skill 卡死(#1328)。匯入的包裡,只要有一個 Skill 跟已安裝的撞名,整包就直接判不能裝。偏偏內容 hash 幾乎每次都對不上,只能手動刪掉本地的再重來。
另外還有加不上 GLM 模型(#1717)、Windows 快取目錄不能換盤(#1516)這種小毛病。參數掃描(parameter sweep)、Slurm 支援、Zenodo / DOI 發布都還在提案階段。
公平地說,維護者修 bug 的速度很快。context overflow 造成死會話(#254)、provider 報錯難讀(#194)、reviewer 自動審查迴圈(#159)都修掉了。一個月從 v0.17 衝到 v0.26,這個迭代速度是玩真的。
第三方怎麼看
最有意思的一份評價,來自 BiomniBench-AI4S 的橫評:七個 AI-for-science agent,用同模型、同評分標準比了一輪,直接把 aipoch/open-science 排除在外。理由寫得很直白:它是包著 OpenCode 和 Claude Code 引擎的桌面 GUI,沒有自己的 agent core,當時也沒有 headless CLI,沒法批次跑 benchmark。v0.26 補上 headless CLI 之後,前半個理由過時了,但「沒有獨立 agent core」這句依然成立。
Bloss0m 寫了一篇 v0.19.0 的深讀,結論我很認同:這個專案的方向是對的——把 skill 產地版本、notebook 新鮮度、OAuth 生命週期、artifact 穩定 ID 都變成可治理的狀態。但每一條後面都要加 honesty clause:標 clear 不代表結論正確、唯讀不代表可信、lineage 不代表引用正確。trace 證明系統留了痕,不證明研究是對的。
SandBase 的評論更狠一點:可信度來自不可變的 provenance 和重放,不來自 agent 的數量。token dashboard 量的是資源,不是科學品質。
我的看法
如果你在找一個 Hermes 可以嵌入的元件,那它不是。它是獨立的 Electron 閉環生態,自己的 workspace、session、artifact 體系。它的價值是當對照組:人家怎麼做「可重現、可稽核」這件事,有哪些坑(上面那一串 issues 就是現成的坑位圖)。
真要試,我的建議只有一句:先驗 notebook 那條路在你的 provider 組合下通不通(#1485)。核心執行路徑不通,其他都是白搭。headless exit code(#1662)和遠端 provenance(#1101)是已知坑,寫自動化之前先測。
官方自己有一句話很誠實,放在 README 裡:「if you need a working AI research assistant today, Claude Science is the more capable choice.」 賣的是結構天花板,不是今天的完成度。衝著這份誠實,給個 star 不虧;要不要拿自己的研究賭上去,先等等。
相關連結:GitHub repo / 官網 / Bloss0m v0.19.0 深讀 / SandBase 評論
(資料時點:2026-09-07,v0.26.0,約 3,850 stars。迭代極快,issue 狀態可能隨版本變化,引用時請對照版本號。)