四十八個德瑞克

Hister:把「看過的網頁」變成自己的搜尋引擎

深藍底上發光漏斗形光流意象圖

Hister:把「看過的網頁」變成自己的搜尋引擎

瀏覽器分頁開了又關,檔案下了又忘。你有沒有過這種經驗:明明記得看過一篇文章,關鍵時刻卻怎麼也找不到?歷史紀錄只存標題和網址,關鍵字對不上就沒轍;問 AI 吧,它也不知道你看過什麼。

Hister 就是來補這個缺口的:一個跑在你自己機器上的私人搜尋引擎,把你看過的網頁、存下的檔案,全部做成全文索引,以後用關鍵字、語意,甚至直接叫 AI 助理幫你找。

它是怎麼做的

原理不複雜,難的是做對。Hister 靠瀏覽器擴充功能(Firefox、Chrome)把你開啟的分頁全文,送回自架的伺服器建索引,再加上本地檔案,一併收進同一個搜尋入口。

關鍵在「由瀏覽器經手」這件事。作者 asciimoo 在 Hacker News 上親自解釋:擴充功能對網站來說是完全隱形的,沒有 captcha、沒有反機器人、沒有登入牆,傳統爬蟲會卡關的地方全部繞過。這也是它能索引 Instagram 這類封閉網站的原因,目前大概沒有第二個開源工具做得到。

搜尋入口有三種:網頁介面、終端機,外加 MCP server。最後一個最值得注意:AI 助理可以直接連上你的私人索引查資料,等於給 agent 配了一個「你看過什麼」的記憶層。查詢語法也下過功夫,欄位過濾、片語、萬用字元、否定、別名都有,不是陽春的關鍵字比對。

另外有可選的語意搜尋,接上你自己指定的 embeddings endpoint,就能用意義找文件,不必死背關鍵字。不過這功能還在實驗階段,作者自己都說效果還不滿意,先當加分題就好。

跑起來有多快


chmod +x hister
./hister listen

從 releases 頁下載對應平台的執行檔,改名、給執行權限、跑起來,開瀏覽器到 http://127.0.0.1:4433,裝上擴充功能,就結束了。本地個人使用零配置。想匯入既有瀏覽紀錄或整站爬取,官方 quickstart 另有說明。

基本盤:Go 寫的單一執行檔,AGPL-3.0 開源,2026 年 1 月才建立,到九月中已經 4,300 多顆星,作者還在高頻更新。隱私設定是玩真的:預設零遙測、沒有強制雲端,擴充功能除了抓 favicon,只把頁面內容送往你自己設的伺服器。

先說醜話:兩個已知的坑

第一個是記憶體。GitHub issue 上有人 reindex 吃掉 10 到 30GB,主因是底層全文索引庫 bleve 的物件常駐增長。作者修過一輪,壓到約 10GB 跑 20 分鐘,但還是很吃資源。Docker 版也曾有 OOM 重啟回報,部分修掉,部分作者重現不出來。結論:索引規模上去之前,先小量試,別一上來就把十年瀏覽歷史全倒進去。

第二個是桌面端摩擦。macOS 從 releases 下的執行檔沒簽名,會被 Gatekeeper 擋;Homebrew formula 還在送進 homebrew-core 的路上。Safari 更不用想,作者沒有蘋果裝置,直接表明不收進主 repo,只支援 Firefox 和 Chrome。

這兩點加起來,Hister 目前的定位很清楚:技術人自架的全文檢索引擎,不是開箱即用的大眾產品。

社群怎麼看

Hister 在半年內兩度登上 Hacker News 首頁。第一次是八月下旬兩百多分,第二次是九月中,四百多分、一百二十多則留言,作者兩次都親自下場回覆。

留言的戰線大概分三條。外包派覺得直接問 ChatGPT 更省事,模糊描述也找得到;自架派反駁說那只是把依賴從搜尋引擎換成 OpenAI,而 Hister 的 MCP,正好讓同一套工作流跑在自己的資料上。信任派質疑裝未審核的執行檔和擴充功能,遲早中獎;容器隔離派說答案是沙盒和細粒度權限,不是一味拒絕。還有人翻出舊帳:Chrome 在 2008 年就內建過本機全文搜尋,2013 年拔掉,有人酸是因為離線頁面播不了廣告。

我站在自架派這邊,但附帶條件:全文索引這層先用,語意搜尋等成熟再開,別把實驗功能算進生產力。

適合誰

每天開幾十個分頁做研究、檔案散落各處、又不想把瀏覽歷史交給任何雲端服務的人。接上 agent 工作流之後,它補的是「看過但還沒整理」的那一層:整理好的知識放筆記系統,還沒整理的原文丟給 Hister,兩層互補。

不適合:主力瀏覽器是 Safari 的人、想點兩下就用的非技術使用者、記憶體吃緊的老機器全量索引。

相關連結:GitHub官網文件快速開始線上 demo

Exit mobile version