Astra for Law:為律師打造的高精度 AI 法律助理,安全且可客製化。

Astra for Law 是 OpenAI 為律師與法律科技公司打造的 AI 法律助理,結合 GPT‑6 Astra、法律搜尋索引與客製化指示,提供高精度的法律研究、分析與寫作支援。

本文為 Introducing Astra for Law | OpenAI 之繁體中文翻譯整理,原文版權歸原作者所有。

今天,我們推出 Astra for Law:一個全新的基礎平台,讓律師事務所與法律科技公司能以自身專業為核心,打造 AI 產品與工作流程。它結合我們最新、能力最強的 GPT‑6 Astra 模型,以及針對專業法律工作量身設計的設定、工具與情境資訊。

Harvey、Legora 等 API 客戶將能以 Astra for Law 為基礎,把這項智慧整合至自己的產品與工作流程。隨著前沿模型持續進步,我們也會把這些法律能力帶到最新模型中。

我們同時持續加強隱私與治理功能,讓律所能針對機密客戶工作設定專屬控制措施。律所亦可利用 26 個全新的生態系插件自訂 Astra for Law,將 ChatGPT 連接至 Relativity、Clio 等既有專業工具。

法律領域的前沿智慧

Astra for Law 把 GPT‑6 Astra、強大的法律搜尋索引,以及法律分析與寫作指示結合在一起。這套配置能全面強化 Astra 在各類法律實務中的能力,同時讓律所與法律科技公司保有自行建立應用程式及工作流程的自由。

法律研究:從事實走向有依據的答案

Astra for Law 可用的工具之一,就是全新的法律搜尋索引。法律研究通常始於尋找最精確適用的權威資料、定位相關段落,並判斷其與當前情況的關聯性及拘束力。這套索引能協助 Astra for Law 完成上述工作,並與律所仰賴的授權內容及專業產品互補,例如 Thomson Reuters 提供的服務。

透過法律搜尋索引,Astra for Law 可以在超過 2.3 億個網址構成的資料庫中,搜尋美國判例法、成文法、法規、法院規則及行政決定,且每天都會加入新來源。我們與 CourtListener 背後的非營利組織 Free Law Project 合作,把涵蓋超過 99.9% 已公布美國先例判決⁠(在新視窗開啟)的判例資料集納入研究體驗。

為衡量這套配置對法律研究的提升幅度,我們使用 Vals AI Legal Research Bench⁠(在新視窗開啟)私人驗證集中的 200 道美國法律研究問題,測試 Astra for Law 的完整配置。這項基準測試評估模型能否找到相關來源與段落,以及研究答案是否符合評估標準。

當兩套系統都使用最高推理強度時,Astra for Law 在 54.0% 的問題上通過整體正確性檢查;僅使用網頁搜尋的 GPT‑6 Astra 則為 38.7%,相對提升 40%。Astra for Law 產生的答案也更完整。

在以判例法為主的問題中,當兩者皆使用最高推理強度時,相較於僅使用網頁搜尋的 GPT‑6 Astra,Astra for Law 找到的參考案例多 24%。在經審核的目標段落集合中,以相同推理強度比較時,它從正確法院判決中擷取到的相關段落最多增加 54%。

這為交易諮詢、爭議評估與法律策略制定提供更穩固的研究基礎,並附有律師可親自查核的可靠權威資料。

Astra for Law 與 GPT‑6 Astra 在不同推理強度設定下,於 Vals AI Legal Research Bench 驗證集上的表現。

提升端到端法律工作流程的表現

法律研究只是第一步。針對法律分析與寫作設計的自訂指示,會引導 Astra for Law 把研究成果套用至客戶事實、發展論點或交易條款,並找出其中的弱點與不確定性。這可能包括區分法院的判決要旨與其他附帶意見、處理削弱某項主張的案例,或解釋合約中的例外條款如何轉移雙方風險。

例如,當系統被要求找出具有相似事實模式且仍屬有效的法律依據時,Astra for Law 不僅能精確找到相關先例,在比對事實模式方面也優於其他前沿模型:

提示詞

我們的客戶在得知某零售商的同類供應商過往平均每年獲得約 800 萬美元訂單後,簽署了一份為期五年的自有品牌產品製造協議。合約承諾零售商每年採購 200 萬美元,其餘訂單則由零售商自行決定。簽約前,客戶知道零售商正在調整供應商之間的訂單分配方式。實際訂單僅略高於最低承諾。內部紀錄顯示,過往平均值可能低得多。零售商主張,我們的客戶已接受最低採購額與新的分配流程。請找出事實最相近的先例,並就客戶的虛假陳述主張撰寫備忘錄。

Claude Fable 5.1
Astra for Law
面對相同提示詞,Astra for Law 找到兩項高度吻合的先例;在訴訟範例中,Claude Fable 5.1 引用的判決要旨已在上訴中遭推翻,而在交易範例中,它則回報找不到此類案例。

Astra for Law 初期將透過 ChatGPT 與 Codex 的 Trusted Access 向部分律所提供,並即將開放 API。它會在模型選擇器中顯示為「GPT‑6 Astra Law」,API 模型名稱則為 gpt-6-astra-law

符合法律專業要求的信任與控制機制

律師事務所需要保護客戶機密,並控管 AI 在法律實務中的使用方式。我們為符合資格的律所建立了專屬 Trusted Access Program,讓律師及其監督下的工作人員能使用 Astra for Law 執行專業法律工作。對符合資格的律所而言,此方案包含 API 的零資料保留(Zero Data Retention,ZDR),而 ChatGPT Enterprise 的使用內容預設不會接受人工審查。

我們也正與 AI 治理領域的領導者 Latham & Watkins 合作,共同設計資訊權限、倫理隔離牆、客戶指示及律所監督等機制。

以律所專業為核心打造 ChatGPT

有了前沿智慧與適當的控制機制,律所可以把自己的先例、方法與專業判斷,轉化為符合自身標準的 AI 工具與工作流程。

我們的前線部署工程師正與部分律所合作,透過自訂介面及專有資料整合來調整 ChatGPT Enterprise,為各家律所的工作流程打造專屬工具:

  • Sullivan & Cromwell 建立了一套協議分析器,把律所的談判手冊與精選先例納入新交易審查。它能協助律師找出多項條款合併解讀時浮現的風險,再把發現轉化為建議紅線修訂及客戶建議初稿,供律師質疑、調整與完善。
  • Ropes & Gray 依照律師審閱資料室及判斷交易重點的方式,建立了一套交易盡職調查系統。它能追溯發現的原始來源,並找出可能影響收購的問題,例如重要客戶合約是否要求事先通知或取得同意。
  • Cooley 建立 GO Public,把自身的資本市場專業導入企業上市準備流程,涵蓋 IPO 申報文件起草及辨識需要管理層關注的風險。當交易內容變更時,系統會把變更同步反映至整份申報文件,讓律師共同審視其影響。

律所可以運用自家團隊與合作夥伴產品進行建置,並自行界定工作可使用的資料來源與審核流程。

我們很榮幸能與推動法律 AI 發展的專業公司合作。今天,我們推出由合作夥伴打造的26 個插件,協助律所更深入運用既有工具與知識。這些插件涵蓋法律實務與律所營運:透過 iManage,律師可在 ChatGPT 中起草談判簡報並儲存至案件檔案;Intapp 可呈現可能需要檢查並登錄工時的活動;DeepJudge 能把過往交易帶入比較。Thomson Reuters 正把 HighQ 的案件情境整合至 ChatGPT,並預告即將推出 CoCounsel Legal 連接器。

此次發布也包括 9 個社群插件(由 LegalQuants、LECG 及 Skills.law 的律師與法律工程師提供),以及 47 項自訂技能,讓實務工作者能在 ChatGPT 中調整、擴充或參考運用。社群插件讓最了解實務需求的人持續為這些技能建立能力標準。我們今天也正式全面推出 ChatGPT for Word,讓律師可直接在日常使用的起草工具中進行校對、取得修訂建議並標示格式問題。

我們採取開放且可組合的方式:律所可以使用專業產品、帶入自家工具與知識,並依實務需求調整社群建立的技能。合作夥伴可持續開發自己的應用程式與工作流程,律所則能自行選擇各項能力的組合方式。在 OpenAI 上建置,應該代表能從整個生態系獲得更多價值,而不是取代它。

與我們共同打造

OpenAI 將長期投資法律領域。在嚴謹評估,以及律師與法律科技合作夥伴回饋的指引下,我們會持續同步改進 Astra for Law 的模型、設定、工具與指示。我們也會不斷提升 ChatGPT,讓律所能以自身專業為核心進行建置,並連接日常使用的工具。

我們與 Wachtell, Lipton, Rosen & Katz 的合作,把該律所在訴訟及公司法方面的專業,與我們的前沿研究及工程能力結合,探索 AI 如何支援需要高度法律判斷的工作。

最具企圖心的應用,將來自法律實務工作者,以及與他們並肩開發的公司。我們致力於與整個生態系合作,讓律所能把自己的專業、標準與判斷導入 AI,並以只有他們才能做到的方式服務客戶。

如欲申請 Astra for Law 搶先體驗、將其整合至產品,或依照律所專業開發工具,請聯絡 OpenAI。

Hacker News 網友討論整理

討論整體並非單純反對法律 AI;較接近的共識是:LLM 已能顯著提升資料整理、檢索與初稿工作的效率,但距離可獨立承擔法律判斷、風險與責任仍很遠。以下整理自 Hacker News 討論串。[1]

1. 最被認可的用途:可驗證的「前處理」與研究輔助

  • 有網友分享,法律團隊用 Claude 讀取格式各異的醫療與福利文件,輸出可直接匯入系統的 JSON,處理速度由每小時約 2–3 份提升到 8–10 份;但每份結果仍須由律師覆核。
  • 一位前大型律所律師、現任獨立訴訟律師表示,模型適合被拆成離散且可驗證的任務,例如 OCR、建立 embeddings、關鍵字/語意搜尋,以及從大量證據中找出支持特定主張的段落。只要保留可追溯來源,實用價值很高。
  • 多位從業者認為,AI 很適合摘要法規、整理事證、比較文件、發現問題與製作初稿,類似替律師完成備料;真正的策略、取捨與最終簽署仍需人類負責。

2. 起草合約與法律文件仍是主要弱點

  • 多位網友實測後認為,模型常產生過度防禦、彼此衝突或不符合商業現實的條款;有時甚至在修訂時忘記自己代表哪一方。
  • 模型傾向列出大量「可改善之處」,卻缺乏資深律師判斷哪些風險值得談判、哪些修改反而不划算。法律文件中 andor 等細微措辭也可能實質改變權利義務。
  • 直接要求模型「寫一份支持 X 的完整訴狀」通常會得到辭藻華麗但訊噪比低的內容;相比之下,把任務拆開並要求逐項附上來源,結果可靠得多。

3. 幻覺、驗證與責任歸屬是核心疑慮

  • 討論反覆提到虛構判例、錯誤引用與看似可信但無法驗證的分析。即使模型的整體幻覺率較低,在法律這種錯誤成本極高的領域,也不能忽略剩餘風險。
  • 一些律師會逐一核對引用,仍認為 AI 能節省大量組裝與搜尋時間;問題在於並非所有使用者都會保持同等程度的審慎。
  • 網友將法律與程式開發相比:程式有編譯器、測試、lint 與 code review,法律文件卻缺乏等價的自動測試框架,而且錯誤往往難以回滾。因此可程式化的 citation checker、第二模型審查、不同上下文重跑與交叉比對,被視為必要的防線,而不是可選功能。
  • 多數意見認為,最終提交文件的律師或使用者仍須承擔責任;若 AI 法律產品未來能提供賠償保證或保險,才可能成為真正重要的商業突破。

4. 不太可能立即取代律師,但會重塑律所人力結構

  • 討論者普遍區分不同法律領域:高額訴訟、出庭辯論、談判、策略調整與複雜利益權衡,短期內仍高度依賴資深律師;例行研究、文件審閱與標準合約工作則更容易自動化。
  • 初級律師、法務助理與 paralegal 被認為最先受影響。律所可能由大量初階人力構成的「金字塔」轉為中段較厚、初階人數較少的「鑽石型」組織。
  • 也有另一種看法:成本降低可能擴大原本無力取得法律服務的市場,因此不一定只會減少職缺,也可能增加整體需求與案件量。

5. 民主化法律服務,或製造更多法律攻擊?

  • 樂觀派認為,LLM 可協助一般人了解權利、看懂合約、準備問題,降低法律知識與基本服務的門檻,甚至讓部分爭議在進入法院前獲得解決。
  • 悲觀派擔心,生成法律主張的成本下降後,法院、政府機關與對手方會被大量低品質文件淹沒;生成端雖然變快,但法官與人工審查仍是瓶頸。
  • 另一項爭議是資源分配:AI 可能讓弱勢方更容易取得基本協助,也可能讓資金雄厚的一方以更多算力與更強模型大量發動法律攻勢。最壞情況是形成「富人使用人類專家、其他人只能使用 AI」的雙軌制度。

6. 法律資料與司法管轄範圍仍是基礎限制

  • 網友特別注意到 Astra for Law 的核心優勢可能不是模型本身,而是法律搜尋索引、可追溯引用及專業工作流。
  • 美國法律資料分散於聯邦、各州、地方、部落、軍事及不同層級法院,並不存在完整的單一下載來源;基層法院資料尤其常受登入、CAPTCHA、數位化不全與授權限制影響。
  • 產品公告聚焦美國法律,但討論認為應更清楚標示司法管轄範圍。普通法與歐陸法系所需的資料不同;歐陸法除了成文法,也需要判決與專業評註,而許多內容掌握在商業出版商手中。

7. 對 OpenAI 商業策略的觀察

  • 部分網友把 Astra for Law 視為「通用前沿模型+垂直領域索引、指示、工具與治理」的專業版封裝,並猜測 OpenAI 正透過金融、法律等垂直產品提高 API 的定價與黏著度。
  • OpenAI 同時把 Harvey、Legora 稱為 API 客戶,引發是否會與既有法律 AI 客戶競爭的討論。法律科技公司若能自由切換底層模型,其護城河可能更多來自工作流、資料整合、權限、審核與使用體驗。
  • 隱私、律師—客戶特權、資料保留與治理被視為企業採用的關鍵,但部分網友認為公告中的承諾仍過於概括,需要更具體的合約、SLA 與技術保證。

討論結論

Hacker News 的主流態度可概括為:把 Astra for Law 當成能力很強、但必須接受監督的法律助理,而不是自動律師。近期最有價值的模式是「AI 搜尋、整理、比對與起草;人類驗證、判斷、談判並承擔責任」。真正決定成敗的可能不是單一 benchmark,而是引用能否追溯、錯誤能否被系統性攔截、機密資料能否受到保障,以及效率收益最終是否真的降低客戶成本。[1]

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *