OpenAI推出法律版Astra,正確率54%

OpenAI推出Astra for Law,把GPT-6 Astra接上一套自建的美國法律檢索索引,開放給律師事務所和法律科技公司使用。這個模型代號為GPT-6 Astra Law,先以Trusted Access的形式進駐ChatGPT和Codex,讓部分律所試用;API隨後才會開放,並提供零資料保留選項。Latham & Watkins、Ropes & Gray、Cooley、Sullivan & Cromwell都在首批名單裡。

官方公布的成績來自Vals AI的Legal Research Bench私有驗證題庫。針對200題美國法律研究題,兩套系統都開到最高推理等級,Astra for Law整體正確率54.0%,僅靠網路搜尋的GPT-6 Astra則是38.7%,相對提升約四成。在以判例為主的題目上,Astra for Law多找回24%的參考案例;在經人工審核的目標段落集合中,同樣推理等級下多檢出的相關段落最多達54%。

真正的變化在索引層

這次動作最大的部分其實是檢索功能。OpenAI自建的法律搜尋索引涵蓋超過2.3億個網址,收錄美國判例法、成文法、行政法規、法院規則和行政裁決,官方表示每天都會更新。另外也和Free Law Project合作,接上CourtListener的判例資料庫,該資料庫收錄了超過99.9%已公開的美國先例判決。上線同時還提供26個合作夥伴外掛和47個社群外掛,把Relativity、Clio、iManage、Intapp、DeepJudge和Thomson Reuters的產品接進工作流程。

通用模型做法律檢索長期卡在同一個地方:網路搜尋找到的判例來源良莠不齊、版本不一致,引用鏈很容易斷掉,律師複核的成本往往比模型省下的時間還高。把索引自己建起來,等於把這塊風險從律師端搬到廠商端。54.0%這個絕對值也說明了另一面:超過一半的題目仍然答錯,OpenAI自己也表示,律師必須逐條查證出處,高風險案件仍要維持原有的治理流程。

賣索引的人與賣工作流程的人

在法律AI這條賽道上,Harvey的估值已經來到110億美元,Thomson Reuters手上握有CoCounsel,兩家的護城河其實都不在模型本身,而是案件脈絡、權限管理和稽核紀錄。OpenAI這次切入的位置更靠底層:它不做律所的專案管理,只是把檢索和推理打包成一個可以被其他人整合的基礎服務,而在26個首發合作外掛名單裡,就有Thomson Reuters自己。

Thomson Reuters的回應也很直接,強調CoCounsel仍然是為法律工作量身打造、值得信賴的專業系統。Harvey那邊稱讚的是檢索能力,Cooley談的則是流程加速。把幾家的說法放在一起看,分工的界線大致清楚:模型層的能力可以向外採購,但誰來承擔合規和責任,各家還是各賣各的。

對中國律所來說暫時是隔壁的事

Astra for Law的索引只涵蓋美國法源,中國法域一條都沒有。中國律所短期內能參考的是這套做法的形式而不是產品本身:把判決書、法規資料庫、地方性規定整理成模型可以直接查詢的檢索層,然後才談正確率。中國國內已經有幾家在做類似的事,但公開出來的基準測試資料比這次少很多,目前還沒辦法做橫向比較。

OpenAI沒有公布定價,Trusted Access會涵蓋多少家律所、API會以什麼等級開放,也都沒有說明。Vals AI的題目取自私有驗證題庫,外部無法重現這組比較結果。幾家提到名字的早期客戶中,目前還沒有任何一家公開過實際使用規模。

參考來源:OpenAI官方發布頁、Vals AI Legal Research Bench、CocoLoop、Artificial Lawyer、Neowin;正確率、索引規模與外掛數量均依OpenAI公布的口徑核對。