OpenAI 发法律版 Astra,研究正确率 54%

OpenAI 上线 Astra for Law,把 GPT-6 Astra 接到一套自建的美国法律检索索引上,面向律所和法律科技公司开放。模型标识为 GPT-6 Astra Law,先以 Trusted Access 的形式进入 ChatGPT 和 Codex,给选定的律所试用,API 随后开放,并提供零数据保留选项。Latham & Watkins、Ropes & Gray、Cooley、Sullivan & Cromwell 出现在首批名单里。

官方给出的成绩单来自 Vals AI 的 Legal Research Bench 私有验证集。200 道美国法律研究题,两套系统都开到最高推理档:Astra for Law 的整体正确率 54.0%,GPT-6 Astra 单靠联网搜索是 38.7%,相对提升 40%。以判例为主的题目上,前者多找回 24% 的参考案例;在人工审计过的目标段落集合里,同等推理档下多检出的相关段落最多 54%。

新东西在索引那一层

这次动静最大的部分是检索。OpenAI 自建的法律搜索索引覆盖超过 2.3 亿个网址,收的是美国判例法、成文法、行政法规、法院规则和行政裁决,官方称每天增补。它还和 Free Law Project 合作接入 CourtListener 的判例库,后者收录了 99.9% 以上已公开的美国先例判决。配套还有 26 个合作伙伴插件和 47 个社区插件,把 Relativity、Clio、iManage、Intapp、DeepJudge 和 Thomson Reuters 的产品接进工作流。

通用模型做法律检索一直卡在同一个地方:网页搜索拿到的判例来源杂、版本不一、引证链容易断,律师复核的成本常常高过模型省下的那部分。把索引自己建起来,等于把这块风险从律师那边挪回厂商这边。54.0% 这个绝对值也说明了另一面,一半以上的题目仍然答不对,OpenAI 自己的说法是律师必须逐条查验来源,高风险事项要保留治理流程。

卖索引的人和卖工作流的人

法律 AI 这条赛道上,Harvey 的估值已经到 110 亿美元,Thomson Reuters 手里有 CoCounsel,两家的护城河都不在模型本身,而在案件上下文、权限管理和审计留痕。OpenAI 这次切进来的位置更靠底层:它不做律所的项目管理,只把检索和推理打包成一个能被别人集成的基座,26 个合作插件的名单里就有 Thomson Reuters。

Thomson Reuters 的回应也很直接,强调 CoCounsel 仍是面向法律工作设计的可信专业系统。Harvey 一侧称赞的是检索能力,Cooley 谈的是流程提速。几家的话放在一起,分工的边界大致清楚:模型层的能力可以外采,谁来承担合规与责任还是各卖各的。

对中国律所暂时是隔壁的事

Astra for Law 的索引只覆盖美国法源,中文法域一条都没有。国内律所短期内能借鉴的是形态而非产品:把裁判文书、法规库、地方性规定做成模型可直接调用的检索层,再谈准确率。国内已经有几家在做类似的事,公开出来的基准数据比这次少得多,横向比较暂时没有条件。

定价 OpenAI 没有公布,Trusted Access 覆盖多少家律所、API 按什么档位开放也没说。Vals AI 的题目取自私有验证集,外部无法复现这组对比。几家早期客户里,没有一家披露过实际使用规模。

参考来源:OpenAI 官方发布页、Vals AI Legal Research Bench、CocoLoop、Artificial Lawyer、Neowin;正确率、索引规模与插件数量按 OpenAI 公布口径核对。