九天前的问题,答案比二选一有意思
本站 9 月 10 日写 Harvey 拿下 5.5 亿美元、估值 155 亿时,提了一个问题:三年之后,法律工作流的入口是 Harvey 这样的垂直厂商,还是模型厂商直供的法律 agent?当时点出的风险正是 OpenAI 和 Anthropic 已开始直接做法律。 九天后 OpenAI 就出了法律配置,而在同一份公告里,**Harvey 被列为 API 客户**。 所以答案不是替代,是分层:模型厂商占住模型和检索索引这一层,垂直厂商占住工作流、审计留痕和客户关系那一层。当时 Harvey 那轮融资写明主要投向「自建专有模型」,现在看这个动作的含义更清楚了——它要的不是超过上游,是不被上游卡住脖子。 也正因为分层,当时那条建议现在更要紧:签合同时把「模板、检索索引、审计记录能不能带走」写清楚。上游关系已经变成供应商关系,你的数据在哪一层、跟着谁走,是签字前该问的。
「不是新模型」这句话决定了它的能力边界
这一点必须说清:Astra for Law 没有换模型。提升来自外面那层——一个专业检索索引加一套法律推理与起草的指令。 所以 54% 对 38.7% 这个差距,量的是「给它一个专业检索源」的价值,不是「一个更懂法律的模型」的价值。这个区别对采购很实用:如果你自己已经有一套可靠的法律语料检索,那你能从这个产品里额外拿到的东西,比这两个数字的落差要小。 54% 本身也要按口径读:200 道题、取自第三方的私有验证集、厂商自测。有报道明确提醒这不构成法律准确性的一般性度量。 还有一条值得记的是底座来源:判例法部分来自非营利项目 Free Law Project 的 CourtListener。公共数据基础设施托着商业产品这件事,本站 9 月 10 日写 AlphaGenome Atlas 时也遇到过——免费的公共层做地基,商业层做接入和分发。
一个准确率五成上下的产品,交付方式只能是「买方必须核对」
把 54% 这个数字直接读出来:在那套法律研究题上,接近一半答不对。这不是贬义——它决定了产品形态。 目标客户是 Am Law 200 律所,那里的每一条引用本来就要被人逐条复核,所以「模型给初稿、律师负责核」这个分工是自洽的,产品定位和能力是匹配的。真正的误读风险在另一头:**如果有人指望它省掉复核那一步,那就用错了。**在法律场景里,省掉核对的代价不是返工,是引错法条。 可用性上目前还很窄:先通过 ChatGPT 和 Codex 里的 Trusted Access 给选定律所,API 即将开放。想评估的人现在能做的是把自己最典型的检索问题准备好——等 API 开了,用自己的题去跑,比看那 200 题的成绩有用。
via: OpenAI:Introducing Astra for Law、SiliconANGLE 报道、Technology.org 报道