当AI读完几十页判决书:法律大模型裁判文书摘要生成改变了什么

周五晚八点,CBD写字楼的空调已经开始降功率吹冷风。林小夏盯着电脑屏幕,右手拇指揉着跳了一下午的太阳穴。屏幕侧边,待整理的裁判文书文件夹显示:97个。

去年她刚进这家精品知识产权律所,第一天上班,带教律师就甩给她一个任务:把近三年同中院的类案裁判文书全部整理成核心摘要,每个三百字以内,要写清争议焦点、裁判观点、判赔金额,周一要用来写上诉状。

实习生桌头堆成山的裁判文书

那一周她几乎没回过出租屋,沙发就在会议室角落,每天熬到两三点,眼睛花得看字都是重影。一百多份文书,少则十几页多则五六十页,你不能光抄判决结果啊,带教要的是法官为什么这么判,要从里面挖出来对我们这边有利的裁判倾向。

最后交上去的时候,还是漏了一个关键的适用规则,被带教当着全所的面说了一顿。她躲在消防通道里喝冰可乐,鼻子酸得慌,觉得实习律师怎么就是个打字整理的工具人。

律所实习生桌面堆裁判文书
律所实习生桌面堆裁判文书

说实话,那时候她根本没想过,法律大模型裁判文书摘要生成这种只出现在行业公众号里的词,会落到自己头上。还是上个月在中院门口的打印店取材料,碰到隔壁所的实习生抱着一摞纸吐槽,说他们所上周刚上了新工具,上传完裁判文书,十几秒就能出符合要求的摘要,比人整理的还准。

她抱着死马当活马医的心态,找对方要了测试链接。

说好的摘要,怎么比我写的还准?

第一次测试,她选了那份之前整理出错的商标侵权判决书。四十多页的文档上传,进度条转了不到十秒,摘要出来了。

她逐字对比自己之前写的版本,差点叫出来。她漏的那个“惩罚性赔偿适用中过错程度的认定标准”,大模型不仅提炼出来了,还特意标在了争议焦点的第一条,甚至把法官原文里的核心表述都摘出来了,字数刚好二百八十多,符合带教要的三百字以内要求。

法律大模型裁判文书摘要生成结果对比界面
法律大模型裁判文书摘要生成结果对比界面

不过话说回来,这不是什么黑科技。现在训练法律大模型,光公开的裁判文书就有几千万份,专门针对摘要生成做微调的时候,标注员都是资深律师,知道这个行业要什么——不是泛泛的概括全文,是精准抓律师需要的核心信息,知道法官写裁判文书的固定结构,知道哪部分是没用的套话,哪部分是能当呈堂证供的裁判规则。

那阵子她省了太多时间。之前一周才能干完的活,现在大模型半小时就跑完了,出来的摘要大部分都能用,只需要改几个词就行。她甚至能准点下班,去看觊觎了很久的电影。

但是没过多久,她就碰到了问题。

摘得准文字,摘得准立场吗?

摘得准文字,摘得准立场吗?
摘得准文字,摘得准立场吗?

上个月处理一起抚养权纠纷的上诉案,她找了同市近三年的十八份类似案情的判决书,全部用大模型生成了摘要,所有摘要都写着“子女不满两周岁,原则上归女方抚养”,看起来所有类案都对我方(男方)不利。

要不是她那天刚好有空,想翻原文核对一下,差点就错过了最关键的那个点。有一份判决书,大模型提炼的结果只写了裁判结果归女方,但是没提那个藏在说理里的细节:女方有轻度产后抑郁,但是法官考虑到孩子出生后一直随女方生活,最终还是把抚养权判给女方,但是把探视权写到了每周两天,寒暑假各一半——这其实就是法官的态度,隐藏的裁判倾向不是写在纸面上的规则,是特殊情况下的利益平衡,刚好是男方上诉最需要的抓手。

为什么大模型没摘出来?因为训练的时候,标注摘要都是优先抓“裁判结果”“核心规则”,这种藏在字里行间的微妙立场,没有被标注出来,大模型自然不会当核心信息提炼。

所里做了三十年家事案的张律师听了这事,笑着说,这太正常了。我们当年翻裁判文书,翻的不是文字,是这个法院这个法官的裁判脾气,你翻个几十份,他吃软还是吃硬,偏向哪一方,心里门清。现在机器给你把摘要做好,你懒得翻原文,自然就漏了这些活的东西。

现在林小夏摸出了自己的用法:大模型先跑一遍所有文书,帮她把完全不相关的筛掉,把核心信息先列出来,剩下有可能的,她一定要翻一遍原文,自己划重点,做批注。省了整理的力气,但是没丢那份翻出来的手感。

昨天我去所里找她吃饭,看到她桌子头上不再堆着一人高的纸质裁判文书,电脑屏幕上,大模型正在后台跑新的一批文书,她的笔记本上,还是写满了歪歪扭扭的批注,旁边放着半杯没喝完的冰美式。

技术把人从堆成山的文字里解放出来了。但是那些藏在文字缝隙里的,属于人的判断和分寸,好像还站在原来的地方。没人知道未来会变成什么样,至少现在,它只是个帮实习生省力气的工具,而已。

作者|大讲堂

排版|大讲堂

审核|见微

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:当AI读完几十页判决书:法律大模型裁判文书摘要生成改变了什么
文章链接:https://www.lfdjt.com/info_23_24770.html