首页洞察 › 法律 AI 大模型底座选型

律所私有化法律 AI 该选哪个大模型底座:DeepSeek / Qwen / GLM 开源模型选型实战(2026)

2026-07-15 · 文书查 · 面向律所信息化负责人 / 法律科技 CTO / 政法信息中心

做私有化法律 AI,绕不开一个上来就要拍的决定:用哪个开源大模型当底座?这一步看着技术、其实关乎全局——底座定了系统的能力天花板,后面的检索适配、微调、评测、运维全都围着它长;而它偏偏又是最难换的一层,一旦选错,想回退基本等于重做一遍。可现实里很多单位是怎么选的呢?看哪个模型上了新闻、在某个榜单拿了高分,就定它,结果要么私有化环境根本部署不动,要么许可协议一看不能稳定商用,要么用了半年发现它断更了。本文把这件事讲清楚:底座和 RAG / 微调到底是什么关系、DeepSeek / Qwen / GLM 这几个可私有化部署的主流国产底座该怎么比、选型要看的五个维度、参数档位怎么对着 GPU 显存选,以及一份可以直接照用的底座选型自查清单。目标是让你选出一个「够用、能私有部署、能长期维护」的底座,而不是一个榜单最亮但用不起来的。

一、先纠一个最贵的误区:底座不是打榜,是工程选择

底座选型最常见、也最贵的一个错,是把它当成打榜——哪个模型在某评测榜单分数高就选哪个。对私有化法律 AI 来说,这个思路几乎必然选错,因为底座的标准从来不是「最强」,而是够用 + 能私有部署 + 能长期维护三条同时成立。三个原因:

一句话原则:选底座像给房子选地基,要的是「承重够、地质稳、以后还能加盖」,而不是「哪块地最近上了新闻」。够用的最小可行底座,几乎总比最强但用不起来的底座更划算。

二、底座、RAG、微调:三者是地基和楼,不是三选一

很多人一上来就纠结「选了底座还要不要做 RAG、要不要微调」,其实这三者根本不是并列的选项,而是地基和楼的关系:

它决定什么换的代价
底座(开源大模型)语言理解、推理、中文法律基础能力的天花板最大——系统在它上面长起来后,换底座≈重做
RAG(检索增强)回答有没有据可查、能不能回链、跟不跟得上法规更新较小——检索策略和提示词可随时调
微调本所的风格、术语、固定输出格式(锦上添花,非必需)中等——可以重做

要点有两个。第一,选了底座通常还要做 RAG:法律最硬的三条要求——可回链、幻觉可控、更新可跟——主要靠 RAG 解决,而不是靠底座本身;微调则是可选项,不是必需。这两者怎么取舍,我们在《RAG 还是微调?律所法律 AI 的技术路线怎么选》里专门讲过。第二,也是本文的重点:底座是这三层里「换的代价最大」的一层。RAG 和提示词随时能调,微调大不了重做,但底座一旦选定,检索适配、微调、评测集、运维流程全都围着它建,再换几乎等于推倒重来。所以底座值得你在项目最前面花最多的心思选对,而不是随手定一个先跑起来再说。

三、主流可私有化国产底座:DeepSeek / Qwen / GLM 怎么比

目前中文法律场景下,常见且支持私有化部署的主流国产开源底座,主要是 DeepSeek(深度求索)、Qwen(通义千问)、GLM(智谱) 这几家系列(海外的 Llama 系中文与中文法律语料相对偏弱,私有化中文场景一般不作首选)。这里要先说清楚一个态度:不存在绝对的「谁最好」,只有「谁更适配你的约束」。不同系列各有侧重、且都在快速迭代,任何「某模型碾压其他」的断言都会很快过期。真正靠谱的比法,不是背名气、抄榜单,而是按下面这五个维度,对着你自己的场景逐条打分:

选型维度看什么 / 为什么重要
① 中文与法律能力本所真实任务(类案问答、文书要点归纳、合同审查)做小样本实测,别信通用榜单;法律术语、长文书理解、引用准确度是重点
② 参数与显存匹配同一系列常有 7B/14B/32B/70B 多档,选显存扛得住、并发够用的那档,不是最大那档(详见第四节)
③ 开源许可与商用合规逐字看清许可协议:能否商用、有无地域/用途限制、私有部署是否被允许——这条不看清,后面全是雷
④ 生态与工具链推理框架、量化方案、微调工具、社区文档是否齐全,直接决定落地和运维省不省力
⑤ 长期维护与更新是否持续迭代、会不会断更;私有化一用就是几年,选一个「活跃、有组织在长期维护」的系列更稳

为什么强调「按维度对着自己场景比」而不是直接给结论?因为一份写死「A 比 B 好」的推荐,三个月后大概率就过时了,反而害人。可复用的是方法,不是某一时刻的排名。务实的比法是:先用后三个「硬约束」(显存、许可、信创)把不合格的直接筛掉,圈定 2-3 个候选;再用前两个维度(真实任务实测 + 显存匹配)在候选里选。下面两节把这两组维度里最容易出事的部分——许可合规参数显存匹配——单独讲透。

许可与合规:最容易被跳过、也最容易埋雷的一步

「开源」不等于「随便商用」。不同模型的许可协议差别很大:有的完全允许商用和私有部署,有的对商用规模、使用地域、具体用途有附加限制,有的权重开放但协议里藏着你想不到的条款。对律所和政法机关这种合规敏感、且要长期使用的场景,底座许可必须在选型阶段就逐字读清、留档、必要时让法务过一遍——毕竟你们自己就是干这行的,不该在自己的地基上踩许可的雷。同时,如果你的部署环境有信创国产化要求(国产 CPU/GPU、国产操作系统),还要提前确认候选底座在目标国产芯片和推理框架上有没有验证过的适配,别等采购完才发现跑不起来。

四、参数档位怎么对着 GPU 显存选:不是越大越好

选定了系列,还要选参数档位。这里最反直觉的一点是:参数不是越大越好,而是要和你的 GPU 显存、并发需求、响应速度一起权衡。参数越大,通常能力越强,但吃的显存越多、单次推理越慢、同样的卡能扛的并发越少。私有化环境里 GPU 是最贵、最稀缺的资源,硬上一个部署不动或并发上不去的大模型,实际体验反而差。下面是一个经验上的对应关系(会随量化方式和推理框架浮动,务必以你环境的实测为准):

参数档大致硬件门槛适合场景
7B 级入门专业卡即可,显存占用低轻量辅助、高并发问答;或作大小模型并存里的兜底小模型
14B 级中端专业卡效果与成本较平衡,常见的落地主力档
32B 级高端单卡或多卡效果明显更好但成本陡增,质量要求高、预算够的场景
70B 级及以上往往要多卡才跑得动对质量要求极高、预算充足、并发不高的场景

经验法则:把「底座参数档 × 量化方式 × 目标并发」放进你的显存预算里算一遍,选能满足业务并发和响应要求的最小档位,把省下的预算和显存留给检索层和冗余。大多数律所落地的甜点在 14B 级左右——够用、跑得动、并发上得来。参数档直接决定 GPU 采购这笔最大的开支,所以这一步最好和三年 TCO 测算一起做。

五、底座是地基,真正拉开差距的是喂给它的数据

最后要泼一盆冷静的水:底座选得再好,也只是决定了能力的下限和上限,真正让法律 AI 好不好用的,是喂给它的检索数据。同一个底座,接一套覆盖全、结构化、能回链、跟得上法规更新的裁判文书与法规库,和接一套残缺、无结构、无法回链的数据,产出的可用性天差地别。这也是为什么我们反复强调:法律 AI 的护城河在数据,不在模型——模型大家都能下载,数据底座的深度和结构化程度才是别人抄不走的。选底座的时候,别把全部注意力放在「哪个模型强」上,而要同步想清楚:它下面接的那套检索数据,够不够撑起律师真正要用的场景?

六、给信息化负责人的一页纸底座选型自查清单

定底座、或评审供应商给的底座方案前,把这份清单逐条过一遍:

  1. 不打榜:是不是拿本所真实法律任务做过小样本实测,而不是只看通用榜单分数?
  2. 显存匹配:选的参数档,在你的 GPU 显存和目标并发下真的跑得动、跑得顺吗?算过没有?
  3. 许可看清:底座的开源许可协议逐字读过吗?能否商用、有无地域/用途限制、私有部署是否允许,留档了吗?
  4. 信创适配:如果有国产化要求,候选底座在目标国产芯片/框架上有验证过的适配吗?
  5. 生态成熟:推理框架、量化、微调工具、社区文档齐全吗?运维时出了问题查得到解法吗?
  6. 长期维护:这个底座系列还在活跃迭代吗?背后有没有稳定的组织在长期维护、不会说停就停?
  7. 可换空间:系统架构有没有预留换底座的余地(检索、提示、评测尽量和具体底座解耦)?
  8. 数据同步想清楚:底座下面接的检索数据够不够全、够不够结构化、能不能回链和更新?
  9. 供应商:如果是供应商交付,底座选型理由、许可合规、后续可换与升级路径,合同里写清楚了吗?

把这九项做成选型前的固定动作,底座这一步就从「看新闻拍脑袋」变成「按约束和实测选出的、能长期用的地基」。记住:法律 AI 的成败,底座定下限,数据定上限,而底座是最难回退的一层——值得在项目最开始花最多的心思选对。

七、常见问题

Q:底座是不是选最强、最新的那个就行?

A:不行。底座是工程选择,标准是「够用 + 能私有部署 + 能长期维护」,不是「最强」。榜单分数和你的真实法律场景相关性弱、最强的往往最吃显存部署不动、最前沿的常伴许可不清或断更风险。正确做法是先定约束(显存、许可、信创),再用本所真实任务小样本实测,选够用的最小可行底座。

Q:选了底座还要不要做 RAG 和微调?

A:底座、RAG、微调是地基和楼的关系,不是三选一。选了底座通常还要做 RAG——法律要求的可回链、幻觉可控、更新可跟主要靠 RAG;微调是可选的锦上添花。关键是底座换的代价最大(系统在它上面长起来后换≈重做),RAG 和提示词随时能调,所以底座最该慎选。

Q:DeepSeek、Qwen、GLM 到底选哪个?

A:没有绝对最好,只有更适配你约束的。别背名气抄榜单,按五维度对着自己场景比:中文法律实测表现、参数与显存匹配、开源许可与商用合规、生态工具链、长期维护。先用显存/许可/信创三个硬约束筛掉不合格的,圈定 2-3 个候选,再用真实任务实测在候选里选。可复用的是这套方法,不是某一时刻的排名。

底座你来定,数据我们来撑

文书查提供 1.5 亿+ 结构化裁判文书私有化部署——无论你的底座选 DeepSeek、Qwen、GLM 还是其他开源模型,我们负责把那套覆盖全、结构化、能回链、可更新的法律数据接到你的底座下面。模型是地基,数据是真正拉开差距的那一层,而且数据不出内网。

📞 联系商务 Jack · 131 6872 7779

或邮件 chenjiaxin@wenshucha.com · 查看 私有化方案详情 · API/MCP 定价

相关阅读:RAG 还是微调?技术路线怎么选 · 律所内网大模型 GPU 选型 · 私有化三年 TCO 测算 · 信创国产化适配部署 · 法律数据底座对比 · 律所 AI 私有化部署指南