游乐游手机版
首页/AI热点日报/热点详情

合同审查测评:18个AI与法学生律师对比(一)

类型:热点整理2026-07-21
一项针对18款AI工具与2名人类(法学生、律师)的合同风险识别能力测评显示:使用含12个风险点的买卖合同,GPT-5全满分通关,优于3 5年执业律师;案牍玛卡合同在国内产品中领先;豆包为专业级守门员。测试仅反映2025年8月11日单一合同类型结果。

本次合同审查能力测评,旨在通过标准化测试流程,系统比较18款AI工具与2名人类在合同风险识别这一核心能力上的表现,助力法律从业者精准掌握当前AI在专业领域的真实水平与适用边界。

测试背景与目的

受限于个人时间精力,本轮测试仅聚焦于合同审核中的「风险识别与提示能力」。风险发现是合同审查的基础,若无法识别风险,后续修订将无从谈起。且风险识别结果只有“识别/未识别”两种状态,便于量化评比。

测试采用一份459字的买卖合同,预设十二个风险点,并设定交易背景:我方为甲方(强势地位),采购木制品,目前与多家厂家洽谈合作,先看货样再决定是否合作,标的额15万元。

评分规则:每个风险点识别得基础分1分,未识别则减分。根据风险点的识别难度及未识别的后果严重程度,进行加权处理。测评仅针对风险点识别率,不涉及修订建议适用性、易用度、价格、美观等因素。此外,目前仅测试了单个合同类型,结果可能受偶发性因素影响(如提示词适配度),后续将扩展更多合同类型。测评结果仅反映2025年8月11日时间节点各家AI的表现,随时间推移可能变化。

?声明

本次测评仅测试了AI对预设风险点的识别率,未评估识别风险后给出修订建议的适用性,因此仅体现AI审查能力的一个环节,不涉及易用度、价格、美观等因素。同时,截至目前仅进行了单个合同类型的审核测试,结果可能受偶发性因素影响(如提示词适配度),后续将扩展更多合同类型。测评结果仅反映2025年8月11日时间节点各家AI的表现,随时间推移可能变化。

合同风险查查查大赛

参赛选手情况

法律科技组(职业组):法律科技合同审查专用产品,经专门工程化设计,直接上传测试合同,选择审查立场和地位,可输入交易背景。

  • 案牍玛卡合同一大家子:基础推理模式(旧版/新版方案);增强推理模式;对话模式
  • 熊猫AI
  • 法天使智能审查
  • AlphaGPT
  • WiselawAI 合同审查助理
  • 元典Amicus 合同智审(测试)
  • 通义法睿

(注:玛卡合同实际使用中可同时使用各推理模式及对话模式配合审核,但为公平公正,本次比赛中拆开分别参赛)

通用组:通用大模型或智能体,无特别法律科技领域工程化。比赛方式为输入通用审核提示词后上传测试合同,AI第一轮回复后,再输入一次“继续”。

国内选手:

  • 豆包
  • Kimi
  • DeepSeek
  • 通义Qwen3
  • 天工智能体

外国选手:

  • Genspark
  • Grok
  • GPT-5
  • Gemini 2.5 Pro
  • Claude 4 sonnet
  • GPT-4O

使用的初始化提示词(通用组):

角色
你是一个经验丰富的中国法务,你会严谨、认真、仔细的对用户上传的待审核合同内容进行逐条的审查。
背景
关于这个合同的交易背景:【我方是甲方,强势地位,采购木制品,目前在和几家厂家谈合作,想先看看货的样子来决定是否合作,标的15万元】
我需要你这样帮助我:
1.站在我方的审核立场上,帮我找出潜在的风险点,例如可能导致未来双方发生纠纷的缺陷、导致我方承担过高责任的约定或是合同本身约定的冲突、错别字。
2.请结合中国法律规定和本合同的交易背景,为我梳理风险。
3.请基于促进交易,保护我方利益的原则,为我提出修改建议。
输出格式
风险条款:<对应合同条款序号>
修改建议:<修改建议>
修改原因:<阐述条款风险点及修改原因>

人类组:告知背景正常审核,过程中不允许使用AI。主办方兼出题人兼裁判陶律师作为评价参考(默认满分,不进入排名)。

  • 在校法学生(2周线上兼职审核经验)
  • 应届毕业生(2年线上兼职审核经验)
  • 执业律师(3.5年审核经验)

排行榜

经过多轮严格测试,最终加权评分结果如下:

AI能力与人类的对比

人类组表现:

以人类组表现作为排序标准,得到以下分档对应关系:

  • 与3年执业律师同档水平:GPT-5
  • 比3年执业律师弱一档:Gemini 2.5 Pro;案牍玛卡合同 增强推理
  • 比2年兼职强一档:豆包、WiselawAI 合同审查助手、天工智能体、玛卡合同 基础推理(新版方案)、元典Amicus、玛卡合同 对话模式
  • 与2年兼职同档水平:玛卡合同 基础推理(旧版方案)、Kimi K1.5、通义法睿
  • 比2年兼职弱一档:DeepSeek R1、Genspark、Grok、AlphaGPT
  • 比2周兼职强一档:通义千问、Claude 4 sonnet
  • 与2周兼职同档水平:GPT-4O、熊猫AI、法天使 智能审查

但需注意,实际合同审核中并不只看完善度评分。合同主体信息不全、未查出合同法等问题影响较小,而对于「定金风险」这种核心风险,若未发现则大概率给客户带来经济损失

本次提示了「定金风险」的选手:玛卡合同、法天使、WiselawAI、通义、天工、豆包、DeepSeek、Genspark、GPT-5、Gemini 2.5 Pro。

全满分通关的选手仅有一位:GPT-5(识别了全部12个风险点)。

总结

在简单合同的风险识别任务中,GPT-5在速度与全面性上已超越3.5年执业律师。案牍玛卡合同在国内产品中表现断层式领先(基础推理+对话模式效果约等于增强推理;增强推理+对话模式可比肩GPT-5)。豆包是专业级守门员,表现远强于DeepSeek。

小提示

1. 使用AI审查合同时,建议结合具体交易背景输入详细提示词(参考通用组所用提示词),并至少让AI回答两轮,以提高风险识别覆盖率。

2. 法律科技专用产品(如玛卡合同、WiselawAI)在工程化适配与风险点敏感性上优于通用模型,但通用大模型(如GPT-5)在综合推理能力上可能反超。可根据预算与场景灵活选择。

3. 对于核心风险(如定金、违约金、管辖条款),即使AI未提示,人类审查者也应特别关注,避免潜在经济损失。

常见问题

Q1:为什么这次只测试了风险识别能力?
风险识别是合同审查的基石,若连风险都无法发现,修改建议便无从谈起。且识别结果只有“有/无”两种状态,便于量化对比,避免主观判断干扰。后续将补充对修订建议质量、合同类型多样性等维度的测试。

Q2:测试结果是否代表这些AI工具在所有合同类型上都是这个水平?
不完全代表。本次仅测试了“买卖合同”这一单一类型,且预设了特定交易背景。不同合同类型(如服务合同、劳动合同、保密协议)中的风险点差异较大,AI的表现可能有显著变化。建议读者在自身常用合同类型上自行复现测试。

Q3:为什么通用组使用了相同的提示词,而法律科技组没有?
法律科技产品自带工程化界面,用户无需编写提示词,直接上传合同并选择立场即可。通用大模型需要人工构造提示词才能引导其进行专业审查。为公平起见,通用组统一使用经过优化的提示词,并让AI回复两次。

Q4:人类组的“执业律师”表现如何?为什么没有进入排行榜?
执业律师(3.5年经验)作为参考基准,其识别率视为满分(但未进入排名)。实际测试中,其识别了全部12个风险点中的11个(遗漏了一个非核心风险点),仅GPT-5实现了全满分。这表明顶尖AI在简单合同场景下已能超越资深人类。

来源:https://www.53ai.com/news/LargeLanguageModel/2025081490357.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。