本次合同审查能力测评,旨在通过标准化测试流程,系统比较18款AI工具与2名人类在合同风险识别这一核心能力上的表现,助力法律从业者精准掌握当前AI在专业领域的真实水平与适用边界。
测试背景与目的
受限于个人时间精力,本轮测试仅聚焦于合同审核中的「风险识别与提示能力」。风险发现是合同审查的基础,若无法识别风险,后续修订将无从谈起。且风险识别结果只有“识别/未识别”两种状态,便于量化评比。
测试采用一份459字的买卖合同,预设十二个风险点,并设定交易背景:我方为甲方(强势地位),采购木制品,目前与多家厂家洽谈合作,先看货样再决定是否合作,标的额15万元。
评分规则:每个风险点识别得基础分1分,未识别则减分。根据风险点的识别难度及未识别的后果严重程度,进行加权处理。测评仅针对风险点识别率,不涉及修订建议适用性、易用度、价格、美观等因素。此外,目前仅测试了单个合同类型,结果可能受偶发性因素影响(如提示词适配度),后续将扩展更多合同类型。测评结果仅反映2025年8月11日时间节点各家AI的表现,随时间推移可能变化。
?声明
本次测评仅测试了AI对预设风险点的识别率,未评估识别风险后给出修订建议的适用性,因此仅体现AI审查能力的一个环节,不涉及易用度、价格、美观等因素。同时,截至目前仅进行了单个合同类型的审核测试,结果可能受偶发性因素影响(如提示词适配度),后续将扩展更多合同类型。测评结果仅反映2025年8月11日时间节点各家AI的表现,随时间推移可能变化。
合同风险查查查大赛
参赛选手情况
法律科技组(职业组):法律科技合同审查专用产品,经专门工程化设计,直接上传测试合同,选择审查立场和地位,可输入交易背景。
- 案牍玛卡合同一大家子:基础推理模式(旧版/新版方案);增强推理模式;对话模式
- 熊猫AI
- 法天使智能审查
- AlphaGPT
- WiselawAI 合同审查助理
- 元典Amicus 合同智审(测试)
- 通义法睿
(注:玛卡合同实际使用中可同时使用各推理模式及对话模式配合审核,但为公平公正,本次比赛中拆开分别参赛)
通用组:通用大模型或智能体,无特别法律科技领域工程化。比赛方式为输入通用审核提示词后上传测试合同,AI第一轮回复后,再输入一次“继续”。
国内选手:
- 豆包
- Kimi
- DeepSeek
- 通义Qwen3
- 天工智能体
外国选手:
- Genspark
- Grok
- GPT-5
- Gemini 2.5 Pro
- Claude 4 sonnet
- GPT-4O
使用的初始化提示词(通用组):
角色
你是一个经验丰富的中国法务,你会严谨、认真、仔细的对用户上传的待审核合同内容进行逐条的审查。
背景
关于这个合同的交易背景:【我方是甲方,强势地位,采购木制品,目前在和几家厂家谈合作,想先看看货的样子来决定是否合作,标的15万元】
我需要你这样帮助我:
1.站在我方的审核立场上,帮我找出潜在的风险点,例如可能导致未来双方发生纠纷的缺陷、导致我方承担过高责任的约定或是合同本身约定的冲突、错别字。
2.请结合中国法律规定和本合同的交易背景,为我梳理风险。
3.请基于促进交易,保护我方利益的原则,为我提出修改建议。
输出格式
风险条款:<对应合同条款序号>
修改建议:<修改建议>
修改原因:<阐述条款风险点及修改原因>
人类组:告知背景正常审核,过程中不允许使用AI。主办方兼出题人兼裁判陶律师作为评价参考(默认满分,不进入排名)。
- 在校法学生(2周线上兼职审核经验)
- 应届毕业生(2年线上兼职审核经验)
- 执业律师(3.5年审核经验)
排行榜
经过多轮严格测试,最终加权评分结果如下:
AI能力与人类的对比
人类组表现:
以人类组表现作为排序标准,得到以下分档对应关系:
- 与3年执业律师同档水平:GPT-5
- 比3年执业律师弱一档:Gemini 2.5 Pro;案牍玛卡合同 增强推理
- 比2年兼职强一档:豆包、WiselawAI 合同审查助手、天工智能体、玛卡合同 基础推理(新版方案)、元典Amicus、玛卡合同 对话模式
- 与2年兼职同档水平:玛卡合同 基础推理(旧版方案)、Kimi K1.5、通义法睿
- 比2年兼职弱一档:DeepSeek R1、Genspark、Grok、AlphaGPT
- 比2周兼职强一档:通义千问、Claude 4 sonnet
- 与2周兼职同档水平:GPT-4O、熊猫AI、法天使 智能审查
但需注意,实际合同审核中并不只看完善度评分。合同主体信息不全、未查出合同法等问题影响较小,而对于「定金风险」这种核心风险,若未发现则大概率给客户带来经济损失。
本次提示了「定金风险」的选手:玛卡合同、法天使、WiselawAI、通义、天工、豆包、DeepSeek、Genspark、GPT-5、Gemini 2.5 Pro。
全满分通关的选手仅有一位:GPT-5(识别了全部12个风险点)。
总结
在简单合同的风险识别任务中,GPT-5在速度与全面性上已超越3.5年执业律师。案牍玛卡合同在国内产品中表现断层式领先(基础推理+对话模式效果约等于增强推理;增强推理+对话模式可比肩GPT-5)。豆包是专业级守门员,表现远强于DeepSeek。
小提示
1. 使用AI审查合同时,建议结合具体交易背景输入详细提示词(参考通用组所用提示词),并至少让AI回答两轮,以提高风险识别覆盖率。
2. 法律科技专用产品(如玛卡合同、WiselawAI)在工程化适配与风险点敏感性上优于通用模型,但通用大模型(如GPT-5)在综合推理能力上可能反超。可根据预算与场景灵活选择。
3. 对于核心风险(如定金、违约金、管辖条款),即使AI未提示,人类审查者也应特别关注,避免潜在经济损失。
常见问题
Q1:为什么这次只测试了风险识别能力?
风险识别是合同审查的基石,若连风险都无法发现,修改建议便无从谈起。且识别结果只有“有/无”两种状态,便于量化对比,避免主观判断干扰。后续将补充对修订建议质量、合同类型多样性等维度的测试。
Q2:测试结果是否代表这些AI工具在所有合同类型上都是这个水平?
不完全代表。本次仅测试了“买卖合同”这一单一类型,且预设了特定交易背景。不同合同类型(如服务合同、劳动合同、保密协议)中的风险点差异较大,AI的表现可能有显著变化。建议读者在自身常用合同类型上自行复现测试。
Q3:为什么通用组使用了相同的提示词,而法律科技组没有?
法律科技产品自带工程化界面,用户无需编写提示词,直接上传合同并选择立场即可。通用大模型需要人工构造提示词才能引导其进行专业审查。为公平起见,通用组统一使用经过优化的提示词,并让AI回复两次。
Q4:人类组的“执业律师”表现如何?为什么没有进入排行榜?
执业律师(3.5年经验)作为参考基准,其识别率视为满分(但未进入排名)。实际测试中,其识别了全部12个风险点中的11个(遗漏了一个非核心风险点),仅GPT-5实现了全满分。这表明顶尖AI在简单合同场景下已能超越资深人类。
