觉得有用,欢迎点「在看」或转发给同事。
昨天写了用WorkBuddy审合同的四步教程,后台有读者问:「它到底靠不靠谱?会不会一本正经地胡说?」这个问题值得认真回答。今天我拿三份真实文档——一份28页的采购合同、一份47页的行业报告PDF、一份来回改了5版的合作协议——从5个维度实测WorkBuddy的文档处理能力,每个维度打分,不吹不黑。
先说结论:总分5个维度我给了4个8分以上,1个6分。哪个维度拖了后腿,往下看。
维度一:长文档信息提取(9分)
测试方法:把28页采购合同传进去,要求提取甲乙方、金额、账期、交付、验收、违约金、解约条件等12项关键信息,并标注条款出处。
结果:12项全部提取正确,我逐条翻原文核对,条款序号引用无一错位。最关键的是它对「合同未约定」的项目如实标注,没有编造——这是文档AI最容易翻车的地方,它守住了。
47页的行业报告同样测了一遍,要求按「结论—论据—数据」三层结构提炼,输出的摘要里所有数字我抽查了8处,与原文一致。
扣1分的原因:报告里有两张图片格式的数据表,它明确说「图片表格无法完整解析」。诚实,但能力上确实是短板。
维度二:风险条款识别(8分)
测试方法:合同里我预先知道有4处对甲方不利的条款(法务朋友帮我标过底),看它能抓出几处。
结果:4处全部命中,还额外提示了2处我们没标的中风险点,其中「争议解决地在对方城市」这条,法务朋友看了说「这条确实该提,我们漏了」。
扣2分的原因:它把一条其实是行业惯例的条款也标成了中风险,属于「宁可错杀」型。风险偏好保守不算大毛病,但你需要自己有基本判断,不能它说什么都信。
维度三:修改建议质量(8分)
测试方法:让它对4处高风险条款给出可直接替换的修改文本和谈判理由。
结果:4条修改文本全部可用,其中违约责任对等化的那条,措辞比我们上一版合同里法务写的还严谨。谈判理由都站在「合作对等」角度,语气商务,直接转发不丢人。
扣2分的原因:有一条建议把违约金上限从3%改到20%,幅度太激进,实际谈判中对方大概率直接拒绝。它给的是「理想值」,不是「能谈成的值」,这个火候还得人来把握。
维度四:多版本对比(9分)
测试方法:把改过5版的合作协议拿最新两版做对比,其中我故意让同事在新版里藏了3处未沟通的改动(改账期起算点、加自动续约条款、删一句质保承诺)。
结果:3处全部揪出来,并且每处都标注了「有利/不利」判断,全部判断正确。28页文档人工对照至少要40分钟,它用了不到2分钟。这是5个维度里我认为最值得付费的能力——因为人眼干这活不仅慢,还真的会漏。
维度五:格式与排版还原(6分)
测试方法:让它把风险清单输出成带表格的Word文档,再把合同关键条款整理成对照表。
结果:内容没问题,但复杂表格的格式还原一般——合并单元格偶尔错位,长文本在表格里的换行不够美观,拿去汇报前需要手动调5分钟格式。纯文本输出很干净,一旦涉及复杂排版就露怯。
附:我的测试方法,你可以自己复现
有读者可能会问:你测的就一定客观吗?我把方法摊开,你拿自己的文档照着测一遍就知道了:
• 用你真实业务里的文档测,别用网上下载的合同范本——范本太「干净」,测不出真实水平。
• 提前埋好「标准答案」:像我请法务朋友预先标注风险点、让同事在新版里藏改动,有了基准才能算命中率,否则AI说什么你都觉得有道理。
• 必查它的原文引用:每条结论都要求附条款原文和序号,翻原文核对。引用对得上,结论才值得信;引用都错位的工具直接淘汰。
• 同一份文档测两遍:换个问法再问一次,看两次结论是否稳定。稳定性差的能力,实际工作里不敢依赖。
这套方法不止能测WorkBuddy,测任何号称「能读文档」的AI工具都适用。
总评:能顶半个法务初筛员,顶不了法务
5个维度:提取9分、风险识别8分、修改建议8分、版本对比9分、格式6分,均分8。
它适合干什么:合同初筛、要点提取、版本找不同、改稿建议——这些占普通人处理文档时间的80%。
它不能干什么:最终法律判断、盖章前的把关、激进条款的谈判分寸。这20%仍然属于专业的人。
一句话:把它当「带着问题清单去见法务」的前置工序,价值最大化;把它当法务本人,早晚出事。
另外补一个实用建议:如果你每月处理的合同超过5份,建议把本文的测试方法先在自己的业务文档上跑一轮,确认它在你的场景里靠谱,再正式接进工作流——工具好不好,永远以你自己的文档为准。
明天最后一篇,我讲一个真实案例:做采购的老周怎么用这套流程,把每月十几份供应商合同的审查时间砍掉七成。
你平时处理合同文档最头疼哪一步:读不懂、对比烦、还是改不动?评论区聊聊。顺手点个「在看」,转给你们公司管合同的同事。
#WorkBuddy #AI办公 #效率工具
① 点个 「在看」 或 转发 给同事
② 关注 高总AI办公笔记,每周持续更新 AI 办公干货
③ 本文已同步发布于 kas2.com,电脑端阅读体验更佳
卡神








