觉得有用,欢迎点「在看」或转发给同事。
昨天那套”会议纪要到任务分派”的四步闭环,很多人第一反应是:AI 抽事项,靠谱吗?
我把家底掀开测一遍:用一份真实的、没经过任何整理的会议记录,从抽取到分发到定时跟进,逐环节实测打分,总分 41/50。
哪一环可以放手让它跑,哪一环你必须自己盯一眼,这篇讲清楚,附测试过程和翻车实录。
测试怎么设计的
先说清测试条件,不然分数没意义。
测试素材:一场 78 分钟内部会议的语音转写稿,约 9200 字。口语、跳跃、有插话、有两段跑题闲聊,人名用花名(阿哲、小柯、老周),中间还有转写错字(”报价”被转成”报架”两处)。
人工基线:我自己先读一遍,手工整理出 14 条应该被抽出的事项,作为标准答案;其中 5 条是明确指派的,9 条是含糊表述(”再看看””对一下””我回头问问”)。
评分口径:每维 10 分,我按”能不能直接用”来打,需要返工一次扣 1–2 分,需要人工全面复核扣 3 分以上。分数是我个人主观判断,供参考。
维度一:事项抽取准确率 —— 9/10
过程:分三段投喂(按议题切分),要求输出事项表,含【含糊】标注和遗漏点提醒。
结果:14 条标准事项抽中 13 条,漏 1 条。漏掉的那条藏在闲聊里——”下周供应商来,顺便把样机带过来看看”,它被判成了闲聊而不是动作。另外多抽了 2 条,一条是重复表述(同一件事在会上说了两遍,被拆成两行),一条是把”我们以前是这么干的”这类背景说明当成了动作。
含糊标注这一项表现很好,9 条含糊表述全部被标了出来,没有漏标。这一点比我预期高,因为它意味着你能一眼看见哪几条今天不定就一定烂尾。
扣分点:重复事项没有自动合并。10 分制扣 1 分,9 分。
维度二:要素补全与拍板提示 —— 8/10
过程:把事项表喂给第二条提示词,要求补齐负责人、截止日、交付物、验收标准,并标出需要我确认的行。
结果:交付物这一列写得相当规矩,”一份含三家报价的对比表””一版更新后的排期图”,基本没有出现”完成推进跟进”这类空词——这是提示词里明令禁止的效果。验收标准也能写成可判真假的句子。
截止日期是个分水岭:会上明确说了时间的,它推算得准(”这周五”能正确算成 8 月 14 日);会上没说时间的 9 条,它全部给了建议值并标了 Y 要我确认,没有自作主张,这个行为很对。
扣分点:建议的截止日整体偏乐观。有一条要跨部门取数的事,它给了两天,实际这类事在我们这儿从来没有两天能完成的。另外负责人推断上,有一条把”提出问题的人”当成了”负责人”。这两处都要人工改,扣 2 分,8 分。
结论:这一环不能全自动,但它把要拍板的地方全给你圈出来了,你只需要花三五分钟做判断题,不用做填空题。
维度三:分发物格式合规 —— 8/10
这一维最容易出问题,也是我测得最细的一维,分三份看。
群通知文案(9 分):按负责人分组、格式统一、字数控制住了,语气也没有那种”让我们共同努力”的客套味。直接能发。
日历 .ics 文件(7 分):内容结构是对的,`BEGIN:VEVENT`、`SUMMARY`、`DTSTART`、`DESCRIPTION`、`VALARM` 提前一天提醒,字段都在。但第一版有两个真实坑:
• 部分事件缺 `UID` 和 `DTSTAMP` 字段。宽松的日历客户端能导入,严格一点的会直接报错;
• 时间没写时区,`DTSTART:20260814T090000` 这种本地时间写法在跨时区场景会漂。
我补了一句要求就修好了:“每个 VEVENT 必须包含唯一 UID 和 DTSTAMP,时间统一使用 UTC 格式并以 Z 结尾”。修完导入日历一次成功。
CSV 台账(8 分):列结构正确,但第一版用普通 UTF-8 保存,用 Excel 双击打开中文全是乱码。这不是 AI 的错,是 Excel 的老毛病:它默认按本地编码读。解决办法也是加一句要求——”CSV 请用带 BOM 的 UTF-8(utf-8-sig)保存”,之后双击打开完全正常。
综合扣分:两处要追加要求才能一次可用,扣 2 分,8 分。这两个坑我现在直接写进提示词模板里,就不会再犯。
维度四:定时跟进稳定性 —— 9/10
过程:设一个每天早上 9:00 的定时任务,读取台账 CSV,挑出逾期和两天内到期的任务,生成催办文案。我连续观察了六个工作日。
结果:六次全部按时触发,没有漏跑。逾期天数计算正确,分组正确,没有任务时也确实只回一句”今日无待办到期”,没有硬凑内容——这一点很重要,如果它每天都强行输出一大段废话,你三天就会开始无视它。
扣分点:有一天我手工把某行状态改成了”已完成 80%”,它没识别成非完成状态里的进行中,直接按未完成催了。说明状态列必须用固定枚举值(未开始/进行中/已完成),不能自由填写。这属于我自己的用法问题,但也说明它不做模糊语义兜底,扣 1 分,9 分。
维度五:口语与嘈杂输入容错 —— 7/10
过程:故意用最差的输入——未切分的完整 9200 字转写稿一次性投喂,看质量掉多少。
结果:明显下降。14 条事项只抽中 10 条,含糊标注漏了 3 处,遗漏点提醒变得笼统。转写错字里,”报架”能根据上下文还原成”报价”,这点不错;但有一处人名被转错成了近音字,它就直接当成了新的人名,凭空多出一个负责人。
结论:分段投喂是刚需,不是优化项。按议题切成三到四段,质量能回到维度一的水平。这一维扣 3 分,7 分。
总分与实操建议
| 维度 | 得分 |
| — | — |
| 事项抽取准确率 | 9/10 |
| 要素补全与拍板提示 | 8/10 |
| 分发物格式合规 | 8/10 |
| 定时跟进稳定性 | 9/10 |
| 口语与嘈杂输入容错 | 7/10 |
| 总分 | 41/50 |
三条落地建议,直接抄:
第一,长会必须分段。 超过 5000 字的转写稿,按议题切,别图省事。
第二,格式要求写死在提示词里。 ics 加 UID/DTSTAMP/UTC,CSV 用 utf-8-sig,状态列用固定枚举。这三句话省掉你后面所有返工。
第三,负责人和截止日必须人工过一遍。 这是整条闭环里唯一不能省的三分钟,其余环节都可以放手。
41 分是什么水平?我的理解是:它能把你从”整理纪要”里彻底解放出来,但还不能替你做管理判断。谁干、几号交,仍然是你的活儿——本来也该是你的活儿。
你更关心哪一维?如果你也测过,评论区报一下你的分数和翻车点,特别是 ics 导日历那一步有没有踩坑,我想收集一批客户端兼容性问题。
觉得这份实测省了你踩坑的时间,点个「在看」,转给正在纠结”AI 纪要到底能不能用”的同事。
#WorkBuddy #AI办公 #效率工具
——高总AI办公笔记
① 点个 「在看」 或 转发 给同事
② 关注 高总AI办公笔记,每周持续更新 AI 办公干货
卡神








