跳转至

用“韬奋杯”等编校大赛真题测评开源书稿审校工具 AI Proofreader 的能力

我开发的书稿审校应用 AI Proofreader(VS Code 扩展),自己用和同事、朋友用都觉得好,比市面上的商业审校工具还好。但这是少数人的感受。当前也没有公开的审校测评数据和平台,无法与竞品进行比较。

为了较为客观地评价本扩展的能力,也想找找优化方向,我在 WorkBuddy 的协助下,收集了网上公开的编辑校对试题,使用本扩展审改,最后逐一核对参考答案并进行统计。

(一)测评资料与统计口径#

测评试题是网络上公开的近年“韬奋杯”全国图书/出版社青年编校大赛、全国报刊编校技能大赛校样校对、篇章加工类真题,筛除了没有参考答案的部分,以及字体字号版式等无法通过纯文本呈现的部分。

有效试题共 19 篇(组),全部预设有差错,附官方参考答案。先用 6 种配置各校对一次:第 1 次 qwen3.8-max,第 2 次 qwen3.8-max 重复 target(即要修改的文本),第 3 次 qwen3.7-max,第 4 次 qwen3.7-max 重复 prompt(包括要修改的文本和修改要求等),第 5 次 qwen3.7-max 按 600 字符起切分,第 6 次 qwen3.7-max 重复 target。除第 5 次外,各次不加切分,每篇作为整体一次完成校对。模型温度均取 1,关闭思考模式。

逐条比对修改前后文本与参考答案,进行统计。“命中”表示改对采分点,“漏报”表示未处理,“误报”表示把对的改错。纯排版格式(包括表格样式)、文本转换类问题,以及须对照原稿的“对校”类问题,因在纯文本环境下无法呈现、修改、评价,这些条目保留但不计入分母(共剔出 10 个计分点);校样中的校对类,因没有原稿可对,有改动即计为命中、未改动则剔出分母。有效计分点,第1、5次为285,其余为284。

(二)总体成绩#

六种配置下的测评结果如Table 1所示。

场次 命中 漏报 误报 召回率 正确率
1 qwen3.8-max 220.0 62.5 4 77.2% 98.2%
2 qwen3.8-max·重复target 228.0 53.5 2 80.3% 99.1%
3 qwen3.7-max 224.5 57.0 2 79.0% 99.1%
4 qwen3.7-max·重复prompt 218.5 63.0 0 76.9% 100.0%
5 qwen3.7-max·600字符起切 223.5 59.0 2 78.4% 99.1%
6 qwen3.7-max·重复target 229.0 54.0 2 81.0% 99.1%

六场召回率为 76.9%—81.0%(波动约 4 个百分点),正确率为 98.2%—100%。计算机文稿、成语、数学片段多次满分;八套报刊大赛卷按 5 分/处实算得 360—375 分(满分 400),偏低的是版面格式卷(38%—63%)、校样片段卷(50%—67%)、版权页(41%—59%)。

因手头没有这些比赛的成绩数据,无法与真人水平进行比较。凭个人经验,这个成绩大概是很不错的。

(三)主要结论、分析与改进策略#

(1)改得很准,漏掉一些,还要用真实书稿来评估。失分几乎全部来自漏报,通常漏报20%有零;每场误报仅 0—4 处。就比赛题场景而言,目前的保守倾向有价值,契合“改不误为误倒扣分”的比赛要求;在真实场景中也能有效减少审核负担,但不利于提醒编辑注意。目前的正确率很高,因而召回率还有不少提高空间,因为找出错误后即使没有改对也有提醒价值。不过,比赛真题并不能完全代表真实书稿的情形,比赛题错误密度高得多,有人为“设计”的因素。下一步还要在真实书稿上测评。

复现的系统性误报只有一处:书籍版本记录中的印次被误改(“第 7 次印刷”→“第 1 次印刷”,答案只要求改“第 1 版”),第 6 场两处误报全部属此类型。

需要说明的是,因为没有标准供参考,参考答案之外的改动一律忽略。从上述正确率以及平时使用经验看,这些地方被改错的可能性相当小,多半可以作为优化提醒。实际上,有若干答案外改动经核对属正确修正,如“通俗相尚”改为“风俗相尚”,因不在采分点内,不计分也不计误报。

值得注意的是: ①单纯重复目标文本能提高召回率,且不影响正确率;而重复完整的提示词(包括目标文本和修改要求等),却导致召回率降低,但正确率提高。——也许较长且结构交替的文本会影响对文字细节的注意,但能提高对逻辑关系的注意。②切分为 600 多字符的短片段(19 篇中有 5 篇在 1000 字到 3038 字之间)几乎不影响校对效果,还白白增加了 token 消耗。——需要用真实书稿来测试,确定多长的文本会影响效果。

(2)短板三类,需要有针对性地补强:①知识、数据核实(数字、年份、版本记录)。可见专项核查、检索资料合并校对很有必要,后续有必要测评这些部分。②“提出质疑即可”的题型——本扩展只在“改/不改”间二选一,通常不输出存疑建议(条目式输出时有说明)。有必要设置专门提示,对非具体字词错误类问题进行质疑、提醒,供用户参考。③计算类全局动作(汇总差错数、算差错率)六次全漏。计算类书稿,比如数学练习册,需要使用专门的提示词,也可尝试打开思考模式。

(3)qwen3.7-max 略优于 qwen3.8-max:前者为纯文本模型,后者为图文影像模型,能力差异不大。但从实际经验来看,前者的普通知识或词语细节专注力似乎更好,建议优先使用。

评论