01 / 背景:模型的分数需要一把可信的尺子
国际气候谈判研究的权威数据库依赖纯人工标注,更新滞后、标注一致性难以保障,且只覆盖到 2013 年。北大王选所与我们的团队 合作研发 EALA(Expert-Augmented LLM Annotation)架构,用 LLM 接续这份工作。
但一个尖锐的问题摆在面前:谁来证明模型的标注是可信的? 如果测量工具本身不可靠,那么「模型超越人工」只是一句营销话术。 我在这个项目中担任模型评测团队负责人,负责人工评测团队的组织、评测体系搭建与数据质量验证。
02 / 需求定义与评测体系:以 Human Baseline 为验收标准
项目组在启动阶段做了一个关键的产品化决定:把 Human Baseline 定义为 LLM 数据生产的验收标准—— 不是先跑模型再看结果好不好,而是先把「什么算对」用人工共识钉死,模型的每一分都要向这把尺子对齐。 在此之上,我搭建了 Codebook 驱动的评测体系:
- Codebook 驱动标注:围绕国际气候谈判的复杂关系抽取任务,制定 Codebook 把模糊的研究概念转译成可执行、可校验的标注规则;
- 双人独立 + 分歧讨论:每段材料由两名评测员独立标注,分歧项进入讨论仲裁流程——既防单人偏差,也防互相污染;
- Human Baseline 量化:以标注一致性经过验证的人工结果作为基线,对模型 Precision / Recall 做量化评测;
- 错误归因闭环:结合人工审读归纳模型典型错误模式,形成优化依据反馈给算法侧。
03 / Human Baseline 的工程化:10 人 × 153 段落
- 组织与分工:招募并培训 10 名评测员,对 153 个谈判段落进行双人独立关系标注,构建统计学意义上的 Human Baseline;
- 关键结论:EALA 在复杂关系抽取中 Precision 达到 74.0%,较单人标注基线的 67.5% 高出 6.5 个百分点;Recall 90.0%,与人工基线 89.2% 基本持平——模型在质量上首次具备了替代人工的可信证据;
- 方法价值:这套「双人盲标 + 分歧仲裁」的流程本身成为项目的方法论资产,写入了合作论文。
04 / 数据质量控制:不放过每一个模糊地带
- 动态议题空间校验:参与对 LLM 生成的议题名称与描述的人工审读修订,27.8% 的议题描述经人工调整后达到出版级数据标准;
- 议题预测评测集:参与构建覆盖 50 个段落、394 条互动关系的专项评测集,沿用双人独立标注与分歧讨论机制,标注一致性达 0.79;
05 / 落地成果与反思
- 规模化验证:支撑 EALA 在 678 份国际气候谈判日报上完成规模化验证,最终生成 45,051 条互动数据,将数据库更新至 2024 年;
- 学术认可:合作论文入选 2025 Asian PolMeth Conference(政治方法论领域旗舰会议)。
如果重来一次:我会让评测员更早参与 Codebook 的修订迭代——前期规则单向上传、 争议积压在讨论环节;后来改成「每周规则共创会」后,一致性上升速度明显加快。 Codebook 不是一份文档,而是一支队伍的对齐协议。