01 / 背景:一支撑了三十年的「人工军队」
国际气候谈判研究的权威数据库依赖纯人工标注,且只覆盖到 2013 年—— 之后十年的谈判格局剧变(巴黎协定落地、能源转型博弈),研究却没法跟进。 每一份谈判日报里,谁对谁提出了什么主张、让步还是坚持,全靠学生夜以继日逐条读。
我是这个项目的负责人:既要证明技术路线可行,又要把它变成一个能持续运转的生产系统。
02 / 技术路线:用 6.2 万条历史数据说话
- 三路线赛马:基于 6.2 万+ 历史人工标注,平行验证 Prompt 工程、Few-shot 与 SFT 三条路线;
- 关键转向:实验证明 SFT 在复杂关系抽取上显著占优,据此推动整个项目从提示工程转向微调路线——这是一个用数据说服团队改变方向的决策;
- 架构共创:与北大王选所共同设计 Expert-Augmented LLM Annotation 架构,把领域 Codebook、任务拆解、模型标注与专家校验整合为标准化工作流。
路线选型不是技术偏好问题,而是产品问题:效果、成本、质量三角里,必须由场景需求决定向哪边倾斜。
03 / 数据闭环与团队:让错误变成养料
- 组建并管理 11 人标注团队:制定 Codebook 约束与任务拆解规范,把复杂的国家互动关系拆成可校验的原子判断;
- 闭环设计:建立「LLM 预标注 → 人工审读 → 错误归因 → 训练数据回流 → 模型迭代」的完整闭环,每一轮错误的分类都成为下一轮训练的燃料;
- 边界定义:明确 Prompt、SFT 与人工复核各自的适用边界,在模型效果、标注成本与数据质量之间找到可持续的平衡点。
04 / 成果
- 质量跃迁:复杂任务 Recall 从 54.0% 提升至 87.9%;Derivation 规则符合率 59.1% → 88.2%,超过人工标注基线;最终模型 Precision 74.0%、Recall 90.0%;
- 规模落地:应用于 678 份国际气候谈判日报,自动生成 45,051 条互动数据,覆盖时间跨度从 1995-2013 扩展到 1995-2024;
- 学术认可:成果入选 2025 Asian PolMeth Conference——AI 数据生产方法论获得了方法论学术共同体的承认。
05 / 反思
这个项目教我最深的一课:AI 产品经理最难的工作往往不在模型,而在「人机分工的设计」。 什么时候信模型、什么时候必须人审、审什么粒度——这些边界定义错了,再好的模型也会被流程拖垮。 这段经历让我在后来的 Agent 产品里,始终把「质量门禁」当作一等公民来设计。