← 返回项目列表 / PROJECTS

CASE P.03 — AI 数据生产 × 学术落地 · 主导完成

国际气候谈判 LLM 数据生产系统

社会科学的数据生产还停留在人海战术:一个数据库几十年靠人工一条条标。 这个项目要回答的是:LLM 能不能接替这支队伍——并且标得比人还准?

MY ROLE / 我的角色
项目负责人 · 主导完成(含 11 人团队管理)
PARTNER / 合作方
北京大学王选计算机研究所
DURATION / 周期
2024.01 — 2025.05 · 十七个月
OUTPUT / 落地产出
45,051 条数据 · 入选 2025 Asian PolMeth

项目主视觉占位
建议放:Expert-Augmented 标注工作流图 或 数据看板截图
尺寸建议 1600×800

FIG.01 — LLM 预标注 → 专家校验工作流EXPERT-AUGMENTED LLM ANNOTATION
54% → 87.9%

复杂关系抽取任务 Recall

45,051

条互动数据自动生成

88.2%

Derivation 规则符合率(超人工基线)

1995-2024

覆盖跨度扩展(原仅至 2013)

01 / 背景:一支撑了三十年的「人工军队」

国际气候谈判研究的权威数据库依赖纯人工标注,且只覆盖到 2013 年—— 之后十年的谈判格局剧变(巴黎协定落地、能源转型博弈),研究却没法跟进。 每一份谈判日报里,谁对谁提出了什么主张、让步还是坚持,全靠学生夜以继日逐条读。

我是这个项目的负责人:既要证明技术路线可行,又要把它变成一个能持续运转的生产系统

02 / 技术路线:用 6.2 万条历史数据说话

  • 三路线赛马:基于 6.2 万+ 历史人工标注,平行验证 Prompt 工程、Few-shot 与 SFT 三条路线;
  • 关键转向:实验证明 SFT 在复杂关系抽取上显著占优,据此推动整个项目从提示工程转向微调路线——这是一个用数据说服团队改变方向的决策;
  • 架构共创:与北大王选所共同设计 Expert-Augmented LLM Annotation 架构,把领域 Codebook、任务拆解、模型标注与专家校验整合为标准化工作流。
路线选型不是技术偏好问题,而是产品问题:效果、成本、质量三角里,必须由场景需求决定向哪边倾斜。

03 / 数据闭环与团队:让错误变成养料

  • 组建并管理 11 人标注团队:制定 Codebook 约束与任务拆解规范,把复杂的国家互动关系拆成可校验的原子判断;
  • 闭环设计:建立「LLM 预标注 → 人工审读 → 错误归因 → 训练数据回流 → 模型迭代」的完整闭环,每一轮错误的分类都成为下一轮训练的燃料;
  • 边界定义:明确 Prompt、SFT 与人工复核各自的适用边界,在模型效果、标注成本与数据质量之间找到可持续的平衡点。

04 / 成果

  • 质量跃迁:复杂任务 Recall 从 54.0% 提升至 87.9%;Derivation 规则符合率 59.1% → 88.2%超过人工标注基线;最终模型 Precision 74.0%、Recall 90.0%;
  • 规模落地:应用于 678 份国际气候谈判日报,自动生成 45,051 条互动数据,覆盖时间跨度从 1995-2013 扩展到 1995-2024
  • 学术认可:成果入选 2025 Asian PolMeth Conference——AI 数据生产方法论获得了方法论学术共同体的承认。

05 / 反思

这个项目教我最深的一课:AI 产品经理最难的工作往往不在模型,而在「人机分工的设计」。 什么时候信模型、什么时候必须人审、审什么粒度——这些边界定义错了,再好的模型也会被流程拖垮。 这段经历让我在后来的 Agent 产品里,始终把「质量门禁」当作一等公民来设计。

REVISIT — P.01

全球商业洞察 Agent:从田野调研到 Multi-Agent 上线 →