AI PRODUCT MANAGER · PORTFOLIO

邵志成 ZHICHENG SHAO

「田野派」AI 产品经理 —— 先去现场找问题,再把它做成产品。

北京大学 2027 届博士研究生 AI 产品经理方向 北京
邵志成 · 个人照片
FIG.00 — SELF PORTRAIT · BEIJING

HELLO — 自我介绍

我习惯先去现场, 再决定做什么产品。

我是邵志成,北京大学区域与国别研究院博士研究生。在印度尼西亚做访问研究的六个月里, 我访谈了 30 多位出海企业负责人。大家手里并不缺报告和数据,真正麻烦的是:资料来自哪里、能不能信、 不同来源冲突时该听谁的,以及这些信息最后怎么变成一个决策。

这后来成为「全球商业洞察 Agent」的起点。过去一年,我独立做了两个 AI 产品:面向企业出海研究的 全球商业洞察 Agent,以及面向消费者找香场景的知香香水导购 Agent。同时,我在北京大学王选计算机所 冯岩松老师团队合作的 EALA 项目中负责模型评测团队,组织人工评测、构建 Human Baseline, 并参与验证 LLM 数据生产的可靠性。

这几段经历看起来很不一样,但我做事的习惯很一致:先把真实问题拆清楚,再决定模型应该做什么; 产品上线以后,用评测而不是感觉判断它有没有变好。

完整教育与获奖 →
03个
0→1 AI 产品落地
30+ 访谈
出海企业负责人
2,367 信源
覆盖 195 国分层信源库
45,051
条标注数据自动生成
01

精选项目

SELECTED WORKS × 3
Multi-Agent · 企业服务 · 从 0 到 1 2025.12 — 2026.08

全球商业洞察 Agent

GLOBAL BUSINESS INSIGHT AGENT

让企业得到的不只是搜索结果,而是一份知道「为什么可以信」的研究结论。 项目来自我在印尼六个月的田野调研和 30+ 企业访谈:把企业研究中最容易出错的环节拆成 国家匹配、证据支持、来源质量、行动建议四项产品指标,再据此设计搜索、分析、报告和核验链路。 独立完成产品定义、Agent 架构、信源体系、评测和上线部署。

Multi-AgentRAG信源工程LLM-as-Judge
+13%综合评分 +25%Actionability 100%硬门禁通过率

LIVE ↗ insight.zhichengshao.cloud

对话推荐 · 知识图谱 · 从 0 到 1 2026.07 — 2026.08

知香 · 香水导购 Agent

FRAGRANCE SHOPPING AGENT

用户说的是「白衬衫的干净感」,商品库写的是「麝香、醛香、柑橘」——知香要把这两种语言接起来。 围绕线上买香水「不会描述、闻不到、怕踩雷」的问题,我搭建了覆盖 1,971 款香水的知识图谱并接入 真实电商商品源,让 Agent 既能理解模糊偏好,也不会推荐一个根本买不到的商品。 从消费者访谈、推荐策略到评测集和 H5 产品,独立完成。

知识图谱对话推荐真实商品接入Taro / React
+39%基础集综合评分 1,971 款香水知识图谱 4 级分级召回

LIVE ↗ zhixiang.pocketbay.app

AI 数据生产 · 模型评测团队负责人 2024.01 — 2025.05

国际气候谈判 LLM 智能标注系统

LLM ANNOTATION SYSTEM FOR CLIMATE NEGOTIATIONS

这个项目里,我不负责证明模型有多强,而是负责把「模型到底标得对不对」测清楚。 在北京大学王选计算机所冯岩松老师团队合作的 EALA 项目中,我负责模型评测团队: 组织 10 名评测员进行双人独立标注,建立 Human Baseline,并参与模型错误分析和数据质量验证。 最终 EALA 的 Precision 达到 74.0%,系统应用于 678 份国际气候谈判日报,自动生成 45,051 条互动数据。

评测体系搭建Human Baseline数据质量控制学术发表
67.5% → 74.0%Precision 0.79双人标注一致性 45,051 条数据生成

PAPER ↗ arxiv.org/abs/2503.01672

02

我的工作方式

HOW I WORK

STEP 01

从真实问题开始

我更相信访谈、失败案例和真实使用过程,而不是坐在桌前猜用户需要什么。

  • 印尼 6 个月田野,访谈 30+ 出海企业负责人
  • 访谈 20+ 香水消费者,拆解线上找香的决策过程
  • 把「信息不可信」「不会描述香味」这类模糊问题,拆成可设计、可评测的产品问题

STEP 02

把模型放在合适的位置

我不默认所有问题都应该交给 LLM。商业洞察里,我把搜索、分析、写作和核验拆开;香水导购里,我让模型理解语言,让知识图谱提供知识,让真实商品源负责库存。

架构不是为了复杂,而是为了把不同风险放到最适合解决它的位置。

STEP 03

用 Bad Case 推动迭代

产品做出来只是开始。我会保留回归集、记录失败案例,把可以确定判断的错误写成代码规则,再用 LLM-as-Judge 评估开放性质量。

每一轮改动都要回答一个问题:到底是哪类错误变少了?