STEP 01
从真实问题开始
我更相信访谈、失败案例和真实使用过程,而不是坐在桌前猜用户需要什么。
- 印尼 6 个月田野,访谈 30+ 出海企业负责人
- 访谈 20+ 香水消费者,拆解线上找香的决策过程
- 把「信息不可信」「不会描述香味」这类模糊问题,拆成可设计、可评测的产品问题
AI PRODUCT MANAGER · PORTFOLIO
「田野派」AI 产品经理 —— 先去现场找问题,再把它做成产品。
HELLO — 自我介绍
我是邵志成,北京大学区域与国别研究院博士研究生。在印度尼西亚做访问研究的六个月里, 我访谈了 30 多位出海企业负责人。大家手里并不缺报告和数据,真正麻烦的是:资料来自哪里、能不能信、 不同来源冲突时该听谁的,以及这些信息最后怎么变成一个决策。
这后来成为「全球商业洞察 Agent」的起点。过去一年,我独立做了两个 AI 产品:面向企业出海研究的 全球商业洞察 Agent,以及面向消费者找香场景的知香香水导购 Agent。同时,我在北京大学王选计算机所 冯岩松老师团队合作的 EALA 项目中负责模型评测团队,组织人工评测、构建 Human Baseline, 并参与验证 LLM 数据生产的可靠性。
这几段经历看起来很不一样,但我做事的习惯很一致:先把真实问题拆清楚,再决定模型应该做什么; 产品上线以后,用评测而不是感觉判断它有没有变好。
完整教育与获奖 →GLOBAL BUSINESS INSIGHT AGENT
让企业得到的不只是搜索结果,而是一份知道「为什么可以信」的研究结论。 项目来自我在印尼六个月的田野调研和 30+ 企业访谈:把企业研究中最容易出错的环节拆成 国家匹配、证据支持、来源质量、行动建议四项产品指标,再据此设计搜索、分析、报告和核验链路。 独立完成产品定义、Agent 架构、信源体系、评测和上线部署。
LIVE ↗ insight.zhichengshao.cloud
FRAGRANCE SHOPPING AGENT
用户说的是「白衬衫的干净感」,商品库写的是「麝香、醛香、柑橘」——知香要把这两种语言接起来。 围绕线上买香水「不会描述、闻不到、怕踩雷」的问题,我搭建了覆盖 1,971 款香水的知识图谱并接入 真实电商商品源,让 Agent 既能理解模糊偏好,也不会推荐一个根本买不到的商品。 从消费者访谈、推荐策略到评测集和 H5 产品,独立完成。
LIVE ↗ zhixiang.pocketbay.app
LLM ANNOTATION SYSTEM FOR CLIMATE NEGOTIATIONS
这个项目里,我不负责证明模型有多强,而是负责把「模型到底标得对不对」测清楚。 在北京大学王选计算机所冯岩松老师团队合作的 EALA 项目中,我负责模型评测团队: 组织 10 名评测员进行双人独立标注,建立 Human Baseline,并参与模型错误分析和数据质量验证。 最终 EALA 的 Precision 达到 74.0%,系统应用于 678 份国际气候谈判日报,自动生成 45,051 条互动数据。
PAPER ↗ arxiv.org/abs/2503.01672
STEP 01
我更相信访谈、失败案例和真实使用过程,而不是坐在桌前猜用户需要什么。
STEP 02
我不默认所有问题都应该交给 LLM。商业洞察里,我把搜索、分析、写作和核验拆开;香水导购里,我让模型理解语言,让知识图谱提供知识,让真实商品源负责库存。
架构不是为了复杂,而是为了把不同风险放到最适合解决它的位置。
STEP 03
产品做出来只是开始。我会保留回归集、记录失败案例,把可以确定判断的错误写成代码规则,再用 LLM-as-Judge 评估开放性质量。
每一轮改动都要回答一个问题:到底是哪类错误变少了?