PROJECTS · CASE STUDIES × 3

三个项目, 三个不同的问题。 THREE CASES, END TO END

一个研究企业如何做跨国决策,一个解决消费者如何找到适合自己的香水,一个验证 LLM 能不能可靠地替代部分人工数据生产。 我更想展示的不是用了多少 Agent、RAG 或知识图谱,而是面对不同问题时,我是怎么定义需求、做取舍、搭产品,再通过评测把它改好的。

Multi-Agent · 企业服务 · 独立完成 2025.12 — 2026.08 · 九个月

全球商业洞察 Agent

GLOBAL BUSINESS INSIGHT AGENT

企业做海外市场研究时,真正困难的不是「搜不到」,而是资料质量参差、国家信息容易混用, 最终结论又很难追溯。这个项目从我在印尼的六个月田野和 30+ 企业访谈开始:把这些问题拆成 国家匹配、证据支持、来源质量和行动建议四项指标,并围绕它们设计完整产品链路。

Harness + Multi-AgentRAG信源工程LLM-as-Judge
2.94 → 3.33 / 4综合评分 +25%Actionability 100%硬门禁通过率

LIVE ↗ insight.zhichengshao.cloud

对话推荐 · 知识图谱 · 独立完成 2026.07 — 2026.08 · 六周冲刺

知香 · 香水导购 Agent

FRAGRANCE SHOPPING AGENT

很多人知道自己想要「干净」「清冷」「适合夏天」的香水,却不知道该搜什么香调。 知香做的是中间这一层翻译:先理解用户自然语言里的偏好,再从香水知识图谱中寻找匹配方向, 最后只从真实在售商品里完成推荐。

知识图谱对话推荐分级召回Taro + React
+39%基础集评分 1,971 款香水 2 个真实商品平台

LIVE ↗ zhixiang.pocketbay.app

AI 数据生产 · 模型评测团队负责人 2024.01 — 2025.05 · 十七个月

国际气候谈判 LLM 智能标注系统

LLM ANNOTATION SYSTEM FOR CLIMATE NEGOTIATIONS

当 LLM 被用来替代人工生产研究数据时,一个比「模型能不能跑」更重要的问题是: 我们怎么知道它做对了?我在项目中负责人工评测侧,组织 10 名评测员建立 Human Baseline, 并通过双人独立标注、分歧讨论和专项评测验证模型质量。

Human BaselineCodebook模型评测数据质量控制
67.5% → 74.0%Precision 0.79标注一致性 45,051 条数据自动生成

PAPER ↗ arxiv.org/abs/2503.01672

// 更多佐证材料:教育与获奖见 关于页 ↗ · 完整简历可下载 PDF