← 返回项目列表 / PROJECTS

CASE P.01 — MULTI-AGENT × 企业出海 · 独立完成

全球商业洞察 Agent

企业出海决策最缺的不是数据,而是「可溯源的判断」—— 这款产品要回答的是:当一个企业负责人问「我该不该去越南」,AI 能不能给出一条有出处、有质量分级、能落地的答案。

MY ROLE / 我的角色
独立完成 · 全链路(研究/设计/评测/部署)
BASIS / 需求来源
印尼 6 个月田野 + 30+ 出海企业访谈
DURATION / 周期
2025.12 — 2026.08 · 五轮评测迭代
STACK / 技术栈
Harness + Multi-Agent · RAG · Vercel / Render / Supabase

项目主视觉占位
建议放:产品界面截图 或 Harness+Multi-Agent 架构图
尺寸建议 1600×800

FIG.01 — 系统架构总览HARNESS × MULTI-AGENT
2.94 → 3.33/4

综合评分(五轮迭代,+13%)

+25%

Actionability 行动建议维度

100%

代码硬门禁通过率

71,904

Chunk 官方知识库(311 份文档)

01 / 背景:痛点来自田野,不是来自想象

我在印尼做过 6 个月实地调研,又访谈了 30+ 出海企业负责人, 反复听到三类抱怨:本地信息不足(英文/中文资料覆盖不到本地市场)、 跨国资料误用(拿 A 国政策套 B 国市场)、结论无依据(咨询报告贵且不可验证)。

通用大模型在这类问题上恰恰不可靠:它会编造政策条文、混淆国别、给出一本正经但无出处的「建议」。 对一个要做真金白银决策的企业来说,这比没有答案更危险。

02 / 定义产品:四个指标,就是四条底线

我把田野中发现的三类痛点翻译成四项可量化的产品指标——它们后来直接构成评测体系的维度:

  • 国家匹配:答案必须针对目标国家,不允许跨国情资料显示;
  • 证据支持:每条关键结论必须挂载出处,「无引用不输出」;
  • 来源质量:官方信源 > 本地媒体 > 一般网页,质量分层可见;
  • 行动建议:不止解释「是什么」,还要给出「下一步怎么做」。

03 / 架构设计:Harness 管秩序,Agent 干专业的事

  • Harness 层:负责搜索路由、上下文管理和质量门禁——它决定「这个问题该怎么查、查到的结果够不够格进入生成」。
  • Multi-Agent 协同:Search Planner 规划检索策略 → Insight 做证据分析 → Report 组织报告生成 → Critic 做引用核验与自我批评,各司其职。
  • 信源工程:构建覆盖 195 国、2,367 个分层信源的 Market Pack(1,265 个官方信源 + 1,102 个本地媒体),支持按目标国家调用当地语言来源。
  • 知识库补全:以外交部、商务部等 311 份官方文档切成 71,904 Chunk 建立知识库,用 RAG 补足基础信息盲区;通过人工标注与 Top-K 评测确定 K=8。
评测驱动架构:K 值不是拍脑袋定的,是测出来的。凡是影响输出质量的参数,都应该有实验支撑。

04 / 评测迭代:硬门禁卡底线,Judge 拉上限

  • 双轨评测体系:代码硬门禁做确定性校验(引用存在性、国别一致性等一票否决项),LLM-as-Judge 打七维主观分;
  • 回归集 10 题 + 泛化集 5 题:每轮迭代必须过回归、看泛化,防止按下葫芦浮起瓢;
  • 五轮迭代成果:综合评分 2.94 → 3.33(+13%),Actionability +25%,Citation Quality +15%,硬门禁通过率达到 100%。

05 / 工程落地与反思

基于 Vercel、Render Worker 与 Supabase 完成线上部署,支持多国家并行研究、 多轮追问、企业知识库接入与运营监控看板。

如果重来一次:我会更早引入 Critic Agent 的国别一致性核验——前两轮迭代里 跨国资料串味是最顽固的 Bad Case,后来才发现与其在生成端反复打补丁,不如在核验端设一道闸。 把质检做成架构的一部分,而不是迭代的补丁。

NEXT CASE — P.02

知香 · 香水导购 Agent:知识图谱如何「懂香」→