← 返回项目列表 / PROJECTS

CASE P.01 — MULTI-AGENT × 企业出海 · 独立完成

全球商业洞察 Agent

企业做海外市场研究时,问题往往不是「没有资料」。 真正麻烦的是:搜到的信息来自哪里?是不是这个国家的?不同来源冲突时该信谁? 最后又能不能变成一个可以执行的判断? 我想做的,是把这条从「找到资料」到「形成判断」的链路做成产品。

MY ROLE / 我的角色
独立完成 · 全链路(研究/设计/评测/部署)
BASIS / 需求来源
印尼 6 个月田野 + 30+ 出海企业访谈
DURATION / 周期
2025.12 — 2026.08 · 五轮评测迭代
STACK / 技术栈
Harness + Multi-Agent · RAG · Vercel / Render / Supabase
全球商业洞察 Agent 产品界面横排实录(五屏)

FIG.01 — 产品界面实录 · 注册建区 → 多国研究 → 企业知识库WEB · NEXT.JS + MULTI-AGENT

FIG.02 — 系统架构总览HARNESS × MULTI-AGENT
2.94 → 3.33/4

综合评分(五轮迭代,+13%)

+25%

Actionability 行动建议维度

100%

代码硬门禁通过率

22,949

Chunks 官方知识库(311 份文档)

01 / 问题从哪里来

我在印度尼西亚做了六个月访问研究,也访谈了 30 多位出海企业负责人。大家经常提到三个问题。

第一,本地市场的信息不好找。很多关键政策、行业动态和企业信息只存在于当地政府网站或本地语言媒体里。

第二,跨国研究很容易串数据。一个看似合理的结论,背后的材料可能来自另一个市场。

第三,研究报告经常只有结论,没有证据链。对于真正要投入资金、团队和时间的企业来说,「听起来有道理」远远不够。

这三个问题最终决定了这个产品要优先解决什么——而不是我先选好了 Multi-Agent,再去寻找使用场景。

02 / 先定义什么叫「答得好」

在设计 Agent 之前,我先给产品定了四个验收指标。

  • 国家匹配:讨论越南,就不能拿泰国或印尼的信息来填空。
  • 证据支持:关键判断必须能回到具体来源;找不到证据就降低结论强度,而不是补一个听起来合理的答案。
  • 来源质量:政府、官方机构、本地主流媒体和普通网页,不能被等权处理。
  • 行动建议:研究最终要帮助企业做下一步决策,而不只是重新整理一遍公开资料。

后来的架构设计和评测体系,基本都围绕这四个指标展开。

03 / 把搜索、分析、写作和核验拆开

第一版产品最大的教训之一,是不能指望一次 Prompt 同时把检索、分析、写作和引用全部做好。 因此后续我把任务拆成几个责任不同的环节:

  • Search Planner 决定应该查什么、用什么语言查、优先进入哪些来源;
  • Insight 只处理已经进入 Evidence Store 的证据,并提炼其中的商业含义;
  • Report 负责把分散洞察组织成完整报告;
  • Critic 不参与写作,只检查国别混用、引用缺失和论据不足的问题。

Harness 负责整个流程的上下文、搜索预算和质量门禁。

与此同时,我搭建了覆盖 195 个国家的 Market Pack,共整理 2,367 个分层信源—— 其中包括 1,265 个官方来源和 1,102 个本地媒体来源。 对于相对稳定的基础信息,我另外整理了 311 份官方资料并切分为 22,949 个 Chunks,通过 RAG 提供补充。

Top-K 最终采用 K=8,也不是因为「行业一般这么做」,而是在人工标注测试集上比较不同参数后确定的。

04 / 怎么判断它真的变好了

我把评测分成两部分。一部分适合代码判断——有没有引用、引用是否存在、回答里是否混入错误国家的信息, 这些问题不存在「审美差异」,直接写成硬门禁; 另一部分很难用规则判断——分析是否完整、建议有没有可执行性、证据是否真正支持结论,交给 LLM-as-Judge。

我保留了 10 道回归题,同时增加 5 道泛化题:每轮迭代既检查旧问题有没有复发,也观察修改有没有只对少数测试题有效。五轮之后:

  • 综合评分从 2.94 提升到 3.33 / 4;
  • Actionability 提升 25%;
  • Citation Quality 提升 15%;
  • 硬门禁通过率达到 100%。

对我来说,比总分上涨更重要的是:我开始知道每次产品修改究竟解决了哪一种错误。

05 / 我会重做什么

这个项目里最顽固的 Bad Case 是「跨国资料串味」。 早期我不断修改生成 Prompt,希望模型自己注意国家边界,但效果一直不稳定; 后来我才把这个问题从「生成能力问题」重新定义成「质量控制问题」,交给 Critic 和代码规则处理, 效果比继续修改 Prompt 稳定得多。如果重新做一次,我会更早建立这一层核验。

看到模型出错时,不要第一反应就改 Prompt。先判断这个错误到底应该在哪一层解决。

NEXT CASE — P.02

知香 · 香水导购 Agent:把「用户的语言」接到「商品的语言」→