01 / 背景:痛点来自田野,不是来自想象
我在印尼做过 6 个月实地调研,又访谈了 30+ 出海企业负责人, 反复听到三类抱怨:本地信息不足(英文/中文资料覆盖不到本地市场)、 跨国资料误用(拿 A 国政策套 B 国市场)、结论无依据(咨询报告贵且不可验证)。
通用大模型在这类问题上恰恰不可靠:它会编造政策条文、混淆国别、给出一本正经但无出处的「建议」。 对一个要做真金白银决策的企业来说,这比没有答案更危险。
02 / 定义产品:四个指标,就是四条底线
我把田野中发现的三类痛点翻译成四项可量化的产品指标——它们后来直接构成评测体系的维度:
- 国家匹配:答案必须针对目标国家,不允许跨国情资料显示;
- 证据支持:每条关键结论必须挂载出处,「无引用不输出」;
- 来源质量:官方信源 > 本地媒体 > 一般网页,质量分层可见;
- 行动建议:不止解释「是什么」,还要给出「下一步怎么做」。
03 / 架构设计:Harness 管秩序,Agent 干专业的事
- Harness 层:负责搜索路由、上下文管理和质量门禁——它决定「这个问题该怎么查、查到的结果够不够格进入生成」。
- Multi-Agent 协同:Search Planner 规划检索策略 → Insight 做证据分析 → Report 组织报告生成 → Critic 做引用核验与自我批评,各司其职。
- 信源工程:构建覆盖 195 国、2,367 个分层信源的 Market Pack(1,265 个官方信源 + 1,102 个本地媒体),支持按目标国家调用当地语言来源。
- 知识库补全:以外交部、商务部等 311 份官方文档切成 71,904 Chunk 建立知识库,用 RAG 补足基础信息盲区;通过人工标注与 Top-K 评测确定 K=8。
04 / 评测迭代:硬门禁卡底线,Judge 拉上限
- 双轨评测体系:代码硬门禁做确定性校验(引用存在性、国别一致性等一票否决项),LLM-as-Judge 打七维主观分;
- 回归集 10 题 + 泛化集 5 题:每轮迭代必须过回归、看泛化,防止按下葫芦浮起瓢;
- 五轮迭代成果:综合评分 2.94 → 3.33(+13%),Actionability +25%,Citation Quality +15%,硬门禁通过率达到 100%。
05 / 工程落地与反思
基于 Vercel、Render Worker 与 Supabase 完成线上部署,支持多国家并行研究、 多轮追问、企业知识库接入与运营监控看板。
如果重来一次:我会更早引入 Critic Agent 的国别一致性核验——前两轮迭代里 跨国资料串味是最顽固的 Bad Case,后来才发现与其在生成端反复打补丁,不如在核验端设一道闸。 把质检做成架构的一部分,而不是迭代的补丁。