我的角色与贡献
我参与早期父子分块、RRF 混合检索与 NLI 引用验证方案,随后持续承担产品技术支持与迭代。CompliPilot 与线上产品 Attrax 属于同一产品线。
背景
跨境电商卖家需要根据产品特征与目标市场识别风险,并核对结论依据的法规。
核心原则
合规 AI 的信任建立在引用层而非语言模型之上——在高风险场景里,幻觉不是「体验问题」,而是「不可用」。
当前方法(2026-09-21 公开仓库说明)
每条合规结论都能回到法规原文
展示当前公开版本的知识库锚定流程:视觉事实、适用范围、原文、生成与分层引用验证。
产品识别
从产品图片提取品类、可见特征和需要确认的信息,形成结构化事实。
- 输入
- 产品图片
- 输出
- 品类与可见特征
引用验证区分 source / literal / semantic;未验证状态明确保留。
当前 Attrax 公开仓库 描述的流程为 vision → generate → verify:根据产品图片形成品类与可见特征,再通过规则知识库的必查项、法规原文与模型生成组织报告。
- 以市场、品类与产品特征查找必查法规,加载对应原文。
- 生成结论时保留法规条款引用与原文摘录。
- 分开呈现来源、字面匹配与语义核验状态,缺少验证时保持未验证。
- 导出合规报告、利润分析、决策表与路线图。
这些是公开仓库记录的实现能力。本文没有提供该版本的生产效果或性能验证结果。
历史方案与演进
早期方案采用父子分块、RRF 混合检索与 NLI 引用验证,并讨论 Must-Check 与 embedding 兜底。以下步骤记录该阶段的设计;当前公开实现以规则知识库和法规原文锚定为主,无 embedding 依赖。
父子分块
父子分块在召回完整性与检索精度之间取平衡。
RRF 混合检索
融合多路检索结果,提升相关来源的召回。
NLI 硬门控
每条结论必须被检索来源支撑,否则不通过。
Must-Check + 兜底
关键项强制核验,embedding 兜底保证鲁棒性。
项目价值
项目沉淀了把法规来源、生成结论与核验状态分别呈现的方法,让使用者能够回查证据,并识别仍需人工核实的内容。
经验教训
方案演进时应同步更新数据来源、引用契约与验证边界,并保留每个版本的真实证据。功能存在、引用存在与结论经过充分核验,需要分别说明。