jlink
按自然语言匹配规则关联两张数据表
实现思路与验证边界 →JEV GUIDE
两张表使用不同名称描述同一对象时,简单字符串相似度可能不够。jlink 允许把“什么才算同一个实体”写成规则,再对候选记录对调用 Jev。本文重点解释候选召回、判定与最终关联各自负责什么。
企业母子公司是否视为同一企业?同一软件不同版本是否合并?这些是数据集的业务定义,不应由模型临时猜测。对于唯一编号一致、规范化名称完全相同的记录,先考虑确定性连接;模型更适合留给有语义歧义的候选。
该指南讨论实体匹配与跨表关联,不是让 Jev 生成 SQL 或随意补齐未知的企业关系。只提供名称时,不能要求模型验证当前股权事实。
本地 blocking 先选出候选记录对;判定阶段把选定字段和匹配规则交给 Jev;随后程序按阈值、候选间差距和一对一或多对多约束决定关联。最后抽样检查结果。
固定版本实现会对部分规范化后完全相同的字段直接接受,跳过模型调用。没有进入候选集合的真实匹配,后面的 Jev 判定无法找回来。
以下是编辑设计的合成样本,不是模型测试结果。假设任务要求母子公司分开、同一公司仅变更法律形式可匹配;先把这两条写入规则,再检查候选生成是否覆盖这些情况。
| 记录 A / 记录 B | 人工预期 | 需要的判断或资料 |
|---|---|---|
| Northstar Labs Inc. / NORTHSTAR LABS, INC | 倾向相同 | 先试规范化精确匹配 |
| Northstar Labs / Northstar Labs Europe 子公司 | 按当前规则分开 | 实体边界 |
| Northstar Labs Inc. / Northstar Labs LLC | 需核对是否只是形式变更 | 名称不足时保留不确定 |
| Northstar Labs / NSL | 待核对 | 缩写候选与额外字段 |
| Northstar Labs / Northstar Logistics | 不能仅凭共同单词合并 | 近似但不同的负例 |
先在本地估算候选规模,再决定允许发送的字段与调用预算。源码支持记录结果并重新应用关联阈值;调整已有分数的接受策略,与修改语义规则重新判定,是两种不同操作。
分别检查候选生成和最终关联。只审核被提交给模型的记录对,无法看到 blocking 漏掉的匹配。先用一小份人工确定的真实关联,确认正确对象有没有进入候选,再审查已判定分数区间。
用不同阈值比较误合并、漏匹配和人工复核工作量。还应抽查同分或接近分数的竞争候选;最高分并不自动意味着一对一分配中的正确对象。概率值需按数据集检验,不能直接当作已校准的正确率。
能在本地离线完成吗?候选生成和部分精确匹配是本地步骤,真实 Jev 判定会把 on 中选定字段发给外部服务。先确认这些字段可用于该服务。
更改阈值一定要重新调用 Jev 吗?只重新筛选已保存分数通常不需要;改变输入、实体定义或模型则需要重新评估。
本文不复用作者速度、费用或 F1 作为本站结论。本站已核对实现,未运行模型或基准数据集。
按自然语言匹配规则关联两张数据表
实现思路与验证边界 →02 / JEV GUIDE
用一个合成故障报告了解 Jev API 请求,查看 state、questions、Bearer 鉴权和响应检查步骤,附可下载 JSON 示例。
阅读指南 →06 / JEV GUIDE
用 Jev Choice 设计文本分类和任务路由,明确候选标签、未知类别与人工检查,连接模型路由和语义筛选案例。
阅读指南 →07 / JEV GUIDE
把 Jev 接在召回之后:定义相关性问题、保留候选来源、区分网页摘要与全文,并用标注查询检查排序是否改善。
阅读指南 →