Jev Gallery

JEV GUIDE

Jev 与生成式 LLM 怎么选?判断、生成与代码的分工

选模型前先确定需要的输出:一个已有选项、一段新文字,还是能精确计算的结果。不同步骤可以使用不同工具;这篇比较关注任务分工,不给未经同条件实测的速度或价格排名。

Jev 的边界:判断,不承担所有任务

TypeSafe 的 jev-1.13 边界文档说明该版本不以生成文本为目标,并建议把数学与日期比较交给代码。它也列出无关上下文、间接提问等容易出错的情况;这里的版本说明不自动代表未来模型。

依据: TypeSafe · Jev 1.13 jaggedness ↗

按输出需求选择执行者

下面是编辑建议的任务拆分。生成模型也可以完成分类;是否引入另一判断模型,应由实际质量、延迟、维护成本与错误代价决定。

按输出需求选择执行者
任务建议分工需要检查
从已知标签中选择判断模型或已验证分类器候选覆盖与拒绝选项
写解释、对话或改写生成式模型事实、文风及用户意图
比较日期、金额或权限代码与规则数据类型、时区及权限来源
执行动作应用工具授权、当前状态及结果

混合架构的例子:生成候选,再评价

Mimicry 让生成模型产生改写,由 Jev 评价风格与原意保留情况,再通过有界循环向用户展示修改。Jev 不负责生成最终文字,也不能保证评价结果正确;用户仍需查看差异并决定是否采用。

依据: Mimicry · pinned source ↗

模拟成功与模型成功要分开

pkg-gate 的已核对实现会在缺少 API 配置或请求报错时回退到模拟判断。测试时必须记录实际使用的模式,否则一次“检查通过”可能根本没有真实模型参与。

依据: pkg-gate · pinned source ↗

怎样做一次公平的 Jev 与 LLM 比较?

编辑建议固定同一输入、标签、正确答案和错误处理要求,分别测试现有实现与候选混合实现。成本应统计完整流程,包含重试、候选生成与人工复核,不只比较单次 API 调用。

报告时写清模型版本、测试日期、样本构成、真实调用与缓存比例,以及错误样例。没有这些记录,就只把方案作为待验证设计;本站未做 Jev 与其他模型的同条件性能评测。

接着看这些项目

继续阅读