外贸询盘太多?用 Jev 帮你自动分类

这几天 AI 圈被一个叫 Jev 的东西刷屏了。它和 ChatGPT 不是一个物种——Jev 是 TypeSafe AI 在 2026 年 9 月发布的”判定模型”(System One Model),不聊天、不写文案,你喂材料 + 题目,它只返回结构化答案 + 概率。
我手上正好沉淀了 247 条真实外贸询盘。这篇文章不重复网上的泛教程,而是用这套真实样本作为测试池,带你搭一套可被代码直接消费的外贸询盘自动分拣流水线,并附上我整理的”30 条盲测法”帮你校准置信度。
真实性说明:本文的方法论、API 参数、定价与限制,均来自 TypeSafe 官方文档 与多家媒体实测报道(见文末「数据来源」),已交叉核验。我尚未以作者身份实际调用 Jev 跑完 247 条样本——下文为可照做的方案,建议你跑通后把真实命中率回填到本文或评论区。
什么是 Jev?先给一个准确的定义
Jev 是 TypeSafe AI 于 2026 年 9 月发布的”判定模型”(System One Model)。它不做文本生成:你传入一份 state(原始材料)和一组带类型的 questions(题目),它并行、隔离地对同一 state 评估每道题,直接返回结构化结果与概率分布,代码可据此分支、排序、路由。 官方原话:No text generation, no parsing。所谓 “zero hallucinations” 指的是输出被锁死在题型 schema 里,而不是说答案一定对。
几个硬参数(来源:TypeSafe 官方文档,2026-09):
- 输入价:$0.042 / 百万 token(=$42 / 十亿 token),输出免费
- 延迟:端到端 70–500ms
- 接入:Waitlist early access,控制台 console.typesafe.ai
- 模型名:
jev-latest(调阈值建议 pin 到具体版本,如jev-1.13.0,避免jev-latest更新后答案漂移) - 官方 SDK:Python
pip install typesafe-sdk(3.10+)、JavaScript@typesafe-ai/sdk
速度 / 成本基准(来源:BrieflyGlobal / LUMIENAI,均为 TypeSafe 自家 eval,独立基准尚未见):官方称相对 GPT-5.6 Terra 约 193.6x 更快、444.6x 更便宜;演示用例 0.114s / $0.000081 vs 8.566s / $0.013880。数字很猛,但属厂商自测,落地请以你的样本实测为准。
Jev vs ChatGPT vs 规则脚本:别再搞混
下面把三者的能力差异用雷达图直观对比(评分为定性 1–5 分,仅用于可视化)。
一句话总结:关键词能解决的事别换它;需要”写”的事它干不了;卡在”既要懂语义、又要稳定可控”的中间地带,才是 Jev 的主场。
外贸人为什么该盯 Jev:3 个高频”判定”场景
- 询盘分类(Choice):产品咨询 / 价格索取 / 样品请求 / 投诉 / 垃圾,一键打标(Choice 支持最多 255 个选项)。
- 紧急度判定(Noul):这封要不要现在回?返回 0~1 概率。
- 购买意向评分(Score):按有序等级给意向打分,给销售排优先级。
这三类恰好是外贸日常里”答案集合事先想得清、但人工做又累又慢”的典型。
上手:从 Waitlist 到第一次跑通
- 打开 typesafe.ai 加入 Waitlist,申请时写清具体用途更容易过。
- 登录 console.typesafe.ai,文档在 docs.typesafe.ai。
- Playground 里贴 State、写 Questions、点 Run 即可看到结果。
- 接 API,下面是一份可直接改的外贸用例骨架(也可改用官方 SDK):
1 | { |
注:部分教程用大写
Noul/Choice/Score,但官方原始 HTTP 示例用全小写noul/choice/score;字段大小写以 API 文档(Primitives) 为准。
下面是一段示意返回(字段结构来自官方文档,answers 下每个题返回类型化结果与 confidence;数值为示例,非真实跑通):
1 | { |
返回里 answers 会按上面每个键名给”选中项 + 概率”。把 Key 放环境变量 TYPESAFE_API_KEY,请求头带 Authorization: Bearer $KEY,POST 到 https://api.typesafe.ai/v1/systemone 即可(详见 API 文档)。
置信度校准:别第一天就自动退款
confidence 来自概率分布的形状,不只是赢家概率。官方示例:billing 以 0.84 胜出,但 confidence 仅 0.596,因为 technical 还占 0.159——这就是”看着像,但其实没那么笃定”。路由建议(来源:Confidence 文档):
- 高 confidence:可自动执行(如归类、打标签)
- 中:交大模型或直接人工
- 低:转人工
阈值要按”答错的成本”来定,不要拍脑袋。我的 30 条盲测法:取 30 条历史询盘,人工先标答案,再让 Jev 跑,画表对比(原始文本 / 人工标 / Jev 选 / confidence),切高、低两刀看错误率。前 1–2 周不要拿低置信度动作直接碰钱(自动退款、自动发合同)。
落地到你的独立站:双轨并行一周
别新搭中台。从你已有的”if 判断”下手:旧规则 + Jev 并行跑一周,两边都记日志,对比 Jev 高把握部分是否和人工一致,再把高把握段切过去。这样出问题能立刻回滚。
成本与限制(来自官方”jaggedness”页,实话实说)
- 便宜:输入 $0.042/百万 token,对询盘文本体量是”几乎免费”。
- 只吃文本:图片 / 语音先转文字。
- 真实限制(来源:TypeSafe jaggedness 文档):
- 字面理解:否定词、范围词、隐含条件都按字面答,写错题它照字面来。
- 不会算数:计数不可靠,计数放代码里,每项是 Noul。
- 日期是文本:先后 / 区间不可靠,用 Choice 枚举再在代码里排序。
- context rot:state 塞无关材料越多越准下降 → 先在代码里过滤,只传相关字段。
- state 非敌对输入:把用户可控内容放进 state 有注入风险,要测。
- 不生成任何东西:要抽自由文本,先 regex / 生成模型取候选,再让 Jev 选。
结语
Jev 不是来抢谁的饭碗,它是把你从”重复分拣”里解放出来的零件。用你手上的 247 条真实询盘作测试池,照上面的方案跑通,先把高把握部分自动化,每天省下的时间够多回 20 封真正高意向的邮件。
如果你也在用 AI 跑外贸独立站,欢迎看我的 AI 写外贸 B2B 文章高效工作流(相关阅读),以及 用 GenAI 构建持续流量的内容引擎——判定模型只是其中一环,真正的增长来自”内容 + 自动化”的组合。也欢迎在评论区告诉我:你最想让 Jev 帮你分拣什么?
数据来源(GEO 可溯源引用)
- TypeSafe AI 官网:https://typesafe.ai/
- 官方文档 Introduction:https://docs.typesafe.ai/introduction
- 官方文档 Confidence:https://docs.typesafe.ai/confidence
- 官方文档 Patterns / 限制:https://docs.typesafe.ai/patterns
- BrieflyGlobal 报道(定价与基准):https://brieflyglobal.com/ai/typesafe-ai-releases-jev-typed-decision-model
- DataCamp 报道(对比与限制):https://datacamp.com/blog/system-one-models-jev
- LUMIENAI 报道(早期用例):https://lumienai.com/news/typesafe-ai-jev-system-one-model-typed-decisions



















