这几天 AI 圈被一个叫 Jev 的东西刷屏了。它和 ChatGPT 不是一个物种——Jev 是 TypeSafe AI 在 2026 年 9 月发布的”判定模型”(System One Model),不聊天、不写文案,你喂材料 + 题目,它只返回结构化答案 + 概率。

我手上正好沉淀了 247 条真实外贸询盘。这篇文章不重复网上的泛教程,而是用这套真实样本作为测试池,带你搭一套可被代码直接消费的外贸询盘自动分拣流水线,并附上我整理的”30 条盲测法”帮你校准置信度。

真实性说明:本文的方法论、API 参数、定价与限制,均来自 TypeSafe 官方文档 与多家媒体实测报道(见文末「数据来源」),已交叉核验。我尚未以作者身份实际调用 Jev 跑完 247 条样本——下文为可照做的方案,建议你跑通后把真实命中率回填到本文或评论区。

什么是 Jev?先给一个准确的定义

主板与芯片特写,象征 Jev 这类 AI 判定模型的底层计算能力

Jev 是 TypeSafe AI 于 2026 年 9 月发布的”判定模型”(System One Model)。它不做文本生成:你传入一份 state(原始材料)和一组带类型的 questions(题目),它并行、隔离地对同一 state 评估每道题,直接返回结构化结果与概率分布,代码可据此分支、排序、路由。 官方原话:No text generation, no parsing。所谓 “zero hallucinations” 指的是输出被锁死在题型 schema 里,而不是说答案一定对。

几个硬参数(来源:TypeSafe 官方文档,2026-09):

  • 输入价:$0.042 / 百万 token(=$42 / 十亿 token),输出免费
  • 延迟:端到端 70–500ms
  • 接入:Waitlist early access,控制台 console.typesafe.ai
  • 模型名:jev-latest(调阈值建议 pin 到具体版本,如 jev-1.13.0,避免 jev-latest 更新后答案漂移)
  • 官方 SDK:Python pip install typesafe-sdk(3.10+)、JavaScript @typesafe-ai/sdk

速度 / 成本基准(来源:BrieflyGlobal / LUMIENAI,均为 TypeSafe 自家 eval,独立基准尚未见):官方称相对 GPT-5.6 Terra 约 193.6x 更快、444.6x 更便宜;演示用例 0.114s / $0.000081 vs 8.566s / $0.013880。数字很猛,但属厂商自测,落地请以你的样本实测为准。

Jev vs ChatGPT vs 规则脚本:别再搞混

下面把三者的能力差异用雷达图直观对比(评分为定性 1–5 分,仅用于可视化)。

一句话总结:关键词能解决的事别换它;需要”写”的事它干不了;卡在”既要懂语义、又要稳定可控”的中间地带,才是 Jev 的主场。

外贸人为什么该盯 Jev:3 个高频”判定”场景

外贸业务员在笔记本前处理客户询盘邮件

  1. 询盘分类(Choice):产品咨询 / 价格索取 / 样品请求 / 投诉 / 垃圾,一键打标(Choice 支持最多 255 个选项)。
  2. 紧急度判定(Noul):这封要不要现在回?返回 0~1 概率。
  3. 购买意向评分(Score):按有序等级给意向打分,给销售排优先级。

这三类恰好是外贸日常里”答案集合事先想得清、但人工做又累又慢”的典型。

上手:从 Waitlist 到第一次跑通

  1. 打开 typesafe.ai 加入 Waitlist,申请时写清具体用途更容易过。
  2. 登录 console.typesafe.ai,文档在 docs.typesafe.ai。
  3. Playground 里贴 State、写 Questions、点 Run 即可看到结果。
  4. 接 API,下面是一份可直接改的外贸用例骨架(也可改用官方 SDK):
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
{
"model": "jev-latest",
"state": "客户原邮件:We need 5000 pcs of custom metal brackets, EXW price please, urgent for Q4 launch.",
"questions": {
"is_urgent": { "type": "Noul", "question": "Is this inquiry time-sensitive?" },
"category": {
"type": "Choice",
"question": "Which category?",
"options": ["product", "pricing", "sample", "complaint", "spam"]
},
"intent_score": {
"type": "Score",
"question": "Purchase intent level?",
"criteria": ["just browsing", "researching", "comparing", "ready to buy", "urgent buy"]
}
}
}

注:部分教程用大写 Noul/Choice/Score,但官方原始 HTTP 示例用全小写 noul/choice/score;字段大小写以 API 文档(Primitives) 为准。

下面是一段示意返回(字段结构来自官方文档,answers 下每个题返回类型化结果与 confidence;数值为示例,非真实跑通):

1
2
3
4
5
6
7
8
9
10
11
{
"answers": {
"is_urgent": { "noul": 0.91, "confidence": 0.88 },
"category": {
"choice": "pricing",
"probabilities": { "product": 0.04, "pricing": 0.82, "sample": 0.06, "complaint": 0.02, "spam": 0.06 },
"confidence": 0.80
},
"intent_score": { "score": 4, "confidence": 0.77 }
}
}

返回里 answers 会按上面每个键名给”选中项 + 概率”。把 Key 放环境变量 TYPESAFE_API_KEY,请求头带 Authorization: Bearer $KEY,POST 到 https://api.typesafe.ai/v1/systemone 即可(详见 API 文档)。

置信度校准:别第一天就自动退款

笔记电脑屏幕上展示的网站分析仪表盘,用于类比 Jev 置信度校准与数据分流

confidence 来自概率分布的形状,不只是赢家概率。官方示例:billing 以 0.84 胜出,但 confidence 仅 0.596,因为 technical 还占 0.159——这就是”看着像,但其实没那么笃定”。路由建议(来源:Confidence 文档):

  • 高 confidence:可自动执行(如归类、打标签)
  • 中:交大模型或直接人工
  • 低:转人工

阈值要按”答错的成本”来定,不要拍脑袋。我的 30 条盲测法:取 30 条历史询盘,人工先标答案,再让 Jev 跑,画表对比(原始文本 / 人工标 / Jev 选 / confidence),切高、低两刀看错误率。前 1–2 周不要拿低置信度动作直接碰钱(自动退款、自动发合同)。

落地到你的独立站:双轨并行一周

两位开发者在办公桌前编写自动化工作流代码

别新搭中台。从你已有的”if 判断”下手:旧规则 + Jev 并行跑一周,两边都记日志,对比 Jev 高把握部分是否和人工一致,再把高把握段切过去。这样出问题能立刻回滚。

成本与限制(来自官方”jaggedness”页,实话实说)

繁忙的集装箱港口航拍,象征外贸物流场景

  • 便宜:输入 $0.042/百万 token,对询盘文本体量是”几乎免费”。
  • 只吃文本:图片 / 语音先转文字。
  • 真实限制(来源:TypeSafe jaggedness 文档):
    1. 字面理解:否定词、范围词、隐含条件都按字面答,写错题它照字面来。
    2. 不会算数:计数不可靠,计数放代码里,每项是 Noul。
    3. 日期是文本:先后 / 区间不可靠,用 Choice 枚举再在代码里排序。
    4. context rot:state 塞无关材料越多越准下降 → 先在代码里过滤,只传相关字段。
    5. state 非敌对输入:把用户可控内容放进 state 有注入风险,要测。
    6. 不生成任何东西:要抽自由文本,先 regex / 生成模型取候选,再让 Jev 选。

结语

Jev 不是来抢谁的饭碗,它是把你从”重复分拣”里解放出来的零件。用你手上的 247 条真实询盘作测试池,照上面的方案跑通,先把高把握部分自动化,每天省下的时间够多回 20 封真正高意向的邮件。

如果你也在用 AI 跑外贸独立站,欢迎看我的 AI 写外贸 B2B 文章高效工作流(相关阅读),以及 用 GenAI 构建持续流量的内容引擎——判定模型只是其中一环,真正的增长来自”内容 + 自动化”的组合。也欢迎在评论区告诉我:你最想让 Jev 帮你分拣什么?


数据来源(GEO 可溯源引用)

常见问题(FAQ)

Jev 能替代 ChatGPT 吗?
不能。Jev 只做判定,不生成内容。二者是互补关系(Jev 做快决策层,LLM 做复杂生成),不是替代。
用 Jev 一定要写代码吗?
第一天不用。Playground 网页就能跑通;要自动化再接 API 或官方 SDK。
中文询盘能用吗?
能,但英文更稳。官方未承诺中文 parity,中文务必用你的真实样本抽测后再上生产。
Jev 能直接看图吗?
不能,先转文字再喂进 State。
confidence 0.9 就能自动处理客户退款吗?
第一周不要。先校准,阈值按『答错成本』定——退款答错成本高,阈值要拉更高。
Key 放哪安全?
只放服务器环境变量,别进前端、别进代码仓库。
和规则脚本比,Jev 强在哪?
规则脚本靠关键词,遇到『语气犹豫但意向高』的邮件就失灵;Jev 懂语义且输出可控、带概率。但关键词能解决的事不必换它。