持续专题 · 2026年9月20日整理

Jev:从快速判断,到查航班与整理论文

浏览器里下一步点哪里,一千篇论文分到哪一类?从官方能力、独立测试到开发者作品,看 Jev 怎样与聊天模型配合。

Browser Use 作者的航班演示结果:Google Flights 显示苏黎世到伦敦的单程航班选项。
作者演示结果:查到航班,未选票或购买。约 7.1 秒为作者记录的这次任务耗时,并非本站实测。Browser Use · MIT · 原始来源查看大图
按问题阅读7 个章节

01先看用途

一封邮件该交给谁,也能成为 AI 的工作

从一封邮件到下一步处理
  1. 读入材料

    邮件内容+分类标准

  2. 作出判断

    从售后、账单、合作中选择

  3. 继续处理

    软件转交;需要时再生成回复

编辑示意,说明一种分工;并非本站实测返回值。 查看依据

收到一封邮件,先判断它属于售后、账单还是合作,再交给对应的人处理。这类反复出现的小判断,是 Jev 要做的事。TypeSafe AI 在 2026 年 9 月 15 日发布它,称这类专注于快速判断的模型为 System One。

使用时先给它材料和问题,再定义可以返回哪些选项。它能选择类别、按给定刻度评分,或判断一句话成立的可能性;多个问题可以一起处理。结果直接交给软件继续执行,回复邮件的文字则可以由另一个模型生成。

来源与补充

02建立参照

固定规则、Jev 和聊天模型,分别接哪一步

同样是处理邮件,“附件大于 20 MB”可以直接用规则判断;“这封邮件在催进度吗”需要理解语气和上下文;“请写一封得体的回复”需要生成文字。把这三步拆开,就更容易理解 Jev 在整件事里的位置。下表是工作分工示例。

以处理一封邮件为例
这一步要做什么可以怎样处理交付什么
检查附件大小固定规则超过或未超过上限
判断意图与归属Jev;语言模型也能做分类预设选项与概率
起草回复能生成文字的语言模型可以继续修改的文字
来源与补充

Jev 的概率和置信度可帮助软件决定何时继续、何时交给别的处理方式。它们不是单次答案正确的保证;输出符合预设格式,也仍可能选错。

03官方与实测

把速度、费用和接手多少任务放在一起看

官方展示的 193.6 倍速度、444.6 倍成本优势,来自自建的工作流程评估,参照答案取 Astra 与 Fable 的平均预测。它说明特定判断流程的表现,不能直接换成所有任务的快慢排行。

Nexus 另用同一批 469 个案例比较助手的检查步骤。Jev 接手其中 58%,其余交回规则。把回退也算进去,Jev 总共错 90 次,Sonnet 5 错 92 次;这次实验更鲜明的差别在等待与费用。

Nexus 作者实测 · 469 例,未接手时回退规则
方案模型接手比例总错误典型耗时 / 单次费用
仅规则规则处理全部148约 50 ms / $0
Sonnet 5 +规则67%926.3 秒 / $0.0178
Jev +规则58%900.66 秒 / $0.00008
来源与补充

作者实测,本站未复跑。该组主要由 AI 标注;模型阈值调优不对等,LLM 耗时包含启动工具。结果适用于这批检查。

04作品一

查一趟航班:选择按钮与填写文字分开做

作者原速演示,约 8 秒,无音轨。先填出发地与目的地,再显示航班结果;任务计时约 7.1 秒,未进行购票。Browser Use · 作者演示 · MIT单独打开视频

Browser Use 的公开演示从一句要求开始:查找 9 月 20 日苏黎世到伦敦、单程、1 位成人的经济舱航班。Jev 从网页控件清单中选择下一步和目标;需要输入城市时,Mercury 2.5 负责生成文字。最终画面显示匹配航班,没有选票或预订。

作者记录的任务耗时为 7.073 秒,从首次读取首页之后开始计算,包含模型调用、填字与网页加载。视频、测量记录和代码都公开,适合一起看“选哪一步”怎样变成屏幕上的操作。

来源与补充

这是作者的一次公开任务记录,本站未运行付费模型复现。Jev 收到的是网页的文本与控件信息,演示画面不代表它直接读取图片。

05作品二

一千多篇论文:先写摘要,再尝试更快分类

1kpapers 现有论文目录首页,展示研究实验室、主题入口与推荐论文。
作者现有论文目录 · 本站 9 月 20 日截图。Jev 分类实验见作者原帖;此画面不表示在线目录已经全部采用 Jev 标签。Nutlope / BitShovel 截图 · 原始来源查看大图

1kpapers 已经把 1,018 篇论文整理成可以按研究方向、实验室和时间浏览的目录。Hassan 在 9 月 17 日报告了一次 Jev 实验:把论文标题、DeepSeek V4 Flash 摘要和 24 个主题选项交给 Jev,分类总费用为 0.08 美元,每篇延迟中位数 256 毫秒。

摘要与分类是两笔工作:网站原有 1,000 篇摘要实验的 DeepSeek 推理费用为 3.99 美元。9 月 20 日读取的公开分类代码仍采用原有模型流程,因此这里展示的是现有论文目录与新增分类实验,不能据此认定在线标签已经全部换成 Jev。

来源与补充

06入口与费用

可以从哪里试,怎样读当前价格

截至 9 月 20 日,TypeSafe 官方列出的直接 API 价格是每百万输入 token 0.042 美元,输出免费;控制台提供试用入口,访问以账号开放情况为准。同日 Vercel AI Gateway 的 Jev 页面标注输入与输出免费,并注明促销在 9 月 25 日结束。两者是不同入口的价格。

Jev 当前读取文本,图片或音频需要先转成可读材料。官方还说明英文表现最好;面向中文邮件、评论或资料分类时,应先拿自己的样本看看。模型调用便宜,不等于整个应用的摘要、运行和其他模型费用都包含在内。

来源与补充

07接回已有使用

你常用的 AI 助手,可以多一种分工方式

如果你在用 GPT、Opus、Grok 等助手写作、编程或整理材料,理解 Jev 可以从刚才的两个作品开始:写城市名称和选择网页按钮分开,写论文摘要和判断分类分开。改变的是一项工作内部怎样分配任务,不必把新模型的出现都理解为换一个聊天订阅。

Astra 专题里的 Blender 作品展示了模型怎样把描述变成可编辑场景。接着看 Jev,可以多问一个问题:这项工作里,哪些步骤需要创造新内容,哪些只是从已有选择里作判断?这是我们从这些作品得到的使用思路,实际怎样搭配仍取决于应用接入。

来源与补充
接下来还会关注

08继续关注

接下来还会关注

  • 哪些重复判断已经在真实工具里用起来?
  • 同一个任务中,规则、Jev 和语言模型怎样分工更合适?
  • 中文场景、准确率与使用入口还有哪些新结果?