TECHNICAL REVIEW · 2026-09-24

TypeSafe Jev 技术综述

System One 模型——不生成文本的决策引擎

发布日期 2026-09-24 Jev 发布后第 9 天 事实源:content-brief.md

在分类与路由这类窄任务上,Jev 声称以中端 LLM 级别的准确率(67.8%)换取约两个数量级的成本与延迟优势;第三方实测方向一致,但幅度远小于宣传。

证据标签说明:正文关键论断后标注 官方 = TypeSafe 官方博客/文档披露或声称(未独立复现);实测 = 第三方媒体/社区/研究者独立测试;观点 = 评论或推测。本报告所有数字均来自统一内容底稿,未添加底稿之外的技术细节。

01核心结论

  1. Jev 真实存在,但不是传统 LLM。旧金山初创公司 TypeSafe AI 于 2026-09-15 发布,输入「程序状态 + 预定义类型化问题」,一次并行前向返回带校准概率的结构化决策,不生成文本。官方
  2. 核心卖点是「Decisions, not strings」。官方声称在相近准确率下拿下约 1/100 的成本与延迟;第三方实测速度 0.5–12×、成本 0.6–478× 不等,取决于对比对象,量级远没有 200×。官方实测
  3. 技术上是黑箱。架构、参数量、训练数据规模全部未披露,无学术论文,仅公开三件套概念:新架构 + 并行采样器 + RLCD,训练数据全部为合成数据。官方
  4. 生态爆发式接入。发布 9 天内 HN 主帖 1977 分,Vercel AI Gateway 24 小时内 13% 付费团队接入;开源社区 4 天内出现数十个复现项目,中国 APUS 基于 Qwen3.5-9B 实现 79ms 本地决策。实测
  5. 争议焦点明确。「新品类」与「分类器重新包装」之争(创始人本人对 HN「zero-shot classifier」回复「exactly right!」);「零幻觉」仅指 schema 构造保证,而非判断正确。实测
  6. 行业影响指向「多层模型栈」。复杂规划给推理 LLM、高频分类/路由给决策模型、确定性逻辑给代码——这一共识正在形成,但 TypeSafe 的护城河仍待观察。观点

02名称消歧

「TypeSafe」「s1」在 AI 圈有多个含义,先做一次澄清,避免张冠李戴。

易混淆对象说明
本报告的 TypeSafe AI旧金山 AI 初创公司,官网 typesafe.ai,2024 年成立,创始人 Diogo Almeida,即 Jev 背后的公司。
原 Scala 生态公司 TypeSafeAkka / Play Framework 背后公司,已改名 Lightbend,与本公司无任何关联。
斯坦福 s1 模型2025 年开源推理模型「Simple test-time scaling」(arXiv:2501.19393),与 Jev 无关,仅缩写相近。

03公司背景与发布时间线

团队与融资

公司 2024 年于旧金山成立,隐身约两年。三位创始人:CEO Diogo Almeida(前 OpenAI 研究员,可独立核实为 InstructGPT 论文第四作者;公司宣传「co-inventor of RLHF」被考证为夸大,因 RLHF 技术早于该论文)观点;CTO Erik Gafni(Ravel Biotechnology 联创,生物医药多模态方向);COO Sasha Sheng(前 Meta AI / FAIR 研究工程师)。公司口号「Build Prod, Not God」。官方

2026-09-15 与模型发布同日官宣种子轮 4000 万美元,由 DCVC 领投;Forbes 援引知情人士称估值约 2 亿美元(媒体报道,非官方确认)。官方实测

发布时间线

2024

公司成立

旧金山成立,进入约两年隐身研发期。

09-10

预热

官方博客《The Bitterest Lesson》;次日发文宣布不做公开 benchmark。

09-15

正式发布 + 融资

《Introducing System One Models & Jev》博客与 4000 万美元种子轮通稿同日发布;Jev 进入 early access 等待名单。

09-18

Vercel / OpenRouter 接入

Vercel AI Gateway 上线;OpenRouter 上架 typesafe/jev-1.13;API 一度被流量打挂。

09-19

APUS 开源复现

中国 APUS 公布 fast-browser-use(MIT,基于 Qwen3.5-9B),RTX PRO 6000 上单次决策 79ms。

09-20

全面开放

深夜取消等待名单,注册送 5 美元免费额度(约合 1.2 亿输入 token);发布后 36 小时放出约 14 万人。

09-21

生态扩展

Cloudflare / Langfuse 集成;LangSmith Evals 上线 Jev judge;提示 prompt injection 风险。

等待名单消化约 14 万人(Almeida 对 VentureBeat);HN 主帖 1977 分 / 513 评论;Almeida 发布帖当天约 420 万次浏览、近 2 万点赞。实测

04产品定位与「System One」概念

「System One」借用 Daniel Kahneman《思考,快与慢》中系统一(快速、直觉)与系统二(缓慢、审慎)的划分,Jev 定位为系统一式快速决策模型——公司也承认系统一传统上意味着易错。「Jev」这个名字致敬 19 世纪经济学家 William Stanley Jevons(杰文斯悖论:效率提升、成本下降反而推高总需求),公司期望「智能成本每降一个数量级,就解锁数量级更多用例」。官方

官方一句话定义:「a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out」,即「智能 if 语句」。它明确不做:不写回复、不写代码、不输出推理过程;当前仅支持文本输入。官方 FAQ 明确「Jev is neither small nor an LLM」。官方

与传统 LLM 的本质区别

维度传统 LLMJev(System One)
输出字符串,逐 token 自回归生成类型安全的结构化值 + 校准概率
采样顺序,每个 token 依赖前一个并行,一次前向对所有位置同时打分
后处理需 parse + validate,有跑偏风险schema 预定义,构造性保证类型正确
训练目标人类偏好(RLHF)/ 可验证奖励(RLVR)校准决策(RLCD)
典型用途聊天、写作、代码生成、推理分类、路由、打分、审核、验证

05技术架构与设计要点

TypeSafe 声称构建了「entirely new stack」,含三部分:新模型架构、并行采样器(parallel sampler)、RLCD 训练法。但参数量、层数、注意力机制、隐藏维度、训练算力、权重全部未披露,无学术论文(arXiv 搜「Reinforcement Learning for Calibrated Decisions」无结果),模型封闭托管、不开源、不支持微调。官方

Jev(System One,并行路径) state + questions 类型化 schema 并行采样器 一次前向 · 所有位置同时打分 概率头 直接读分布,不 commit typed decisions + 校准概率 虚线框:内部实现官方未披露(示意) 传统 LLM(自回归路径) prompt 文本 自由格式 自回归逐 token 串行 · t 依赖 t-1 parse / validate JSON 校验 · 可能跑偏 string 长文本 · 成本随长度涨 单次请求内多个问题并行、彼此隔离地对同一 state 求值;官方称「加问题几乎不增加响应时间」 实测:GDPR 全文 13 问合并调用 vs 逐题调用 = 12.2× 成本差 + 10× 时间差 【官方】
图 1 · Jev 并行决策路径 vs LLM 自回归路径(示意,内部结构官方未披露)

已知失败模式(官方 jaggedness 页自陈,jev-1.13)

照字面理解否定、隐含条件按字面取,不答「以为」的问题。
不会数数 / 算术计数、四则运算、hex 颜色、Score 档位间插值不可靠——算术留给代码。
日期是文本不是量先后、窗口判断不可靠——拆成 Choice 后在代码里比较。
多跳问题损精度双重否定、属性的属性属系统二任务,应拆成直接问题。
上下文腐烂大而嘈杂的 state 中无关内容越多精度越降——先在代码里过滤。
对抗文本可挪动答案state 当数据不当敌意输入,注入指令可改变结果。
不生成文本把 choice 链成文本既慢又差。

第三方推测(非事实):社区猜测其为「BERT 式 encoder + 现代 LLM 数据/算力配方」;工程师 Sean Goedecke 认为约束解码 + 受限 logit 切片用 1.5B 小模型即可拿到类似 2–3× 加速,「未必有护城河」。观点

06训练方法:RLCD

RLCD = Reinforcement Learning for Calibrated Decisions(校准决策强化学习),是 TypeSafe 自造的训练方法名。优化目标不是人类偏好,也不是程序可验证奖励,而是「认知上诚实的概率」——在系统一任务上报出的概率要准。官方

方法优化对象产物
RLHF人类评分者偏爱的写稿 / 聊天回复聊天模型、过度自信、mode dropping
RLVR程序可验证的输出(数学证明等)可自动校验的结果
RLCD系统一任务上带诚实概率的校准决策类型化决策 + 校准置信度

校准(calibration)的含义:概率针对结果优化、反映不确定性;校准是在一组预测上统计衡量的——说 0.9 的那一批长期约 90% 正确,不保证某一条具体答案正确。官方对比示例:LLM 自报 0.9 置信度的批次实际正确率约 63%,经过校准的报 0.9 批次实际约 89%。官方

关键缺口:TrueFoundry 指出「校准」是整个发布里最需要外部独立检验、而目前尚无任何第三方系统测过的论断。官方未发布 calibration error、reliability diagram、Brier score 或 log loss。创始人 Almeida 是 InstructGPT 联合作者,RLCD 可视为其把 RLHF 经验迁移到「决策校准」新目标。实测

07API 设计与原语

官方直连端点 POST https://api.typesafe.ai/v1/systemone(非 OpenAI 兼容);OpenRouter 另提供 Decisions API 与 System One API 两个面。请求 body 携带 state(字符串 / JSON 对象 / 文本数组)+ model(jev-latest,当前权重 jev-1.13.0)+ questions map。官方

三种原语(共 3 种,无独立 Boolean)

原语回答什么返回内容
Choice从一组选项里选一个choice 选中项 + 每个选项的 probabilities + confidence;上限 255 选项
Score沿有序量表打分(2–10 级)概率加权位置的 score(可落在两档之间)+ 各档概率 + confidence
Noul一个条件是否成立(是非题)一个 0–1 的概率 noul(yes 的概率,非纯 true/false)

响应示例

{
  "department": {
    "type": "choice", "choice": "technical",
    "probabilities": {"technical": 0.87, "billing": 0.09, "sales": 0.04},
    "confidence": 0.81
  },
  "is_urgent": { "type": "noul", "noul": 0.994 }
}

每次响应带 usage.cost 字段显示本次美元成本。

规格约束

SDKPython(pip install typesafe-sdk,需 3.10+)、JavaScript(@typesafe-ai/sdk);另有 MIT 开源 system-one-adapter 用 OpenAI/Anthropic 结构化输出模拟同接口。
上下文长度官方称每请求上限 64k tokens(state + 最长问题占 32k);OpenRouter 模型页标注 Context = 32K,存在口径出入,接入前以官方最新文档为准。
速率限制250k tokens/s + 1200 请求/分钟(截至 9/20 口径)。
微调不支持,所有账户共享同一套权重。
模态纯文本,不支持图像 / 音频 / 视频。

08性能与定价

官方声称端到端延迟 70ms–500ms、速度提升 40×–200×、成本降低 100×–400×;首页「193.6× faster / 444.6× cheaper」来自官方 workflow evals,官方自认是「现实收益上限」。并排 demo(Jev 0.114s/$0.000081 vs GPT-5.6 Terra 8.566s/$0.013880)官方自承「高度简化」。官方

图 2 · 对数轴;条带宽度代表官方 / 第三方给出的区间范围,非点估计
数据来源:TypeSafe 官方首页与 workflow evals(2026-09-15,自设 harness)为「官方声称」区间;第三方区间综合 xbill 八天审计、OpenRouter 线上监控、Every.to、Browser Use 等独立观测(2026-09-18 至 09-24)。共识方向为「确实快、确实便宜」,但量级远小于 200×。

OpenRouter 线上延迟分布

数据来源:OpenRouter 线上真实流量监控(2026-09-18 起),P50 ≈ 0.24–0.25s、P99 ≈ 0.93–0.95s,可用性 99.8%。xbill 另测服务端本身约 105ms(扣网络约 76ms)。实测

第三方独立观测(给官方数字打折)

来源实测结果
Every.to777 次判断 <0.7s、成本约 1/4 美分;逐段判断中位 0.35s vs 对照 8.83s;植入 7 处缺陷检出 6 处。
Browser Use浏览器 agent 任务中位 9.45s → 7.07s,浏览器协议调用 1092 次 → 101 次。
Vercel CEO 转述命令安全分类比 GPT-5.6 Luna 在 p95 快最多 18× 且更准。
xbill 八天审计速度 0.5×(比本地 Gemma 慢)到 12.1× 快;成本 0.6×(更贵)到 478× 便宜。
反例:backnotprop德州扑克 150 个决策点吻合率 63%;有争议的 55 个点位仅 38%。

定价

输入$0.042 / 百万 token($42 / 十亿)。
输出免费("too cheap to meter",输出为结构化决策而非长文本)。
对比约为 GPT-5.6 Terra($2.00/M 输入 + $12.00/M 输出)输入价的 1/48。
免费额度全面开放后注册送 5 美元(约合 1.2 亿输入 token)。
官方自陈无法证明定价未被补贴,预期价格「会降不会涨」。

09评测结果与横向对比

TypeSafe 明确不跑公开基准(认为会被「benchmaxxed」),自建 4 个 production-style workflow(安全事件响应、Agent trace 可观测性、发票处理、客服)。无人工 ground truth——参考答案由 GPT-6 Astra + Claude Fable 5.1(均 high thinking)回答后取平均;LLM 侧统一通过其开源 system-one-adapter 跑。官方

图 3 · 纵轴从 50% 起(非零起点),仅为放大模型间差异阅读;Jev 为强调色高亮,其余为灰色系
数据来源:TypeSafe 官方 Workflow Evals,2026-09-15,4 个 workflow 平均准确率,自设 harness、自写 workflow、参考答案来自两家前沿模型取平均。Jev 并非最准(比 GPT-5.6 Sol / Claude Opus 5 低约 5–6 个点),官方主张是在相近准确率下拿下成本 / 延迟 Pareto 前沿约两个数量级。
模型平均准确率每 case 成本每 case 耗时
Jev67.8%$0.00040.4s
GPT-5.6 Sol74.1%$0.083623.3s
Claude Opus 573.1%$0.176137.8s
GPT-5.6 Terra67.9%$0.030410.1s
Claude Sonnet 567.8%$0.117478.1s
GPT-5.6 Luna66.8%$0.003312.9s
DeepSeek V4-Pro65.5%$0.041386.5s
DeepSeek V4-Flash64.4%$0.005951.9s
Claude Haiku 4.553.6%$0.019512.5s

第三方审计要点

xbill 八天系统审计(Google Developer Expert,审计 14 篇 arXiv、104 个 GitHub 仓库、33 篇 dev.to/Medium 文章):444.6× 只在「Jev vs Opus 5 的 workflow 配置」下成立,8 个配置平均后约 97.8× 更快、149.2× 更便宜,计时来自团队美西笔记本、未公开 case 数 / 方差。准确率上 Jev 与中端 LLM 同档、落后前沿 6.5–11.5 个点(如 Janardhan 200 项 6 模型对比中 Jev 72.5%,低于 Claude Fable 5.1 的 84.0%)。实测

校准度:英文熟悉域开箱即用最好(Bespoke Labs 13 子集中位 ECE 0.071),但跨域后双向出错——公开多分类集上过度自信(GoEmotions 上 0.80–0.95 置信度档仅 15% 命中),事故叙事上欠自信;50–几百条标签拟合 temperature 后 15 个 LLM 反超。稳健性弱点:选项名调换导致 32.5% 答案翻转(n=1200);俄语 XNLI 从 88.3% 掉到 77.3%。实测

与专用分类模型 / 小模型对比

垃圾邮件Jev 98.33%(18,514 封),与 TF-IDF 逻辑回归 98.39% 持平。
日文新闻主题310M 日文 encoder 用 200 行数据训练后反超 Jev 12 个点(88.8% vs 76.8%)。
钓鱼邮件Luce(Qwen3-4B+LoRA,1000 条标签)97.4% vs Jev 62.6%;但两行正则 91.6%、五个窄 Jev 问题 + 逻辑回归组合 95.0%。

结论:有领域标签时,微调小模型 / 传统分类器普遍能打赢 Jev;Jev 的价值是零样本、免标注、开箱即用。实测

10开源复现生态

发布后 4 天内出现数十个复现项目,绝大多数是「用现有 LLM / encoder 的 logprob 读取 + 外层 prompt 工程」,而非训练新模型;微调路线需要几百到几千条标签。技术路线分三类:实测

路线做法代表项目
Prompt-Logprob
(不训练)
拼 prompt,一次 prefill,读选项 token logits 做 softmaxikermoel/open-alternative-jev(so1)、ekzhang/openjev-sglang、bnsd55/openjev;Qwen3.6-27B 上 RACE-H 92.9%
小模型 + 评分头
(微调)
小 encoder + LoRA / 全参微调,加评分头system-one-gemma(Gemma 3 270M,~50ms,64.4%)、openJev-verdict-2.0(ModernBERT 151M,77%,WebGPU)、decider-2b
离散扩散模型扩散模型只读 logits、不 commit tokenDevQuasar 的 OpenJev(DiffusionGemma-26B MoE,94ms/请求,64 并发 57 req/s);vLLM PR #57250

APUS 案例(中国团队,麒麟合盛)

9/19 公布,封装为 Agent Skill fast-browser-use(MIT,跨 macOS/Linux/Windows,无 GPU 也能跑)。做法是黑盒反推:基于 Qwen3.5 系列 / Google Gemma,模型本身不改,只在外层把网页可交互元素列成候选项让模型直接选择,自研 KV Cache 广播。效果:维基百科检索约 18 秒,RTX PRO 6000 上单次决策 79ms,对标 Jev 官方 70–500ms。自研小模型(9B/4B)已开源为 APUS-OpenJev-v1,称「初步看已超过 Jev」。负责人张旭博士判断「目前公开出来的部分没有什么特别神秘的地方」,但承认黑箱里可能还有未公开的东西。实测

11生态集成

集成方时间说明
Vercel AI Gateway09-18上线 24 小时内近 13% 付费团队使用,AI Gateway 历史最快 adoption(约 GPT-5.6 家族 2 倍)。
OpenRouter09-18模型 ID typesafe/jev-1.13,走专用 Decisions API。
LangChain09-17博客《Building a Harness with Jev》;09-21 起可作为 LangSmith Evals judge。
Cloudflare09-21VentureBeat 报道集成。
Langfuse09-21可观测性集成。
Pydantic AI—官方文档提供 Jev 集成指南,并警告 guardrail 应与确定性检查并存而非替代。
browser-use—jev-ultrafast 项目,Jev 做浏览器 agent 动作判断层。
Ably—Pong 演示:Jev 12 秒 47 次操作决策,对比 Gemini / Claude / GPT 仅 2–3 次。

12应用场景

适合

  • Agent 循环内高频微决策:工具选择、routing、任务终止、失败重试、结果排序
  • 内容审核 / guardrail / jailbreak 检测(成本延迟是硬约束)
  • 客服工单分类、分诊、退款风险评分、A/B 分流
  • 大规模 map-reduce 标注:5000 万行评论打标签约 $20;10 万 X 帖分析 $0.67 / 20.4s
  • 实时回路:约 10 次/秒玩 Doom(约 $7/小时)、浏览器操作
  • 模型路由:简单问题给小模型、复杂问题升级大模型

不适合

  • 写代码、写邮件、写总结、聊天、需要书面解释的场景
  • 需要多步推理 / 查资料 / 前因后果的复杂问题
  • 受监管审计场景单独使用(无 rationale)
  • 非英文 / 小语种大规模生产(有退化)
  • 答案不在输入中、需要外部知识的题(无 unknown 选项时会「自信地错」)
  • 炒股 / 金融交易(张旭明确:快不代表炒股水平高)

13局限、风险与争议

能力边界

仅文本输入、无多模态;不生成文本、不写代码、不给推理过程;Choice 上限 255 选项,更高基数走两阶段会变慢;算术 / 计数 / 日期比较 / 多跳推理弱;大而嘈杂 state 导致精度下降;非英文退化(俄语 XNLI −11 个点、西班牙语 −3~6 点、日语新闻落后开源 encoder 11.6 个点),中文场景下概率校准本身会退化。官方实测

安全风险

Prompt injection 脆弱:state 不被当敌对内容,外部注入指令可移动答案——Octomind 实测给 rm -rf ~/.ssh 加「用户已预批准」字段,拦截概率从 0.76 降到 0.48。选项顺序 / 措辞敏感:调换选项描述可翻转约 1/3 答案(xbill,n=1200)。别名漂移:jev-latest 答案可能在无改动下变化,上线应钉死版本号。实测

「不会幻觉」的真实含义

这只是结构性保证:输出永不越出预定义选项分布(不编造字段 / 选项 / JSON),0% 类型错误是构造保证、非实测统计。它仍可能高置信度地选错合法选项——官方 workflow 上仅 67.8% 与参考一致,即约 1/3 判断不同。The Register 的 Thomas Claburn 指出「这不是公平比较,因为 Jev 输出的不是自然语言,它仍可能错」;36氪 / 腾讯科技总结为「类型正确 ≠ 判断正确」。实测

主要争议

新品类 vs 分类器HN 评论称其「basically a zero-shot classifier」,Almeida 亲自回复「exactly right!」;Reddit 高赞「行业又重新发现了分类模型」。
性能数字公平性任务是 Jev 最擅长的系统一型;参考答案来自 GPT-6 Astra + Fable 5.1(与 8 个对比模型中 6 家同源);LLM 侧走 TypeSafe 自己的 adapter;workflow 由自家团队编写。
RLCD 无论文训练方法无学术发表,校准效果未独立验证。
创始人话术「co-inventor of ChatGPT / RLHF」被考证为夸大;Almeida 在 X 称「下一个时代不属于 Claude Code,Jev 才是未来」。
黑盒无参数、无架构、无训练数据细节、无权重、无私部署;受监管领域审计困难(无 rationale)。
定价可持续性官方自陈无法证明未补贴。

14未来展望

官方路线图明确部分有限:System One 是一个类别,Jev 是第一个实例,后续会有更多但无时间表;不发公开 benchmark,只在产品更新时发「带日期、发完即弃」的一次性 eval;官方博客立场为「做对任务 > 数据 > 算力 > 算法」。官方

多层模型栈成共识:复杂规划给前沿推理 LLM、普通推理给 Flash、高频分类 / 路由 / 验证给决策模型、确定性逻辑给代码,harness 负责调度——36氪、TrueFoundry、APUS 张旭均持此判断。大厂可能内置:DeepSeek V4.1 Flash 已在解耦 Prefill / Decode,GPT-6 Astra 的 Loop Transformer 本质是隐空间循环思考,通用模型厂商未来可能提供快速决策模式,最终是「两个模型」还是「一个模型两个角色」未定。开源 / 端侧机会:APUS 代表中国团队押注本地 / CPU / 小算力决策模型,适配中文业务的决策模型有差异化机会。不确定性:定价是否补贴可持续、RLCD 是否真为新范式、校准是否在客户数据上成立、大 lab 复制后 TypeSafe 的护城河——均待观察。观点

15参考来源

官方一手

  1. TypeSafe 发布博客:Introducing System One Models & Jev
  2. 官方文档:System One 概念
  3. 官方评测站 Workflow Evals
  4. 官方文档:原语 Choice / Score / Noul
  5. 官方 jaggedness 页(jev-1.13 失败模式)
  6. system-one-adapter(MIT,GitHub)
  7. DCVC 官方博客(融资)

第三方深度分析

  1. TrueFoundry:TypeSafe AI / Jev 分析
  2. DataCamp:System One Models / Jev
  3. AI Wiki 事实核查(2026-09-23)
  4. xbill 八天独立审计(dev.to)
  5. Sebastian Raschka:Jev 分类泛化分析
  6. DevQuasar:桌面开源 System One 复现
  7. redlinesoft:4 天复现总结

生态方

  1. LangChain:Building a Harness with Jev
  2. Vercel:What is Jev
  3. OpenRouter 文档:Jev
  4. OpenRouter 模型页:typesafe/jev-1.13

中文媒体

  1. 36氪 / 腾讯科技:一个「不说话」的 AI 刷屏,Jev 真是新范式吗?
  2. 36氪:爆火模型 Jev 全面开放
  3. 36氪:Jev 爆火,具身智能迎来大救星?
  4. 新华网:APUS 开源复现
  5. 新浪科技报道

开源复现

  1. APUS fast-browser-use(GitHub)
  2. APUS-OpenJev-v1(HuggingFace)
  3. vLLM DiffusionGemma PR #57250