System One 模型——不生成文本的决策引擎
在分类与路由这类窄任务上,Jev 声称以中端 LLM 级别的准确率(67.8%)换取约两个数量级的成本与延迟优势;第三方实测方向一致,但幅度远小于宣传。
「TypeSafe」「s1」在 AI 圈有多个含义,先做一次澄清,避免张冠李戴。
| 易混淆对象 | 说明 |
|---|---|
| 本报告的 TypeSafe AI | 旧金山 AI 初创公司,官网 typesafe.ai,2024 年成立,创始人 Diogo Almeida,即 Jev 背后的公司。 |
| 原 Scala 生态公司 TypeSafe | Akka / Play Framework 背后公司,已改名 Lightbend,与本公司无任何关联。 |
| 斯坦福 s1 模型 | 2025 年开源推理模型「Simple test-time scaling」(arXiv:2501.19393),与 Jev 无关,仅缩写相近。 |
公司 2024 年于旧金山成立,隐身约两年。三位创始人:CEO Diogo Almeida(前 OpenAI 研究员,可独立核实为 InstructGPT 论文第四作者;公司宣传「co-inventor of RLHF」被考证为夸大,因 RLHF 技术早于该论文)观点;CTO Erik Gafni(Ravel Biotechnology 联创,生物医药多模态方向);COO Sasha Sheng(前 Meta AI / FAIR 研究工程师)。公司口号「Build Prod, Not God」。官方
2026-09-15 与模型发布同日官宣种子轮 4000 万美元,由 DCVC 领投;Forbes 援引知情人士称估值约 2 亿美元(媒体报道,非官方确认)。官方实测
旧金山成立,进入约两年隐身研发期。
官方博客《The Bitterest Lesson》;次日发文宣布不做公开 benchmark。
《Introducing System One Models & Jev》博客与 4000 万美元种子轮通稿同日发布;Jev 进入 early access 等待名单。
Vercel AI Gateway 上线;OpenRouter 上架 typesafe/jev-1.13;API 一度被流量打挂。
中国 APUS 公布 fast-browser-use(MIT,基于 Qwen3.5-9B),RTX PRO 6000 上单次决策 79ms。
深夜取消等待名单,注册送 5 美元免费额度(约合 1.2 亿输入 token);发布后 36 小时放出约 14 万人。
Cloudflare / Langfuse 集成;LangSmith Evals 上线 Jev judge;提示 prompt injection 风险。
等待名单消化约 14 万人(Almeida 对 VentureBeat);HN 主帖 1977 分 / 513 评论;Almeida 发布帖当天约 420 万次浏览、近 2 万点赞。实测
「System One」借用 Daniel Kahneman《思考,快与慢》中系统一(快速、直觉)与系统二(缓慢、审慎)的划分,Jev 定位为系统一式快速决策模型——公司也承认系统一传统上意味着易错。「Jev」这个名字致敬 19 世纪经济学家 William Stanley Jevons(杰文斯悖论:效率提升、成本下降反而推高总需求),公司期望「智能成本每降一个数量级,就解锁数量级更多用例」。官方
官方一句话定义:「a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out」,即「智能 if 语句」。它明确不做:不写回复、不写代码、不输出推理过程;当前仅支持文本输入。官方 FAQ 明确「Jev is neither small nor an LLM」。官方
| 维度 | 传统 LLM | Jev(System One) |
|---|---|---|
| 输出 | 字符串,逐 token 自回归生成 | 类型安全的结构化值 + 校准概率 |
| 采样 | 顺序,每个 token 依赖前一个 | 并行,一次前向对所有位置同时打分 |
| 后处理 | 需 parse + validate,有跑偏风险 | schema 预定义,构造性保证类型正确 |
| 训练目标 | 人类偏好(RLHF)/ 可验证奖励(RLVR) | 校准决策(RLCD) |
| 典型用途 | 聊天、写作、代码生成、推理 | 分类、路由、打分、审核、验证 |
TypeSafe 声称构建了「entirely new stack」,含三部分:新模型架构、并行采样器(parallel sampler)、RLCD 训练法。但参数量、层数、注意力机制、隐藏维度、训练算力、权重全部未披露,无学术论文(arXiv 搜「Reinforcement Learning for Calibrated Decisions」无结果),模型封闭托管、不开源、不支持微调。官方
| 照字面理解 | 否定、隐含条件按字面取,不答「以为」的问题。 |
| 不会数数 / 算术 | 计数、四则运算、hex 颜色、Score 档位间插值不可靠——算术留给代码。 |
| 日期是文本不是量 | 先后、窗口判断不可靠——拆成 Choice 后在代码里比较。 |
| 多跳问题损精度 | 双重否定、属性的属性属系统二任务,应拆成直接问题。 |
| 上下文腐烂 | 大而嘈杂的 state 中无关内容越多精度越降——先在代码里过滤。 |
| 对抗文本可挪动答案 | state 当数据不当敌意输入,注入指令可改变结果。 |
| 不生成文本 | 把 choice 链成文本既慢又差。 |
第三方推测(非事实):社区猜测其为「BERT 式 encoder + 现代 LLM 数据/算力配方」;工程师 Sean Goedecke 认为约束解码 + 受限 logit 切片用 1.5B 小模型即可拿到类似 2–3× 加速,「未必有护城河」。观点
RLCD = Reinforcement Learning for Calibrated Decisions(校准决策强化学习),是 TypeSafe 自造的训练方法名。优化目标不是人类偏好,也不是程序可验证奖励,而是「认知上诚实的概率」——在系统一任务上报出的概率要准。官方
| 方法 | 优化对象 | 产物 |
|---|---|---|
| RLHF | 人类评分者偏爱的写稿 / 聊天回复 | 聊天模型、过度自信、mode dropping |
| RLVR | 程序可验证的输出(数学证明等) | 可自动校验的结果 |
| RLCD | 系统一任务上带诚实概率的校准决策 | 类型化决策 + 校准置信度 |
校准(calibration)的含义:概率针对结果优化、反映不确定性;校准是在一组预测上统计衡量的——说 0.9 的那一批长期约 90% 正确,不保证某一条具体答案正确。官方对比示例:LLM 自报 0.9 置信度的批次实际正确率约 63%,经过校准的报 0.9 批次实际约 89%。官方
关键缺口:TrueFoundry 指出「校准」是整个发布里最需要外部独立检验、而目前尚无任何第三方系统测过的论断。官方未发布 calibration error、reliability diagram、Brier score 或 log loss。创始人 Almeida 是 InstructGPT 联合作者,RLCD 可视为其把 RLHF 经验迁移到「决策校准」新目标。实测
官方直连端点 POST https://api.typesafe.ai/v1/systemone(非 OpenAI 兼容);OpenRouter 另提供 Decisions API 与 System One API 两个面。请求 body 携带 state(字符串 / JSON 对象 / 文本数组)+ model(jev-latest,当前权重 jev-1.13.0)+ questions map。官方
| 原语 | 回答什么 | 返回内容 |
|---|---|---|
| Choice | 从一组选项里选一个 | choice 选中项 + 每个选项的 probabilities + confidence;上限 255 选项 |
| Score | 沿有序量表打分(2–10 级) | 概率加权位置的 score(可落在两档之间)+ 各档概率 + confidence |
| Noul | 一个条件是否成立(是非题) | 一个 0–1 的概率 noul(yes 的概率,非纯 true/false) |
{
"department": {
"type": "choice", "choice": "technical",
"probabilities": {"technical": 0.87, "billing": 0.09, "sales": 0.04},
"confidence": 0.81
},
"is_urgent": { "type": "noul", "noul": 0.994 }
}
每次响应带 usage.cost 字段显示本次美元成本。
| SDK | Python(pip install typesafe-sdk,需 3.10+)、JavaScript(@typesafe-ai/sdk);另有 MIT 开源 system-one-adapter 用 OpenAI/Anthropic 结构化输出模拟同接口。 |
| 上下文长度 | 官方称每请求上限 64k tokens(state + 最长问题占 32k);OpenRouter 模型页标注 Context = 32K,存在口径出入,接入前以官方最新文档为准。 |
| 速率限制 | 250k tokens/s + 1200 请求/分钟(截至 9/20 口径)。 |
| 微调 | 不支持,所有账户共享同一套权重。 |
| 模态 | 纯文本,不支持图像 / 音频 / 视频。 |
官方声称端到端延迟 70ms–500ms、速度提升 40×–200×、成本降低 100×–400×;首页「193.6× faster / 444.6× cheaper」来自官方 workflow evals,官方自认是「现实收益上限」。并排 demo(Jev 0.114s/$0.000081 vs GPT-5.6 Terra 8.566s/$0.013880)官方自承「高度简化」。官方
| 来源 | 实测结果 |
|---|---|
| Every.to | 777 次判断 <0.7s、成本约 1/4 美分;逐段判断中位 0.35s vs 对照 8.83s;植入 7 处缺陷检出 6 处。 |
| Browser Use | 浏览器 agent 任务中位 9.45s → 7.07s,浏览器协议调用 1092 次 → 101 次。 |
| Vercel CEO 转述 | 命令安全分类比 GPT-5.6 Luna 在 p95 快最多 18× 且更准。 |
| xbill 八天审计 | 速度 0.5×(比本地 Gemma 慢)到 12.1× 快;成本 0.6×(更贵)到 478× 便宜。 |
| 反例:backnotprop | 德州扑克 150 个决策点吻合率 63%;有争议的 55 个点位仅 38%。 |
| 输入 | $0.042 / 百万 token($42 / 十亿)。 |
| 输出 | 免费("too cheap to meter",输出为结构化决策而非长文本)。 |
| 对比 | 约为 GPT-5.6 Terra($2.00/M 输入 + $12.00/M 输出)输入价的 1/48。 |
| 免费额度 | 全面开放后注册送 5 美元(约合 1.2 亿输入 token)。 |
| 官方自陈 | 无法证明定价未被补贴,预期价格「会降不会涨」。 |
TypeSafe 明确不跑公开基准(认为会被「benchmaxxed」),自建 4 个 production-style workflow(安全事件响应、Agent trace 可观测性、发票处理、客服)。无人工 ground truth——参考答案由 GPT-6 Astra + Claude Fable 5.1(均 high thinking)回答后取平均;LLM 侧统一通过其开源 system-one-adapter 跑。官方
| 模型 | 平均准确率 | 每 case 成本 | 每 case 耗时 |
|---|---|---|---|
| Jev | 67.8% | $0.0004 | 0.4s |
| GPT-5.6 Sol | 74.1% | $0.0836 | 23.3s |
| Claude Opus 5 | 73.1% | $0.1761 | 37.8s |
| GPT-5.6 Terra | 67.9% | $0.0304 | 10.1s |
| Claude Sonnet 5 | 67.8% | $0.1174 | 78.1s |
| GPT-5.6 Luna | 66.8% | $0.0033 | 12.9s |
| DeepSeek V4-Pro | 65.5% | $0.0413 | 86.5s |
| DeepSeek V4-Flash | 64.4% | $0.0059 | 51.9s |
| Claude Haiku 4.5 | 53.6% | $0.0195 | 12.5s |
xbill 八天系统审计(Google Developer Expert,审计 14 篇 arXiv、104 个 GitHub 仓库、33 篇 dev.to/Medium 文章):444.6× 只在「Jev vs Opus 5 的 workflow 配置」下成立,8 个配置平均后约 97.8× 更快、149.2× 更便宜,计时来自团队美西笔记本、未公开 case 数 / 方差。准确率上 Jev 与中端 LLM 同档、落后前沿 6.5–11.5 个点(如 Janardhan 200 项 6 模型对比中 Jev 72.5%,低于 Claude Fable 5.1 的 84.0%)。实测
校准度:英文熟悉域开箱即用最好(Bespoke Labs 13 子集中位 ECE 0.071),但跨域后双向出错——公开多分类集上过度自信(GoEmotions 上 0.80–0.95 置信度档仅 15% 命中),事故叙事上欠自信;50–几百条标签拟合 temperature 后 15 个 LLM 反超。稳健性弱点:选项名调换导致 32.5% 答案翻转(n=1200);俄语 XNLI 从 88.3% 掉到 77.3%。实测
| 垃圾邮件 | Jev 98.33%(18,514 封),与 TF-IDF 逻辑回归 98.39% 持平。 |
| 日文新闻主题 | 310M 日文 encoder 用 200 行数据训练后反超 Jev 12 个点(88.8% vs 76.8%)。 |
| 钓鱼邮件 | Luce(Qwen3-4B+LoRA,1000 条标签)97.4% vs Jev 62.6%;但两行正则 91.6%、五个窄 Jev 问题 + 逻辑回归组合 95.0%。 |
结论:有领域标签时,微调小模型 / 传统分类器普遍能打赢 Jev;Jev 的价值是零样本、免标注、开箱即用。实测
发布后 4 天内出现数十个复现项目,绝大多数是「用现有 LLM / encoder 的 logprob 读取 + 外层 prompt 工程」,而非训练新模型;微调路线需要几百到几千条标签。技术路线分三类:实测
| 路线 | 做法 | 代表项目 |
|---|---|---|
| Prompt-Logprob (不训练) | 拼 prompt,一次 prefill,读选项 token logits 做 softmax | ikermoel/open-alternative-jev(so1)、ekzhang/openjev-sglang、bnsd55/openjev;Qwen3.6-27B 上 RACE-H 92.9% |
| 小模型 + 评分头 (微调) | 小 encoder + LoRA / 全参微调,加评分头 | system-one-gemma(Gemma 3 270M,~50ms,64.4%)、openJev-verdict-2.0(ModernBERT 151M,77%,WebGPU)、decider-2b |
| 离散扩散模型 | 扩散模型只读 logits、不 commit token | DevQuasar 的 OpenJev(DiffusionGemma-26B MoE,94ms/请求,64 并发 57 req/s);vLLM PR #57250 |
9/19 公布,封装为 Agent Skill fast-browser-use(MIT,跨 macOS/Linux/Windows,无 GPU 也能跑)。做法是黑盒反推:基于 Qwen3.5 系列 / Google Gemma,模型本身不改,只在外层把网页可交互元素列成候选项让模型直接选择,自研 KV Cache 广播。效果:维基百科检索约 18 秒,RTX PRO 6000 上单次决策 79ms,对标 Jev 官方 70–500ms。自研小模型(9B/4B)已开源为 APUS-OpenJev-v1,称「初步看已超过 Jev」。负责人张旭博士判断「目前公开出来的部分没有什么特别神秘的地方」,但承认黑箱里可能还有未公开的东西。实测
| 集成方 | 时间 | 说明 |
|---|---|---|
| Vercel AI Gateway | 09-18 | 上线 24 小时内近 13% 付费团队使用,AI Gateway 历史最快 adoption(约 GPT-5.6 家族 2 倍)。 |
| OpenRouter | 09-18 | 模型 ID typesafe/jev-1.13,走专用 Decisions API。 |
| LangChain | 09-17 | 博客《Building a Harness with Jev》;09-21 起可作为 LangSmith Evals judge。 |
| Cloudflare | 09-21 | VentureBeat 报道集成。 |
| Langfuse | 09-21 | 可观测性集成。 |
| Pydantic AI | — | 官方文档提供 Jev 集成指南,并警告 guardrail 应与确定性检查并存而非替代。 |
| browser-use | — | jev-ultrafast 项目,Jev 做浏览器 agent 动作判断层。 |
| Ably | — | Pong 演示:Jev 12 秒 47 次操作决策,对比 Gemini / Claude / GPT 仅 2–3 次。 |
仅文本输入、无多模态;不生成文本、不写代码、不给推理过程;Choice 上限 255 选项,更高基数走两阶段会变慢;算术 / 计数 / 日期比较 / 多跳推理弱;大而嘈杂 state 导致精度下降;非英文退化(俄语 XNLI −11 个点、西班牙语 −3~6 点、日语新闻落后开源 encoder 11.6 个点),中文场景下概率校准本身会退化。官方实测
Prompt injection 脆弱:state 不被当敌对内容,外部注入指令可移动答案——Octomind 实测给 rm -rf ~/.ssh 加「用户已预批准」字段,拦截概率从 0.76 降到 0.48。选项顺序 / 措辞敏感:调换选项描述可翻转约 1/3 答案(xbill,n=1200)。别名漂移:jev-latest 答案可能在无改动下变化,上线应钉死版本号。实测
这只是结构性保证:输出永不越出预定义选项分布(不编造字段 / 选项 / JSON),0% 类型错误是构造保证、非实测统计。它仍可能高置信度地选错合法选项——官方 workflow 上仅 67.8% 与参考一致,即约 1/3 判断不同。The Register 的 Thomas Claburn 指出「这不是公平比较,因为 Jev 输出的不是自然语言,它仍可能错」;36氪 / 腾讯科技总结为「类型正确 ≠ 判断正确」。实测
| 新品类 vs 分类器 | HN 评论称其「basically a zero-shot classifier」,Almeida 亲自回复「exactly right!」;Reddit 高赞「行业又重新发现了分类模型」。 |
| 性能数字公平性 | 任务是 Jev 最擅长的系统一型;参考答案来自 GPT-6 Astra + Fable 5.1(与 8 个对比模型中 6 家同源);LLM 侧走 TypeSafe 自己的 adapter;workflow 由自家团队编写。 |
| RLCD 无论文 | 训练方法无学术发表,校准效果未独立验证。 |
| 创始人话术 | 「co-inventor of ChatGPT / RLHF」被考证为夸大;Almeida 在 X 称「下一个时代不属于 Claude Code,Jev 才是未来」。 |
| 黑盒 | 无参数、无架构、无训练数据细节、无权重、无私部署;受监管领域审计困难(无 rationale)。 |
| 定价可持续性 | 官方自陈无法证明未补贴。 |
官方路线图明确部分有限:System One 是一个类别,Jev 是第一个实例,后续会有更多但无时间表;不发公开 benchmark,只在产品更新时发「带日期、发完即弃」的一次性 eval;官方博客立场为「做对任务 > 数据 > 算力 > 算法」。官方
多层模型栈成共识:复杂规划给前沿推理 LLM、普通推理给 Flash、高频分类 / 路由 / 验证给决策模型、确定性逻辑给代码,harness 负责调度——36氪、TrueFoundry、APUS 张旭均持此判断。大厂可能内置:DeepSeek V4.1 Flash 已在解耦 Prefill / Decode,GPT-6 Astra 的 Loop Transformer 本质是隐空间循环思考,通用模型厂商未来可能提供快速决策模式,最终是「两个模型」还是「一个模型两个角色」未定。开源 / 端侧机会:APUS 代表中国团队押注本地 / CPU / 小算力决策模型,适配中文业务的决策模型有差异化机会。不确定性:定价是否补贴可持续、RLCD 是否真为新范式、校准是否在客户数据上成立、大 lab 复制后 TypeSafe 的护城河——均待观察。观点