TypeSafe AI 是面向软件自动化的 AI 模型平台,也是 Jev 的官方入口。Jev 被官方称为首个公开的 System One 模型:它不负责聊天或撰写长文本,而是读取一段状态信息,再返回预先定义类型的判断、概率和置信度,让代码可以据此分类、路由、评分或决定是否转人工。平台目前处于 early access,首次访问者可以先在 Playground 验证问题结构,再申请 API 权限。
Jev 是什么:把判断结果直接交给代码
通用大语言模型通常先生成字符串,业务程序再解析 JSON、校验字段并处理格式失败。Jev 选择了不同路线:调用方提前定义允许的答案类型,模型只在这个范围内输出结构化结果。官方把这种模式概括为“unstructured state in, typed probabilistic decisions out”,即输入可以是自然语言或其他状态描述,输出则是带概率的类型化决策。
这并不意味着 Jev 会替代聊天模型。它主动放弃自由文本生成,换取更适合程序消费的固定输出。真正适合它的任务,是“这张工单应该进入哪个队列”“风险等级处于哪个区间”“这条陈述有多大可能成立”等窄而明确的判断;需要长篇推理、资料检索、写作或开放式回答的任务,仍应使用其他模型或先拆成多个原子问题。
Choice、Score 和 Noul 怎样选择
TypeSafe API 提供三种问题原语。它们可以在一次请求中混合使用,并针对同一份 state 独立、并行求值。问题 ID 由开发者命名,返回结果会使用相同 ID,便于程序直接读取。
| 问题类型 | 适合的判断 | 主要返回值 | 典型用途 |
|---|---|---|---|
| Choice | 从有限选项中选择一个 | choice、各选项概率、confidence |
工单路由、内容分类、语言识别 |
| Score | 按有序等级或量表评分 | score、等级概率、confidence |
情绪强度、质量等级、风险评分 |
| Noul | 判断一个命题成立的程度 | 0 到 1 的 noul |
紧急性检测、条件判断、守卫规则 |
Choice 和 Score 的 confidence 来自完整概率分布:结果集中在一个选项时置信度较高,多个选项接近时置信度会下降。Noul 直接返回 0 到 1 的连续值,不另外附带 confidence。两者不能混为同一个指标。
第一次验证 Jev 的完整路径
先用 Playground 检查问题是否足够原子
- 打开 TypeSafe Console 并登录,当前入口为
https://console.typesafe.ai/。 - 在 Playground 的 state 中粘贴一段真实但已脱敏的输入,例如客户反馈或待分类记录。
- 先添加一个 Noul 问题,再补充 Choice 或 Score。每个问题只判断一件事,不要把“判断部门、紧急程度并给出处理方案”塞进同一句指令。
- 检查返回值是否包含预期的问题 ID、类型和概率。若结果不稳定,先修改选项边界或补充 state,而不是立即降低人工复核门槛。
官方 Quick Start 用一条无法连接 Stripe 的紧急工单作为示例,同时询问负责部门、客户沮丧程度和是否紧急。这个例子说明了 Jev 的主要价值:同一份输入可以产生多维、可组合的判断,业务代码只消费当前分支真正需要的结果。
再用 HTTP API 或 Python SDK 接入
获得 early access 后,可以在 dashboard 创建 API key。HTTP 端点是 POST https://api.typesafe.ai/v1/systemone,请求头使用 Bearer 认证;官方 Python SDK 需要 Python 3.10 或更高版本,可通过 pip install typesafe-sdk 安装,客户端默认读取环境变量 TYPESAFE_API_KEY 并调用 jev-latest。
{
"state": "客户已连续三天无法连接支付账户,并表示正在损失订单",
"model": "jev-latest",
"questions": {
"department": {
"type": "choice",
"instructions": "应该由哪个团队处理",
"criteria": {
"billing": "支付或订阅问题",
"technical": "故障或集成问题",
"sales": "价格或账户咨询"
}
},
"is_urgent": {
"type": "noul",
"instructions": "这条消息具有紧急性或时间敏感性"
}
}
}
上面的请求形状依据官方示例整理,用于说明字段关系,并非本站的独立运行测试。验收时应确认 answers.department.choice 只会落在预设选项内,概率分布能够解释候选之间的差距,同时根据 is_urgent.noul 决定是否提高优先级。生产接入前还要用自己的历史数据校准阈值。
置信度应控制流程,而不是装饰界面
Jev 的结构化输出只能保证字段形状符合预设,并不能保证每个业务判断都正确。官方文档建议把置信度分成高、中、低三段:高置信度允许自动执行;中等置信度要求确认、补充信息或排队复核;低置信度则停止自动动作并回退到人工或其他系统。实际分界值取决于错误成本,不能从演示数字直接复制。
- 可恢复的低风险动作:例如展示一个帮助页面或添加内部标签,可以采用较宽松阈值,并保留撤销路径。
- 影响用户权益的动作:例如退款、账户限制或资金操作,即使模型置信度较高,也应加入身份确认、权限检查和人工复核。
- 信息不足的输入:概率分布过平通常意味着选项边界模糊、state 缺少关键信息,或者问题包含多个维度。此时应询问用户或拆分问题,而不是强行选择概率最高项。
哪些工作流更适合 System One 模型
从官方文档和发布说明看,Jev 的强项集中在分类、路由、评分、抽取后的判断分支,以及对其他模型输出进行审核或守卫。它适合嵌入已有代码中的“模糊 if 语句”:规则难以穷举,但输出集合、风险控制和后续动作都能由开发者提前定义。
复杂决策应拆成多个互相独立的问题,再由代码明确组合权重。例如评估一个项目时,可以分别询问市场规模、技术可行性和差异化程度,再用业务公式合并,而不是让模型一次返回一个含义不清的“综合分”。这种做法也让团队在策略变化时修改系数,而不必重新设计整段提示词。
官方速度与价格数据怎样看
TypeSafe 在 2026 年 9 月的发布文章中给出的当前价格是每百万输入 token 0.042 美元,并称端到端响应约为 70–500 毫秒;首页展示的 193.6 倍更快、444.6 倍更便宜,来自其 System One 工作流评测。上述数字属于厂商公布的早期结果,不是 WarpNav 独立复现的结论。
官方也主动披露了限制:评测从美国西海岸运行,工作流由其模型能力团队制作,参考答案使用外部大模型的平均概率,而且首页倍数可能处于真实收益的高端。选型时更合理的做法,是拿自己的输入长度、问题数量、地区延迟和错误成本做小规模评估,同时核对控制台中的实时价格与可用地区。
early access 阶段的选择建议
TypeSafe AI 目前更适合已有明确自动化流程、能够定义答案空间,并愿意保留人工回退的开发团队。只想聊天、生成内容或完成开放式研究的用户,Jev 并不是直接替代品;无法取得 early access、缺少历史样本或尚未定义错误成本的团队,也应先在 Playground 完成验证,再决定是否进入工程接入。
官网入口为 https://typesafe.ai/,文档入口为 https://docs.typesafe.ai/。由于 Jev 刚开放 early access,模型名称、价格、配额和接入资格可能继续变化,实际使用前应以控制台与官方文档的当前信息为准。
数据统计
相关导航
没有相关内容!
暂无评论...
