不会说话的AI,估值14亿
九月的AI行业并不缺乏话题,多家大型企业接连推出新模型,按照以往规律,焦点本应集中在它们身上。然而,过去一周,开发者在X、GitHub以及各类技术群组中热烈讨论的,却是一个连完整语句都不愿输出的模型。
这个模型名为Jev,于9月15日发布,上线后不久,官方接口便因大量开发者涌入而无法正常调用。到了9月21日,公司直接取消了候补名单,向所有用户开放,每位注册用户获赠5美元额度,约合1.2亿个Token。今年,用这种方式“放量”的新模型并不多见。
开发Jev的公司是TypeSafe AI,总部位于旧金山。这家公司隐身两年后,带着两样东西亮相:一个是模型,另一个是由DCVC领投的4000万美元种子轮融资,约合人民币2.8亿元。据Forbes援引知情人士的说法,此轮融资估值为2亿美元,即大约14亿元人民币。
更引人关注的是创始人Diogo Almeida。他在OpenAI工作了四年,参与了RLHF、InstructGPT、ChatGPT和GPT-4的研发。RLHF即基于人类反馈的强化学习,ChatGPT之所以能理解指令并得体回应,这项技术功不可没。换句话说,他是当年教会大模型“说人话”的团队成员之一。离开OpenAI后,他开发的产品却走上了相反的道路。
一个“哑巴”模型,引发热潮
使用大模型进行分类的用户,大多有过这种困扰。只想让它判断一封邮件是否紧急,回答“是”或“否”即可,但它却偏向先做一段分析,既慢又消耗Token。Jev的解决方案简单直接:干脆不让模型说话。它读取杂乱的状态信息,输出开发者预先定义好类型的决策,每个答案附带一个经过校准的概率。TypeSafe将其命名为System One决策模型,典故源自《思考,快与慢》中的“快思考”。人能一眼判断的事情,就交给它处理。
Almeida在一档播客中解释了这种设计。Jev只有三种输出类型:Choice在给定选项中挑选一个,Score用于排序或与阈值比较,Noul回答是非题,但返回的是概率,由程序决定是否进入某个分支。简单来说,它是为代码设计的。
速度和价格是其出圈的直接原因。官方公布的端到端延迟在70至500毫秒之间,相较于前沿大模型快40至200倍,每百万Token收费0.042美元,输出则免费。
TypeSafe还公布了更夸张的数据,在其内部工作流程测试中,一些任务速度最高可提升193.6倍,价格最低可降低444.6倍,但这些数据来自公司自测,未经独立实验室验证。
公司也提示,实际表现会根据任务和比较方式有所不同。第三方数据更为谨慎,独立测试发现,它在分类一致性上与DeepSeek V4.1 Flash相当,中位延迟为0.32秒。即便打折,这个价格也足以令人心动,甚至有文章将其价格比作AI界的“蜜雪冰城”。
真正推高热度的是开发者的各种创意应用。官方首先展示了一个案例,让Jev玩初代《毁灭战士》游戏,每秒钟做出约十次选择来控制角色移动、躲避敌人和射击,连续运行一小时约花费七美元。
Browser Use团队将这一内容接入浏览器自动化,在打开网页、搜索苏黎世飞往伦敦的航班过程中,整个过程只需7.1秒,花费0.0039美元。实时通信公司Ably做了一个更直观的比较:几分钟内,Jev做出了47次决策,而Gemini、Claude和GPT等只做了一两次。中文开发者也没闲着,使用大模型出牌时明显出现卡顿,而换成Jev后,单次决策只需0.7秒,出牌动画还没播放完,下一回合就已发出。这些场景都需要快速、密集的决策,但每个决策本身并不复杂。
游戏本身热闹,而商业动作更能说明问题。Vercel第一时间将AI网关接入Jev,开发者用它作为大模型的裁判,在几十毫秒内完成对大模型行为是否合法、是否有事实依据的审核,并给出事实一致性评分。当成本低到可以忽略不计时,以前算不出来的事情,突然就变得可行了。
ChatGPT的功臣,反手泼了冷水
Almeida的履历在业内很有分量。OpenAI在GPT-4的贡献者名单中,将他列在“基础RLHF与InstructGPT工作”一栏。他在OpenAI花了四年打磨ChatGPT的回答,2024年离开,着手训练一种新的基础模型。另外两位联合创始人中,COO Sasha Sheng此前是Meta和FAIR的研究工程师,Erik Gafni担任CTO。三人埋头干了两年,外界几乎没听说过这家公司。
按常理,这样的人创业,多半会做一个更会聊天的模型。但Almeida偏偏反其道而行之,他批评的正是自己亲手参与打造的那套方法。
他的逻辑并不复杂。RLHF的做法是收集人的偏好再据此优化,等于把人直接放进训练回路,目标是让人满意,而不是让软件自主运行。他对Forbes说得更直白:行业一直在为人优化,模型讨好人的能力已经超过了人。他在演讲中讲过一个段子:有人给ChatGPT发送一段放屁音效,请它诚实评价自己“创作”的这首音乐,ChatGPT回答说,这营造出一种很诡异的氛围。当人在旁边盯着时,这种圆滑无伤大雅。但如果要让软件在后台无人值守地运行,一个明明错了却总想显得没错的模型,就成了大麻烦。
因此,他敢放话:下一个时代不会是Claude Code的时代。他说自己也爱用Claude Code,但它仍属于“辅助时代”,本质上依赖的还是RLHF。这话从ChatGPT的缔造者之一嘴里说出来,多少带点反讽意味。
投资人看重的,很大程度上就是这个判断以及说出这个判断的人。美国投资人Trace Cohen的点评很有代表性:在他看来,给一家尚未交付产品的公司开出4000万美元种子轮,押的就是背景,赌的是团队而非产品。从OpenAI出走的研究员一直是硅谷最抢手的创业者,这类估值逻辑早已见怪不怪。有趣的是,TypeSafe自己在产品上线前也没什么把握。
Almeida后来在播客中回忆,上线前反馈相当糟糕。非技术同事担心他们卖的是“维生素”而非“止痛药”,公司几乎没有收入,一半以上的测试者没看懂,看懂的人第一反应是问采购审批如何通过。他自己也很害怕,于是拼命推动尽快上线。
上线后的局面,他恐怕也没预料到。提高调用上限的申请从各处涌来,按他在播客中的说法,日调用量已超过一万亿Token,深夜也在持续调用,说明是程序在后台运行,而非人来尝个鲜就走。这个数字目前只有创始人一方的说法,但深夜调用这个细节,确实比注册人数更能说明产品是否被真正用了起来。
名字也有讲究。Jev取自经济学家William Stanley Jevons,即提出杰文斯悖论的那位学者。19世纪蒸汽机越来越省煤,英国的煤炭消耗却越烧越多。这个名字的用意不难猜测。
“智能大拆分”,动了谁的奶酪
Foundation Capital合伙人Jaya Gupta写过一篇长文,为Jev的走红找到了一个更大的背景,她称之为“智能大拆分”。她的观察是,过去三年大模型的奇迹在于“打包”:信息抽取、搜索、排序、判断、选工具、写回复乃至高难度推理,都交给同一个足够聪明的模型。开发者省了事,但代价被隐藏起来。Agent会把人的一个目标拆解成成百上千次机器决策,每一步在成本和延迟上的细微差异层层累积,最终决定整个产品的经济模型。她把其中的浪费称为“解码税”:软件明明只需要一个“放行”或“拦截”,大模型却要先生成一段文字,程序再把文字翻译回决策。
这笔账最终要算到大模型公司头上。Gupta在文中提到,据报道Anthropic的毛利率超过80%,一个简单的分类任务,只因发生在Claude的调用里,就得按前沿模型的价码付费。
她的推演是,便宜、可预测的高频操作会被逐步分流,留给前沿模型的是更模糊、周期更长、更难验证的问题,每次调用也许更值钱,但被调用的次数会变少。应用层的任务也跟着变了,需要把任务拆开,为每一步购买够用且最便宜的智能。过去一套系统也许只抽查1%的行为,当判断足够便宜后,就有机会全部检查一遍,客服对话、交易记录、合同条款都能逐条过。Almeida看中的场景也在这条线上,比如大公司囤积多年、却因调用大模型太贵而从没分析过的“暗数据”。他举过保险核保的例子:模型读完材料,直接给出某处房产发生过火灾的可能性有多大。
故事讲得漂亮,但护城河的问题几乎同步摆上了桌面。Jev发布后短短两天,GitHub上就冒出了至少六个复刻项目,有人拿Qwen的小模型在笔记本上训练不到两小时,就做出了接口相同的决策模型。
这些复刻不少是冲着“平替”去的。涨得最快的Laya,5天就拿下1.8万个Star。Jared Palmer做的Kev基于Qwen3.5,与TypeSafe官方SDK完全兼容,业务代码不用改,换个请求地址就能切到本地;Bespoke Labs的Nimble基于Qwen3.5-9B,测试准确率90.1%,接近Jev官方公布的93.2%。热闹之下,阿里通义千问在这轮复刻潮中意外当了一回“底座”。复刻品也有短板,有评测认为,面对任意提问和几十个长选项的场景,眼下还得用Jev。
Jev自身的局限同样明显。它是闭源API,模型拿不到手,数据也要传到TypeSafe的服务器上,这对不少企业客户是个门槛。官方所说的“不会幻觉”也要打个折扣,它保证的只是答案不会跑出开发者定义的格式,而不是答案一定正确。
Almeida倒不回避这些。他承认校准并不完美,模型会犯很多错误,但只要收益足够高、阈值设得合适,照样可以投入使用。有主持人试用后发现,单步判断很强,步骤一多效果就逐渐下滑,他的回应是,哪些任务适合交给System 1,最终要看实际效果。外部压力也摆在那里,大厂还在持续压低推理成本、提升速度,TypeSafe宣称的优势能守多久,需要经过市场检验。
过去几年,大家比的是谁的模型更会思考。Jev这一周的热闹,让行业第一次认真坐下来算另一笔账:思考一次,到底要花多少钱。
本文来自微信公众号“融中财经”(ID:thecapital),作者:王涛,编辑:吾人,36氪经授权发布。