查看作品文字内容

锐评续篇 · 2026 年 9 月 24 日 200 倍的营销, 0.46 的实测 Jev 发布第八天:官方把「快 200 倍、便宜 400 倍、零幻觉」讲成神话,独立开发者把它拉回地面——哈希数据上它的判断能力是 0.46,比瞎猜还差。祛魅之后,剩下什么才真正值得抄? 对象:TypeSafe · Jev · 独立实测 基调:拆解,非吹捧 口径:官方数字 vs 第三方实测分开标注 主旨 一页看懂 Jev 一周内走完了从「 爆火叙事 」到「 独立祛魅 」的完整过山车。官方卖的是故事,实测拆的是工程;而祛魅之后剩下的那部分——「判断 = 函数调用」——恰好是 Agent 产品最该抄的范式。 判断 01 火的不是能力,是叙事。RLHF 反叛者人设 + 千万级围观 + 4000 万美元背书,「零幻觉、输出免费」一句比一句抓眼。但六组独立实测里,Jev 单独使用从未稳定赢过强基线,最差时只有 0.46。 推文围观从 967 万涨到 3700 万 判断 02 三个头条数字全是「带限定的真话」:193.6 倍、444.6 倍是官方自测上限,测试集自家团队构建;「零幻觉」是格式保证,不是正确率保证。转述时限定词全被剥掉了,这是教科书级传播。 官方博客自己承认的限定 判断 03 它最值钱的「校准置信度」,恰恰最缺独立大样本验证。现有实测只证明「方向对、幅度收」(头等舱女性真实生还 0.97,它给 0.79),离「95% 把握 = 95% 正确」的自动化红线还差一整套证据。 校准是卖点,也是黑箱 判断 04 生态爆发是真的,护城河是假的。6.6k 星的浏览器 Agent、LangChain 集成、40 秒分析 724 条广告——需求真实;但复刻成本极低(OpenJev、jev-visual 均已 MIT 开源),国产跟进会迅速抹平先发。 生态的火 ≠ 供应商的墙 判断 05 对做产品的人,正确姿势是「抄范式、别押供应商」:当特征用、问法即超参数、冷启动先验、校准闸门——这些已被 MIT 开源的实测仓库验证,今天就能在你的数据上落地。 行动建议见第六部分 第一部分 先对质:官方说的,和实测说的 同一件事,两套口径,限定词决定真相 官方口径 独立实测口径 「快 20–200 倍」 端到端 70–500ms;首页挂 193.6 倍 LangChain 实测 0.44 秒/次 广告分析中位 216ms/条——快是真的,但这是小任务上的数字,且官方承认 193.6 倍是「真实收益上端」 「便宜 40–400 倍,输出免费」 输入 0.042 美元/百万 token 21 万次判断总成本不到 3 美元 ——价格数量级是真的;但「输出永远免费」没有商业模式支撑,只开放候补 「零幻觉」 schema 保证,数学上不可能输出非法值 7 处埋错只找出 6 处 哈希特征数据上 AUC 0.46(比瞎猜差)——它不编造,但可以错得离谱;零幻觉≠不错 「校准置信度」 RLCD 训练,95% 把握≈95% 正确 实测「方向对、幅度收」 泰坦尼克头等舱女性真实生还 0.97,它给 0.79;校准的独立大样本验证尚未出现 「System One,全新类别」 软件直接依赖的决策接口 「最好的位置是当特征」 六组实验里它单独用从不稳定赢基线,加进强模型每次都显著提升——叙事说取代,实测说外挂 官方博客六项局限原文:工作流评测由自家模型能力团队构建、对照 LLM 用了自家封装层(更慢更贵)、演示查询简化、Doom 用结构化状态非图像、维基竞速对手开非推理模式。 出处: TypeSafe 官方博客 | 掘金·六组实验独立实测 | 机器之心/投资界 把官方数字按「技术路线参考」读,别按「产品承诺」读——这是官方自己标注的阅读方式,也是被传播剥掉的那一层。 第二部分 为什么一周就祛魅 四个机制,决定它从神话到地面的速度 机制一:叙事引擎是顶配 「参与发明 ChatGPT 的人说 RLHF 跑偏了」——这是行业里最贵的人设。推文围观 967 万到 3700 万,DCVC 4000 万美元背书,Wasp CEO 录视频解读,连 OpenAI 内部红人都在转发。发布本身被设计成了事件:反叛故事、口号化数字、稀缺的候补名单,每一层都在放大传播。 机制二:便宜到人人可验证,真相来得太快 这是最反「传统大模型」的一点:21 万次判断不到 3 美元,意味着任何人都能大规模实测。官方故事的保质期取决于实测速度,而实测成本低到可以忽略——所以只用了三天,独立开发者就拿出了「单独不赢、0.46 AUC、问法敏感」的反证。祛魅不是被黑,是价格太便宜,验证太容易。 机制三:生态用脚投票,不管叙事真假 开发者不关心校准有没有大样本验证,先接 API 试:浏览器 Agent(jev-ultrafast,6.6k 星)、Claude Code 上下文压缩(fast-jev-compaction 及其移植版)、724 条广告 40 秒分类、LangChain 的 Jev-as-a-Judge——「智能 if 语句」这个需求被反复证明为真。生态的火是真的,只是它烧的是范式,不是 TypeSafe 的壁垒。 机制四:平台化苗头 = 生死战开始 API Key 已可申请(console.typesafe.ai)、REST/gRPC、LangChain 与 Vercel AI Gateway 适配器出现——Jev 正在从「爆款 demo」走向「基础设施」。而基础设施的战争打的是:免费输出能烧多久、校准能否在真实大样本上成立、复刻潮(OpenJev、jev-visual)会不会把价格和心智同时拉平。这一周的热度,只是开场。 第三部分 反直觉判断 越是刺眼的结论,越要钉死证据 ① 「零幻觉」最抓眼球,却最不值钱;值钱的是校准,而校准恰好最缺证据 现象 全网传播集中在「零幻觉」;官方最核心的卖点其实是 RLCD 校准。 本质 零幻觉只是格式合规,对商业价值几乎零贡献;校准才是「敢不敢自动化」的开关。营销重点和工程短板完美错位。 影响 采购方若按「零幻觉=不会错」决策,会在 0.46 和 6/7 上付出代价。 ② 「输出免费」不是让旧事变便宜,是赌新用途爆炸——但 4000 万烧多久? 现象 输出 token 永远免费,官方称便宜到不值得计量。 本质 Jevons 悖论:价格打到底,用量总量爆发,卖的是「决策流水线」的入口。策略本身精妙,但免费输出 + 候补阶段 = 纯烧钱换心智。 影响 商业模式是全场最大的未解之谜;依赖它的业务,必须备好替代(开源复刻即可)。 ③ 官方说「新类别取代生成」,实测说「最好的位置是当特征」 现象 官方定位:软件直接依赖的决策接口,替代人类过审;实测结论:单独用不赢,当第二信号显著赢。 本质 一个声称取代,一个证明互补——后者有 21 万次判断背书。Jev 的真实价值是「世界知识外挂」,不是「模型终结者」。 影响 把 Jev 当特征/筛选器用的人赚了,当「万能判断器」用的人会摔。 ④ 最火的演示,全是它最窄的区间 现象 Doom、浏览器点击、广告分类、Agent 验收——全部是结构化状态、有限选项、语义型任务。 本质 「信号在语义里」它强(泰坦尼克 0.83);「信号…