「幻觉不出的AI」是真的吗 - 不让ChatGPT“说话”的想法 开发者热衷的超高速AI“Jev”的真相

「幻觉不出的AI」是真的吗 - 不让ChatGPT“说话”的想法 开发者热衷的超高速AI“Jev”的真相

AI的价值,真的在于“能说会道”吗

生成AI的进步长期以来一直围绕着“能写出多自然的文章”和“能回答多难的问题”这两个轴心进行讨论。然而,当企业将AI深度嵌入软件并试图自动化处理时,流畅性并不一定是最大的价值所在。

所需的是区分查询是取消咨询还是退款请求。判断要执行的命令是否危险。从多个AI模型中选择适合该工作的一个,并以程序可处理的形式返回判断的置信度。

因此,备受关注的是美国TypeSafe AI作为早期访问发布的“Jev”。开发负责人迪奥戈·阿尔梅达曾是OpenAI的研究员,参与了使用人类反馈调整模型的RLHF研究以及与ChatGPT相关的技术开发。

Jev的最大特点是不进行聊天。不生成故事或说明文,而是对开发者预先定义的选项返回固定格式的值和概率。TypeSafe称之为“System One Model”,它模仿人类快速直观的思考“系统1”,优化方向是大量处理瞬时判断,而非深度长时间推理的AI。


通过“不生成文章”获得的速度

一般的大规模语言模型基于前一个单词或标记逐个生成下一个标记。虽然自由度高,可用于对话、摘要、程序创建等广泛用途,但输出越长,时间和费用就越多。此外,从程序中使用时,还必须解析回复并检查是否为预期格式。

Jev有意放弃了这种自由度。即使输入是自然语言等非结构化数据,输出候选和数据类型也需事先确定。例如,将客户邮件分类为“账单”、“取消”、“产品故障”、“其他”,并以概率返回每个的可能性。由于不逐字生成文章,并行输出多个判断,因此易于加速。

根据TypeSafe公布的数据,响应时间为70至500毫秒。输入费用为每百万标记0.042美元,输出被视为“无需测量的成本”而免费。该公司表示,在目标System One型任务中,Jev在保持接近现有LLM智能的同时,速度可提高数十倍至最多200倍。其独特的工作流评估显示速度提高了193.6倍,成本降低了444.6倍。

然而,这些主要是由开发商设计和公开的评估。TypeSafe自己也明确指出,工作流创建者可能存在偏见,比较条件可能对Jev有利,价格未被补贴的情况只能在长期内证明。不能将这些夸张的倍数视为可在所有用途中重现的一般性能。


开发者反应的不是“聪明”而是易于嵌入

据称,公开后,关注度集中到一度无法跟上API的提供能力。社交媒体上引人注目的不是与模型闲聊的反应,而是开发者替换实际业务流程并进行测量的帖子。

 

Vercel的软件工程师Pranit Sharma报告说,在命令安全性确认的分类处理中,将现有的OpenAI模型替换为Jev后,精度提高的同时速度提高了5至18倍。

Bryo AI的CTO Nikhil Mudholkar在业务邮件分类中与Gemini进行比较。他自己的测试显示,虽然Gemini的精度略高,但Jev的成本仅为其1/10至1/20,尤其是每个判断附带实用概率的点被高度评价。这是因为更容易创建仅将低置信度案件转给人类的机制。

另一方面,参与开源模型执行基础的Armin Ronacher指出,如何处理概率是用户的责任。如果是50%,是否停止处理;如果是95%,是否可以自动执行。模型不会决定这些界限。Jev显示不确定性,但如何将不确定性转化为业务规则需要引入企业自行设计。

这些社交媒体上的报告作为Jev可能性的初步案例很有趣。然而,这些是各自开发者在特定用途上进行的测试结果,而非在统一条件下进行的第三方基准测试。需要区分积极的反应和一般性能证明。


“不产生幻觉”意味着什么

关于Jev最需要注意的表达是“不产生幻觉”。

如果输出候选和类型从一开始就固定,原则上更容易防止随意创建不存在的项目或在说明中破坏格式的问题。因为返回的内容被限制为真假值、分类标签、数值、概率等,生成软件无法读取的文章或虚构的函数调用的余地很小。

然而,形式正确并不保证判断内容正确。即使将“退款请求”误分类为“一般问题”,输出格式本身仍然完美正确。TypeSafe保证的主要是不会偏离模式或类型,并不意味着总是对现实给出正确答案。

此外,概率的校准也很重要。当模型回答“90%”的案例大量聚集时,如果确实约90%是正确的,那么该概率可以说是经过良好校准的。相反,如果显示为90%而正确率为60%,则无法用作自动化的安全阀。需要根据行业、语言、输入长度、数据随时间变化等进行持续验证。

在日本企业中使用时,还需确认对日本语敬语、省略表达、公司特有词汇、模糊请求的处理。即使在英语邮件中表现良好,也不一定能在日本语呼叫中心记录或审批文件中达到相同精度。


不是替代生成AI,而是进行旁观监视

Jev的一个有力用途不仅仅是替代LLM,还可以作为生成AI的前后“监视者”。

例如,判断用户请求中是否包含获取机密信息的命令。检查AI代理尝试执行的操作是否危险。评估生成的回复是否与会话内容不矛盾,是否触犯禁令。调用高性能LLM作为监视者每次都可能增加费用和等待时间,但廉价且快速的判断模型则更容易插入多阶段检查。

另一个用途是“模型路由”。简单请求分配给小型廉价模型,难题分配给高性能模型,包含图像的请求分配给多模态模型。如果使用昂贵的LLM进行分配,节约效果会减弱,但像Jev这样的模型可能在入口处进行细致的选择。

在企业系统中,与其将所有过程交给一个万能AI,不如组合不同专长的小部件,在费用、速度、审计方面更为现实。Jev的目标是成为用户看不见但在无数应用程序内部被调用的“判断的通用部件”。


名字中蕴含的“杰文斯悖论”

Jev这个名字来源于19世纪经济学家威廉·斯坦利·杰文斯。杰文斯悖论是指资源利用效率提高时,不仅没有节约,反而用途扩大,总消耗量增加的可能性。

如果AI的判断成本降低到1/100,企业未必会将AI支出减少到1/100。可能会在此前因成本过高而无法引入的场合中增加数百、数千的判定处理。因为可以在每个查询、交易、点击、代理操作中插入“稍微聪明的判断”。

这在提高便利性的同时,也意味着监视和自动选择可能扩展到看不见的地方。如果用于候选人分类、客户优先级排序、不正当使用判定等,错误和偏见的影响将很大。廉价的优点是可以大量使用,但也意味着可以大量放大相同的误判断,这是一体两面的风险。


日本企业的现实导入步骤

在日本,生成AI的导入多从公司内部聊天和文档创建支持开始。Jev型模型适合于下一阶段。用于查询分配、监视警报优先级排序、销售案件分类、内容审核、AI代理操作批准等,目前是人类通过查看屏幕进行分流的工作。

在导入时,不要立即自动执行,首先与人类判断并行运行是安全的。通过业务数据测量精度和概率校准,对错误可能造成重大损失的项目提高自动化阈值。将低置信度案件返回给人类,持续监视模型和输入数据的变化。此外,还需要记录谁定义了输出候选,谁批准了阈值。

重要的是,不要模糊“因为AI判断了”而责任不清,并能够解释将AI的概率转换为企业决策的规则。Jev的强项在于返回结构化的值而非自由文章。能否将这一强项与可审计性相结合,将决定其作为高速分类器和可信赖的业务基础之间的差异。


AI的主战场将转移到屏幕之外

Jev并不是要终结像ChatGPT这样的对话AI。在文章创作、对话、复杂推理、创造性工作中,LLM的自由度是不可或缺的。另一方面,在软件内部重复数百万次的小判断中,自由度反而可能成为障碍。

Jev提出的本质问题不是“哪个AI最聪明”,而是“这项工作是否真的需要生成文章”。如果所需答案是几个选项和概率,那么每次调用庞大的对话模型的理由就很薄弱。

未来,类似的模型和竞争产品将增多,独立的第三方评估将推进。Jev的神秘架构、仅用合成数据训练的主张、价格的可持续性也需要验证。即便如此,AI的未来不仅在于华丽的聊天界面,而是扩展到条件分支、监视、分类、分配等不起眼的处理中的观点是有说服力的。

下一次AI革命未必是通过与人类对话来实现的。它将在软件深处以人们察觉不到的速度决定“下一步做什么”。Jev正试图站在这一静默变化的前沿。


关于SNS的反应

本文中介绍的SNS反应基于开发者在公开后发布的个别测试以及TechCrunch的采访和引用整理而成。虽然对速度、价格、概率输出的评价很高,但由于不是在相同条件下进行的大规模独立验证,因此需要在各公司的生产数据中重新评估。


出处URL