在人工智能领域,一个被称为“异类”的产品迅速走红。
9月15日,TypeSafe推出了Jev。数日后,它已被集成至Vercel、Cloudflare、LangChain、Langfuse等开发者工具中。Vercel透露,Jev接入AI Gateway后的24小时内,接近13%的付费团队已开始使用它。
然而,AI领域的产品看似功能强大,令许多人跃跃欲试,但当真正想亲自动手时,不少人仍不知从何入手。需要下载什么?是否要先配置环境?不会编程能否体验?
因此,趁着目前还能免费试用,我们先行替大家尝试一番:亲自体验Jev,并尽量教会大家轻松上手使用Jev。
但在开始前,不得不提,测试下来Jev的第一道门槛比预期要低。就像之前的OpenClaw,我们曾提到它的配置需求不高,未来甚至可能连智能手表都能运行。
而Jev的首次体验更为省事,甚至无需打开电脑,仅通过网页端就能使用。
另一方面,我们这次选择的体验案例也与大多数人在网上冲浪的实际需求密切相关。随着AI的爆发,社交媒体上的信息也开始真假混杂。哪些是真实消息?哪些是胡编乱造?哪些是AI生成的?
过去,人们不可能逐一核实每条信息的“真伪鉴定”步骤,这次我们打算交给Jev来完成。
用Jev打造“火眼金睛”
目前,能体验Jev的入口已经不少,比如我们这次使用的第三方网站Jev AI Dev,其基本功能均可在此试用,每个账号每天还有六次免费体验额度,适合大家先熟悉一下。
网址提供如下:https://jevai.dev/zh-Hans/playground/
点击链接后,会进入中文试玩页面。先点击右上角的“登录”,按提示登录账号,然后向下找到“单个问题”和“多个问题”。
这两个选项可以理解为:基于同一份材料,只询问一件事,或一次性询问多件事。例如,给Jev一条科技新闻,我们可以只让它判断“这属于哪类新闻”,也可以顺便询问“消息有多可信”“其中的说法是否得到验证”。
既然要做一个信息核实工具,我们这次选择“多个问题”,便能对一条消息同时提出多个问题。
继续向下浏览,可以看到页面默认填充了一套“AI助手任务交接”的示例。我们可以直接在这套示例上进行修改,将内容替换为自己的。
先找到“输入”框,删除原有示例文字,填入以下消息:
“9月23日,一家AI公司发布新模型,声称其代码能力比上一代提升30%,但目前仅公布了宣传材料,未公开完整测试数据。”
然后,便可直接体验Jev的三种能力:Choice、Score和Noul。虽然这些名称看起来陌生,但实际使用后,还是很容易理解的:
Choice是让Jev从几个答案中选一个。 比如,我们为它设置几个选项,让它判断一条内容下一步该如何处理。提交后,它会告知我们选择了哪个答案,同时给出每个答案的概率。
例如,我们想为这条新闻分类,需先告诉它有哪些类别可选。在Choice下方的“问题 / 指令”中,填入“这条消息最适合归类为什么?”
此时,可将“可选项”框中的原有内容替换为以下四行:
- product: 产品发布
- performance: 性能提升
- funding: 融资消息
- other: 其他
假如Jev最终返回product,表示它判断这条新闻的分类是“产品发布”。这样,我们就为Jev设定了一道选择题。
它会从这四个答案中选一个,同时给出每个答案的概率,让我们了解它倾向于各个选项的程度。
Score则是评分。 分类只能告诉我们这是一条什么消息,但无法告知我们该多信任它,因此需要一个评分系统来辅助。
在Score的“问题 / 指令”中,填入“这条消息的可信程度有多高?”
下面的“评分等级”需要我们自己设置。这里每行填一个等级,按从低到高的顺序排列:
- 很低
- 较低
- 中等
- 较高
- 很高
此时,我们相当于给了Jev一把评分的尺子,用以判断输入材料的可信度高低。
最后是Noul,可以简单理解为回答“是或否”。 网页上这一栏称为“Probability (Noul)”。
有时,我们可能还想了解比“可信程度有多高”更具体的信息。拿我们原本想问的问题为例,我们可能会好奇,公司声称代码能力提升30%,是否提供了证据?
那么,在这一栏的“问题 / 指令”中填入“这家公司是否已经证明新模型的代码能力比上一代提升30%?”,再将下方“‘否’与‘是’的定义”改为这两行:
- false: 没有证明
- true: 已经证明
至此,三个问题都已设置好。再来回顾一下,通过这一轮设置,我们让Jev对同一条消息进行分类、评分,并判断其中性能提升的说法是否得到验证;再点击下方的“体验Jev”,便将三个问题一并提交了。
由于此次测试在网页端运行,无论是电脑还是手机,都能看到Jev返回的结果。
最终可以看到,Choice选择了product,即“产品发布”,对应概率为0.62。“性能提升”的概率为0.38。它判断这是一次产品发布。
Score给出的分数是1.09。对照之前设置的五档,这次结果接近“可信程度较低”。
Noul的结果则是0.04,说明根据我们提供的材料,它倾向于认为尚未得到验证。
在这一系列操作后,Jev已给出其初步判断:一条消息便有了分类、可信程度评分,以及针对具体说法的判断。但它的依据仅是我们填入的文字,并未替我们上网查找完整测试报告。
于是,我们继续向下测试。要真正实现一个自动判断真伪的工具,还需让Python直接调用Jev,帮我们搭建一个科技新闻的自动审核流程。
全自动,手搓审核工具
我们在Jev的Playground主页下方,找到了AI模型聚合平台OpenRouter。注册并登录账号,创建API Key后,便可在Python中调用Jev。
这里创建普通的OpenRouter API Key即可,无需另外申请Jev专用的。
另外,前面第三方网站每天六次的免费体验额度,不会延续到OpenRouter,运行前需确认账号中有可用额度。
接下来,我们需要在程序中填好要判断的新闻、要问的问题,以及可选的答案。这和之前在网页中填表是一样的,只是提交和接收结果的工作,现在交给Python来完成。
第一条测试,我们给Jev一条这样的新闻:
“某AI公司宣布新模型准确率提升50%,但目前没有公开任何测试方法、数据集或完整测试结果。”
我们提前告知Jev,接下来只有三个选择:publish(发布)、verify(核实)、reject(拒绝)。同时,再让它判断这条消息的可信程度,以及是否需要人工审核。
这里依然使用了前面的三种能力。Choice这次负责选择下一步如何处理,Score负责评分,Noul负责判断是否需要人工审核。 后两项的数值,需要结合程序中设置的评分标准和审核条件来使用。
结果是:下一步:verify;可信程度:0.35;人工审核概率:0.88。
也就是说,Jev认为这条消息暂时不能直接发布,应先核实,而且很可能需要人工查看。Python程序拿到这个结果后,便可自动将其放入“待核实”队列,并加上“需要人工审核”的标记。
整个过程其实可以简单理解为:
新闻输入 → Jev判断 → 程序查看结果 → 自动执行下一步
不过,我们还想尝试一个更接近真实使用场景的玩法。
平时用AI查消息,我们常会遇到一个问题。它能给出一个看似合理的回答,但这段回答究竟有多少依据,能否直接使用,还需自己判断。
因此这次,我们让普通AI先回答问题,再将它的回答交给Jev检查。看看能否让程序先进行筛选,把需要核实的回答留下来。
于是,我们先向AI输入了一个问题:
“OpenAI最新模型的代码能力比上一代提升了30% 吗?”
此时,我们同时得到了普通AI的回答和Jev的结果:
可以看到,基于AI的回答,Jev给出的判断是,下一步是“verify”,可信程度3.2,人工审核概率0.38。
根据前面的三个选项,publish表示可采用,verify表示需核实,reject表示拒绝采用,也就是说AI回答的这个答案仍有些问题。
当然,Jev给出verify,也不等于它认定AI的回答是错误的。
而人工审核概率为0.38,也未达到我们设置的人工审核条件,所以程序未将其交给人工,而是让它继续进入自动核实流程。
这样一来,一个最简单的“AI + Jev”的组合便形成了一个基础流程:用户提问 → AI回答 → Jev检查 → 程序执行下一步
此时,便可让这个流程进入更具体的场景:
还是让Jev判断一条AI新闻该如何处理,不过这次,我们将结果明确分为三个:publish:直接发布;verify:先核实;reject:直接拦截。
然后用Python编写一个非常简单的规则:Jev返回什么,程序就执行对应的动作。
第一条测试内容为:某公司已公开完整测试数据和技术报告,证明新模型性能有明确提升。Jev的判断是publish,直接发布;
第二条换成:某公司宣布新模型性能提升30%,但关键测试数据尚未公开。这次,Jev给出的结果是verify,待核实;
最后,我们故意将条件变得更加夸张:某公司声称新模型性能提升1000%,但没有任何测试数据,也没有可靠来源。Jev返回reject,拒绝。
这三轮测试下来,发布、核实、拦截三个分支均已跑通。
以后再有新闻输入,程序便可先让Jev判断,再将消息交给对应步骤处理,省去我们逐条查看结果、手动分类的过程。
下一个Manus时刻?
这次使用下来,我们觉得最需花心思的地方,其实是把问题问清楚。例如,“这条消息可信吗”和“这家公司有没有证明性能提升”,看似相近,但对AI来说完全是两种不同的判断。
以前我们费尽心力为AI编写更好的提示词,现在看来,使用Jev这类软件,扎实的语文功底仍是必不可少的。先想好自己需要什么结果,才能让Jev发挥作用。
另外,Jev的玩法其实还有很多。前面的新闻审核只是最基础的玩法,已有人直接拿Jev研究微信聊天。
例如“Crush好感监控器”,能分析聊天记录中的情绪和意图,还能为自己的回复评级。以前要截图问朋友“他这句话是什么意思”,现在有人将这件事做成了工具。
说起来,Jev的热度确实高得惊人,有当年Manus爆火时的感觉。
如果将“Manus时刻”理解为一种让人看完演示后,便忍不住想亲手试试的兴奋感,那么Jev身上,或许确实迎来了属于它的“Jev时刻”。
本文来自微信公众号“蓝字计划”,作者:Chester,36氪经授权发布。













想了解更多将复杂的游戏世界观设定与体验顺序同步解读,降低理解门槛。相关内容,尽在华体会娱乐。
华体会娱乐围绕平台内容围绕游戏话题持续更新,保持与玩家社区的同步。不断创新,回应用户的真实需求。
回复 20分钟前