Egg's Fragrance Memory.淡淡香憶

  • 首頁
  • FB粉專
Egg's Fragrance Memory.淡淡香憶
請多多閱讀分享!
  1. 首頁
  2. AI
  3. 本文

Jev 是什麼?217 個案例、300 次判斷實測:速度、準確率與應用場景

2026-09-19 10次閱讀 0人點讚 0則留言

目錄

  • Jev 是什麼:一個只做選擇題的 AI
    • 如何取得 Jev
  • 官方數據,以及需要保留看待的地方
  • 已經實際跑通的使用情境
    • 一、替 AI 助手充當決策器
    • 二、逐筆分類大量資料
    • 三、信心足夠就自動通過,不足再交給大模型
  • 已經整合進產品的案例
    • 哪些案例沒有列入
  • 我的實測:四次失敗,兩輪跑通
    • 先說四次失敗:把 Jev 塞進自己的工具,全都卡住
  • 第一輪實測:讓 Jev 自己為 217 個專案評分
  • 第二輪實測:信心分數準不準?中文環境下有多快?
  • 綜合判斷
  • 建議流程

Jev 是什麼?217 個案例、300 次判斷實測:速度、準確率與應用場景

Jev 發布不到一週,網路上已經充滿「快近 200 倍」、「永不出錯」、「LLM 要被取代」等說法。我翻閱大量文章,也跑了一批用例後發現:真正把東西做出來的人不多,大多數內容只是轉發、觀點,或「我打算做一個……」。這篇文章只做三件事:說清楚 Jev 是什麼、不是什麼;把真正跑通的案例按用途分類;把其中的內容說明白。

Jev 是什麼:一個只做選擇題的 AI

TypeSafe AI 在 2026 年 9 月 15 日發布 Jev,創辦人 Diogo Almeida 出身 OpenAI。

一句話理解:ChatGPT、Claude 是「會寫作文的 AI」,Jev 是「只會做選擇題的 AI」。你給它一段資訊和幾道預先定好的題目,它一次回傳答案,每個答案都附帶一個「我有幾成把握」的信心分數。

它只會回答三種題型:

  • 單選(Choice):從最多 255 個選項中選一個。
  • 評分(Score):在一個刻度上給分。
  • 是/否(Noul):給出「是」的機率。

為什麼它又快又便宜?普通大型語言模型會逐字產生文字;Jev 的答案範圍事先固定,只要計算每個選項的機率即可。官方資料顯示,回應時間約為 0.07 至 0.5 秒;輸入每百萬 token 收費 0.042 美元,輸出免費。它的訓練目標也不同:不追求答案寫得漂亮,而是追求機率準確——說有 70% 把握時,實際上就應該約有 70% 的答案正確。

但 Jev 不能聊天、不能寫程式、不能寫文案,也不能看圖片。

如何取得 Jev

目前有兩個管道。

第一個是官方管道:到 TypeSafe 官網排隊申請,通過後會收到「You're in!」的電子郵件,點擊連結註冊帳號即可取得 API 金鑰。

第二個是 OpenRouter:不必排隊,註冊後直接呼叫 typesafe/jev 模型,按用量付費。想立即開始使用可以走這條;本文後面的兩輪實測也是透過 OpenRouter 執行。

官方數據,以及需要保留看待的地方

以下是官方的比較:

項目 一般大型語言模型 Jev
輸出 自由文字,需要由程式再解析 固定選項與機率
回應時間 3 秒至 5 分鐘 0.07 至 0.5 秒
輸入價格 每百萬 token 約 0.20 至 10 美元 每百萬 token 0.042 美元
輸出價格 通常是輸入價格的 5 倍 免費
可處理的輸入長度 數十萬 token 約 3.2 萬 token
圖片理解 可以 不可以,只接受文字

官方沒有使用公開排行榜,而是自行建立測試:讓不同模型在同一段程式中做決策,再把兩個最強模型的平均答案當作標準。在這套測試中,Jev 的準確率約為 68%,接近中等水準的大模型,但價格便宜 40 至 400 倍、速度快 20 至 200 倍。

不過,Hacker News 上有幾個值得記住的質疑:

  1. 「永不產生幻覺」指的是不會輸出選項以外的答案,但選錯選項仍然完全可能。TypeSafe 的執行長也承認了這一點。
  2. 「前沿模型」這個說法有借光之嫌。更準確的說法是:在「做選擇題」這件事上,它把速度和成本推到了新的水準。
  3. 速度比較不完全公平。Jev 比的是大型語言模型完整寫出一段答案的時間,而不是讓大模型也只回傳一個字母。
  4. 刷屏的 Doom 遊戲示範餵給模型的是敵人座標,不是遊戲畫面。模型等於能透視,證明的是反應速度,不是它會玩遊戲。

這些批評沒有推翻 Jev 的價值,但說明「Jev 取代大模型」是個錯誤命題。合理的用法是:由大模型協助想清楚判斷規則,再由 Jev 在生產環境中高頻、低成本地執行。它搶的不是大模型的工作,而是那些過去不值得導入 AI 的小型判斷。

已經實際跑通的使用情境

一、替 AI 助手充當決策器

這是數量最多、品質最高的一類。AI 助手每一步都要在有限動作中選一個,正好符合選擇題,而且需要快速完成。

代表案例是 Browser Use 開源的 Jev Ultrafast:不再每一步都截圖交給視覺模型,而是先把網頁拆成帶編號的元素清單,再讓 Jev 選擇「要做什麼」以及「對哪個元素做」。實測顯示,搜尋一張機票的全流程從 9.5 秒縮短至 7.1 秒。這個專案附有測量腳本,是目前看到證據最完整的案例。

二、逐筆分類大量資料

這是 Jev 最可能省錢的地方。輸出免費、輸入極便宜,代表逐筆詢問幾百萬筆資料,例如「這筆資料要不要觸發警報」、「這封郵件是不是詐騙」,在成本上變得可行。使用大型語言模型處理這類工作,過去通常太昂貴、太慢。

三、信心足夠就自動通過,不足再交給大模型

這是最值得研究的用法,因為它真正用到 Jev 最獨特的功能:信心分數。高信心的結果自動通過,低信心的結果再交給大模型或人工處理。

已經整合進產品的案例

這是最重要的訊號:有人已經在真正的付費產品中接入 Jev

產品 用途
Higgsfield API 為圖片/影片生成請求選擇模型
GojiberryAI 銷售線索資格判斷與排序
Shipper 內部用來決定如何把網站轉換成 App
SPIRITT 工作區中可直接選用 Jev
AshAI/ReqLLM 加入由 Jev 驅動的動作

哪些案例沒有列入

OpenJev、Kev、Nimble 等模仿 Jev 的替代模型沒有列入,因為它們不是 Jev 的應用。純觀點、教學文章、上線公告,以及沒有執行證據的構想也都排除;這些內容的數量大約是真實案例的好幾倍。

我的實測:四次失敗,兩輪跑通

上面的案例都是其他人的成果。接下來是我自己的測試。先說失敗,再說跑通。

先說四次失敗:把 Jev 塞進自己的工具,全都卡住

拿到 Jev 的第一週,我沒有先做基準測試,而是直接把它塞進每天使用的工具,想看看能不能提升效率。結果試了四次、全部失敗。需要先說清楚:失敗原因都不在模型本身——Jev 的 API 每次都正常回應,中文判斷也準——而是它一進入真實應用就撞牆。

原本想讓它做什麼 結果 卡住的地方
替 Claude Code 安裝上下文壓縮外掛 無法安裝;勉強執行後變成「無腦刪除」,換成對任何內容都回答 0 的假模型,效果也一樣 為了塞進 32K 上限,外掛先把內容全部砍掉,Jev 只看得到工具名稱與長度
替 Codex 做模型路由,節省額度 反而多花 59% 至 184%,每一步多等 1 至 2 秒 中間代理讓請求變重 2.5 倍,也遺失了快取
替自己的文章挑出「AI 味」 速度快、成本低,但 62 句中誤報 22 句;淨增加的價值接近零 原本就會逐句自我審稿,Jev 沒有多找出任何問題
判斷 40 部大型影片哪些可以刪除 判定 0 部可以刪除,單純規則反而能找出 7 部 看不到檔案內容,只能根據檔名猜測

四次失敗的根本原因有三個:

  1. 它看不到內容。上下文壓縮與磁碟清理都死在這裡。為了塞進 32K 上限,必須先刪減內容;刪完之後,它就無法判斷。所謂「又快又準」只成立了前半句——要準就得讓它看見內容,但讓它看見內容又會超過上限。不是它不精準,而是根本沒有得到可供判斷的內容。
  2. 訂閱制殺死了它的經濟學。它的賣點是「比呼叫大模型便宜幾百倍」,但我使用的 Codex、Claude Code 都是訂閱制,判斷這件事本來就包含在月費內,邊際成本是零。再插入一層 Jev,只會多一層、多一秒,也多出故障點。所謂「路由到便宜模型以節省額度」,換便宜模型不叫節省,叫少買一點。
  3. 它只會判斷,不會做事。只要要接進真實流程,就需要第三方外掛或代理搬運資料,而那些專案多半是個人花兩三天寫出來的。失敗往往不是 Jev 的錯,而是周圍那層外殼的錯。

這四次經驗帶來的教訓不是「Jev 沒用」,而是:想靠它替自己提升效率,通常走不通;把它當作零件做進產品,才有可能成功。

第一輪實測:讓 Jev 自己為 217 個專案評分

我把 60 個案例,加上 GitHub 上 167 個 Jev 專案,共 217 筆公開介紹交給 Jev,逐筆判斷「今天能不能取得、能不能使用」。

  1. 真正能立即使用的很少,而且幾乎都是介面,不是應用。217 筆中,被判定為「目前可用」且證據充分的只有 15 個;其中 14 個是 pydantic-ai、LangChain、Vercel AI SDK 等主流開發框架中的 Jev 整合。唯一的應用是 jev-ultrafast,與前文列為標竿的判斷一致。
  2. X 上的示範,大多是「作者跑通了,但你拿不到」。熱鬧是真的,能下載使用的很少。
  3. 「已整合進產品」的五個案例,Jev 比我更保守。它只認定 SPIRITT 與 ReqLLM 是今天可以直接接觸到的產品。

這一輪的限制:Jev 只閱讀我提供的文字,不開啟連結,也不執行程式;它判斷的是「公開證據是否足夠」,不是專案本身好不好。由於沒有 217 筆資料的標準答案,也無法在這一輪驗證它的信心分數是否準確。

第二輪實測:信心分數準不準?中文環境下有多快?

我準備 100 條中文科技資訊,事先標記正確答案;每條資訊設計三道題,總共進行 300 次判斷。對照組是價格便宜的大模型 Qwen 3.8 Flash,測試從上海逐筆串列呼叫。

  1. 它標示「九成以上把握」的結果,一個都沒有錯。300 次判斷中,有 255 次屬於這個區間,全部答對。若把 80% 設為自動放行門檻,可以放掉 89% 的請求,只錯 1 題。「有把握就自動通過」這套方法,至少在簡單任務上成立。
  2. 實測約 0.7 秒,比官方數字慢,但非常穩定。最慢的一次是 1.5 秒;Qwen Flash 對照組的中位數差不多,但最慢一次達到 32 秒。Jev 真正勝出的不是絕對速度,而是沒有長尾延遲。
  3. 準確率與費用都和便宜大模型打平。Jev 準確率 94.7%,Qwen Flash 為 93.0%;兩者成本都約 0.003 美元。官方所說的「便宜 40 至 400 倍」,比較對象是前沿大模型;與輕量模型比較時,Jev 並沒有價格優勢。

這一輪的限制:100 條資料是由 25 個模板各自變化 4 次生成,任務偏簡單,因此高信心結果全部答對並不意外;80% 至 90% 區間只有 11 個樣本,無法下定論。Jev 與 Qwen 答案不同的 12 題,幾乎都是「雲端資料庫算不算應用」這類標籤邊界問題,結果很大程度取決於標籤如何定義。若要做出生產環境結論,仍需用真實資料進行盲測。

綜合判斷

完成兩輪實測,再加上前面的四次失敗後,我的看法很明確。

  1. Jev 是真的,但它不是「更便宜的大模型」,而是另一種東西。與 Qwen Flash 這類輕量模型比較時,它的準確率打平、費用打平;多出來的只有兩項優勢:反應時間穩定,以及每個答案都有可用來分流的信心分數。誰把「便宜」當成選擇 Jev 的主要理由,誰就選錯了。它不是更聰明,而是把「判斷」這種工作從「寫作文」改成「塗答題卡」——代價是它只會塗答題卡。
  2. 今天能用的 Jev,是框架中的介面,不是完整應用。217 個專案中只有 15 個真正可用,14 個是 pydantic-ai、LangChain、Vercel AI SDK 等框架的整合層。我自己把它接進日常工具四次,全部失敗。X 上的示範可以參考,但不要預期拿來就能用。Jev 是給產品開發者使用的零件,不是給一般工具使用者提升效率的工具。
  3. 它真正有價值的用法只有一個:按照信心程度分流。高信心自動通過,低信心再詢問大型語言模型。我的測試中,信心達九成以上的 255 次判斷一個都沒有錯。這不是「取代大模型」,而是在大模型前面加上一道又快又穩的閘門,把八、九成的請求擋在外面。
  4. 但現在還不適合直接正式上線。兩輪樣本都偏簡單,80% 至 90% 區間只有 11 個樣本;官方帳號仍需排隊,OpenRouter 雖然可以立即使用,但它是第三方通道,並不代表官方服務承諾。

建議流程

  1. 列出業務中所有「目前使用大模型,但其實只要求回傳一個選項」的呼叫。如果一個都沒有,就不必追逐這個熱點。
  2. 如果有,挑選一個場景,以真實歷史資料建立人工標準答案,先做一次盲測,重點檢查 70% 至 90% 信心區間的實際正確率。
  3. 測試通過後,在大模型前面加入 Jev 閘門,從 90% 門檻開始,根據資料逐步調低。
參考資料:TypeSafe AI:Introducing System One Models and Jev、ExplainX:TypeSafe AI Jev 系統介紹。
本作品採用 知識共享署名-相同方式共享 4.0 國際許可協議 進行許可
標籤: AI Agent AI 模型 AI 評測 Jev LLM TypeSafe AI 人工智慧 模型路由 資料分類 開發工具
最後更新:2026-09-20

EGG

請多多按讚分享!

贊助 點讚
< 上一篇

文章評論

razz evil exclaim smile redface biggrin eek confused idea lol mad twisted rolleyes wink cool arrow neutral cry mrgreen drooling persevering
取消回覆

Translate To Your Language
Search
聯絡我

文章邀約請寄至:[email protected]

寄信或商品試用請寄至:台南市南區大同路郵局第81號信箱 淡淡香憶收

文章目錄
  • Jev 是什麼:一個只做選擇題的 AI
    • 如何取得 Jev
  • 官方數據,以及需要保留看待的地方
  • 已經實際跑通的使用情境
    • 一、替 AI 助手充當決策器
    • 二、逐筆分類大量資料
    • 三、信心足夠就自動通過,不足再交給大模型
  • 已經整合進產品的案例
    • 哪些案例沒有列入
  • 我的實測:四次失敗,兩輪跑通
    • 先說四次失敗:把 Jev 塞進自己的工具,全都卡住
  • 第一輪實測:讓 Jev 自己為 217 個專案評分
  • 第二輪實測:信心分數準不準?中文環境下有多快?
  • 綜合判斷
  • 建議流程

COPYRIGHT © 2023 Egg's Fragrance Memory.淡淡香憶. ALL RIGHTS RESERVED.