Jev 是什麼:一個只做選擇題的 AI
TypeSafe AI 在 2026 年 9 月 15 日發布 Jev,創辦人 Diogo Almeida 出身 OpenAI。
一句話理解:ChatGPT、Claude 是「會寫作文的 AI」,Jev 是「只會做選擇題的 AI」。你給它一段資訊和幾道預先定好的題目,它一次回傳答案,每個答案都附帶一個「我有幾成把握」的信心分數。
它只會回答三種題型:
- 單選(Choice):從最多 255 個選項中選一個。
- 評分(Score):在一個刻度上給分。
- 是/否(Noul):給出「是」的機率。
為什麼它又快又便宜?普通大型語言模型會逐字產生文字;Jev 的答案範圍事先固定,只要計算每個選項的機率即可。官方資料顯示,回應時間約為 0.07 至 0.5 秒;輸入每百萬 token 收費 0.042 美元,輸出免費。它的訓練目標也不同:不追求答案寫得漂亮,而是追求機率準確——說有 70% 把握時,實際上就應該約有 70% 的答案正確。
但 Jev 不能聊天、不能寫程式、不能寫文案,也不能看圖片。
如何取得 Jev
目前有兩個管道。
第一個是官方管道:到 TypeSafe 官網排隊申請,通過後會收到「You're in!」的電子郵件,點擊連結註冊帳號即可取得 API 金鑰。
第二個是 OpenRouter:不必排隊,註冊後直接呼叫 typesafe/jev 模型,按用量付費。想立即開始使用可以走這條;本文後面的兩輪實測也是透過 OpenRouter 執行。
官方數據,以及需要保留看待的地方
以下是官方的比較:
| 項目 | 一般大型語言模型 | Jev |
|---|---|---|
| 輸出 | 自由文字,需要由程式再解析 | 固定選項與機率 |
| 回應時間 | 3 秒至 5 分鐘 | 0.07 至 0.5 秒 |
| 輸入價格 | 每百萬 token 約 0.20 至 10 美元 | 每百萬 token 0.042 美元 |
| 輸出價格 | 通常是輸入價格的 5 倍 | 免費 |
| 可處理的輸入長度 | 數十萬 token | 約 3.2 萬 token |
| 圖片理解 | 可以 | 不可以,只接受文字 |
官方沒有使用公開排行榜,而是自行建立測試:讓不同模型在同一段程式中做決策,再把兩個最強模型的平均答案當作標準。在這套測試中,Jev 的準確率約為 68%,接近中等水準的大模型,但價格便宜 40 至 400 倍、速度快 20 至 200 倍。
不過,Hacker News 上有幾個值得記住的質疑:
- 「永不產生幻覺」指的是不會輸出選項以外的答案,但選錯選項仍然完全可能。TypeSafe 的執行長也承認了這一點。
- 「前沿模型」這個說法有借光之嫌。更準確的說法是:在「做選擇題」這件事上,它把速度和成本推到了新的水準。
- 速度比較不完全公平。Jev 比的是大型語言模型完整寫出一段答案的時間,而不是讓大模型也只回傳一個字母。
- 刷屏的 Doom 遊戲示範餵給模型的是敵人座標,不是遊戲畫面。模型等於能透視,證明的是反應速度,不是它會玩遊戲。
這些批評沒有推翻 Jev 的價值,但說明「Jev 取代大模型」是個錯誤命題。合理的用法是:由大模型協助想清楚判斷規則,再由 Jev 在生產環境中高頻、低成本地執行。它搶的不是大模型的工作,而是那些過去不值得導入 AI 的小型判斷。
已經實際跑通的使用情境
一、替 AI 助手充當決策器
這是數量最多、品質最高的一類。AI 助手每一步都要在有限動作中選一個,正好符合選擇題,而且需要快速完成。
代表案例是 Browser Use 開源的 Jev Ultrafast:不再每一步都截圖交給視覺模型,而是先把網頁拆成帶編號的元素清單,再讓 Jev 選擇「要做什麼」以及「對哪個元素做」。實測顯示,搜尋一張機票的全流程從 9.5 秒縮短至 7.1 秒。這個專案附有測量腳本,是目前看到證據最完整的案例。
二、逐筆分類大量資料
這是 Jev 最可能省錢的地方。輸出免費、輸入極便宜,代表逐筆詢問幾百萬筆資料,例如「這筆資料要不要觸發警報」、「這封郵件是不是詐騙」,在成本上變得可行。使用大型語言模型處理這類工作,過去通常太昂貴、太慢。
三、信心足夠就自動通過,不足再交給大模型
這是最值得研究的用法,因為它真正用到 Jev 最獨特的功能:信心分數。高信心的結果自動通過,低信心的結果再交給大模型或人工處理。
已經整合進產品的案例
這是最重要的訊號:有人已經在真正的付費產品中接入 Jev
| 產品 | 用途 |
|---|---|
| Higgsfield API | 為圖片/影片生成請求選擇模型 |
| GojiberryAI | 銷售線索資格判斷與排序 |
| Shipper | 內部用來決定如何把網站轉換成 App |
| SPIRITT | 工作區中可直接選用 Jev |
| AshAI/ReqLLM | 加入由 Jev 驅動的動作 |
哪些案例沒有列入
OpenJev、Kev、Nimble 等模仿 Jev 的替代模型沒有列入,因為它們不是 Jev 的應用。純觀點、教學文章、上線公告,以及沒有執行證據的構想也都排除;這些內容的數量大約是真實案例的好幾倍。
我的實測:四次失敗,兩輪跑通
上面的案例都是其他人的成果。接下來是我自己的測試。先說失敗,再說跑通。
先說四次失敗:把 Jev 塞進自己的工具,全都卡住
拿到 Jev 的第一週,我沒有先做基準測試,而是直接把它塞進每天使用的工具,想看看能不能提升效率。結果試了四次、全部失敗。需要先說清楚:失敗原因都不在模型本身——Jev 的 API 每次都正常回應,中文判斷也準——而是它一進入真實應用就撞牆。
| 原本想讓它做什麼 | 結果 | 卡住的地方 |
|---|---|---|
| 替 Claude Code 安裝上下文壓縮外掛 | 無法安裝;勉強執行後變成「無腦刪除」,換成對任何內容都回答 0 的假模型,效果也一樣 | 為了塞進 32K 上限,外掛先把內容全部砍掉,Jev 只看得到工具名稱與長度 |
| 替 Codex 做模型路由,節省額度 | 反而多花 59% 至 184%,每一步多等 1 至 2 秒 | 中間代理讓請求變重 2.5 倍,也遺失了快取 |
| 替自己的文章挑出「AI 味」 | 速度快、成本低,但 62 句中誤報 22 句;淨增加的價值接近零 | 原本就會逐句自我審稿,Jev 沒有多找出任何問題 |
| 判斷 40 部大型影片哪些可以刪除 | 判定 0 部可以刪除,單純規則反而能找出 7 部 | 看不到檔案內容,只能根據檔名猜測 |
四次失敗的根本原因有三個:
- 它看不到內容。上下文壓縮與磁碟清理都死在這裡。為了塞進 32K 上限,必須先刪減內容;刪完之後,它就無法判斷。所謂「又快又準」只成立了前半句——要準就得讓它看見內容,但讓它看見內容又會超過上限。不是它不精準,而是根本沒有得到可供判斷的內容。
- 訂閱制殺死了它的經濟學。它的賣點是「比呼叫大模型便宜幾百倍」,但我使用的 Codex、Claude Code 都是訂閱制,判斷這件事本來就包含在月費內,邊際成本是零。再插入一層 Jev,只會多一層、多一秒,也多出故障點。所謂「路由到便宜模型以節省額度」,換便宜模型不叫節省,叫少買一點。
- 它只會判斷,不會做事。只要要接進真實流程,就需要第三方外掛或代理搬運資料,而那些專案多半是個人花兩三天寫出來的。失敗往往不是 Jev 的錯,而是周圍那層外殼的錯。
這四次經驗帶來的教訓不是「Jev 沒用」,而是:想靠它替自己提升效率,通常走不通;把它當作零件做進產品,才有可能成功。
第一輪實測:讓 Jev 自己為 217 個專案評分
我把 60 個案例,加上 GitHub 上 167 個 Jev 專案,共 217 筆公開介紹交給 Jev,逐筆判斷「今天能不能取得、能不能使用」。
- 真正能立即使用的很少,而且幾乎都是介面,不是應用。217 筆中,被判定為「目前可用」且證據充分的只有 15 個;其中 14 個是 pydantic-ai、LangChain、Vercel AI SDK 等主流開發框架中的 Jev 整合。唯一的應用是 jev-ultrafast,與前文列為標竿的判斷一致。
- X 上的示範,大多是「作者跑通了,但你拿不到」。熱鬧是真的,能下載使用的很少。
- 「已整合進產品」的五個案例,Jev 比我更保守。它只認定 SPIRITT 與 ReqLLM 是今天可以直接接觸到的產品。
這一輪的限制:Jev 只閱讀我提供的文字,不開啟連結,也不執行程式;它判斷的是「公開證據是否足夠」,不是專案本身好不好。由於沒有 217 筆資料的標準答案,也無法在這一輪驗證它的信心分數是否準確。
第二輪實測:信心分數準不準?中文環境下有多快?
我準備 100 條中文科技資訊,事先標記正確答案;每條資訊設計三道題,總共進行 300 次判斷。對照組是價格便宜的大模型 Qwen 3.8 Flash,測試從上海逐筆串列呼叫。
- 它標示「九成以上把握」的結果,一個都沒有錯。300 次判斷中,有 255 次屬於這個區間,全部答對。若把 80% 設為自動放行門檻,可以放掉 89% 的請求,只錯 1 題。「有把握就自動通過」這套方法,至少在簡單任務上成立。
- 實測約 0.7 秒,比官方數字慢,但非常穩定。最慢的一次是 1.5 秒;Qwen Flash 對照組的中位數差不多,但最慢一次達到 32 秒。Jev 真正勝出的不是絕對速度,而是沒有長尾延遲。
- 準確率與費用都和便宜大模型打平。Jev 準確率 94.7%,Qwen Flash 為 93.0%;兩者成本都約 0.003 美元。官方所說的「便宜 40 至 400 倍」,比較對象是前沿大模型;與輕量模型比較時,Jev 並沒有價格優勢。
這一輪的限制:100 條資料是由 25 個模板各自變化 4 次生成,任務偏簡單,因此高信心結果全部答對並不意外;80% 至 90% 區間只有 11 個樣本,無法下定論。Jev 與 Qwen 答案不同的 12 題,幾乎都是「雲端資料庫算不算應用」這類標籤邊界問題,結果很大程度取決於標籤如何定義。若要做出生產環境結論,仍需用真實資料進行盲測。
綜合判斷
完成兩輪實測,再加上前面的四次失敗後,我的看法很明確。
- Jev 是真的,但它不是「更便宜的大模型」,而是另一種東西。與 Qwen Flash 這類輕量模型比較時,它的準確率打平、費用打平;多出來的只有兩項優勢:反應時間穩定,以及每個答案都有可用來分流的信心分數。誰把「便宜」當成選擇 Jev 的主要理由,誰就選錯了。它不是更聰明,而是把「判斷」這種工作從「寫作文」改成「塗答題卡」——代價是它只會塗答題卡。
- 今天能用的 Jev,是框架中的介面,不是完整應用。217 個專案中只有 15 個真正可用,14 個是 pydantic-ai、LangChain、Vercel AI SDK 等框架的整合層。我自己把它接進日常工具四次,全部失敗。X 上的示範可以參考,但不要預期拿來就能用。Jev 是給產品開發者使用的零件,不是給一般工具使用者提升效率的工具。
- 它真正有價值的用法只有一個:按照信心程度分流。高信心自動通過,低信心再詢問大型語言模型。我的測試中,信心達九成以上的 255 次判斷一個都沒有錯。這不是「取代大模型」,而是在大模型前面加上一道又快又穩的閘門,把八、九成的請求擋在外面。
- 但現在還不適合直接正式上線。兩輪樣本都偏簡單,80% 至 90% 區間只有 11 個樣本;官方帳號仍需排隊,OpenRouter 雖然可以立即使用,但它是第三方通道,並不代表官方服務承諾。
建議流程
- 列出業務中所有「目前使用大模型,但其實只要求回傳一個選項」的呼叫。如果一個都沒有,就不必追逐這個熱點。
- 如果有,挑選一個場景,以真實歷史資料建立人工標準答案,先做一次盲測,重點檢查 70% 至 90% 信心區間的實際正確率。
- 測試通過後,在大模型前面加入 Jev 閘門,從 90% 門檻開始,根據資料逐步調低。

文章評論