frontier LLM の精度を、Jev の速さで実現する 4B のオープンモデル、Reflex-1

GitHubで見る

課題

業務の分類や判定に AI を使う場合、GPT-5.6・Gemini 3.8 などの frontier LLM は精度が高い一方で、1 問に 1〜3 秒かかり、クラウドでの従量課金になります。判定専用 AI の Jev は 0.3 秒と速いものの、推論が要る判定では精度が崩れ、画像には対応していません。どちらも重みが公開されていないため、自社の判定を後から学習させることもできません。

解決策

Google Gemma 4 E4B をベースに、分類の判定と、latent reasoning(推論を文章として書き出さず、モデルの内部で進める手法)による推論を備えた 4B のオープンモデル Reflex-1 を開発しました。要求は Jev と互換の形で、判定ごとに追加学習(LoRA + 潜在推論用の小さな部品)すれば、推論が要る自社特有の判定も、同じ速さで扱えるようになります。考えた各段は、あとから言葉に戻して確かめられます。

成果

分類の判定では frontier LLM と同じ精度帯のまま、1 判定 0.10 秒(中央値)と GPT-5.6 より 12 倍速く、Jev(0.30 秒)より速い応答になりました。追加学習した推論の判定(10 段の論理パズル)では、frontier LLM が 2.7 秒で出す 100% の精度を 0.8 秒で出しています。重みは 4bit で 9.8 GB と GPU 1 枚に載り、画像も読めます。開発は個人の環境(GX10 1 台)で 4 日、外部の費用は比較用の API 代 約 2.5 ドルでした。

Reflex-1: frontier LLM の精度を Jev の速さで。1 判定のレイテンシ Reflex-1 0.10 秒、Jev 0.30 秒、GPT-5.6 1.24 秒、Gemini 3.8 Flash 2.28 秒

Reflex-1 は、研究プロジェクト NerveReflex(AI モデルを、言葉ではなく内部表現のまま協調させる AI アーキテクチャの研究)の考え方を、実際に使えるオープンモデルとして形にした派生の成果です。

分類の判定では GPT-5.6・Gemini 3.8 などの frontier LLM と同じ精度帯の答えを、判定専用 AI の Jev より速く返し、自社の判定を追加学習すれば、推論が要る判定でも frontier LLM 並みの精度を Jev 並みの速さで出します。手元の GPU で動き、画像も読めます。個人の開発環境で、数日、数ドルで作りました。

12×GPT-5.6 より速い分類の判定(精度は同じ帯)
0.10 s1 判定のレイテンシ(中央値)。Jev は 0.30 秒
100% · 0.8 s追加学習した推論の判定(10 段の論理パズル、同じ 50 問)。frontier LLM は 100% に 2.7 秒、Jev は 0.3 秒で 52%
4B · 9.8 GB4bit で GPU 1 枚に載る公開の重み。画像も読める。1 回ごとの料金なし

分類の判定: 精度はそのまま、速さは桁違い

問い合わせの振り分け、SNS の感情、投稿の審査など、業務で使う分類を同じ問題・同じ選択肢で比べました。精度は 4 者とも同じ帯に並び、答えが返るまでの時間だけが桁で違います。

1 判定のレイテンシ(文章の分類 5 タスク)
1 判定のレイテンシ(文章の分類 5 タスク)
文章の分類: 精度 × 速さ
問い合わせの振り分け・発話の意図・感情・肯定否定・投稿の審査の平均
文章の分類: 精度 × 速さ
画像の分類: 精度 × 速さ
料理写真・EC 商品画像の平均。Jev は画像に非対応
画像の分類: 精度 × 速さ
左上ほど速くて正確です。Reflex-1 は GX10(GPU 1 枚)で 1 件ずつ、Jev・frontier は API 経由(通信込み)で計測しました。数値の詳細は「評価」にあります。
即答の判定: Jev と早押し — モデルに見せた選択肢をそのまま並べ、応答した瞬間に札が付きます。
画像の分類(Jev は非対応) — 料理と商品の写真 30 枚、1 枚 約 0.3 秒(写真は Wikimedia Commons の CC0 / パブリックドメイン)。

推論が要る判定も、追加学習で frontier LLM の精度を Jev の速さで

Jev は速いものの、推論が要る判定では崩れます。frontier LLM は reasoning ありなら正確ですが、1 問に数秒かかります。Reflex-1 は latent reasoning(推論を文章として書き出さず、モデルの内部で進める手法)でこの 2 つを両立します。判定を追加学習させると、推論が要る判定でも frontier LLM 並みの精度を、Jev と同じ 1 秒前後で返します。考えた各段は、あとから言葉に戻して確かめられます。下の図は、推論が要る論理課題 5 種で学習させた結果です。

推論が要る判定: 精度 × 速さ(追加学習した論理課題 5 種の平均)
推論が要る判定: 精度 × 速さ(追加学習した論理課題 5 種の平均)
お題: BIG-Bench Hard 由来の論理課題を同じ規則で深くしたもの(嘘つきの連鎖 10 段・20 段、入れ替え追跡 7 人・14 手、真偽式、道順)。課題ごとに追加学習しています。
推論: frontier・Jev と早押し — 問題の読み方の説明つき。左の札は潜在ステップを言葉に戻した trace です。

自社特有の判定も、学習させれば同じ速さで使える

この推論は課題ごとの追加学習で身につけたもので、どんな推論にもそのまま効くわけではありません。逆に言えば、請求書と発注書の突き合わせ、承認経路の判定、規程どおりかの確認など、自社特有の判定も、同じ方法で学習させれば、同じ速さで推論できるようになります。重みが公開されていない Jev や frontier LLM には、このように自社の判定を学習させることはできません。

frontier LLM・Jev とどう違うか

frontier LLM
GPT-5.6 / Gemini 3.8
Jev
typesafe/jev-1.13
Reflex-1
即答の判定▲精度は高いが 1〜3 秒●同じ精度帯・0.3 秒●同じ精度帯・0.1〜0.2 秒
推論が要る判定▲reasoning ありなら正確、数秒×崩れる●約 1 秒(追加学習した判定)
自社特有の判定を学習させる×できない×できない●追加学習できる
推論の中身を確かめる●reasoning の出力を読む×—●潜在ステップを言葉に戻す
画像●対応×非対応●1 枚 約 0.2 秒
手元で動く・軽さ×クラウドのみ×クラウドのみ●GPU 1 枚、4bit で 9.8 GB
重みの公開×非公開×非公開●公開
1 回ごとの料金×従量課金×従量課金●なし
要求の形式▲チャット●Decisions API●Jev と同じ形
● できる・強い ▲ 条件つき × できない

評価: frontier LLM・Jev・Reflex-1 の比較

同じ問題集・同じ選択肢で比較しています。Jev と Reflex-1 は全問(分類は各 200 問、推論は各 100 問)、frontier LLM はその中から選んだ参考値(分類は各 100 問、推論は各 50 問)です。数字は正解率 %、括弧はレイテンシです。

即答の判定(文章)

文章と選択肢を渡し、1 つ選ばせます。問い合わせをどの窓口に回すか / 音声アシスタントへの日本語の発話の意図 / SNS 投稿の感情(4 種)と肯定・否定・中立(3 種)/ コメントが他人への悪口か(投稿の審査)。

タスクfrontier LLMJevReflex-1
GPT-5.6 SolGemini 3.8 Flash
意図分類(CLINC150)979696.593.5
日本語の発話意図(MASSIVE)969692.590.0
SNS の感情(tweet_eval)847981.082.0
SNS の肯定・否定・中立(tweet_eval)787774.574.5
投稿の審査: 他人への悪口か(civil_comments)737673.580.0
レイテンシ中央値(秒)1.1–1.32.1–2.60.300.09–0.21

即答の判定(画像)

写真を 1 枚渡し、種類を選ばせます。料理の写真(10 種)/ EC サイトの商品写真(10 種)/ スキャンした書類の種類(16 種)。

タスクfrontier LLMJevReflex-1
GPT-5.6 SolGemini 3.8 Flash
料理写真(Food-101、10 種)9898—98.5
EC 商品画像(10 種)9096—83.0
書類種別(RVL-CDIP、16 種)———58.0
レイテンシ中央値(秒)1.8–2.02.9–3.1—0.21–0.26

推論(追加学習した論理課題)

推論が要る論理パズルを解かせます(Reflex-1 は課題ごとに追加学習)。嘘つきの連鎖: 「前の人は嘘つき / 正直」と順に言う 10・20 人の最後の人が正直か / 入れ替え追跡: 7 人が 14 回ボールを交換した後、指定の人が持つボール / 真偽式: not・and・or の式の値 / 道順: 指示どおりに歩くと出発点に戻るか。

タスクfrontier LLMJevReflex-1
GPT-5.6 Sol
reasoning なし
Gemini 3.8 Flash
reasoning あり
嘘つきの連鎖 10 段46100 (2.7 s)59.0100 (0.8 s)
嘘つきの連鎖 20 段50100 (3.1 s)58.072 (1.5 s)
入れ替え追跡 7 人・14 手10100 (3.5 s)26.270 (1.2 s)
真偽式(BBH)92100 (2.4 s)98.9100 (0.4 s)
道順(BBH)78100 (2.5 s)98.280.8 (0.5 s)
レイテンシ中央値(秒)1.2–1.32.4–3.50.300.4–1.5

使い方

要求は Jev と互換の形(state・questions・instructions・criteria、choice 型)です。mode・skill・trace・image・text 型は Reflex-1 独自の拡張です。

POST /v1/decisions
{"state": "I want to know my credit rating",
 "questions": {"desk": {"type": "choice",
   "instructions": "Which desk should handle this inquiry?",
   "criteria": {"credit_score": "", "transfer": "", "none": "none of these"}}}}
→ {"answers": {"desk": {"choice": "credit_score", "confidence": 0.97,
     "probs": {"credit_score": 0.97, "transfer": 0.01, "none": 0.02}}}, "latency_ms": 90}

{"state": "Question: Ryan tells the truth. Michael says Ryan lies. ...",
 "mode": "deep", "skill": "web_of_lies", "trace": true, "questions": {...}}
→ {"answers": {"a": {"choice": "No", "confidence": 1.0,
     "trace": ["start -> Ryan tells the truth", "Michael says Ryan lies -> Michael lies", "..."]}},
   "latency_ms": 820}

引用: Suzuki, G. (2026). Reflex-1: frontier-LLM accuracy at Jev speed with a 4B open model. Zenodo. doi:10.5281/zenodo.23005201

開発環境

大規模な計算クラスタは使わず、手元の GPU マシン 1 台(ASUS Ascent GX10)で開発しました。学習・評価・動画の作成まで、すべてこのマシンで行っています。

項目内容
マシンASUS Ascent GX10 × 1 台(NVIDIA GB10 Grace Blackwell、CPU 20 コア、CPU と GPU で共有する統合メモリ 128 GB)
OS / ソフトUbuntu 24.04 (aarch64) · PyTorch 2.14 (CUDA 13) · Transformers 5.17 · PEFT 0.21 (LoRA) · bitsandbytes 0.50 · vLLM 0.19
ベースモデルGoogle Gemma 4 E4B (Apache 2.0)
追加学習LoRA + 潜在推論用の小さな部品。1 課題あたり GPU 1 枚で 1.4〜2.2 時間
開発期間4 日。比較の計測を含む
外部の費用比較用の API 代(Jev・GPT-5.6・Gemini 3.8)合計 約 $2.5。学習にクラウドは使っていない

注記

  • 推論が要る判定は、判定ごとの追加学習が前提です。学習した種類・深さの判定で力を発揮し、学習していない種類の推論にはそのまま効きません。分類の判定は追加学習なしで使えます。
  • 推論モードは現在 NVIDIA GPU(CUDA)で動作します。llama.cpp など一般的な実行環境への対応を近日中に進めます。

Reflex-1 の土台になった考え方と、これまでの検証は NerveReflex のプロジェクトページにまとめています:

計測: 2026 年 9 月、GX10(NVIDIA GB10)1 台。Jev(typesafe/jev-1.13)と frontier は OpenRouter 経由、API 実費は合計 約 $2.5。Reflex-1 は Google Gemma 4 E4B(Apache 2.0)からの派生で、Google の公認・関与はありません。Jev は TypeSafe AI の製品で、比較結果は筆者が OpenRouter 経由で測ったものです(TypeSafe AI の公認ではありません)。データ: CLINC150(Larson ら 2019、CC BY 3.0)、MASSIVE(FitzGerald ら 2022、CC BY 4.0)、Civil Comments(Jigsaw、CC0)、BIG-Bench Hard(Suzgun ら 2022、MIT)、tweet_eval(Barbieri ら 2020)、Food-101(Bossard ら 2014)、Fashion Product Images、RVL-CDIP(Harley ら 2015)。動画の写真は Wikimedia Commons の CC0 / パブリックドメイン。コンセプト: NerveReflex。

この記事をシェア

この記事についてのLinkedIn投稿でコメントや意見を共有できます。

LinkedInで議論する