ヘルプTOP / 使い方ガイド / モデルと速度の目安

モデルと速度の目安(実測)

Morphifexはモデルを同梱していません。Ollamaに入っているモデルをそのまま使います。どれを選ぶかで、出来上がりも、待ち時間も、必要なGPUメモリも変わります。下に載せるのは開発機とRunPodで借りたGPUでの実測値です。お使いの環境では前後します。

必要なGPUメモリは、動かすモデルで決まります 12b級なら16GBで十分に動きます。26b-a4b(MoE)も同様です。いっぽう31b級を16GBで動かすと、実測で13倍遅くなりました。あふれた分がCPU側へ回るためです。数字は下の「VRAMに載るかどうか」を見てください。
このページの「16GB」はVRAM(グラフィックボード専用のメモリ)のことで、ふだん言う「メモリ64GB」=PCメモリとは別ものです。動くかどうかは両方の合計で決まり、速いかどうかはVRAMに収まったかで決まります。詳しくははじめかたにあります。

計測した環境

下の数値は、次の2つの環境での実測です。Morphifex本体と保存先はどちらの場合も手元のPCで、RunPodのGPUはOllamaの接続先としてだけ使っています。

手元の開発機 GPU: GeForce RTX 5070 Ti(VRAM 16GB)
CPU / メモリ: Ryzen 7 9700X(8コア)/ 64GB
接続先: http://localhost:11434
RunPodで借りたGPU GPU: RTX 5090(RunPodで時間借り)
用途: 同じ条件を短時間でまとめて撮るため
接続先: 別PCのOllamaと同じ設定
計測したモデルgemma4:12b-it-qat / gemma4:26b-a4b-it-qat / gemma4:31b-it-qat / ornith:35b
生成の設定temperatureなどは指定していません。各モデルの既定値のまま動かしています
母数完了したOllamaジョブ565件(RunPod 484件 / 手元 81件)。2026年7月13日〜21日
代表値中央値。読み込み直後の1回だけ遅いといった外れ値を避けるため、平均ではなく中央値を出しています

出力速度(1秒あたりトークン数)

モデルが文章(SVGやHTMLのコード)を書き出す速さです。数字が大きいほど速く、待ち時間は短くなります。

モデル別の出力速度(1秒あたりトークン数・中央値) 同じ4モデルを、手元のRTX 5070 Ti(VRAM 16GB)とRunPodのRTX 5090で計測した中央値。数値は下の表と同じです。 0 60 120 180 240 tok/s gemma4:12b-it-qat 84.1 n=28 129.9 n=100 gemma4:26b-a4b-it-qat 88.7 n=44 200.5 n=125 gemma4:31b-it-qat 5.0 n=8 66.6 n=113 ornith:35b ローカル: VRAM 16GB では動かしていません 221.0 n=146
  • RTX 5070 Ti(VRAM 16GB・手元)
  • RTX 5090(RunPod)
4モデル × 2環境の出力速度(中央値)。n は計測した回数です。
モデルRTX 5070 Ti(16GB)RTX 5090
gemma4:12b-it-qat84.1 tok/s(n=28)129.9 tok/s(n=100)
gemma4:26b-a4b-it-qat88.7 tok/s(n=44)200.5 tok/s(n=125)
gemma4:31b-it-qat5.0 tok/s(n=8)66.6 tok/s(n=113)
ornith:35b計測していません221.0 tok/s(n=146)

VRAMに載るかどうかが、いちばん効く

同じ gemma4:31b-it-qat で、同じお題を作ったときの差です。モデルもプロンプトも同じで、違うのはGPUだけです。

環境出力速度イラスト1枚
RTX 5070 Ti(VRAM 16GB)5.0 tok/s約8分(479秒・n=5)
RTX 509066.6 tok/s約48秒(47.5秒・n=20)
差は約10倍でした モデルがVRAMに収まりきれば速く、あふれてCPU併用になると一気に遅くなります。「このGPUなら足りる」は動かしたいモデルが決まってはじめて言えることで、逆にいえば軽いモデルを選べば要求は下がります。
ただし「遅い」であって「動かない」ではありません 上の8分は、VRAM 16GBの環境で31Bが動いたという記録でもあります。VRAMからあふれた分はPCメモリとCPUが肩代わりするので、PCメモリに余裕があれば大きいモデルも動きます。手元の開発機はPCメモリ64GBです。
数をこなすなら12B・26B、1枚に時間をかけてでも出来を上げたいなら31B、という使い分けができます。待てるなら、VRAMが小さくても大きいモデルを試す価値はあります。

機能ごとの所要時間

1回の生成にかかった時間(中央値)です。やり直しが入ると、この時間がその回数分かかります。2つのグラフは目盛りをそろえてあるので、そのまま見くらべられます。

手元の RTX 5070 Ti(VRAM 16GB)

まずは、多くの人の環境に近いほうから。回数の少ないセルもそのまま載せていますn が計測した回数です)。

機能ごとの1件あたり所要時間(RTX 5070 Ti・VRAM 16GB・中央値) 手元の開発機で4モデルを比べた、1回の生成にかかった秒数の中央値。棒が軸の右端まで伸びているものは120秒を超えています。計測していない組み合わせは「計測なし」と書いています。数値は下の表と同じです。 0 30 60 90 120 イラスト 35.2秒 n=3 56.5秒 n=2 ▸ 479.0秒 n=5 計測なし アイコン 46.3秒 n=3 88.0秒 n=1 ▸ 421.1秒 n=1 計測なし 4コマ(作画) 26.5秒 n=1 計測なし 計測なし 計測なし Webゲーム ▸ 276.2秒 n=3 85.2秒 n=10 計測なし 計測なし ノベル 45.6秒 n=5 計測なし 計測なし 計測なし
  • gemma4:12b-it-qat
  • gemma4:26b-a4b-it-qat
  • gemma4:31b-it-qat
  • ornith:35b
手元の16GBでの1件あたり所要時間(中央値)。 が付いた棒は目盛りの上限120秒を超えています。
機能12b26b-a4b31bornith:35b
イラスト35.2秒(n=3)56.5秒(n=2)479秒(n=5)
アイコン46.3秒(n=3)88.0秒(n=1)421.1秒(n=1)
4コマ(作画)26.5秒(n=1)
Webゲーム276.2秒(n=3)85.2秒(n=10)
ノベル45.6秒(n=5)
回数が少ないセルは、1回の当たり外れがそのまま出ます たとえば12bのWebゲームが26b-a4bより遅く見えますが、これは3回のうち2回が7月17日の計測で、そのとき12.9〜13.5 tok/sしか出ていなかったためです。同じ12bでも7月20日の回は82.1 tok/s出ています。直前に別のモデルを動かした後などは、同じモデルでもこれだけ変わります。n の小さい数字は「その環境で確実にこうなる」ではなく、「少なくともこういう回があった」として読んでください。

16GBで数をこなせるのは12b級と26b-a4bで、Webゲーム1本が1分半ほどです。31bはイラスト1枚に8分かかりました。ゲームが動かなかったときの修復は、26b-a4bで実行時エラーが38.4秒(n=5)、静的エラーが81.2秒(n=5)です。

RunPodの RTX 5090

こちらは同じ条件をまとめて撮ったので、どのセルも11〜24回あります。

機能ごとの1件あたり所要時間(RTX 5090・中央値) RunPodのGPUで4モデルを比べた、1回の生成にかかった秒数の中央値。上のグラフと同じ目盛りです。数値は下の表と同じです。 0 30 60 90 120 イラスト 27.7秒 n=21 26.3秒 n=21 47.5秒 n=20 31.7秒 n=19 アイコン 28.4秒 n=14 32.5秒 n=14 42.0秒 n=14 25.1秒 n=14 4コマ(作画) 18.4秒 n=13 11.8秒 n=13 38.1秒 n=13 20.1秒 n=13 Webゲーム 47.2秒 n=22 40.4秒 n=20 79.5秒 n=24 42.1秒 n=22 ノベル 19.8秒 n=11 19.5秒 n=21 31.4秒 n=12 19.7秒 n=29
  • gemma4:12b-it-qat
  • gemma4:26b-a4b-it-qat
  • gemma4:31b-it-qat
  • ornith:35b
RunPodのGPUでの1件あたり所要時間(中央値)。上のグラフと同じ目盛りです。
機能12b26b-a4b31bornith:35b
イラスト27.7秒(n=21)26.3秒(n=21)47.5秒(n=20)31.7秒(n=19)
アイコン28.4秒(n=14)32.5秒(n=14)42.0秒(n=14)25.1秒(n=14)
4コマ(作画)18.4秒(n=13)11.8秒(n=13)38.1秒(n=13)20.1秒(n=13)
Webゲーム47.2秒(n=22)40.4秒(n=20)79.5秒(n=24)42.1秒(n=22)
ノベル19.8秒(n=11)19.5秒(n=21)31.4秒(n=12)19.7秒(n=29)

4コマは構成(13〜23秒)を作ってから作画に入るので、1本の合計はこの表より長くなります。

「計測なし」の組み合わせは、まだ手元で試していないものです。16GBで31bや ornith:35b を動かす計測は、待ち時間が長いぶん後回しになっています。撮れた分から順に、このページへ足していきます。

どのモデルから試すか

出来ばえの差は数字では出ません。同じ条件で作って作品管理で見比べるか、作例集で実物を見てください。

自分の環境で測る

上の数字はあくまで2つの環境の実測です。GPU、量子化、コンテキスト長、接続先が違えば結果は変わります。Morphifexは同じ計測をあなたの環境でも取っています。

  1. 比べたいモデルで同じ条件の作品を作る

    題材と設定はそろえて、モデルだけ変えて作ります。作り方は同じ条件で比べるを参照してください。

  2. 実行履歴を開く

    サイドメニューの「実行履歴」から、モデル性能レポートの「計測対象」と「GPUラベル」を選びます。

  3. 4項目を見る

    平均総所要時間、総所要時間の中央値、平均モデル読込時間、平均出力速度が、モデルごとに並びます。読み方は実行履歴と性能へ。

接続先ごとにGPUラベルを付けておくと、上のような比較が自分の手元でもそのまま作れます。

1件ずつ順番に処理します

生成も評価も、アプリ全体で常に1件だけ動きます。複数モデルで比べるときも、選んだ順に1モデルずつ処理します。同時に動かすとVRAMを取り合って、どちらも遅くなるためです。

何かが動いているあいだに別の生成を始めようとすると、「別の生成または評価が実行中です」と表示されて断られます。いま何が動いているかは、画面上部の実行中インジケータで確認できます。

モデルはOllama側で用意する

アプリの一覧に出るのは、Ollamaが持っているモデルです。Morphifexがモデルを自動でダウンロードすることはありません。ollama pull <モデル名> で入れたものが選べるようになります。

モデルを追加・更新したあとは、「Ollama接続」画面の「モデル能力を再取得」を押します。画像に対応しているかどうかなどの情報をOllamaから読み直す操作です。

コンテキスト長

モデルへ一度に渡せる長さの設定です。Morphifexが生成時にOllamaへ明示するのは、この値と、一部機能での最大出力トークン(4コマ漫画の構成・作画など)だけです。

temperatureやseedなどの生成パラメーターは指定しません。すべてのモデルを、それぞれの既定値(Modelfileの設定)のまま動かします。配布者が調整した「そのモデルの素の状態」を同じ扱いで比べることが、この道具の前提だからです。変えたい場合はOllama側のModelfileで調整できますが、その場合は過去の結果と比較の土台が変わることに注意してください。

既定値65,536
候補4,096 / 8,192 / 16,384 / 32,768 / 65,536 / 131,072 / 262,144

イラスト、アイコン、4コマ漫画では、この値は65,536に固定されていて画面には出ません。Webゲームだけは作成画面で選べます(8,192・16,384・32,768・65,536・131,072から選択、初期値は16,384)。

コンテキスト長を大きくするほど必要なメモリも増えます。比較の条件にも入るので、値を変えると同じ題材でも別のグループになります。

vision対応が要るのはどこか

イラスト、アイコン、4コマ漫画、Webゲーム、ビジュアルノベルは、どれもテキスト生成モデルで動きます。モデルが書くのはSVGやHTMLというコードなので、画像を見る能力は要りません。

vision(画像を見る能力)が必要なのは、通常の導線から外してある互換機能だけです。

これらの画面では、vision対応のモデルだけが選択肢に出ます。Ollamaにvision対応モデルが1つもない場合は、その旨が表示されます。