メインコンテンツへスキップ
ESC
キーワードを入力してください
Compare · Models

AIモデルを、一つの尺度で並べる。

性能・価格・コンテキスト長・マルチモーダル対応を一覧。最大4モデルを選んで詳細比較できます。

40
Models
7
Providers
2026/06
Updated
0 モデルが比較対象に選択されています(最大 4
Catalog

40 モデル一覧

気になるモデルの「+」を押して、下の詳細比較で並べる(最大4つまで)

0Selected/ Max 4
Model+
1347
1294
1288
1235
Gemini 3 Pro
Google DeepMind
1219
GPT-5
OpenAI
1198
1173
1085
Gemini 2.5 Pro
Google DeepMind
1021
DeepSeek-R1
DeepSeek
787
Gemini 3.5 Flash
Google DeepMind
GPT-5.5
OpenAI
Qwen3.6-27B
Alibaba Cloud (Qwen Team)
Gemma 4 E2B
Google DeepMind
Gemma 4 E4B
Google DeepMind
Gemma 4 26B A4B
Google DeepMind
Gemma 4 31B
Google DeepMind
Mistral Small 4
Mistral AI
GPT-5.4
OpenAI
Gemini 3.1 Pro
Google DeepMind
Qwen3.5-397B-A17B
Alibaba Cloud (Qwen Team)
Gemini 3 Flash
Google DeepMind
GPT-5.2
OpenAI
Mistral Large 3
Mistral AI
Gemini 3 Deep Think
Google DeepMind
GPT-5.1
OpenAI
Gemini 2.5 Flash
Google DeepMind
Qwen3-30B-A3B
Alibaba Cloud (Qwen Team)
Qwen3-235B-A22B
Alibaba Cloud (Qwen Team)
Gemini 1.5 Pro
Google DeepMind
Side by Side

選んだモデルを並べる

最大 4 モデル。一覧で「+」を押すか、空きスロットから追加。

+モデルを追加
+モデルを追加
+モデルを追加
+モデルを追加
OVERALL
yuuQ Score
PERFORMANCE
MMLU
HumanEval
JA-MT
CAPACITY
Context
Speed
PRICING
Input
Output
MULTIMODAL
Vision
Audio
Video
PARETO FRONTIER

コスパで俯瞰する

縦軸に性能、横軸に Output 価格(対数)。緑線は同価格帯で最高性能を更新するモデル群=パレートフロンティア。

Pareto Frontier

Model performance at each price point

8 件のモデルを yuuQ Score 性能 (縦軸) 対 価格 ($/1Mトークン、対数横軸) で散布。緑線がパレートフロンティアで、同価格帯で最高性能を更新するモデル群を結ぶ。Pareto Optimal: 6 件。100011201240136014801600$1$10BLENDED PRICE PER 1M TOKENS (3:1 RATIO) →yuuQ ScoreClaude Sonnet 4.6Claude Sonnet 4.6: 1288 @ $6.00/1M (Optimal)Claude Opus 4.6Claude Opus 4.6: 1347 @ $10.00/1M (Optimal)Claude Opus 4.5: 1294 @ $10.00/1MGemini 3 ProGemini 3 Pro: 1219 @ $4.50/1M (Optimal)Claude Haiku 4.5Claude Haiku 4.5: 1173 @ $2.00/1M (Optimal)DeepSeek-V3.2-ExpDeepSeek-V3.2-Exp: 1085 @ $0.32/1M (Optimal)Claude Sonnet 4.5: 1235 @ $6.00/1MGPT-5GPT-5: 1198 @ $3.44/1M (Optimal)
  • Pareto Optimal
  • Reasoning
  • Coding
  • Multimodal
  • Open / General
Recommendations

用途別、編集部の選定

性能・価格・運用安定性のバランスから、用途ごとに上位を選定。

USE CASE 01

コード生成・補完

HumanEval / SWE-bench を重視。実装パターンを安定して引ける推論力。

対応モデルは登録待ち

USE CASE 02

RAG・社内ドキュメント検索

コンテキスト長と日本語の正確さが鍵。長文要約 / 引用整合の品質。

  1. 01 Qwen3.5-397B-A17B Alibaba Cloud (Qwen Team)
  2. 02 DeepSeek-V3.2-Exp DeepSeek
  3. 03 Mistral Medium 3 Mistral AI
USE CASE 03

エージェント・ツール呼び出し

function-calling / tool 連携の安定性、推論モードの制御性。

対応モデルは登録待ち

From the Editor

ベンチマーク値だけでは決まらない、選定の現場知。

ベンチマーク差は数ポイント単位でも、現場では「日本語の語感」「ツール呼び出しの安定性」「推論コストとレイテンシの折り合い」が決定打になります。 まずは 主要ベンチで上位を絞り、用途別レコメンドと自社のRAG/エージェント要件で再評価するのが最短ルート。

更新: 2026/06 · 編集部 モデル選定の解説記事へ →

関連リンク