Claude Opus 5.5とGPT-6 Sol / Lunaが出たので、普段使うモデルを選び直したくなりました。AstraやFableまで含めると、名前だけでは価格帯も得意な仕事も追いにくくなっています。今回は、私が仕事を振り分けるならどうするかを整理します。
2026年9月24日時点の公式資料を使った比較です。全モデルを同じ課題で実測した記事ではありません。公表値と、それを踏まえた私の選び方を分けて書きます。
まず、比較するモデルと料金の種類を揃える
ここでいうモデルは、文章やコードを読み、回答やツール操作の判断を返す部分です。Claude CodeやCodexのようなアプリでは、使えるツールや実行環境も作業結果に影響します。
今回はGPT-6 Astra / Sol / Luna、Claude Opus 5.5 / Fable 5.1、Gemini 3.8 Flash、Grok 4.7を中心に見ます。Gemini 3.1 Pro Previewも料金の比較対象に残しました。Flashという名前だけで軽作業向けと決めるのは、もう難しいと感じます。
OpenAIの公式説明では、Astraは難しい作業全体、Solは複雑な開発とエージェント処理、Lunaは範囲の明確な大量処理向けです。これは用途の位置づけであり、すべての課題で同じ順番になるという意味ではありません。GPT-6のモデルガイド
もう一つ、APIの従量料金と月額契約は別に考えます。以下は開発で比較しやすいAPI料金です。月額プランでは、対象モデル、利用上限、追加料金、使う画面まで確認する必要があります。たとえばSol / Lunaの9月22日の提供案内はCodexとChatGPT Work向けで、Chat向けではありません。公式の提供案内
API単価を並べると、常用と難問用を分けたくなる
単位は100万トークンあたりの米ドルです。通常速度の短いコンテキストに対する単価を揃えています。キャッシュ読取は、再利用できた入力部分の価格です。税、検索などのツール料金、キャッシュ作成・保存料金は含めません。
| モデル | 入力 | キャッシュ読取 | 出力 |
|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.01 | $0.50 |
| Gemini 3.8 Flash | $0.75 | $0.075 | $3.75 |
| GPT-6 Sol | $2.00 | $0.20 | $10.00 |
| Grok 4.7 | $2.00 | $0.50 | $6.00 |
| Gemini 3.1 Pro Preview | $2.00 | $0.20 | $12.00 |
| Claude Opus 5.5 | $4.00 | $0.20 | $20.00 |
| GPT-6 Astra | $10.00 | $1.00 | $50.00 |
| Claude Fable 5.1 | $10.00 | $0.25 | $50.00 |
出典:OpenAI API料金、Claude Opus 5.5発表、Claude Fable 5.1、Gemini API料金、Grok API料金。
Gemini 3.8 Flashは2026年12月31日までの導入価格です。2027年1月1日から入力$1.50、出力$7.50になります。継続運用の見積もりでは、今の半額料金だけを使わないようにします。Gemini API料金
GPT-6の3モデルは入力272,000トークン超で、そのリクエスト全体の入力・キャッシュ料金が2倍、出力が1.5倍になります。Grok 4.7は200,000トークン以上で長文料金、Gemini 3.1 Pro Previewは200,000トークン超で別料金です。大きなリポジトリや資料一式を渡す場合は、上の表をそのまま使えません。GPT-6 Solの仕様、Grok API料金、Gemini API料金
同じ入力・出力量なら、SolはAstraの5分の1、LunaはSolの20分の1です。Opus 5.5とFable 5.1では入力・出力の単価が2.5倍違います。ただ、ここから仕事1件の価格までは決まりません。推論ややり直しで使う量が違うためです。
性能表では、モデル名の小数点まで確認する
資料を読んで最初に引っかかったのは、比較相手の世代でした。Opus 5.5やGrok 4.7の発表資料にあるSolの数値は、GPT-5.6 Solです。これをGPT-6 Solの成績として読むと、選び方が変わってしまいます。
まずはAnthropicのOpus 5.5発表表から、性格の異なる3項目だけを抜き出します。どれも高い方が良い指標です。
| 評価 | Opus 5.5 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0:端末を使う複数段階の仕事 | 66.4% | 55.8% | 57.9% |
| AutomationBench:業務アプリをまたぐ処理 | 40.0% | 31.4% | 41.4% |
| Terminal-Bench-Science 0.1:科学研究のエージェント作業 | 58.7% | 52.6% | 64.6% |
これは私の測定値ではなく、Anthropicが掲載した値です。Terminal-Bench 4.0はOpusがxhigh、Astraがhighで、思考量を統一した比較ではありません。Opusの一部課題では安全機構による別モデルへの切り替えも含みます。Scienceの標準誤差はモデルごとに±3.5〜5ポイントあるため、小さな差を確定順位として扱いません。評価条件を含む発表資料
この範囲なら、Opus 5.5を開発の有力候補にしつつ、Astraを研究や複雑な業務処理で試す理由は残ります。Fable 5.1については、価格が高いから必ずOpusより上とは読めません。既存の作業でFableの方が通る場合に残す、という判断が自然だと思います。
GrokとGeminiは、別の発表資料から確認します。下の2行は評価そのものが違うため、数字の大小を横断して比べる表ではありません。
| モデル | 公式発表で確認した数値 | 読み方 |
|---|---|---|
| Grok 4.7 | CursorBench 4.0で46.3%(xHigh) | 同じ発表表のFable 5.1は51.8%、GPT-5.6 Solは41.7%。GPT-6 Solの成績ではありません |
| Gemini 3.8 Flash | HLE-Verifiedで54.9% | 多分野の推論評価。通常のHLEや、端末操作の成功率とは直接比較しません |
出典:Grok 4.7の発表、Gemini 3.8 Flashの発表。Googleは、高い思考設定では推論やツール利用が増え、トークン消費も増える場合があると説明しています。単価が低いモデルでも、処理全体が必ず安いとは限りません。
今回確認したOpenAIのモデル仕様・提供案内では、GPT-6 Sol / Lunaを上の全モデルと同条件で並べられる成績を揃えられませんでした。旧Solの数値で穴埋めせず、用途と料金から試す順番を決めます。Solの仕様、Lunaの仕様
私なら、用途ごとにこの順番で試す
以下は公表仕様と料金を踏まえた私の推奨です。日本語の自然さや、自社コードでの修正成功率まで実測して順位を付けたものではありません。
| やりたいこと | 最初に試すモデル | 選ぶ理由・次の候補 |
|---|---|---|
| 問い合わせ分類、項目抽出、短い要約を大量に処理 | GPT-6 Luna | 単価が低く、仕事の範囲を絞りやすい。検証で落ちたものをSolへ回します |
| 日常の実装、テスト追加、複数ファイルの修正 | GPT-6 Sol | 複雑な開発向けの位置づけで、Astraより低単価。修正が収束しなければOpus 5.5を比較します |
| 大きな改修、レビュー、根拠付きの資料作成 | Claude Opus 5.5 | 公表評価と単価を見て有力な常用候補。まず普段の課題でSolと比較したいです |
| 科学・数理の難問、複数の道具を使う調査 | GPT-6 Astra | 難しい作業全体を任せる候補。Opus 5.5も同じ完了条件で比較します |
| 既存の長時間処理でFableが安定している | Claude Fable 5.1 | 実績のある処理を基準に残します。新規の常用候補は先にOpus 5.5で試します |
| 動画・音声・PDFをまとめて読みたい | Gemini 3.8 Flash | これらを入力として扱えるため、前処理を含めて比較しやすいです |
| Xの投稿や直近の話題を調べたい | Grok 4.7+X Search | X検索を組み込めるのが選ぶ理由。検索の呼び出し料金も予算に入れます |
Gemini 3.8 Flashはテキスト、画像、動画、音声、PDF入力に対応しています。出力はテキストです。会議動画や画面録画を扱うなら、文章の点数だけで比べるより、この入出力の違いが効くと思います。Gemini 3.8 Flashの仕様
Grokは、モデル単体で常にXの最新情報を知っているわけではありません。APIで現在の情報を取り込むには、X SearchやWeb Searchを有効にします。単にgrok-4.7へ切り替えるだけでは、最新情報を使う構成にはなりません。Grokのモデル説明
Fable 5.1は長時間・複数アプリをまたぐ作業向けに設計されています。ただ、Opus 5.5が出た今は、名前の上位下位だけで選ぶ理由は薄くなりました。私なら、過去に失敗した改修や調査を両方に渡し、最後まで通るかで残すモデルを決めます。Fable 5.1の用途
日本語の記事を書く用途では、Opus 5.5とSolを同じ文体ルールで比べたいです。今回の公表ベンチマークでは、日本語の敬語や文章の癖までは判断できません。原稿を直す時間も含めて選びます。
月1万件の処理なら、どれくらい違うか
問い合わせの要約を想定して、1件あたり入力2,000、課金対象の出力500トークン、月1万件で計算します。出力500には課金される推論トークンも含める前提です。キャッシュの読取・書込、検索、再試行、追加のツール実行は使わない仮定です。
月合計は入力2,000万、出力500万トークンになります。
月額のモデル料金 = 入力単価 × 20 + 出力単価 × 5
GPT-6 Solの例 = $2 × 20 + $10 × 5 = $90
| モデル | 月1万件の試算 |
|---|---|
| GPT-6 Luna | $4.50 |
| Gemini 3.8 Flash | $33.75(導入価格) |
| Grok 4.7 | $70.00 |
| GPT-6 Sol | $90.00 |
| Gemini 3.1 Pro Preview | $100.00 |
| Claude Opus 5.5 | $180.00 |
| GPT-6 Astra | $450.00 |
| Claude Fable 5.1 | $450.00 |
これは同じ量を処理したときの計算で、同じ品質を達成する費用ではありません。Gemini 3.8 Flashは告知済みの2027年料金なら$67.50です。実際の日本語が何トークンになるかも、各モデルで確認します。
たとえば全件をLunaで処理し、そのうち10%をSolで最初から処理し直すなら、この条件では$4.50+$9.00=$13.50です。ただし、失敗を検出できることが前提です。モデル自身の自信だけで振り分けず、必須項目、形式、元データとの一致などで判定できる仕事に使いたいです。
開発エージェントでは入力の再利用も大きくなります。Fable 5.1のキャッシュ読取は$0.25で、Astraの$1.00より低い設定です。一方、キャッシュを作る費用もあります。新規入力・書込・読取・推論を含む出力を分けて、実際の使用量から計算する必要があります。Fableの料金、OpenAI API料金
次は、同じ仕事を最後まで終える費用で比べたい
今回整理して、私はまず常用候補をSolとOpus 5.5に置き、定型処理をLunaへ分けたいと思いました。動画や音声の入力はGemini、X上の調査はGrokという選択肢も残します。AstraとFableは、難しい作業で追加の費用に見合う差が出るかを見たいです。
次に試すなら、普段の不具合修正、資料要約、項目抽出をそれぞれ数件ずつ用意します。完了条件と使える道具を揃えて、成功率、完了までの時間、再試行を含む料金、人が直した時間を記録します。月額契約で使う場合も、使い切るまでの件数を同じ課題で比べるつもりです。
単価表だけならLunaが目を引きますが、依頼を分けたり結果を直したりする時間もかかります。私の仕事でどこまで任せられるかは、そこまで測ってから決めたいです。
ここまで読んでいただき、ありがとうございます。もしこの記事の技術や考え方に少しでも興味を持っていただけたら、ネクストのエンジニアと気軽に話してみませんか。
- 選考ではありません
- 履歴書不要
- 技術の話が中心
- 所要時間30分程度
- オンラインOK