
OpenAIは9月23日(日本時間)、AIモデル「GPT-6 Sol」と「GPT-6 Luna」を発表し、同日提供を開始した。最上位の「GPT-6 Astra」には及ばないものの、前世代より性能を高めたうえで、API料金を50%引き下げたという。あわせてPlus・Pro・Businessなどのサブスクリプションの契約者には、利用枠を回復できる使用量リセット権も1回分配布している。
GPT-6 SolとGPT-6 Lunaは、GPT-6 Astraと同じ手法で学習した、速度と価格を優先するGPT-6シリーズのモデルである。専門的な業務、事実の正確さ、コーディング、PC操作、人間の意図との整合という5つの領域で、Astraの成果を反映させたという。GPT-6 Solは難度の高い業務やコーディングに、GPT-6 Lunaは日常業務を大量に処理する用途に向いている。
使用量リセット権は、ChatGPT WorkやCodexの利用枠を使い切ったあとでも、自分の好きなタイミングで枠を回復できる仕組みだ。適用すると5時間ごとと週ごとの上限が同時に全回復し、週のリセット日も変わる。今回配布されたものは、筆者の環境では10月23日が期限と表示された。
業務自動化ベンチマーク「AutomationBench」のスコアと1タスクあたりコスト。GPT-6 Solは33.2%で、Claude Opus 5の26.9%を上回った
OpenAIが公表したベンチマークでは、GPT-6 SolがAnthropicの「Claude Opus 5」を上回る項目がある。47種類のツールを使う業務自動化の「AutomationBench 1.0.6」は、GPT-6 Sol(xhigh)が33.2%で、Opus 5(max)の26.9%を6.3ポイント上回った。1タスクあたりのコストは0.27ドル(約43円、1ドル=約158円換算)で、Opus 5の約9%にとどまる。上位のGPT-6 Astra(low)の30.3%も上回った。
「Agents’ Last Exam」のスコアと1タスクあたりコスト。GPT-6 Solは56.4%で、Claude Opus 5の最高スコアを上回った
55の業種の実務を模した「Agents’ Last Exam」も、GPT-6 Sol(max)が56.4%だった。同ベンチマークでのOpus 5の最高スコアを、1タスクあたり60%低いコストで上回っている。
コード修正ベンチマーク「DeepSWE v1.1」のスコアと1タスクあたりコスト。GPT-6 Solは68.8%で、Claude Fable 5の69.9%に届かなかった
もっとも、GPT-6 Solが全項目で優位に立つわけではない。コード修正の「DeepSWE v1.1」では、GPT-6 Sol(max)が68.8%で、「Claude Fable 5」の最高スコア69.9%(xhigh)を1.1ポイント下回った。PC画面の自律操作を測る「OSWorld 2.0」(オフライン)でも、GPT-6 Sol(xhigh)は60.5%で、Opus 5(medium)の60.3%にほぼ並んだ。ただし、どちらの場合もコストは約80%低い。
GPT-6 Lunaも、上位モデルに迫る。DeepSWE v1.1ではGPT-6 Luna(max)が66.6%で、設定を中程度にしたOpus 5とFable 5に並ぶ水準だという。このときの1タスクあたりのコストは、Opus 5より93%、Fable 5より96%低い。
コーディング時の虚偽報告の割合。GPT-6 Solは1.3%で、GPT-5.6 Solの10.4%を下回った
不正直な回答が出やすい課題を集めた社内評価では、コーディング中に自分の作業について事実と異なる報告をする割合も下がった。GPT-6 Solは1.3%で、GPT-5.6 Solの10.4%の約8分の1にとどまった。GPT-6 Lunaも2.8%で、GPT-5.6 Lunaの9.5%を下回る。
値下げを支えたのは、キャッシュと推論の効率化である。同じ内容を繰り返し送る際に再処理を省くプロンプトキャッシュが改善され、キャッシュに当たった入力トークンは読み取り料金が90%割り引かれる。GitHubによると、OpenAIのモデル全体で、この数カ月のうちに新たな処理が必要なトークンは50%以上減ったという。
GPT-6 Sol and Luna are out. Not only are they a very significant improvement across the board, but also in writing and general “you know when you try it” quality.
We are also permanently reducing the API price by 50% making both of them viable for a ton of new usecases and…https://t.co/vbyUhVlKH3
— Tibo (@thsottiaux)September 22, 2026
