AIの基礎とツール

コーディングAIを1つだけ選ぶなら? 1年間実際に使ったユーザーの選択

最近、開発者コミュニティで特によく見かける質問の1つが、「Claude CodeとCodexのどちらを使うべきですか?」です。私はClaudeを約1年、Codexを6か月以上契約して毎日使っており、最近リリースされたClaude Fable 5とGPT-5.6 Solも体験しました…

読了 10 分
コーディングAIを1つだけ選ぶなら? 1年間実際に使ったユーザーの選択のカバー画像

Claudeを1年、Codexを6か月使った開発者の結論

最近、開発者コミュニティで特によく見かける質問の1つが、「Claude CodeとCodexのどちらを使うべきですか?」です。私はClaudeを約1年、Codexを6か月以上契約して毎日使っており、最近リリースされたClaude Fable 5とGPT-5.6 Solも体験しました。実は、この2つに落ち着く前にCursorとKiroも使っています。Cursorは最初は本当に良かったのですが、Claudeが非常に優秀だったので自然に乗り換えました。Kiroも悪くないツールですが、比較的マイナーなため、スキルやプラグインなどのエコシステムが十分に整っていません。結局Kiroの中でもClaudeモデルを使うことになるので、あえて経由する理由はないと感じました。この記事では、実際に感じた違いに加えて、コミュニティ調査やベンチマーク、GitHubのIssueなどの客観的な資料もまとめます。

2つのエージェントに感じた性格の違い

一言でまとめると、こうです。Claudeは全体的に何でもこなすシニア開発者のようで、Codexは口数は少ないものの正確な同僚のようです。

Claude Codeは比較的速く、正確です。コードベースを把握する感覚や文脈を読む力に優れているため、指示が曖昧でも意図をうまく汲み取ります。ただ、ときどきミスもします。自信を持って突き進む一方で細部を見落とす、まさにシニアらしいスタイルです。利用者が多いことから、スキルやプラグインなど周辺エコシステムが豊富なのも大きな利点です。必要なワークフローを検索すれば、誰かがすでに作ったものが見つかります。

CodexはClaudeほど速く、大胆にコードを書くわけではありません。その代わり正確です。時間をかけて考える分、成果物に隙が少なくなります。

面白いのは、これが私だけの印象ではないことです。500人以上が参加したRedditの調査では、日常利用では65%がCodexを好みました。一方、ブラインドコードレビューでは67%がClaudeのコードのほうがきれいだと評価しています。海外コミュニティでも、「Claudeは精密な編集に強く、Codexは広範なリファクタリングに強い」「Codexは遅いが複雑な作業ではより徹底している」という評価がよく見られます。私の実感ともほぼ一致します。

Claude Fable 5:不満だった点がほぼ解消されました

2026年6月にリリースされたClaude Fable 5には、個人的にとても満足しています。従来のClaudeの弱点、つまり「速いが、ときどきミスをする」という部分がほぼ解消されました。

数値でも確認できます。Fable 5はSWE-bench Verifiedで95%、SWE-bench Proで80.3%を記録しました。直前の最上位モデルだったOpus 4.8のSWE-bench Proスコアは69.2%だったため、11ポイント以上の上昇です。難度の高いFrontierCode Diamondでは29.3%で、Opusの13.4%の2倍を超えています。Stripeは、5,000万行のRubyコードベースの移行をFable 5で1日で完了したと発表しました。手作業なら2か月以上かかった作業です。もちろん、これらのベンチマークはAnthropic独自のスキャフォールディングに基づいており、中立的なハーネスではないという批判もあります。そのため、数値そのものより傾向として見るのが適切です。

GPT-5.6 Sol:トークン問題という致命的な傷、それでも圧倒的です

OpenAIが7月9日にリリースしたGPT-5.6 Solも非常に優れたモデルです。Artificial AnalysisのCoding Agent Indexで80点を獲得し、新記録を打ち立てました。しかしリリース直後から、「使用量の上限が異常な速さで減る」という報告が相次ぎました。私も経験しましたが、詳しく調べるとかなり具体的な状況が見えてきます。

  • CodexリポジトリのGitHub Issue #32250によると、Pro契約者がGPT-5.6 Sol Mediumに短い作業を1つ依頼したところ、5時間制限の残量が87%から76%へ、一度に11ポイント減りました。その後は、ツール呼び出しのない些細な追加質問でも、1回につき約1ポイントずつ減少しました。同じユーザーが使っていたGPT-5.5 xhighよりも早く消費されたのです。
  • Issue #31860では、CodexアプリがSolのコンテキストを、1.05Mトークン仕様の約35%にあたる372Kに切り詰めて使っていたことが確認されました。コンテキストが90%に達すると早期compactionが発生し、この再処理によってトークン消費がさらに加速した可能性が指摘されています。
短い作業1回で使用量の上限が11ポイント消失
短い作業1回で使用量の上限が11ポイント消失

最終的にOpenAIも、「最高の計算設定をあまりにも簡単に使えるようにした一方、その影響を十分に知らせられなかった」と認め、24時間以内にrate limitを2回リセットしました。OpenAI関係者の説明によれば、5.6 SolのMediumは5.5のMediumと同じランクではなく、デフォルトはSol Lowで、xhighは本当に難しい問題にだけ使うべきだそうです。つまり、モデル自体がトークンあたり非効率というより、高計算設定がデフォルトのように使われてしまったUX上の問題と、アプリ側のバグが重なった事案に近いと言えます。実際、OpenAIはSolのmax reasoningによって、競合モデルと比べて出力トークンを54%削減したと主張しています。

致命的な傷ではありましたが、それでもモデル自体は非常に優秀です。設定を理解して使えば、成果物の正確さは依然として最高水準です。

もうClaudeにこだわる必要はありません

数か月前までは、「コーディングなら絶対にClaude」という雰囲気がありました。今はそうではないと思います。どちらも非常に優秀です。Terminal-Bench 2.1ではCodex CLIの組み合わせが83.4%で1位、SWE-bench ProではFable 5が80.3%で首位です。ベンチマークごとに1位が分かれる時代になりました。

だから私の結論は、両方使うのが最善だということです。ただ、1つだけ選ぶなら私はCodexを選びます。すでにChatGPTを頻繁に使っており、画像生成まで1つのサブスクリプションで済むからです。コーディングエージェント単体ではなく、サブスクリプション全体の価値で考えた場合の結論です。

結局、誰もが両方使うようになるのではないでしょうか

もう1つ加えたい視点があります。最近のモデルはトークン使用量が飛躍的に増えているという点です。エージェント型AIは一般的なチャットボット利用の最大1,000倍のトークンを消費するという分析があり、ForbesとTechCrunchはこの現象を「Tokenpocalypse」と呼び、サブスクリプションの上限を予想以上に早く使い切るユーザーが急増していると報じました。実際、コミュニティでCodexを追加契約する最大の理由は、「Claudeの上限がすぐに尽きるから」です。

1つのサブスクリプションの上限では足りなくなる時代なら、最終的には誰もが自然に2つのサブスクリプションを併用する形に収束するのではないかと思います。

2つのエージェントを併用すると性能も向上します

両方使う理由は、単に上限の問題だけではありません。AIオーケストレーションを試すと、同じエージェントを2つ組み合わせるより、異なるエージェント同士を交流させるほうが性能は高くなりました。

これも研究で裏付けられています。X-MAS研究(arXiv 2505.16997)は、マルチエージェントシステムで異なるLLMを役割ごとに配置すると、同種の組み合わせと比べて正確さが8~47%向上すると報告しました。別の研究(arXiv 2602.03794)では、多様なエージェント2つが同種のエージェント16個と同等、またはそれ以上の結果を出しました。

私の経験で最もよく機能した組み合わせはこれです。**Claudeに作業をさせ、Codexに成果物をチェックさせることです。**速く大胆なシニアが作った成果物を、慎重で正確なレビュアーがふるいにかける構成です。性格が異なるため、お互いの盲点をうまく見つけられます。

Claudeがコードを書き、Codexがチェックする協業構成
Claudeがコードを書き、Codexがチェックする協業構成

まとめ

  • Claudeは速く正確なシニア型、Codexは遅いものの正確なタイプです。コミュニティの評価も同じです。
  • Fable 5はClaudeの弱点(ときどき起きるミス)を解消し、GPT-5.6 Solもトークン問題を抱えながら非常に優秀です。
  • もうClaudeにこだわる必要はありません。どちらも最高水準で、両方使うのが最善です。
  • 1つだけ選ぶなら、ChatGPTと画像生成まで含まれるサブスクリプションの価値を考えて、私はCodexを選びます。
  • トークン消費が急増していることを考えると、結局は誰もが両方使う形になるのではないでしょうか。
  • オーケストレーションでは異種の組み合わせが答えです。Claudeが作り、Codexがチェックする組み合わせが最もよく機能しました。

参考資料