世界を動かす技術を、日本語で。

「Claude」よりも「Codex」を多く使った一週間

概要

  • CodexとClaudeの使用感を比較した個人的な印象のまとめ
  • Claudeのほうが親しみやすく、柔軟な対応力があると感じた
  • Codexは技術的でシンプルな出力が特徴
  • 作業フローやツール連携における違いも明確
  • それぞれの長所・短所が作業スタイルに影響

CodexとClaudeの比較に関する個人的な印象

  • 今年はClaudeとCodexを同等のスキルセットで運用 Claudeにはより多くのスキル があり、一部のセッションからスキルを作成、全てをCodexに移植できていない状況 解決策:CodexにClaudeのスキルフォルダを指定し、変換を依頼する方法

  • 緊急時やデバッグ時はClaudeを優先して利用 Claudeがより馴染みやすく、安心感がある ため、ツールの使い慣れが重要と再認識

  • CodexによるRuby/Ruby on Railsのコード変更はコメントが少ない傾向 コメントの少なさが好印象 であり、今後実験結果を共有予定

  • Codexエージェントの出力はより“技術的” Claudeはペアプロの同僚のような親しみやすさ CodexはStar TrekのDataのような論理的な印象

  • Codexで複数のセッションを小分けにして運用 Claudeでは大きなセッションを一つ持つ運用が多かった Codexで細分化したほうが集中しやすいと実感

  • Codexは変更作業自体は速いが、PRの仕上げに時間がかかる傾向 テストやレビューを何度も実行する徹底ぶり 最終的な所要時間はClaudeと大差なし

  • Codexはコードアーキテクチャがシンプル Claudeは抽象化や型定義など多くの追加要素を作成 同じ要件で比較した際、Claudeは複雑だが網羅性が高い

  • Codexにもミスが発生 ブランチのリベース処理で意図しない動作があった Claudeは意図を理解し、作業の同期をうまくこなす

  • JiraやAtlassianとの連携はCodexがやや不便 CLIツール利用時、CodexはブラウザとCLIを頻繁に切り替える煩雑さ Claudeは過去のセッションを踏まえて柔軟に対応

  • MCPとの連携はCodex CLI方式のほうが好み Codexはユーザーに認証コマンドを促し、適切なフローを実行 Claudeは自動実行を試みてフリーズすることがある

  • 総括:Claudeはユーザーの意図を先読みして積極的に対応 Codexは指示通りに動き、必要以上のことはしない伴走者的存在 完了と判断したら即座に処理を止める傾向

Hackerたちの意見

仕事の種類によると思うけど、私のはCodexの方がずっと役立ってる。正直、主に速さが大きいかな。みんなが言ってるように、無駄な言葉を吐き出さないように調整されてるみたいだし、チャットのやりとりやコードでもそう。私は、結構地味なスタックで、細かい変更を一つずつ慎重にやってるから、機能やコードを確認しながら進めてる。自分が何をしているかは分かってるけど、やりたくないことも分かってる(キャリアの中で何度もやった同じことのセットね)。

みんながまだClaudeに夢中になってる中で、2026年8月中旬のコーディングモデルの最新情報をお届け。Codexは良いよ、CLIもデスクトップアプリも、どのプランでもたくさん使える。Solもいい!ちゃんと仕事をこなしてくれるし、長くて考え抜かれたプロンプトを書いたら、Solを高負荷か最大速で1時間くらい放置しておけばいい。OMPは素晴らしいハーネスで、ClaudeのコードやCodexが追加してる機能は、もう数ヶ月前からここにあった可能性が高い。みんなの開発者友達に勧めてるけど、他の人にはCodexの方がシンプルで使いやすいからおすすめ。Claudeはまあまあだけど、特別良くはない。どのモデルもなんだか制限が増えてきてる。最大プランだとほぼ無制限にOpusが使えるけど、Fableは遅いし、ランダムなガードレールが本当に使えないから、ここ数週間は一度も使ってない。Gemini 3.7はスピードが素晴らしい。みんなが見逃してるけど、私も含めて。Kimi K3はフロントエンドに最適で、犯罪を犯すことを厭わない数少ないモデルの一つだし、成功する可能性もある。DS ProとFlashは速いけど、重要なことには使いたくない、SolやFable、時々3.7とは違って。GLM 5.3はまだ試してない。ローカルモデルも実際に良くなってきてるから、名誉の言及を。5090は今後ますます高くなるだろうね、残念ながら。世の中にはClaude以上のものがたくさんあって、それに気づくのに意外と時間がかかってるのかも。もしかしたら、それが一番いいのかもね!

ハーネスとモデルの組み合わせが、あなたの分析が示している以上に重要だと思う。DS Flash v4とPrime-Agentの組み合わせで運が良かった。結果がすごく気に入ってるし、思考トークンも見れる。オープンコードではモデルがあまり好きじゃなかったけど、SolとLunaはどこでも素晴らしい。SolのプランとLunaのビルドが最高だね。

Claudeモデルでのトークン使用量が先月83%減った。今はほとんど、ちょっとした質問や論文を読むためだけに使ってる。Opusモデルがサイクルループに入るのを止めるのが不可能に感じるし、私の仕事はFableにはセキュリティが近すぎる。Codexは素晴らしい作業馬で、ガードレールを気にせずに使えるし、コンパクトにしても全てを失うことはないし、計画ファイルでワークスペースを散らかすこともない。

DS ProとFlashは速いけど、SolやFable、時々3.7とは違って重要なことには使いたくない。 Gemini 3.7 Flash(主にストレージ用のGoogleサブ)とDS4 Flashをたくさん使ってきたけど(約60億トークン)、実際にはDS4 Flash(0713以前でも)をGemini 3.7 Flashより上に置くかな。Geminiは実装されてないことが多いし、正直言ってハーネスとしては物足りないところがある。DS4 Flashはいつでも褒めるけど、価格が上がった後は私にはもう意味がなくなった(GPT 5.6 Lunaの方がずっと良い価格帯だし)。高ボリュームのワークフローはすっかりMuse Spark 1.2 Contributorに移行したけど、こっちの方がDS4 Flash 0713よりもパフォーマンスが良いと感じてる。

残念ながら、Codexのプランは以前ほどトークンを提供してくれなくなったよ。これが変わったのは約1週間前。多くのユーザーがこの問題に気づいてるみたいで、俺も自分のアカウントで同じパターンを見た。前は週のクォータに達することなんてなかったのに、先週は1日で終わらせられた。同じプロジェクトで、同じセッションの連続作業なのにね。これが問題なのか意図的なのかは分からないし、すべてのアカウントに当てはまるかも不明。HNの他のユーザーも同じ問題に気づいてるか気になるな。

Claudeが「無制限」のクォータを提供してるってどういうこと?俺はMax $100とTeam PremiumでリラックスしてOpus 5 high+を使うと、5時間のうちに2-3時間で使い切っちゃうんだよ。スキルやプラグインも少ししか使ってないのに、そんなリラックスした使い方でも週のクォータが3日で消えちゃう。Codexでも$100の週のクォータが3日で使い切るし、Sol high+でも同じ。Claudeのモデルに$200払う気にはなれないな。Claudeは15-20分ごとに介入しないといけないし、自律性がないし、自己修正も信頼できない。GPTは自己修正が得意だけど、計画から逸れて無駄にトークンと時間を使っちゃうことが多い。Opusは無知な意見や偽の情報を押し付けて、どんどん意図したデザインから離れていく。Opusは仕様をスキップして間違いが多すぎる。クローズドフロンティアモデルについては、ClaudeよりもGPTモデルの方が好きだな。最近はGrok、GLM、Kimi、DeepSeekモデルをサブエージェントに使うことが多くなって、クローズドフロンティアモデルへの依存を減らそうとしてる。もう開発にはSoTAじゃないからね。

Piだけでも十分に使えるし、OMPもまあまあだけど、すごいハーネスにはあまり必要ないよ(これらのモデルはコーディングエージェントとして徹底的にRLで訓練されてるから、時には少ない方がいい)。SlopCodeBenchをたくさん使ってるよ - https://github.com/michaelasper/benchmarks Fable/Sol/GLM 5.3/Kimiがそのレベル(この順番で)。Deepseek/Opusはしっかりしてるし、Qwen 27Bは最低ラインだね。Sonnet/Terra/Haikuを日常的に使う理由はないと思う。Sol(xhigh)を全てに使う必要はないし、お金があるなら別だけど。OpenAIのLunaを使う方が十分だと思うし、必要な時にはOpus/Solにもアクセスできる。Gemini 3.7にはまだアクセスできてないけど、もうすぐ仕事で使えるようになるから、試してみるつもり!Codex CLIはちょっと貧弱だし(少なくともPiは拡張可能)。Claudeのコードは極端にバイブスが悪い。

ClaudeとCodex(他のものも含めて)について、私のコーディングの会話が漏れたり、トレーニングに使われたりしないか、どれくらい信頼できるか意見ある?プライバシー設定はちゃんと整えてるけど、各社にどれだけ信頼を置けるか気になってるんだ。

gemini 3.7はスピードがすごい これって、コードをより早く壊せるようになったってこと?それとも実際に良くなるように改善されたの?過去のバージョンでGeminiにチャンスを与えた時、ほぼすぐに何かを壊してループに入ってしまったんだ。プログラミングに役立った経験はないし、他の誰かが役立てた話もほとんど聞いたことがないよ。LLMがリポジトリやデータベースを壊滅的に削除する話、覚えてる?いつもGeminiだった。DeepSeekの方が信頼できるって、すごいね。調整後にかなり良い経験をしたけど、まだ短いリードで使ってるから。

仕事でSOTAモデルをかなり使ってるんだけど、トークンの消費量がすごいんだ。ずっと一つのモデルにこだわることはめったにないんだけど… でも、1ヶ月前にKimi K3とompを試し始めてからは、戻れなくなった。この組み合わせがRust開発にすごく合ってるみたい。モデルに全然イライラしないし、OpusやSOLに切り替えてない。月々のトークン代もかなり安くなったし…

Codexはスタートレックのデータのバージョンみたいだ。 なんかいい例えだね。最初はCodex Solがちょっと冷たい感じがしたけど、数週間使ってるうちに愛着が湧いてきたし、少し個性も見えてきた。ビジネスライクなところが気に入ってる。Fableは時々仕事に集中すべき時にちょっとフレンドリーすぎる。Codexはちょっと細かいところが気になるかも。彼の他の観察にもほとんど同意する。どのモデルが一番合ってるかでタスクを振り分け始めてる。一般的に、しっかりしたタスクでコードをサクッと書きたい時はCodexを使う。あまり仕様が決まってないタスクで、広い視野が必要な時や詳細を埋めてほしい時はFableを使う。どちらも素晴らしくて、いいチームを組んでる。

Hacker Newsで議論の続きを見る