世界を動かす技術を、日本語で。

Anthropicが「Claude Code」において作業負荷の軽減レベルをA/Bテストしているようです

2026年8月23日原文(twitter.com)

概要

  • Anthropic がサーバー側で Fable 5 セッションに実験的変更を適用
  • Claude code 2.1.236+ 以降、一部ユーザーにのみ エフォートスケール縮小 テスト実施
  • Opus 5 や古いバージョンは 対象外
  • "High""Low" 並みの出力となるA/Bテスト
  • 公式changelogには未記載 で混乱発生

AnthropicによるFable 5セッションのエフォートスケール実験

  • Anthropicサーバー側Fable 5 の一部セッションを実験対象に設定
  • Claude code 2.1.236以降、エフォートスケール(努力度)の値を 縮小 するA/Bテストを実施
  • Opus 5古いバージョン のセッションは 変更対象外
  • このテストは 全ユーザー対象ではなく、一部ユーザーのみが影響を受ける仕組み
  • "High" 設定でも "Low" 並みの出力になる場合は テストグループ に該当
  • Fable の応答が 今週急に鈍くなった場合、利用者側の問題ではなく Anthropic側の仕様変更 が原因
  • 2.1.237以降 では、モデルが "high" effort100段階中10 として扱い、以前の "low" と同じ数値に設定
  • 公式changelog には 本件が記載されていない ため、開発者やユーザーに混乱が発生
  • t3 code や自作アプリの不具合と誤認しやすい状況

影響と注意点

  • 一部ユーザー のみが A/Bテスト の対象となるため、同じ環境でも挙動が異なるケースが発生
  • "High" effort 設定でも 出力品質が低下 している場合、 Anthropicの実験 が原因
  • 公式発表やchangelog に情報がないため、ユーザー自身で状況を判断する必要
  • 開発者・利用者 ともに 混乱や誤解 を招きやすい運用
  • Anthropic の仕様変更に対する 透明性の欠如 が問題視される可能性

Hackerたちの意見

これだけじゃない気がする。ラバーバンディングの使用制限や、バックエンドで別のモデルにルーティングする「最適化」がたくさんあるし、インセンティブが強すぎるんだよね。

APIを使ってるんだけど(宣伝しちゃうけど:alyp.ai経由で)、その違いがすごい。チャットベースのモデルは、個人の使用状況や全体の負荷に応じてロボトミーされてるのが明らかだよ(例えば、PSTのビジネスアワーは最悪)。APIはこれに影響されてないみたい。

Opus 5がやってることはおかしい。プロンプトは「設定ファイルを新しいデータで読み込んで更新する」だったんだけど、4.6ではファイルを読み込んで新しいデータを解析してパッチを当てるのに2分もかからない。Opus 5の結果は、コンテナを引っ張ったり、サンドボックスを動かしたり、テストスイートを作ったりで43分かかった。しかも、設定ファイルの範囲を超えてリポジトリ全体を評価してるし。どちらもファイルの修正は1回だけ。

そうだね、あれでトークンを燃やしてるようなもんだ。

AI企業は、実際のタスクに必要な以上にトークンを消費させる経済的インセンティブがあるんだよね。

ビジネスの利益はトークンに依存してるから、株主はそれをちゃんと見たいんだよね。

Opus 5 in xhighは基本的な数学もできないよ。あまりにも簡略化されて、昨日サブスクリプションをキャンセルしちゃった。以前は$200のサブスクだったけど、フェイブルの騒動の後に$20に落ちて、Codexの使用が残ってない時だけ使ってる。/on 文章が耐えられないほど重い — どの文も、読むためじゃなくて深く聞こえるように作られた感じがする。

Opus 5は避けて、似たような問題でOpus 4.8に戻ったよ。Opus 4.8は今でもすごく調子いい!

私も同じ経験だよ。Opus 5は「それをするな。なんでそんなことしたの?何度も言ったのに、またやってるじゃん。」っていう終わりのない連鎖。ちょっとした質問でも10分以上考えてるし、書く文章はひどい。まるでLinkedInの詐欺師を読んでるみたい。「厳しい真実!二つの道、一つの決断!現実チェック!」

最初はオーパス5とフェイブルの高い推論レベルで信じられないほどひどい体験をしたよ。中程度の努力でずっと良い結果が出てる。私の理解が正しければ、みんなの合意は中程度以上の努力はあまり価値がないってことみたいで、むしろ極端な最悪のケースに遭遇することが多い。私の経験とも一致してる。エルドシュ問題を解かせるために宝くじを当てようとするくらいじゃないと、本当に価値がないよ。

俺、ほんとに時代遅れなのかな…なんで手動で設定ファイルを更新しないの?コーヒーショップまでプライベートジェットで行くみたいなもんじゃない?

彼らは高トークン使用を最適化して、もっとお金を取ろうとしてるんだよね。

Hacker Newsで議論の続きを見る