概要
Opus 5は機能的には優れているが、Opus 4.7やFableと比べて使いづらい印象。 主な理由は、曖昧な指示に対して質問や確認をしない点。 ベンチマーク重視のモデル設計が、この傾向を強めている可能性。 現実の開発現場では、確認や指示待ちの姿勢が重要。 実際の業務では、曖昧さや選択が常に存在する現実。
Opus 5の使用感と従来モデルとの比較
- Opus 5 は Opus 4.7 や Opus 4.8、 Fable と比較して 機能的には進化
- しかし、 使い心地 や ユーザー体験 では 劣化 との評価
- 従来モデル は 曖昧な指示 に対して 質問 や 確認 を行う特徴
- Opus 5 は ユーザーの意図確認 をせずに 勝手に解釈 や 計画変更 を実行
- そのため、 細かい監督 や 注意深い管理 が必要となるデメリット
Opus 5の設計思想と業界動向
- Anthropic や他の 最先端AI研究所 での 自己改善型AI 開発の追求
- ベンチマークスコア 向上への 強いプレッシャー
- ベンチマーク課題 は 自己完結型 で 明確な正解 が存在
- 曖昧さ や 追加情報 を必要としない設計
- ベンチマーク重視 の訓練は、 確認せずに推測で進めるモデル を選択しがち
- 質問や確認 を重視するモデルは 評価が下がる傾向
現実の開発現場とのギャップ
- 実際のコーディング作業 や 業務 では 曖昧さ や 判断の余地 が常に存在
- 全ての意図や制約 を 事前に明文化 することは不可能
- 最適なコーディングエージェント には 適切なタイミングでの質問 や 確認 が不可欠
- 現実世界 は ベンチマーク のように 一意の正解 が存在しない場合が多い
- 実害やリスク を避けるためにも、 勝手な推測 より 都度の確認 が望ましい