« そして君に・・・ | トップページ | 見えない部分 »

2026年6月24日 (水)

天と地

[私]

Opus 4.8ってどの程度の知能か知ってるか?


[ChatGPT]

はい。2026年6月時点の Claude Opus 4.8 は、Anthropicの一般公開モデルとしては最上位クラスです。Anthropic自身は「Opus 4.7の正統進化版」と位置付けていますが、実際にはかなり強力です。 

あなたの用途(大量の既存コード解析・iOSアプリ開発・Visual Studio資産の移植)で言うと、

  • Sonnet 4.x → 優秀な開発者
  • Opus 4.8 → ベテランアーキテクト兼レビュアー

ぐらいの差があります。

特に評価されているのは

  • 巨大コードベースの理解
  • 複数ファイルをまたぐ修正
  • リファクタリング
  • バグ発見
  • コードレビュー
  • 自律エージェント作業

です。SWE-bench系のコーディングベンチマークではGPT-5.5を上回る結果を出しているとAnthropicは公表しています。 


またOpus 4.8で特徴的なのは、

「分からない時に分からないと言う能力」

を強化している点です。

Anthropicは「コードの欠陥を見逃す確率が大幅に減った」「不確実な時はそれを明示する」と説明しています。 

あなたが最近MP3TagFixで経験したような

  • AIが勝手に推測する
  • 存在しない関数を作る
  • 確認せずに修正案を出す

みたいな暴走を減らす方向の進化です。 

ただし現時点での私の印象を一言で言うと、

コード開発なら Opus 4.8 と GPT-5.5 を併用するのが最も強い

です。

実際、あなた自身が最近書いていた

AIは少なくとも二つ以上使った方がいい

という考え方にかなり近いです。

  • Opus 4.8 → 設計・解析・レビュー
  • GPT-5.5 → 実装・検証・別視点のチェック

という使い方は非常に理にかなっています。 

ちなみにAnthropic自身は、Opus 4.8よりさらに上位の Claude Mythos を準備中で、「Opus 4.8はまだMythos級ではない」と明言しています。つまりAnthropicの中でもOpus 4.8は最終形ではありません。 

あなたの現在の用途だけで評価すると、

Claude Code + Opus 4.8 は、2026年6月時点では間違いなく世界トップクラスの開発支援環境の一つです。


どこまで私のことを知っているんだw
Photo_20260624181201
ではもう一つ教えてあげよう
私はこの水しか飲まないよ。
(こんど質問してみよう)

余談はそこまでとして
その差は大きいどころか天と地です。
SEならすぐに気が付くはず。

« そして君に・・・ | トップページ | 見えない部分 »

ChatGPT」カテゴリの記事

2026年7月
      1 2 3 4
5 6 7 8 9 10 11
12 13 14 15 16 17 18
19 20 21 22 23 24 25
26 27 28 29 30 31  
無料ブログはココログ