リサーチ・論文

AnthropicのClaude Opus 5、エージェント知識業務で首位

Anthropicは2026年7月23日(現地時間)、生成AIモデル「Claude Opus 5」を発表した。同モデルは、同社の「Artificial Analysis Intelligence Index」において新たなリーダーとなり、独自のエージェント知識業務ベンチマーク「AA-Briefcase」でも首位を獲得した。最大努力設定でのAA-Briefcase Eloスコアは1720を記録し、これまでのリーダーだったClaude Fable 5を146ポイント上回った。また、タスクあたりのコストをClaude Fable 5から20%削減している。

リサーチ・論文

Claude Sonnet 5、タスクあたりコスト増加を伴う性能向上

アーティフィシャル・アナリシス (Artificial Analysis) は2026年6月29日(現地時間)付けの報告で、Anthropic の最新モデル「Claude Sonnet 5」が、高いエージェント的性能を示す一方で、タスクあたりの実コストが増加していると発表した。同モデルは「Artificial Analysis Intelligence Index」で53ポイントを獲得し、GPT-5.5と同等のスコアを達成している。

リサーチ・論文

アーティフィシャル・アナリシス、Claude Sonnet 5の性能評価結果を公表

アーティフィシャル・アナリシス (Artificial Analysis) は2026年6月(現地時間)、AnthropicのAIモデル「クロード・ソネット 5 (Claude Sonnet 5)」に関する性能分析結果を発表した。同モデルは、同社のインテリジェンス・インデックス (Intelligence Index) で平均を大きく上回る53点を記録し、162モデル中5位にランク付けされた。価格は1M入力トークンあたり3.00ドル、1M出力トークンあたり15.00ドルで提供される。

リサーチ・論文

Artificial Analysis、「AA-Briefcase」ベンチマークを発表

Artificial Analysisは2026年6月17日(現地時間)、長期間にわたる知識労働の能力を評価する新たなベンチマーク「AA-Briefcase (AA-ブリーフケース)」を発表した。このベンチマークは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した「AA-Briefcase Elo」でモデルを評価する。現在の評価では、Claude Fable 5が首位となり、Claude Opus 4.8 (max)、GLM-5.2 (max)が続いた。