リサーチ・論文

アーティフィシャル・アナリシス、AIモデル評価の新プラットフォーム「Optima」を提供開始

アーティフィシャル・アナリシス (Artificial Analysis) は2026年8月12日(現地時間)、AIモデルのカスタムベンチマーク作成プラットフォーム「Optima(オプティマ)」をローンチしたと発表した。同プラットフォームは、ユーザーが自身のファイルやエージェントトレース、コーディング環境から独自のベンチマークを構築し、主要なAIモデル間で品質、タスクあたりのコスト、タスクあたりの時間を比較することを可能にする。これにより、特定のユースケースに最適なモデルや、現在の設定と比較して最大10倍のコスト削減が可能な代替モデルの特定を支援する。

規制・政策

米英AIセキュリティ機関、Moonshot AI「Kimi K3」のサイバー能力を共同評価

UK Artificial Intelligence Security Institute (UK AISI)とU.S. Center for AI Standards and Innovation (CAISI)は7月23日(現地時間)、Moonshot AIの最新モデル「Kimi K3」のサイバー能力に関する共同評価の結果を発表した。この評価でKimi K3は、先行する最先端のサイバー対応モデルと比較して、予備的なサイバー評価において著しく低い性能を示した。エクスプロイト開発ベンチマーク「ExploitBench」では32%の成功率を記録したが、これは最先端モデルの性能を大幅に下回る。また、モデルのセーフガードはサイバーエクスプロイト開発や攻撃的なサイバーオペレーションの試みを阻止しなかったと報告された。

リサーチ・論文

arXiv、AI評価結果報告の新基準「EvalCards」を論文で提案

arXiv(アーカイブ)cs.AIは2026年6月8日(現地時間)、AI(人工知能)評価結果の報告における一貫性の欠如を指摘し、この課題に対処するための運用可能なレポート層「EvalCards(評価カード)」を提案する論文を発表した。同論文は、評価結果の比較困難さや情報欠落の問題を解決するため、ベンチマークメタデータ、評価実行データ、モデルメタデータを統一された記録に統合する仕組みを詳述しており、AI評価報告の透明性と信頼性向上に寄与すると期待される。