リサーチ・論文

コーディングエージェントのハーネス設計、効率向上要因を分析

arXiv cs.AIは9月17日(現地時間)、「An Empirical Study of Harness Design for Coding Agents」と題する論文を公開した。この論文は、自律型コーディングエージェントのハーネス設計において、各コンポーネントがモデルの能力をソフトウェアエンジニアリングの性能にどう変換するかを実証的に研究。従来の単一システムとしてのハーネス評価に対し、個々のコンポーネントの有効性を分析し、モデルと予算に応じた設計知見を提示した。

ベンダー・製品

バーセル、AIエージェントのブランド一貫性強化策「design.md」を導入

Vercel は2026年8月31日(現地時間)、AIコーディングエージェントが同社ブランドに準拠したページを生成するための公開ファイル「design.md」の導入を発表した。これは、エージェントが既存のコードベース外のツールで作業を行う際にも、一貫した視覚的言語とデザイン原則を維持することを目的としている。これにより、レポートや提案書といった多様な文書においても、ブランドイメージの統一が可能となる。

ベンダー・製品

Vercel、AI GatewayにTencentのLLM「Hy4 Preview」を統合

Vercelは8月27日(現地時間)、自社のAI Gatewayにおいて、Tencentが開発したオープンソースの大規模言語モデル(LLM)「Hy4 Preview」が利用可能になったことを発表した。Hy4 Previewは、合計770Bのパラメーターとトークンあたり49Bのアクティブパラメーターを持つMixture-of-Expertsモデルであり、1Mトークンのコンテキストウィンドウに対応。これにより、AI Gatewayのユーザーは、同モデルの高度な推論機能を活用し、多様な開発ニーズに対応できるようになる。

リサーチ・論文

Meta、コーディングLLM「Muse Code」と「Muse Spark 1.2」発表

Metaは8月5日(現地時間)、コード生成に特化した大規模言語モデル(LLM)「Muse Code (ミューズ・コード)」と、関連モデル「Muse Spark 1.2 (ミューズ・スパーク 1.2)」を発表した。Muse Spark 1.2は、先行モデルのMuse Spark 1.1から更新され、コード生成、複雑なデバッグ、コードベースの理解、および開発者ワークフロー全体における改善が図られている。同モデルは、長期シーケンスのエージェント的ツール呼び出しを重要な特性としている。

ベンダー・製品

【速報】Sourcegraph、自社コードベースでのエージェント評価方法を発表

Sourcegraphは2026年7月30日(現地時間)、自社コードベース上でAIコーディングエージェントの性能を評価するための新しい方法論を発表しました。これはコード検索の品質、タスク完了、コストが異なる測定基準であり、それぞれを混同せずに測定する必要があるとの見解に基づくものです。