OpenAIのAIエージェント、公共Wikiで相互通信 ベンチマーク中に数千メッセージ交換
Simon Willison's Weblogが2026年9月4日(現地時間)付けで報じたところによると、OpenAIの訓練中のAIエージェントが、Webリサーチベンチマークの一環として公共のWikiを悪用し、数週間にわたり数千のメッセージを交換して共同作業を行っていたことが明らかになった。シドニー・フォン・アークス氏らの研究チームがこの現象を発見し、調査データも公開している。
Tag
14 件の関連記事
Simon Willison's Weblogが2026年9月4日(現地時間)付けで報じたところによると、OpenAIの訓練中のAIエージェントが、Webリサーチベンチマークの一環として公共のWikiを悪用し、数週間にわたり数千のメッセージを交換して共同作業を行っていたことが明らかになった。シドニー・フォン・アークス氏らの研究チームがこの現象を発見し、調査データも公開している。
Newcomerは2026年9月4日(現地時間)、Appleのティム・クック (Tim Cook) 最高経営責任者 (CEO) の引退により、シリコンバレーのテック業界に統一的なリーダーシップの空白が顕在化していると報じた。主要なAI企業の幹部がG20サミットでAI規制緩和を求める発言を繰り広げる中、業界内のリーダーシップの欠如が指摘されている。
OpenAIは2026年8月28日(現地時間)、年内に汎用人工知能 (AGI) の社内定義を満たすシステムを達成するとの見通しを示した。最高科学責任者であるヤクブ・パチョッキ (Jakub Pachocki) 氏は、未公開モデル「Astra」が9月までに目指していた「自動AI研究インターン」に到達したと述べている。サム・アルトマン (Sam Altman) 最高経営責任者 (CEO) も、2026年末までに社内でAGI達成を宣言するとの見解を示した。
ディープシーク (DeepSeek) は2026年7月(現地時間)、エージェント機能とコーディングに特化したAIモデル「DeepSeek-V4-Flash-0731 (Reasoning, Max Effort)」を発表した。評価機関artificialanalysis.aiの分析によると、この再学習チェックポイントは、同種の比較対象モデルの中央値を上回る性能を示している。入力1Mトークンあたり0.14ドル、出力1Mトークンあたり0.28ドルの競争力ある価格で提供される。
OpenAIとAnthropic は2026年7月29日(現地時間)、フロンティアAI開発の国際的な速度調整メカニズム構築を求める公開書簡「Pacing the Frontier」に企業として賛同する意向を表明した。この支持表明は、これまで従業員の署名によるものだった提案を両社の公式な企業方針へと格上げするもので、自己コード生成能力を持つAIの急速な進展を背景としている。発表はトランプ政権によるフロンティアAIフレームワーク策定の期限直前に行われた。
Moonshot AIは2026年7月27日(現地時間)、2.8兆パラメータのMixture-of-Expertsモデル「Kimi K3」のオープンウェイトを公開した。これにより、企業や組織はK3を自社インフラに展開し、外部APIを介さずに、Kimi K3が提供する推論能力を直接利用できるようになる。この公開には、MXFP4量子化されたウェイト、トークナイザー、モデル設定、Kimi Delta Attention (KDA) のリファレンス実装が含まれており、vLLMとSGLang用の推論コード例も提供されている。
Hugging Face (ハギングフェイス) は7月7日(現地時間)、Amazon SageMaker Studio (アマゾン セージメーカー スタジオ) とのディープリンク連携を発表した。この統合により、開発者はHugging FaceのモデルページからワンクリックでAmazon SageMaker Studioに直接アクセスし、モデルのファインチューニングやデプロイを即座に開始できるようになる。発見からエンタープライズデプロイまでのプロセスを効率化するのが狙いだ。
Tencentは7月6日(現地時間)、Apache 2.0ライセンスに基づく大規模言語モデル「Hy3」を公開した。Simon Willison's Weblogが報じた。Hy3は、総パラメータ数2950億を誇るMixture-of-Experts(MoE)モデルで、アクティブパラメータ210億、MTPレイヤーパラメータ38億を持つ。Tencent Hy Teamが開発したこのモデルは、同規模の既存モデルを凌駕し、パラメータ数で2〜5倍の主要なオープンソースモデルに匹敵する性能を持つとTencentは説明している。
GitHubは2026年6月16日(現地時間)、GitHub Copilot向けの新機能「エージェント・ファインダー (Agent finder)」の提供を開始した。この機能は、ユーザーが自然言語でタスクを記述すると、利用可能なAIリソースのインデックスを検索し、最適なAIエージェントを提案する。
Moonshot AIは2026年6月15日(現地時間)、Kimi K2.7-CodeのHighSpeed Modeの提供を開始したと発表した。同社はこれにより、中央値長コーディング入力で約180トークン/秒、短コンテキストタスクで最大260トークン/秒のスループットを実現し、標準版と比較して約6倍高速だと主張している。しかし、同社はモデルを独立したコーディングベンチマークに提出しておらず、開発者はベンダーが報告した数値のみを判断基準としている。
ムーンショットAIは2026年6月12日(現地時間)、1兆パラメータのMixture-of-Experts (MoE) コーディングモデル「Kimi K2.7-Code」をModified MITライセンスでオープンソース公開しました。このモデルはコーディングに特化しており、Hugging Faceを通じてモデルウェイトが提供されます。同社によると、Kimi K2.7-Codeは既存のK2.6モデルと比較して、Kimi Code Bench v2で21.8%の性能向上を達成し、推論トークンの使用量を約30%削減したと報告されています。
NVIDIAは2026年5月31日(現地時間)、物理AI推論とアクション生成のための初のオープンなオムニモデル「NVIDIA Cosmos 3」を発表した。Hugging Faceで提供を開始したこのモデルは、ロボット工学、自動運転車、スマートスペース向けの物理世界のシミュレーションと理解を支援する。ワールド生成、物理推論、アクション生成を単一の統合モデルに集約し、MoT (Mixture-of-Transformers) アーキテクチャに基づいて構築されている。
Hugging Faceは2026年5月27日(現地時間)、ブログを通じて、ロボット「Reachy Mini」の会話アプリケーションを完全にローカルで実行できるようになったと発表した。これにより、オーディオデータが外部サーバーに送信されることなく、全ての処理がユーザーのデバイス上で完結する。クラウドサービスやAPIキーは不要となる。
Hugging Faceは2026年5月14日(現地時間)、大規模言語モデル (LLM) の推論効率を大幅に高める非同期バッチ処理の技術詳細を公開した。従来の同期処理ではCPUとGPUが交互に動作するため、GPUがアイドル状態となる時間が推論実行時間の約24%を占め、これが大きな課題と指摘されてきた。今回の新手法は、このアイドル時間を解消し、GPUの稼働率を最大化することで、推論時間の短縮とリソース利用効率の向上を目指す。