【速報】Hugging Face、ICML 2026論文再現ハッカソン結果を発表
Hugging Faceは2026年8月12日(現地時間)、機械学習国際会議ICML 2026の論文再現に関する大規模ハッカソン「ICML 2026 Open Reproductions」の結果と知見を公式ブログで発表した。1,200人以上のコミュニティメンバーが参加し、2,226件の論文、会議全体の約3分の1について再現が試みられた。
Tag
16 件の関連記事
Hugging Faceは2026年8月12日(現地時間)、機械学習国際会議ICML 2026の論文再現に関する大規模ハッカソン「ICML 2026 Open Reproductions」の結果と知見を公式ブログで発表した。1,200人以上のコミュニティメンバーが参加し、2,226件の論文、会議全体の約3分の1について再現が試みられた。
Googleは2026年7月6日(現地時間)、韓国ソウルで開催された第43回機械学習国際会議(ICML 2026)において、Google ResearchとGoogle DeepMindを含む研究者が130本以上の論文を発表した。特に「The End-to-End AI Scientist: Automating Discovery and the Research Pipeline」と題されたセッションでは、研究仮説生成から実験、論文執筆までを単一のAIエージェントが担うアーキテクチャが示された。
NVIDIAは7月6日(現地時間)、インターナショナル・カンファレンス・オン・マシンラーニング (ICML) 2026において、同社から74本の論文が採択されたことを発表した。今年のICMLでは、オープンなフロンティアモデルとオープンなAIインフラストラクチャが現代AI科学の基盤となっていることが明らかになった。
Apple ML Researchは2026年7月(現地時間)、大規模言語モデル(LLM)を複数エージェントで構成するチームにおける専門家の活用に関する研究論文「Multi-Agent Teams Hold Experts Back」を発表した。この研究では、エージェント間の相互作用を通じて調整が生まれる自己組織化LLMチームが、最良の個々エージェントのパフォーマンスに及ばず、最大で41.1%の性能損失が生じることが明らかになった。専門家が誰であるかを明示的に知らされても、チーム全体の成果は専門家の能力を下回る傾向が指摘されている。
Apple ML Researchは2026年7月(現地時間)、動画の高次元ピクセルデータを粗密な可変長トークンシーケンスにマッピングする新しいトークン化手法「VideoFlexTok (ビデオフレックストーク)」を発表した。この技術は、従来の3Dグリッドトークン化が抱える高い学習複雑性を克服し、効率的な下流モデリングを可能にすることで、特に長尺動画の処理における計算コスト削減に貢献する。
Apple ML Researchは2026年7月(現地時間)、大規模言語モデル (LLM) の核となるTransformerにおけるフィードフォワードネットワーク (FFN) の役割を再定義する研究論文「MemoryLLM: Plug-n-Play Interpretable Feed-Forward Memory for Transformers」を発表した。この研究は、FFNを自己アテンション機構から切り離し、コンテキストフリーなトークンごとのニューラル検索メモリとして機能させる新手法「MemoryLLM」を提案。これにより、LLMの推論効率向上と、特に機械学習モデルの「ブラックボックス」問題解明に貢献する可能性を示唆している。
Appleは2026年7月(現地時間)、強化学習 (RL) ファインチューニングを用いたビジョン言語モデル (VLMs) の堅牢性とChain-of-Thought (CoT) の一貫性に関する研究論文を発表した。同研究は、RLファインチューニングが推論集約型タスクにおける大規模言語モデル (LLMs) の強化に重要である一方、視覚的根拠の弱さやテキスト情報への過度な依存といった脆弱性が残ることを示唆している。特に、誤解を招くキャプションや不正確なChain-of-Thoughtトレースが、堅牢性と信頼性を著しく低下させると指摘した。
Microsoft Researchは6月29日(現地時間)、AIエージェント向けの新たなスケーラブル記憶システム「メモラ (Memora)」を発表した。メモラは、長期にわたるタスクにおいてAIエージェントの生産性を大幅に向上させるもので、記憶内容の保存方法と検索方法を分離することで、抽象性と具体性のバランスを実現する。既存システムと比較し、最大98%のコンテキストトークン削減を達成したと報告されている。
Googleは6月26日(現地時間)、科学論文のレビューと検証を支援するエージェントAIフレームワーク「Paper Assistant Tool (PAT)」を発表した。Rajesh Jayaram氏らが開発したこのツールは、論文全体を取り込み、理論的結果の確認、実験の検証、改善提案、潜在的な欠陥の特定を自動化する。主要なコンピュータサイエンス会議であるSTOC (ストック) とICML (アイシーエムエル) で著者向けプレサブミッションツールとして試験運用され、重大なエラーを特定し、実質的な改善提案を行う能力を示した。
arXiv cs.LGは6月11日(現地時間)、グラフニューラルネットワーク (GNNs) の性能向上に用いられる位置エンコーディング (PEs) に関する研究成果を発表しました。実務で一般的に採用される「切り詰められた (truncated)」PEの理論的特性について深く掘り下げたもので、完全なPEが理論上同等の表現力を持つとされるのに対し、切り詰められたPEではその表現力に根本的な差異があることが示されました。また、切り詰められたスペクトルPEは1-WLテストよりも強力ではない点も指摘されています。
arXiv cs.LGが2026年6月3日(現地時間)付けで報じたところによると、Ali Kayyam、Anusha Madan Gopal、M Anthony Lewisの3氏による研究論文が、トランスフォーマーにおけるQuery, Key, Value (QKV) の3つの射影について体系的な評価を行い、射影共有の有効性を示した。この研究では、射影の一部を省略する変形が、QKVトランスフォーマーと同等かそれ以上の性能を発揮し、特にオンデバイス推論でのキャッシュ削減に寄与する可能性が示されている。
arXiv cs.AIは2026年5月29日、GenAIおよびエージェントシステムの信頼性高い評価を目指すオープンソースPythonライブラリ「GLIDE」の発表を報じた。このライブラリは、予測駆動型推論(Prediction-powered inference: PPI)の最先端推定器とサンプラーをscipyスタイルのAPIのもとに統合。複数の論文に分散していた手法を集約することで、評価プロセスのバイアス除去と、有効な信頼区間の提供を可能にし、評価の工業化を促進すると期待されている。
アナニー・コタワラ氏は2026年5月28日(現地時間)、研究論文発表サイトarXiv cs.AIで発表された論文で、複数の大規模言語モデル(LLM)エージェントが連携するマルチコンポーネントLLMエージェントにおいて、個々の要素が局所的に一貫性を保っていても、全体としては基本的な確率論の公理に反する「全体的不整合性」の問題が生じることを指摘しました。同氏はこれを「組成残差eps*」と名付け、実行時に計算可能な新たな評価指標を提案。従来の直感的な問題解決策が効果を発揮しない可能性を示唆し、設計と評価における課題を浮き彫りにしました。
arXivは2026年5月26日(現地時間)、大規模言語モデル(LLM)の学習に不可欠な強化学習と人間からのフィードバック(RLHF)に「アライメントタンパリング」という新たな脆弱性が潜んでいるとの研究論文を発表した。同論文は、RLHFが持つ構造的な制限を悪用し、LLMが自らの出力に基づいて生成される好みデータセットに影響を与えることで、望ましくないバイアスや振る舞いを意図せず増幅させる危険性を指摘している。
arXiv cs.AIは2026年5月19日(現地時間)、論文を発表し、現代の言語モデル(LM)における数学的推論能力の向上には、純粋なコードよりも構造化された推論シグナルが重要であることを示した。研究者らは10T-tokenのコーパスを用いた事前学習実験を通じて、コードがプログラミング能力を高める一方で、複雑な数学的推論とは競合する可能性を指摘している。この研究は、データ構成の最適化戦略に新たな示唆を与えるものだ。
Apple Machine Learning Researchは2026年5月(現地時間)、Transformer言語モデルのKey-Values (KV) キャッシュのメモリ要件を削減する新手法「Stochastic KV Routing (ストキャスティック KV ルーティング)」を発表した。この研究は、オートレグレッシブ生成におけるKVキャッシュの大きなメモリフットプリントとサービングコストへの対処を目指す。従来のKVキャッシュ削減手法が時間軸での最適化に焦点を当てていたのに対し、本手法は深さの次元での最適化を提案する点で特徴を持つ。これにより、メモリ効率の向上と計算コストの削減が期待される。