【速報】Hugging Face、マルチモーダルエンコーダー「NeoMME」発表
Hugging Faceは2026年9月2日(現地時間)、効率的なマルチモーダル・マルチリンガルエンコーダー「NeoMME」を発表した。このモデルは2億6000万と8億の2つのサイズで提供され、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理する。事前学習済みのビジョンタワーや因果言語モデルを使用しないアーキテクチャが特徴である。
Tag
22 件の関連記事
Hugging Faceは2026年9月2日(現地時間)、効率的なマルチモーダル・マルチリンガルエンコーダー「NeoMME」を発表した。このモデルは2億6000万と8億の2つのサイズで提供され、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理する。事前学習済みのビジョンタワーや因果言語モデルを使用しないアーキテクチャが特徴である。
ムナワル・ハサン氏とアポストル・ヴァシレフ氏は2026年8月31日(現地時間)、arXiv cs.LGに「Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks」と題する論文を発表した。この研究は、滑らかな2層フィードフォワードネットワーク(FFNs)が、特定の条件下で追加の構造モデル抽出チャネルを露出させることを示した。パラメータや勾配へのアクセスなしに、選ばれた入力と生の出力情報のみを用いることで、隠れた内部構造を高精度で回復する手法が詳述されている。
arXivは8月26日(現地時間)、論文を公開し、Ali Bahri (アリ・バーリ) 氏らが大規模言語モデル (LLM) の推論コスト削減手法「深層プルーニング (depth pruning)」によって生じる精度損失を補正する新たなフレームワーク「SHIFT-LLM」を発表しました。この手法は訓練不要で、プルーニングされたTransformerブロックの隠れ状態分布の乱れを線形残差アダプター (LRA) で補正すると報告されています。実験では、複数のモデルとベンチマークにおいて、深層プルーニングで失われた精度を一貫して回復したことを示しています。
Yongliang Zhang氏らの研究チームは8月19日(現地時間)、arXiv cs.CVが公開した論文で、測位データと高精度道路ネットワークを接続するマップマッチング技術の新たなフレームワーク「SceneGTMM」を発表した。同フレームワークは、既存手法が抱えるノイズ堅牢性、クロスリージョン転送、解釈性といった課題に対応するため、コンフォーマルマッピングに基づくシーンアウェア転送戦略とGNN-Transformerデュアルグラフ相互作用アーキテクチャを導入している。
arxiv.orgは8月3日(現地時間)、テスト時潜在推論手法「GradCuit (グラッドキュイット)」に関する査読前プレプリントを発表した。大規模言語モデル (LLM) の推論において平均64.5%の精度を記録し、既存の勾配伝播の課題を解決。推論形成に貢献する潜在状態への直接的クレジット割り当てを可能にすることで、モデルの堅牢性と解釈性を大幅に向上させ、次世代LLM開発における信頼性確保に寄与すると期待される。
Kiran Nair (キラン・ネアー) 氏、Smriti Regmi (スムリティ・レグミ) 氏、Rodrigue Rizk (ロドリグ・リスク) 氏らは7月28日(現地時間)、arXivで公開された論文の中で、トランスフォーマーの推論効率を向上させる新しいフレームワーク「CausalGate (コーザルゲート)」を開発したと発表した。CausalGateは、大規模言語モデル (LLM) における冗長なモジュールを特定し除去することで、計算効率を高めることを目的としている。
Apple は2026年7月(現地時間)、テキストから動画を生成する処理速度を向上させる学習不要の新たな手法「CalibAtt」を発表しました。この技術は、既存の拡散モデルが抱える時空間アテンションのボトルネックを解消し、動画生成の品質とテキストとの整合性を維持しながら、最大1.58倍の高速化を実現します。これにより、高品質な動画生成における実行時間の遅さという課題の解決に貢献すると見られます。
Apple ML Researchは2026年7月(現地時間)、大規模言語モデル (LLM) の核となるTransformerにおけるフィードフォワードネットワーク (FFN) の役割を再定義する研究論文「MemoryLLM: Plug-n-Play Interpretable Feed-Forward Memory for Transformers」を発表した。この研究は、FFNを自己アテンション機構から切り離し、コンテキストフリーなトークンごとのニューラル検索メモリとして機能させる新手法「MemoryLLM」を提案。これにより、LLMの推論効率向上と、特に機械学習モデルの「ブラックボックス」問題解明に貢献する可能性を示唆している。
arXiv cs.LGは7月1日(現地時間)、研究論文「Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training」を発表した。この論文は、大規模言語モデル(LLM)の強化学習(RL)後学習において、Transformerモデルの単一の層のみを学習させることで、モデル全体の全パラメータを学習するのと同等か、それを上回る性能向上が得られる可能性を指摘している。既存のRLアプローチの前提に疑問を呈し、層ごとの学習効果を分析した点が特徴だ。
ジョバンニ・モネア(Giovanni Monea)氏らは7月1日(現地時間)、学術論文公開サイトarXivにおいて、大規模言語モデルの基盤技術であるTransformerの性能を向上させる新たな「状態予測分離仮説」を提唱する論文を公開しました。Transformerが次トークンの予測と将来の状態保持に同一の順方向計算ストリームを使用することに着目し、これら二つの役割を分離することで、データ効率と計算効率の両面で優れた言語モデリング性能が得られることを実証しました。
論文『Hierarchical Global Attention (HGA)』は6月29日(現地時間)、arXiv cs.LG上で公開されました。HGAは、事前学習済み大規模言語モデルの密な因果アテンションを代替する技術です。既存のチェックポイントパラメータを維持し、再トレーニングなしでの導入を可能にすることで、限られたGPUメモリで超長尺コンテキストを効率的に処理する新たな道を開きます。
arXiv cs.LGは2026年6月25日(現地時間)、論文「Prism Transformer: Progressive Head Schedules for Hierarchical Attention Processing」を発表した。従来のTransformerモデルにおけるMulti-head attentionの均一なヘッド割り当てが、性能を阻害する構造的ボトルネックであることを指摘。この課題に対し、Shubham Aggarwal氏が新たなアーキテクチャ「Prism Transformer」を提案した。同モデルは層間でヘッド数を単調に増加させるプログレッシブなヘッドスケジュールを採用し、パラメーターと計算量を増やさずにモデルの潜在能力を効果的に引き出す。
ポール・デュボワ (Paul Dubois) 氏は2026年6月26日(現地時間)、大規模言語モデル (LLM) とワールドモデルの関係性に関する研究論文をarXivで発表した。論文では、LLMがワールドモデルの退化した特殊ケースであり、ワールドモデルはLLMの厳密な一般化であると主張。ヤン・ルカン (Yann LeCun) 氏が2022年に提唱した、汎用人工知能達成のためのラテント空間アーキテクチャへの移行の必要性に対する、二元論的ではない新たな視点を示した。
Transformerアーキテクチャ (Transformer architecture) の共同著者であるノーム・シャゼール氏は2026年6月18日(現地時間)、Google DeepMindを退社し、OpenAIに参画することを明らかにした。同氏は、現代の主要なAIモデルの基盤となる2017年の論文「Attention Is All You Need」を共同執筆している。シャゼール氏はOpenAIで、アーキテクチャ研究のリードを務める。
arXiv cs.AIは6月16日(現地時間)、「Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers」と題する論文を発表した。同論文は、深層およびループアーキテクチャが直面する信号伝播問題を解決するため、固定点収束を停止メカニズムとして組み込んだTransformerベースのモデル、Fixed-Point Reasoning Model (FPRM) を提案している。FPRMはタスクの難易度に応じて計算資源を適応的に利用し、効率的な推論の実現を目指す。
arXiv cs.LGは2026年6月4日(現地時間)、リカレントニューラルネットワーク (RNNs) の事前学習における新たな手法「Supervised Memory Training (SMT)」を発表した。SMTは、従来のバックプロパゲーション・スルー・タイム (BPTT) が持つ、時間的な逐次処理による並列性制限や、勾配消失・勾配爆発による長距離の関連性学習の困難さを克服することを目的とする。リカレントな信用伝播を完全に回避し、RNNの訓練を1ステップのメモリー遷移ラベルに対する教師あり学習に還元することで、これらの課題に対処する。
arXiv cs.LGは2026年5月23日(現地時間)、「Graph Mamba Survival Analysis Based on Topology-Aware ordering」と題する論文を公開した。計算病理学の分野で、Whole Slide Images (WSIs) 生存分析における患者の予後評価を阻む技術的課題に対応するため、本論文は新しいGraph Mamba生存分析フレームワーク「TopoMamSurv」を提案。これは、トポロジー認識順序付け(Topology-Aware ordering, TAO)の採用により、既存手法の限界を克服することを目指す。
ニール・ソマニ氏 (Neel Somani) は5月21日(現地時間)、Transformerモデルの回路説明を検証可能にする新フレームワーク「Verifiable Transformers」を導入した。arXiv cs.LGが同日付で報じた。これは、Transformerモデル内のメカニスティックな解釈可能性において、回路を発見することと、その回路の機能を厳密に証明することとの間に存在するギャップを埋めることを目指す。
arXiv 2026年5月25日(現地時間) 研究論文投稿サイトarXivは、大規模言語モデル(LLM)の長文処理における計算コスト増大の課題を克服する新メカニズムを提案する論文『Language Models Need Sleep』を公開した。提案されたのは、人間の睡眠に類似した「統合メカニズム」で、モデルが周期的に過去のコンテキスト情報を永続的な重みに変換し、一時的なキャッシュをクリアする。これにより、LLMが長期間の複雑なタスクを効率的かつ高性能に処理する可能性が示されている。
Rao Fu氏らの研究チームは2026年5月11日(現地時間)、arXiv cs.LGで、既存のLooped Transformerモデルが抱える訓練時の不安定性を解決する新モデル「Fully Looped Transformer」を発表した。この新モデルは、パラメータ数や文脈長を増やすことなく性能向上を可能にするLooped Transformerの利点を維持しつつ、特にループ反復回数が増加する際の訓練安定性を大幅に改善する。これは、Looped Transformerが直面していた勾配振動や残差爆発といった根本的な問題を克服する画期的な試みだ。
Allen Institute for AI (allenai) は2026年5月15日(現地時間)、地球観測モデル「OlmoEarth」の最新版となる「OlmoEarth v1.1」を発表した。この新しいモデルファミリーは、OlmoEarth v1の性能を維持しながら、コンピューティングコストを最大3倍削減することが可能だとしている。
arXiv cs.CRは2026年5月14日(現地時間)、大規模言語モデル (LLM) に対する新たなバックドア攻撃手法「MetaBackdoor」が発表されたと報じた。この手法は、従来のコンテンツベースのトリガーに依存せず、入力テキストの視覚的または意味的な変更を伴わずに、位置情報をトリガーとして悪用する。研究者らは、TransformerベースのLLMがトークンの位置をエンコードする特性に着目し、長さと相関する位置構造がモデルの内部計算に反映されることを利用して、検出が困難なバックドアを活性化させる可能性を示している。