ベンダー・製品

【速報】Hugging Face、マルチモーダルエンコーダー「NeoMME」発表

Hugging Faceは2026年9月2日(現地時間)、効率的なマルチモーダル・マルチリンガルエンコーダー「NeoMME」を発表した。このモデルは2億6000万と8億の2つのサイズで提供され、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理する。事前学習済みのビジョンタワーや因果言語モデルを使用しないアーキテクチャが特徴である。

リサーチ・論文

Transformer FFNの曲率暗号解読法、構造抽出チャネルを解明

ムナワル・ハサン氏とアポストル・ヴァシレフ氏は2026年8月31日(現地時間)、arXiv cs.LGに「Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks」と題する論文を発表した。この研究は、滑らかな2層フィードフォワードネットワーク(FFNs)が、特定の条件下で追加の構造モデル抽出チャネルを露出させることを示した。パラメータや勾配へのアクセスなしに、選ばれた入力と生の出力情報のみを用いることで、隠れた内部構造を高精度で回復する手法が詳述されている。

リサーチ・論文

深層プルーニングLLMの精度を回復する「SHIFT-LLM」登場

arXivは8月26日(現地時間)、論文を公開し、Ali Bahri (アリ・バーリ) 氏らが大規模言語モデル (LLM) の推論コスト削減手法「深層プルーニング (depth pruning)」によって生じる精度損失を補正する新たなフレームワーク「SHIFT-LLM」を発表しました。この手法は訓練不要で、プルーニングされたTransformerブロックの隠れ状態分布の乱れを線形残差アダプター (LRA) で補正すると報告されています。実験では、複数のモデルとベンチマークにおいて、深層プルーニングで失われた精度を一貫して回復したことを示しています。

リサーチ・論文

SceneGTMM、高精度で転送可能なマップマッチングの新手法を提案

Yongliang Zhang氏らの研究チームは8月19日(現地時間)、arXiv cs.CVが公開した論文で、測位データと高精度道路ネットワークを接続するマップマッチング技術の新たなフレームワーク「SceneGTMM」を発表した。同フレームワークは、既存手法が抱えるノイズ堅牢性、クロスリージョン転送、解釈性といった課題に対応するため、コンフォーマルマッピングに基づくシーンアウェア転送戦略とGNN-Transformerデュアルグラフ相互作用アーキテクチャを導入している。

リサーチ・論文

GradCuit、潜在推論精度64.5%達成 LLM堅牢性向上へ新手法

arxiv.orgは8月3日(現地時間)、テスト時潜在推論手法「GradCuit (グラッドキュイット)」に関する査読前プレプリントを発表した。大規模言語モデル (LLM) の推論において平均64.5%の精度を記録し、既存の勾配伝播の課題を解決。推論形成に貢献する潜在状態への直接的クレジット割り当てを可能にすることで、モデルの堅牢性と解釈性を大幅に向上させ、次世代LLM開発における信頼性確保に寄与すると期待される。

リサーチ・論文

CausalGate、トランスフォーマーの効率向上へ新手法

Kiran Nair (キラン・ネアー) 氏、Smriti Regmi (スムリティ・レグミ) 氏、Rodrigue Rizk (ロドリグ・リスク) 氏らは7月28日(現地時間)、arXivで公開された論文の中で、トランスフォーマーの推論効率を向上させる新しいフレームワーク「CausalGate (コーザルゲート)」を開発したと発表した。CausalGateは、大規模言語モデル (LLM) における冗長なモジュールを特定し除去することで、計算効率を高めることを目的としている。

リサーチ・論文

アップル、動画生成を最大1.58倍高速化する新手法「CalibAtt」発表

Apple は2026年7月(現地時間)、テキストから動画を生成する処理速度を向上させる学習不要の新たな手法「CalibAtt」を発表しました。この技術は、既存の拡散モデルが抱える時空間アテンションのボトルネックを解消し、動画生成の品質とテキストとの整合性を維持しながら、最大1.58倍の高速化を実現します。これにより、高品質な動画生成における実行時間の遅さという課題の解決に貢献すると見られます。

リサーチ・論文

Transformerの状態予測分離仮説提唱、言語モデルの性能向上へ

ジョバンニ・モネア(Giovanni Monea)氏らは7月1日(現地時間)、学術論文公開サイトarXivにおいて、大規模言語モデルの基盤技術であるTransformerの性能を向上させる新たな「状態予測分離仮説」を提唱する論文を公開しました。Transformerが次トークンの予測と将来の状態保持に同一の順方向計算ストリームを使用することに着目し、これら二つの役割を分離することで、データ効率と計算効率の両面で優れた言語モデリング性能が得られることを実証しました。

リサーチ・論文

LLMはワールドモデルの特殊ケース、連続的発展の可能性を指摘

ポール・デュボワ (Paul Dubois) 氏は2026年6月26日(現地時間)、大規模言語モデル (LLM) とワールドモデルの関係性に関する研究論文をarXivで発表した。論文では、LLMがワールドモデルの退化した特殊ケースであり、ワールドモデルはLLMの厳密な一般化であると主張。ヤン・ルカン (Yann LeCun) 氏が2022年に提唱した、汎用人工知能達成のためのラテント空間アーキテクチャへの移行の必要性に対する、二元論的ではない新たな視点を示した。

リサーチ・論文

Fixed-Point Reasonersが計算を適応化、安定性と効率を両立

arXiv cs.AIは6月16日(現地時間)、「Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers」と題する論文を発表した。同論文は、深層およびループアーキテクチャが直面する信号伝播問題を解決するため、固定点収束を停止メカニズムとして組み込んだTransformerベースのモデル、Fixed-Point Reasoning Model (FPRM) を提案している。FPRMはタスクの難易度に応じて計算資源を適応的に利用し、効率的な推論の実現を目指す。

リサーチ・論文

arXiv、リカレントネットワーク向け新事前学習法「SMT」発表 - 並列訓練と長期依存性捕捉を強化

arXiv cs.LGは2026年6月4日(現地時間)、リカレントニューラルネットワーク (RNNs) の事前学習における新たな手法「Supervised Memory Training (SMT)」を発表した。SMTは、従来のバックプロパゲーション・スルー・タイム (BPTT) が持つ、時間的な逐次処理による並列性制限や、勾配消失・勾配爆発による長距離の関連性学習の困難さを克服することを目的とする。リカレントな信用伝播を完全に回避し、RNNの訓練を1ステップのメモリー遷移ラベルに対する教師あり学習に還元することで、これらの課題に対処する。

リサーチ・論文

計算病理学、グラフマンバ生存分析に新基盤 トポロジー認識型フレームワーク「TopoMamSurv」発表

arXiv cs.LGは2026年5月23日(現地時間)、「Graph Mamba Survival Analysis Based on Topology-Aware ordering」と題する論文を公開した。計算病理学の分野で、Whole Slide Images (WSIs) 生存分析における患者の予後評価を阻む技術的課題に対応するため、本論文は新しいGraph Mamba生存分析フレームワーク「TopoMamSurv」を提案。これは、トポロジー認識順序付け(Topology-Aware ordering, TAO)の採用により、既存手法の限界を克服することを目指す。

リサーチ・論文

Fully Looped Transformer、訓練安定性を大幅改善 新モデル発表

Rao Fu氏らの研究チームは2026年5月11日(現地時間)、arXiv cs.LGで、既存のLooped Transformerモデルが抱える訓練時の不安定性を解決する新モデル「Fully Looped Transformer」を発表した。この新モデルは、パラメータ数や文脈長を増やすことなく性能向上を可能にするLooped Transformerの利点を維持しつつ、特にループ反復回数が増加する際の訓練安定性を大幅に改善する。これは、Looped Transformerが直面していた勾配振動や残差爆発といった根本的な問題を克服する画期的な試みだ。

ベンダー・製品

Allen Institute for AI、OlmoEarth v1.1を発表 計算コストを最大3倍削減

Allen Institute for AI (allenai) は2026年5月15日(現地時間)、地球観測モデル「OlmoEarth」の最新版となる「OlmoEarth v1.1」を発表した。この新しいモデルファミリーは、OlmoEarth v1の性能を維持しながら、コンピューティングコストを最大3倍削減することが可能だとしている。

リサーチ・論文

LLM新手法「MetaBackdoor」、位置エンコーディング悪用しテキスト非変更攻撃

arXiv cs.CRは2026年5月14日(現地時間)、大規模言語モデル (LLM) に対する新たなバックドア攻撃手法「MetaBackdoor」が発表されたと報じた。この手法は、従来のコンテンツベースのトリガーに依存せず、入力テキストの視覚的または意味的な変更を伴わずに、位置情報をトリガーとして悪用する。研究者らは、TransformerベースのLLMがトークンの位置をエンコードする特性に着目し、長さと相関する位置構造がモデルの内部計算に反映されることを利用して、検出が困難なバックドアを活性化させる可能性を示している。