アップル、動画生成を最大1.58倍高速化する新手法「CalibAtt」発表
Apple は2026年7月(現地時間)、テキストから動画を生成する処理速度を向上させる学習不要の新たな手法「CalibAtt」を発表しました。この技術は、既存の拡散モデルが抱える時空間アテンションのボトルネックを解消し、動画生成の品質とテキストとの整合性を維持しながら、最大1.58倍の高速化を実現します。これにより、高品質な動画生成における実行時間の遅さという課題の解決に貢献すると見られます。
Tag
16 件の関連記事
Apple は2026年7月(現地時間)、テキストから動画を生成する処理速度を向上させる学習不要の新たな手法「CalibAtt」を発表しました。この技術は、既存の拡散モデルが抱える時空間アテンションのボトルネックを解消し、動画生成の品質とテキストとの整合性を維持しながら、最大1.58倍の高速化を実現します。これにより、高品質な動画生成における実行時間の遅さという課題の解決に貢献すると見られます。
Apple ML Researchは2026年7月(現地時間)、大規模言語モデル (LLM) の核となるTransformerにおけるフィードフォワードネットワーク (FFN) の役割を再定義する研究論文「MemoryLLM: Plug-n-Play Interpretable Feed-Forward Memory for Transformers」を発表した。この研究は、FFNを自己アテンション機構から切り離し、コンテキストフリーなトークンごとのニューラル検索メモリとして機能させる新手法「MemoryLLM」を提案。これにより、LLMの推論効率向上と、特に機械学習モデルの「ブラックボックス」問題解明に貢献する可能性を示唆している。
arXiv cs.LGは7月1日(現地時間)、研究論文「Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training」を発表した。この論文は、大規模言語モデル(LLM)の強化学習(RL)後学習において、Transformerモデルの単一の層のみを学習させることで、モデル全体の全パラメータを学習するのと同等か、それを上回る性能向上が得られる可能性を指摘している。既存のRLアプローチの前提に疑問を呈し、層ごとの学習効果を分析した点が特徴だ。
ジョバンニ・モネア(Giovanni Monea)氏らは7月1日(現地時間)、学術論文公開サイトarXivにおいて、大規模言語モデルの基盤技術であるTransformerの性能を向上させる新たな「状態予測分離仮説」を提唱する論文を公開しました。Transformerが次トークンの予測と将来の状態保持に同一の順方向計算ストリームを使用することに着目し、これら二つの役割を分離することで、データ効率と計算効率の両面で優れた言語モデリング性能が得られることを実証しました。
論文『Hierarchical Global Attention (HGA)』は6月29日(現地時間)、arXiv cs.LG上で公開されました。HGAは、事前学習済み大規模言語モデルの密な因果アテンションを代替する技術です。既存のチェックポイントパラメータを維持し、再トレーニングなしでの導入を可能にすることで、限られたGPUメモリで超長尺コンテキストを効率的に処理する新たな道を開きます。
arXiv cs.LGは2026年6月25日(現地時間)、論文「Prism Transformer: Progressive Head Schedules for Hierarchical Attention Processing」を発表した。従来のTransformerモデルにおけるMulti-head attentionの均一なヘッド割り当てが、性能を阻害する構造的ボトルネックであることを指摘。この課題に対し、Shubham Aggarwal氏が新たなアーキテクチャ「Prism Transformer」を提案した。同モデルは層間でヘッド数を単調に増加させるプログレッシブなヘッドスケジュールを採用し、パラメーターと計算量を増やさずにモデルの潜在能力を効果的に引き出す。
ポール・デュボワ (Paul Dubois) 氏は2026年6月26日(現地時間)、大規模言語モデル (LLM) とワールドモデルの関係性に関する研究論文をarXivで発表した。論文では、LLMがワールドモデルの退化した特殊ケースであり、ワールドモデルはLLMの厳密な一般化であると主張。ヤン・ルカン (Yann LeCun) 氏が2022年に提唱した、汎用人工知能達成のためのラテント空間アーキテクチャへの移行の必要性に対する、二元論的ではない新たな視点を示した。
Transformerアーキテクチャ (Transformer architecture) の共同著者であるノーム・シャゼール氏は2026年6月18日(現地時間)、Google DeepMindを退社し、OpenAIに参画することを明らかにした。同氏は、現代の主要なAIモデルの基盤となる2017年の論文「Attention Is All You Need」を共同執筆している。シャゼール氏はOpenAIで、アーキテクチャ研究のリードを務める。
arXiv cs.AIは6月16日(現地時間)、「Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers」と題する論文を発表した。同論文は、深層およびループアーキテクチャが直面する信号伝播問題を解決するため、固定点収束を停止メカニズムとして組み込んだTransformerベースのモデル、Fixed-Point Reasoning Model (FPRM) を提案している。FPRMはタスクの難易度に応じて計算資源を適応的に利用し、効率的な推論の実現を目指す。
arXiv cs.LGは2026年6月4日(現地時間)、リカレントニューラルネットワーク (RNNs) の事前学習における新たな手法「Supervised Memory Training (SMT)」を発表した。SMTは、従来のバックプロパゲーション・スルー・タイム (BPTT) が持つ、時間的な逐次処理による並列性制限や、勾配消失・勾配爆発による長距離の関連性学習の困難さを克服することを目的とする。リカレントな信用伝播を完全に回避し、RNNの訓練を1ステップのメモリー遷移ラベルに対する教師あり学習に還元することで、これらの課題に対処する。
arXiv cs.LGは2026年5月23日(現地時間)、「Graph Mamba Survival Analysis Based on Topology-Aware ordering」と題する論文を公開した。計算病理学の分野で、Whole Slide Images (WSIs) 生存分析における患者の予後評価を阻む技術的課題に対応するため、本論文は新しいGraph Mamba生存分析フレームワーク「TopoMamSurv」を提案。これは、トポロジー認識順序付け(Topology-Aware ordering, TAO)の採用により、既存手法の限界を克服することを目指す。
ニール・ソマニ氏 (Neel Somani) は5月21日(現地時間)、Transformerモデルの回路説明を検証可能にする新フレームワーク「Verifiable Transformers」を導入した。arXiv cs.LGが同日付で報じた。これは、Transformerモデル内のメカニスティックな解釈可能性において、回路を発見することと、その回路の機能を厳密に証明することとの間に存在するギャップを埋めることを目指す。
arXiv 2026年5月25日(現地時間) 研究論文投稿サイトarXivは、大規模言語モデル(LLM)の長文処理における計算コスト増大の課題を克服する新メカニズムを提案する論文『Language Models Need Sleep』を公開した。提案されたのは、人間の睡眠に類似した「統合メカニズム」で、モデルが周期的に過去のコンテキスト情報を永続的な重みに変換し、一時的なキャッシュをクリアする。これにより、LLMが長期間の複雑なタスクを効率的かつ高性能に処理する可能性が示されている。
Rao Fu氏らの研究チームは2026年5月11日(現地時間)、arXiv cs.LGで、既存のLooped Transformerモデルが抱える訓練時の不安定性を解決する新モデル「Fully Looped Transformer」を発表した。この新モデルは、パラメータ数や文脈長を増やすことなく性能向上を可能にするLooped Transformerの利点を維持しつつ、特にループ反復回数が増加する際の訓練安定性を大幅に改善する。これは、Looped Transformerが直面していた勾配振動や残差爆発といった根本的な問題を克服する画期的な試みだ。
Allen Institute for AI (allenai) は2026年5月15日(現地時間)、地球観測モデル「OlmoEarth」の最新版となる「OlmoEarth v1.1」を発表した。この新しいモデルファミリーは、OlmoEarth v1の性能を維持しながら、コンピューティングコストを最大3倍削減することが可能だとしている。
arXiv cs.CRは2026年5月14日(現地時間)、大規模言語モデル (LLM) に対する新たなバックドア攻撃手法「MetaBackdoor」が発表されたと報じた。この手法は、従来のコンテンツベースのトリガーに依存せず、入力テキストの視覚的または意味的な変更を伴わずに、位置情報をトリガーとして悪用する。研究者らは、TransformerベースのLLMがトークンの位置をエンコードする特性に着目し、長さと相関する位置構造がモデルの内部計算に反映されることを利用して、検出が困難なバックドアを活性化させる可能性を示している。