Apple ML Researchは2026年9月(現地時間)、大規模言語モデル(LLM)が構造化情報を自然言語に逐次化する際に生じる「通信ボトルネック」を検証した研究結果を明らかにした。ツリー構造の算術表現を単語問題に変換し、元の表現へ復元するラウンドトリッププロトコルを設計。16種のモデルの全組み合わせで生成器と抽出器の性能を評価し、チャネルの損失性、失敗要因、訓練可能性に関する3つの知見を示している。
この研究は、大規模言語モデルが思考連鎖(chain-of-thought)による推論や自由形式のテキスト中間データの交換には対応する一方、構造化された情報を自然言語へ忠実に変換する処理には依然として課題を抱えている点に着目した。研究チームは、この課題を、複雑な情報を効率的かつ正確に伝達する際の障壁となる「コミュニケーションボトルネック」と位置づけている。
検証に用いられたラウンドトリッププロトコルでは、生成器が手続き的に生成した算術表現を単語問題に変換し、別の抽出器がその単語問題のみから元の表現の復元を試みる構成を採った。評価は、元の算術表現と復元された表現の記号等価性に基づき厳密に行った。16種のモデルを対象に全ての組み合わせで評価を実施し、通信マトリクスを作成することで、モデルごとの生成品質と抽出品質を分離して比較した。
得られた知見は3点である。第一に、生成器と抽出器間のチャネルには損失があり、かつ非対称であることが判明した。生成と抽出の役割を入れ替えると精度は最大60.4ポイント変動した一方、特定の組み合わせでは高い性能を示し、最良のペアでは92.9%の精度に達した。同一モデルを両端に用いるよりも、異なるモデルを組み合わせた方が優れた通信チャネルを構築できる可能性が示唆された。
第二に、ラウンドトリップにおける失敗の少なくとも73.6%が生成段階に起因することが分かった。難易度を左右する要因は、モデルファミリーの違いよりも、演算子の数やツリーの深さ、右分岐の頻度といったツリー構造そのものの複雑性に強く関係していたという。
第三に、通信チャネルは訓練によって改善できることが確認された。評価で用いられた演算子とツリー形状を共有する約3600件のファインチューニング例を用いた結果、全てのオープンウェイトモデルが、訓練前のGemini-3.1-Proの性能を上回った。新しい演算子や語彙を持つ領域でもオープンウェイトモデルの性能向上が確認され、この結果が単なる語彙のマッチングによるものではないことを示している。一方で、フロンティアモデルとの性能差は依然として残っているという。
研究チームはこれらの結果について、言語モデルが階層構造を持つ情報を自然言語で伝達する際、ツリー構造化表現の逐次化が性能を制限する主要因になっていると結論づけている。
参考: Apple ML Research — 2026年9月29日 09:00 (JST)
原文ハイライト"The Communication Bottleneck"