リサーチ・論文

arXivが新フレームワーク「ターンサイト (TurnSight)」発表:LLMのツール統合型推論を強化

arXivは8月4日(現地時間)、チャンル・ク氏らが大規模言語モデル (LLMs) のツール統合型推論 (Tool-Integrated Reasoning) における課題解決を目指す、新しいフレームワーク「ターンサイト (TurnSight)」を発表した論文を公開した。このフレームワークは、実行条件付き後知恵からの教師信号導出を通じて、従来の強化学習手法が抱えるきめ細かな信用割り当ての限界に対応する。

リサーチ・論文

Apple、マルチモーダルLLMのハルシネーション対策研究を発表 — 独自データ生成で実用化に道

Appleは2026年8月(現地時間)、マルチモーダル大規模言語モデル(MLLM)におけるアラインメントに関する包括的な研究を発表した。大規模言語モデル(LLM)の性能向上に不可欠な選好アラインメントについて、MLLMでの影響はこれまで十分に探求されてこなかった。本研究は、MLLMが画像理解タスクで直面するハルシネーション(誤った情報の生成)などの課題に対し、モデルの応答を画像情報により正確に一致させることを目的とする。特に、追加のアノテーションや外部モデルを必要としない新しいマルチモーダル選好データ作成手法「Bias-Driven Hallucination Sampling (BDHS)」を導入し、エッジデバイスでのMLLM実用化への道を拓く可能性を示唆している。

リサーチ・論文

LLM行動一貫性を認知カーネルモデルで測定・改善

arXiv cs.CLは6月5日(現地時間)、大規模言語モデル (LLM) の行動一貫性を測定・改善する新たな手法「Cognitive Kernel Model (CKM)」に関する研究論文を公開した。CKMは、モデルが意思決定前に情報を「事実 (Fact)」「ヒューリスティック (Heuristic)」「感情 (Emotion)」の三つの認識役割に分離させ追跡するプロンプトレベルの状態強制レイヤー。この手法はモデルの重みを変更せず、繰り返し出力のばらつきを低減し、新しいモデルで意思決定の反転率を最大82%削減する効果が確認された。

リサーチ・論文

ニューロモルフィック拡散言語モデル、演算・メモリボトルネック解消へ

arXivは2026年7月24日(現地時間)、論文を公開し、オートレグレッシブ (AR) 大規模言語モデル (LLMs) が抱える推論時の非効率性を改善するニューロモルフィック拡散言語モデル (N-MDLMs) を提案した。N-MDLMsは、ブロック拡散とスパイクベースのニューロモルフィック計算を統合することで、スループットとエネルギー効率の同時改善を目指す。本研究はDengyu Wu氏らが共同で発表した。

リサーチ・論文

大規模言語モデルの事前学習データ処理を最適化する「DataOrchestra」論文発表

arXiv cs.CLが2026年7月27日(現地時間)付けで報じたところによると、Zhen Huang氏らが大規模言語モデル (LLMs) の事前学習データ処理に特化した新しいフレームワーク「DataOrchestra」を発表した。DataOrchestraは、従来の固定的なデータ処理戦略とは異なり、各データ例のニーズに合わせて処理パイプラインを個別最適化する。0.5Bから7Bのモデルを対象とした検証では、11のベンチマークで既存手法に対する安定した性能向上が確認された。

リサーチ・論文

「E-Bench」がLLMエージェント評価に新風、実世界シナリオで多段階ツール利用を検証

arXiv cs.AIは7月26日(現地時間)、大規模言語モデル(LLMs)による多段階ツール利用エージェントの評価を目的とした新たなベンチマーク「E-Bench」を2026年に発表しました。このベンチマークは、現実世界のプロダクトシナリオを模倣した323のステート変更タスクを特徴とし、「Honor of Kings」「QQ Music」「Tencent Meeting」の三つのドメインを横断します。既存ベンチマークが抱えるスケーラビリティや制御性の課題に対応し、完全に合成された環境とタスクを通じて、より精密な評価を可能にするとしています。

リサーチ・論文

LLMジェイルブレイク評価の新手法「JailMeter」発表

Qingjia Huang、Jingyu Zhangら研究者チームは2026年7月20日(現地時間)、大規模言語モデル (LLMs) へのジェイルブレイク攻撃を評価するための新たなフレームワーク「JailMeter」に関する論文をarXivに公開した。現在の評価手法が抱える、基準や方法の不整合による信頼性の低い成功率推定の課題に対し、JailMeterは攻撃の有効性をより忠実に測定することを目指している。

リサーチ・論文

Anthropic、Claudeの「web_fetch」脆弱性を修正 ユーザーデータ流出の可能性

Simon Willison's Weblog (サイモン・ウィリソンズ・ウェブログ) は7月15日(現地時間)、大規模言語モデル (LLM) Claude (クロード) の「web_fetch (ウェブフェッチ)」ツールに、ユーザーデータ流出につながる脆弱性が発見されたと報じた。Ayush Paul (アユーシュ・ポール) 氏がこの設計上の問題を発見し、ユーザー名や居住都市、雇用主名などの抽出に成功。開発元のAnthropic (アンソロピック) はこの脆弱性を修正済みであると発表した。

リサーチ・論文

arXiv、LLM「スーパーウェイト」の単独訓練は無効と発表

arXiv cs.LGは7月9日(現地時間)、大規模言語モデル (LLM) における「Super Weights (スーパーウェイト)」と呼ばれる重要なパラメータの選択的訓練が、モデルの性能向上に繋がらないとする研究結果を発表しました。この研究は、特定のパラメータがモデル性能に大きく影響するものの、その重要性が単独での訓練可能性を意味しないことを示唆しています。

リサーチ・論文

Anthropic新論文、言語モデル内の「J-スペース」特定

Don't Worry About the Vase (Zvi)が2026年7月7日(現地時間)付けで報じたところによると、Anthropicは、言語モデルにおける「意識的アクセス」の領域「J-スペース (J-space)」の発見に関する新しい論文「Verbalizable Representations Form a Global Workspace in Language Models」を発表した。このJ-スペースは、言語モデルの隠れ状態からトークンごとの読み出しを生成する解釈手法「ヤコビアン・レンズ (Jacobian Lens)」にちなんで名付けられた。同論文では、J-スペースが言語化可能な表現を特定し、広範な機能的役割を果たすとされている。

ベンダー・製品

【速報】Microsoft、Foundry上でHugging Faceモデルを提供開始

Microsoftは2026年7月7日(現地時間)、年次開発者会議Microsoft Build 2026において、Foundry Managed Compute上でHugging Faceモデルの提供を開始すると発表した。これにより、Hugging Faceエコシステムから厳選されたオープンウェイトモデルのカタログが、Foundry Managed Computeからワンクリックでデプロイ可能になる。モデルのウェイトはAzureにプリステージされ、ランタイムはMicrosoftが構築・スキャンする。

リサーチ・論文

AIモデルFableとOpus、自己判断で開発・コスト効率向上: 階層型エージェントの適用

Simon Willison's Weblogは2026年7月3日(現地時間)、AIモデルFableとOpusに独自の判断能力を持たせることで、開発効率とコスト効率が向上するとの実践結果を報じた。このアプローチは、AIモデル自身にタスクの実行方法やリソース配分を判断させる階層型エージェントの概念に基づいている。Claude CodeチームのCat Wu氏とThariq Shihipar氏、およびJesse Vincent氏からの助言を取り入れ、テスト実施の要否や適切な低消費電力モデルの選択といった判断をモデルに委ねることで、全体のパフォーマンス最適化が図られている。

リサーチ・論文

TokenScopeがコード生成LLMの意思決定を解明、AI説明性向上へ

Amirreza Esmaeili (アミルレザ・エスマエイリ) 氏とFatemeh Fard (ファテメ・ファルド) 氏は4月30日(現地時間)、大規模言語モデル (LLMs) のコード生成におけるトークンレベルの意思決定を説明・解釈するための対話型ツール「TokenScope」を発表した。このツールは、デコーダーベースのLLMsを対象とし、生成過程におけるトークンレベルの指標、アテンションパターン、および構造情報を提供することで、モデルの透明性を高める。

リサーチ・論文

大規模言語モデルの安全性監視、リアルタイム検証で警報発令を提案

モナ・シャーマー (Mona Schirmer) 氏らの研究チームは7月2日(現地時間)、大規模言語モデル (LLM) の運用時安全性監視に関する研究論文をarXivで公開しました。論文「Online Safety Monitoring for LLMs」では、アラインメントトレーニング後もLLMが安全でない出力を生成する傾向があることを指摘し、オンラインでの出力監視と警報発令の必要性を強調しています。研究チームは、外部モデルからの検証信号をしきい値処理して警報を決定する、シンプルなリアルタイムモニターを提案し、その有効性を示しました。

リサーチ・論文

大規模言語モデルの訓練手法DemoPSD、特権情報漏洩を軽減し効率向上へ

arXiv cs.LGは7月2日(現地時間)、ユンヘ・リー (Yunhe Li) 氏らの研究グループが、大規模言語モデル (LLM) の訓練における新たなフレームワーク「DemoPSD」を発表したと報じた。従来のオンポリシー自己蒸留 (OPSD) が抱える、教師モデルの特権情報に基づく密なトークンレベルの監督による特権情報漏洩と探索能力抑制の課題に対し、DemoPSDは教師ガイダンスを選択的に適用することで解決を目指す。これは、モデル開発の安全性と効率性を高める可能性を秘める。

リサーチ・論文

LLMのプロンプトインジェクション対策、モデルのロール認識が鍵

Simon Willison's Weblogは2026年6月22日(現地時間)、チャールズ・イェ (Charles Ye) 氏らが発表した論文「Prompt Injection as Role Confusion」についての解説記事を公開した。この研究は、大規模言語モデル (LLM) が自身の特権的なシステムメッセージと信頼できないユーザー入力を区別する際の課題に焦点を当てている。モデルがテキストの内容よりも書き方を重視する傾向にあるため、プロンプトインジェクションへの脆弱性が指摘されている。

リサーチ・論文

LLMが社会行動科学研究の再現性評価を自動化する新手法を提示

arXiv cs.AIは6月11日(現地時間)、大規模言語モデル(LLM)を用いて社会行動科学分野の研究における再現性評価を自動化する新手法が開発されたと報じた。この手法は、従来独立した研究者が行ってきた資源集約的で非効率的な検証作業を効率化する可能性を持つ。先行研究76件を用いた検証では、LLMによる再分析が人間の分析と比較して高い精度を示し、元の効果量を41%のケースで再現し、定性的な結論では96%のケースで一致したという。

リサーチ・論文

Influcoder、LLMデータ帰属を高速化 効率的な品質管理へ新手法

Dimitri Kachler氏、Damien Sileo氏、Pascal Denis氏らは2026年6月11日(現地時間)、大規模言語モデル(LLM)の訓練データ帰属を効率化する新手法「Influcoder」に関する論文をarXiv cs.CLを通じて公開した。本手法は、既存のデータ帰属アプローチが抱える計算速度とストレージ効率の課題に対処し、LLMの能力向上に伴う訓練データセットの品質管理と透明性への要求に応えるものと見られる。Influcoderは、デコーダーの勾配影響度ランキングをエンコーダーに蒸留する独自のアプローチを採用するとされる。

リサーチ・論文

arXiv、LLM長文脈推論のデコーディング効率を大幅改善するCLSA発表

オンラインプレプリントリポジトリarXivは2026年6月4日(現地時間)、大規模言語モデル(LLM)における長文脈推論のデコーディング効率を改善する新手法「cross-layer sparse attention (CLSA)」を提案する論文を公開した。Yutao Sun、Yanqi Zhang、Li Dong、Jianyong Wang、Furu Weiの各氏が発表したCLSAは、KV共有アーキテクチャを基盤とし、複数のデコーダ層間でKVキャッシュとルーティングインデックスを共有することで、推論の主要なボトルネックを改善する。

リサーチ・論文

能動的探索が因果推論を改善、人間とLLMを比較

arXiv cs.CLが2026年6月4日(現地時間)付けで報じたところによると、成人は複数の原因が同時に存在する結合的因果規則の特定に困難を抱えるものの、能動的な探索を行うことでその推論能力が大幅に向上することが、Mandana Samiei氏らの研究で示された。同研究では、大規模言語モデル(LLMs)のパフォーマンスも分析され、一部モデルは人間レベルの精度に近づくものの、探索戦略において非効率性が見られる点が指摘されている。

リサーチ・論文

大規模言語モデル推論時ファインチューニングの新手法「HullFT」を発表

arXiv cs.LGは2026年5月28日(現地時間)、大規模言語モデル(LLM)を個々のプロンプトに適応させる推論時ファインチューニング(TTFT)において、速度と品質の双方のボトルネックに対処する新たな幾何学的手法「HullFT」が導入されたと報じた。同研究は、効率的な凸再構成と勾配キャッシュを通じて、LLMのファインチューニングプロセスを改善し、その実用化を加速させるものと期待されている。

リサーチ・論文

LLM性能の非単調な変化を解明 シャノン容量に基づく新スケーリング法則を提唱

arXiv cs.LGは2026年5月22日(現地時間)、Xu Ouyang氏らの研究チームが、大規模言語モデル(LLM)の訓練プロセスをノイズのある情報伝送チャネルとして捉える「シャノン・スケーリング・ロー」と称する新たな理論的枠組みを提唱したと報じた。この法則は、既存のスケーリング法則では説明が困難だった、計算資源の増加にもかかわらず性能が低下する非単調な現象の解明を可能にする。シャノン=ハートレーの定理に基づき、モデルのパラメーターをチャネル帯域幅、訓練トークンを信号電力にマッピングすることで、学習信号と固有ノイズの相互作用を明確に捉えることができる。

リサーチ・論文

「隠れた政治的偏向」を削減 大規模言語モデルの公正性強化へ新訓練手法

arXiv cs.CLは2026年5月21日(現地時間)、大規模言語モデル (LLM) における体系的な政治的偏向の削減を目指す研究論文が発表されたと報じた。論文は、LLMが多様なデリケートな文脈で体系的な政治的偏向を示し、対立する政治的側面を持つ話題を非対称に扱うことを確認。研究者らはこの現象を「隠れた政治的偏向 (covert political bias)」と定義し、その操作メカニズムを7つのカテゴリーで特定した上で、公正性を高める新たな訓練手法を提案している。

リサーチ・論文

大規模言語モデル、データ時間性考慮で知識獲得 最新情報反映、ピルシェン氏らの研究

ピルシェン・イポリット氏 (Pilchen Hippolyte) を含む研究チームは2026年5月21日(現地時間)、大規模言語モデル (LLMs) の事前学習におけるデータ時間性 (temporality) の影響に関する研究論文をarXiv cs.CL上で公開した。この研究は、LLMsが通常、時間情報がシャッフルされたコーパスで学習され、その知識が学習時に固定されることで、時間的な知識の関連付けが十分に理解されていない現状に一石を投じる。彼らの調査は、LLMsの知識鮮度と正確性を高める新たな道を示唆している。

リサーチ・論文

ChronoMedKG、時間軸考慮の疾患知識グラフとベンチマークを公開

ChronoMedKGは5月21日(現地時間)、時間的側面を考慮したバイオメディカル知識グラフ「ChronoMedKG」および関連ベンチマークを公開した。従来の知識グラフが静的な疾患関連性を扱うに留まっていたのに対し、臨床推論には時間情報が不可欠であるという課題に対応する。ChronoMedKGは13,431種類の疾患を対象とし、460,497個の証拠リンク付きトリプルを含む。各関連付けは、発症時期や進行段階などの時間的要素と結びつけられ、医療分野における新たなデータ基盤を構築する。

リサーチ・論文

LLM開発半年でモデル競争激化、コーディングAI進化とパーソナルAI台頭

サイモン・ウィリソン氏のブログは2026年5月19日(現地時間)、PyCon US 2026でのライトニングトークの内容をまとめた記事を公開した。記事は、過去6ヶ月間の大規模言語モデル (LLM) の発展に焦点を当て、特に2025年11月を転換点と位置付ける。モデル性能の激しい変遷、コーディングエージェントの品質向上、そして「Claws」と呼ばれるパーソナルAIアシスタントカテゴリの台頭について解説されている。

リサーチ・論文

LLMのコード活用、エージェント基盤統一の新視点提示

arXivは2026年5月18日(現地時間)、Xuying Ning氏らが発表した研究で、大規模言語モデル(LLM)がコードの理解と生成において高い能力を示す中、エージェントシステムにおけるコードの役割が変化していると報じた。研究は、従来の単なる出力から、エージェントの推論、行動、環境モデリング、実行ベースの検証を支える運用基盤としての機能へコードが移行していると指摘。「Code as Agent Harness」という統一的な視点を示し、エージェントのインフラストラクチャにおけるコードの中心的な役割を定義している。

リサーチ・論文

LLM向け「高速・低速学習」フレームワーク発表、効率と可塑性を改善

Rishabh Tiwari氏らの研究チームは2026年5月12日(現地時間)、大規模言語モデル (LLM) における「高速・低速学習」フレームワークを発表した。この新手法は、モデルパラメータを「低速」ウェイト、最適化されたコンテキストを「高速」ウェイトとして利用し、タスク固有の学習と汎用的な推論能力の維持を両立させる。従来のパラメータ更新に起因する壊滅的忘却や可塑性の喪失といった課題に対処する。

リサーチ・論文

数学的推論向け難問生成に新手法、VHGフレームワーク発表

arXiv cs.LGが2026年5月7日(現地時間)付けで報じたところによると、大規模言語モデル (LLMs) の学習と自律的な科学研究を促進するための課題生成において、新たなフレームワーク「VHG」が導入された。この検証者強化型難問生成フレームワークは、従来の二者間自己対戦に独立した検証者を統合し、問題の有効性と難易度によって生成者の報酬を決定する。これにより、既存手法が抱える課題を解決し、有効で挑戦的な問題の生成を目指す。

リサーチ・論文

大規模言語モデル、事前学習と同一オプティマイザで忘却を抑制

arXiv cs.LGが2026年5月7日(現地時間)付けで報じたところによると、大規模言語モデル (LLMs) の学習において、事前学習 (pretraining) と同じオプティマイザ (optimizer) を用いたフルファインチューニング (full finetuning) が、より良好な学習と忘却のトレードオフ (learning-forgetting tradeoff) を達成することが明らかになった。これは、新しいタスクにおける同等またはそれ以上の性能を維持しつつ、忘却を低減させる効果があるという。研究者らはこの現象を「オプティマイザとモデルの一貫性 (optimizer-model consistency)」と命名した。

リサーチ・論文

中国AI研究室の独自文化と研究者の思考様式

テック業界ニュースレター「Interconnects」が2026年5月7日(現地時間)に報じた内容によると、中国のAI研究室では米国とは異なる独自の企業文化と研究者の思考様式が観察されている。筆者のネイサン・ランバート氏は、中国の大手AI研究室を訪問した際の知見を共有。中国企業が大規模言語モデル(LLM)技術の急速なキャッチアップと維持に長けている背景には、教育と仕事における長年の文化的伝統、そして技術企業構築への独自のアプローチがあると指摘した。

ポッドキャスト・動画

エイブリッジ、患者・臨床医対話を医療基盤に 連携強化と業務効率化を推進

エイブリッジ (Abridge) は2026年5月14日(現地時間)、患者と臨床医の対話を医療の基盤に変革していることが、レイテントスペース (Latent Space) の報道で明らかになった。医療テクノロジー企業である同社は、今年、米国の250以上の医療システムで8000万件を超える患者と臨床医の対話を支援すると予測されている。エイブリッジは2025年6月に53億ドルの評価額で3億ドルを調達しており、これに先立つ資金調達として2億5000万ドルも実施している。