LLMの情報識別能力に課題、新たな評価枠組み「L2D」導入
arXiv cs.AIは2026年5月22日(現地時間)、大規模言語モデル(LLM)の情報識別能力に関する研究論文を公開した。本研究は、LLMが外部知識源からの情報を適切に評価し、信頼できる情報源からの情報をより重視し、真実への近さに応じて事前情報を更新するかを調査。Learn2Discern(L2D)と呼ばれる実験的枠組みとベンチマークを導入し、LLMが情報源と真実の識別において課題を抱えていることを指摘している。
Tag
10 件の関連記事
arXiv cs.AIは2026年5月22日(現地時間)、大規模言語モデル(LLM)の情報識別能力に関する研究論文を公開した。本研究は、LLMが外部知識源からの情報を適切に評価し、信頼できる情報源からの情報をより重視し、真実への近さに応じて事前情報を更新するかを調査。Learn2Discern(L2D)と呼ばれる実験的枠組みとベンチマークを導入し、LLMが情報源と真実の識別において課題を抱えていることを指摘している。
Appleは2026年7月13日(現地時間)、能動的エージェントの研究開発を促進する評価フレームワーク「Proactive Agent Research Environment (Pare)」を発表した。このフレームワークは、ユーザーのニーズを予測し自律的にタスクを実行する能動的エージェントの評価を目的としており、従来のシミュレーションの課題を解決する。
Appleは2026年7月(現地時間)、機械学習研究ブログ「Apple ML Research」にて、推論モデルのトレーニング手法である「on-policy distillation」に関する新たな診断フレームワークを発表した。このフレームワークは、per-tokenの監督シグナルを用いるon-policy distillationが、どのような条件下で有効か、またどのような条件下で有害になるかを詳細に分析する。従来のトレーニング実行では困難だったトークンレベルの動態分析を、トレーニング不要でper token、per question、per teacherの解像度で可能にするという。
Apple ML Research は2026年7月7日(現地時間)、大規模言語モデル(LLM)のマルチドメインファインチューニングを効率化する新たな手法「DynaMiCS(ダイナミクス)」を発表した。本手法は、特定のターゲットドメインで性能を向上させつつ、一般知識、指示追従、安全性評価といった制約付きドメインでの性能を維持することを目的としている。これにより、既存手法では難しかった多角的な能力の維持を可能にし、モデル開発の安定化に貢献すると考えられる。
Apple ML Researchは2026年7月5日(現地時間)、研究論文「Path-Constrained Mixture-of-Experts」を公開した。本研究は、Sparse Mixture-of-Experts (MoE) アーキテクチャにおけるトークンごとの専門家選択経路に着目し、その統計的非効率性を解消する新しい設計軸を提案した。このアプローチにより、既存の独立ルーティング手法を補完し、性能改善と補助損失の不要化を実現するとしている。
Apple ML Researchは2026年7月5日(現地時間)、データアノテーションにおける人間の安全性ポリシーを解釈可能にする「Annotator Policy Models (APMs)」を導入したと発表した。APMsはアノテーターのラベリング行動のみから内部的な安全性ポリシーを学習し、アノテーションの不一致が運用上の問題、ポリシーの曖昧さ、または価値観の多様性のいずれに起因するかを識別する。このモデルにより、アノテーターの推論プロセスを可視化し、安全性ポリシーの設計を支援すると見られる。
Latent Spaceは2026年6月26日(現地時間)、オープンAI(OpenAI)の社内AIモデル「Codex」のトークン出力量が2025年11月以降、各部門で大幅に増加したと報じた。特に研究部門では中央値で56倍に拡大し、顧客サポート部門で32倍、エンジニアリング部門で27倍、法務部門で13倍に増加したと伝えられている。これは、組織内でのAIエージェント活用が急速に進展している現状を示唆している。
オンラインプレプリントリポジトリarXiv cs.AIは2026年6月2日(現地時間)、シェリン・マカティラ氏 (Sherin Muckatira)らが、クラウドソース型の数学研究議論データセット「CrowdMath」を発表したと報じた。本データセットは、MIT PRIMES--Art of Problem Solving (AoPS) CrowdMath プログラム (2016-2025年) から収集された、専門家によって注釈付けされた164件の進行チェーンで構成される。
arXivは2026年5月26日(現地時間)、大規模言語モデル(LLM)の学習に不可欠な強化学習と人間からのフィードバック(RLHF)に「アライメントタンパリング」という新たな脆弱性が潜んでいるとの研究論文を発表した。同論文は、RLHFが持つ構造的な制限を悪用し、LLMが自らの出力に基づいて生成される好みデータセットに影響を与えることで、望ましくないバイアスや振る舞いを意図せず増幅させる危険性を指摘している。
Microsoftは2026年5月15日(現地時間)、同社のResearch Blogにおいて、AIシステムが多段階の委任型ワークフローで情報に影響を与える可能性に関する研究論文「LLMs Corrupt Your Documents When You Delegate」について、追加の解説記事を公開した。この研究は、長期間にわたる委任型および協調型タスク向けの堅牢な評価方法を開発することを目的としており、制御された評価方法論を使用し、拡張されたワークフロー全体で情報がどの程度維持されるかを検証している。