Google Research、LLMの事実認識ボトルネックは記憶想起と指摘
Google Researchは8月12日(現地時間)、大規模言語モデル (LLM) の事実認識能力に関する研究結果を発表しました。それによると、最先端のLLMは事実のほぼ全てをエンコード(記憶)しているものの、その多くをリコール(想起)できないことが判明。事実誤認は知識の欠如ではなく、記憶の利用にボトルネックがあると指摘されています。
Tag
11 件の関連記事
Google Researchは8月12日(現地時間)、大規模言語モデル (LLM) の事実認識能力に関する研究結果を発表しました。それによると、最先端のLLMは事実のほぼ全てをエンコード(記憶)しているものの、その多くをリコール(想起)できないことが判明。事実誤認は知識の欠如ではなく、記憶の利用にボトルネックがあると指摘されています。
Apple ML Researchは2026年8月(現地時間)、大規模言語モデル(LLM)の質問応答(QA)能力を評価するための新たなデータセット「DEEPAMBIGQA (ディープアンビグQA)」と、そのデータ構築パイプライン「DEEPAMBIGQAGEN (ディープアンビグQAジェン)」を発表した。本ベンチマークは、名前の曖昧さ解消と多段階推論を要する複雑な質問に対する回答の完全性を測ることを目的としている。
Replit(リプリット)は7月28日(現地時間)、Ambient Intelligenceを中核とする新たなクリエイティブスイート「Replit Design」を発表した。同サービスは、アイデアからデザインへの具現化プロセスを高速化し、思考と同じ速さで形にする設計を特徴とする。複数の主要なデザイン向けモデルであるClaude、GPT-5、Gemini、Kimi、GLMに対応している。
One Useful Thing (Ethan Mollick) は2026年7月23日(現地時間)、AIの利用に関する最新ガイド「An opinionated guide to which AI to use to do stuff The Summer 2026 Edition」を公開した。近年AIは単なるチャットボットから、ツールを組み合わせて計画・実行するエージェントシステムへと進化しており、これによりAIが人間の数時間分の作業を一度にこなせるようになったと指摘。同ガイドでは、目的やリスクレベルに応じたAIモデルの選択、特にChatGPTとClaudeを活用した具体的な実務への応用について解説している。
エポックAI (Epoch AI) は5月29日(現地時間)、オープンウェイトモデルが最先端のクローズドモデルに対し、平均4ヶ月、8 ECIポイントの遅れをとっているとの分析結果を発表しました。同社が独自に集計する「エポック能力指数 (ECI)」に基づく調査で、この遅延は2025年10月時点での3ヶ月から拡大しています。
OpenAIは2026年6月22日(現地時間)、セキュリティ企業Doppel (ドッペル) がGPT-5を活用したAI防御システムにより、フィッシング詐欺やブランドなりすましといった攻撃を拡散前に阻止している事例を公開した。Doppelのシステムは、アナリストのワークロードを80%削減し、脅威対応時間を数時間から数分に短縮したと報告されている。
pricepertoken.comは6月22日(現地時間)、ソフトウェアエンジニアリング能力を評価するベンチマーク「SWE-bench Lite」のリーダーボードが更新され、AnthropicのClaude Opus 4.6が62.7%のスコアで首位を獲得したと報じた。このベンチマークは、実際のGitHubの問題解決能力をテストするもので、人工知能 (AI) モデルのパフォーマンスを比較する際の重要な指標となっている。競争が激化するAI開発において、具体的なタスク解決能力の高さが注目されている。
OpenAIは2026年1月29日(現地時間)、チャットボット「ChatGPT」において、GPT-4o、GPT-4.1、GPT-4.1 mini、OpenAI o4-miniの各モデルを廃止すると発表した。これらのモデルは同年2月13日をもって提供終了となり、すでに発表済みのGPT-5(InstantおよびThinking)の廃止と同時に実施される。かつて一時的にアクセスが復元されたGPT-4oだが、ユーザーフィードバックを経て現行モデルへの利用が集中したことから、今回の決定に至った。
OpenAIは2026年5月26日(現地時間)、同社のモデルリリースノートを更新し、2026年2月5日に「GPT-5.3-Codex」を発表したことを明らかにした。このモデルは、CodexとGPT-5のトレーニングスタックを統合した初のコード生成モデルであり、コード生成、推論、汎用知能を一つのモデルに集約している。
arXiv cs.CLは2026年5月21日(現地時間)、AIチャットボットのニュース仲介能力に関する研究論文を発表した。同研究は、AIチャットボットがニュースに接する人々の方法を急速に変える中、これらのシステムが新たな事実を言語や地域を超えていかに正確に処理するかを体系的に測定した先行研究の不足を指摘。2026年2月9日から22日までの14日間、Gemini 3 FlashおよびPro、Grok 4、Claude 4.5 Sonnet、GPT-5、GPT-4o miniの6システムを評価した。最良システムは、数時間前に報じられた出来事に関する多肢選択式質問で90%以上の精度を達成したが、自由回答形式では11-13%精度が低下したと報告されている。
OpenAIは2026年5月8日(現地時間)、3つの新しいストリーミング音声モデル「GPT-Realtime-2」「GPT-Realtime-Translate」「GPT-Realtime-Whisper」をRealtime APIでリリースしました。同社はGPT-Realtime-2を「最もインテリジェントな音声モデル」と位置付け、GPT-5クラスの推論能力をリアルタイム音声エージェントに提供すると説明しています。GPT-Realtime-Translateは70以上の入力言語から13の出力言語へのストリーミング翻訳をサポートし、GPT-Realtime-Whisperは音声が生成されると同時に文字起こしやキャプションを提供します。