Apple ML Research、LLM評価の新ベンチマーク「DEEPAMBIGQA」発表
Apple ML Researchは2026年8月(現地時間)、大規模言語モデル(LLM)の質問応答(QA)能力を評価するための新たなデータセット「DEEPAMBIGQA (ディープアンビグQA)」と、そのデータ構築パイプライン「DEEPAMBIGQAGEN (ディープアンビグQAジェン)」を発表した。本ベンチマークは、名前の曖昧さ解消と多段階推論を要する複雑な質問に対する回答の完全性を測ることを目的としている。