arXiv cs.LGは2026年8月11日(現地時間)に提出された論文で、心臓病予測における大規模言語モデル(LLM)生成ルールベースシステムと従来の機械学習モデルの性能を比較した研究結果を発表した。UCI Heart Diseaseデータセットを用いた評価では、Random ForestやNaive Bayesといった既存の機械学習モデルが、GPT-4oやClaude Sonnet 4.6で生成されたルールベースシステムに比べ、一貫して高い予測精度を示した。
この研究は、Feisal Alaswad氏を含む5名の著者によって発表され、医療分野における人工知能(AI)の応用に着目している。
評価対象となった従来の機械学習モデルには、Logistic Regression、K-Nearest Neighbors (KNN)、Support Vector Machine (SVM)、Naive Bayes、Decision Tree、Random Forestが含まれる。実験結果は、従来の機械学習モデルがLLM生成ルールベースシステムよりも予測性能で優位にあることを示した。特にRandom Forestは、90.2%の精度、0.829の適合率、1.0の再現率、0.906のF1スコアで最高の全体性能を達成した。Naive Bayesも88.5%の精度と0.881のF1スコアでこれに続いた。
一方、LLM生成ルールモデルでは、Claude Sonnet 4.6が80.3%の精度と0.833のF1スコア、GPT-4oが70.5%の精度と0.690のF1スコアを記録し、従来のモデルに劣る結果となった。しかし、LLMが生成するルールは「IF-THEN」形式の診断ロジックを提供するため、臨床意思決定における説明可能性と透明性を高める利点があるとされている。
これらの発見は、医療AIシステムにおいて、予測性能と解釈可能性の間にトレードオフが存在することを示唆している。実験の完全な実装コードはGitHubリポジトリで公開されている。
参考: arXiv cs.LG (アーカイブ) — 2026年9月15日 13:00 (JST)
原文ハイライト"Evaluating LLM-Generated Rules for Heart Disease Prediction"