arXiv cs.CR は2026年7月26日(現地時間)、論文を公開し、大規模言語モデル (LLM) が生成する認証コードのセキュリティアーキテクチャに不確実性があることを示した。5つのAIコーディングアシスタントをNIST SP 800-63Bガイドラインに基づいて評価した結果、基本的なプロンプトでは重要な保護機能が欠落していることが判明。包括的なセキュリティの実現には、モデルを自己監査ループに導く反復的なRepromptingが必要だと結論付けている。
研究は、LLMがソフトウェア開発ワークフローに組み込まれる中での、セキュアな認証コードを自律的に生成する能力の評価を目的とした。
論文では、静的コード分析と動的侵入テストを組み合わせたバイモーダル評価フレームワークを採用している。このフレームワークをNIST SP 800-63Bガイドラインにマッピングし、5つの主要なAIコーディングアシスタントが生成する認証システムのセキュリティアーキテクチャを評価した。開発者の指導レベルを反映させるため、Basic、Secure、NIST-Based、Repromptingの4種類のプロンプティング戦略を用いてモデルの動作が検証された。
実証結果として、機能的または一般的な安全プロンプトから生成されたコードが、ブルートフォース耐性、セッション管理、堅牢なパスワード処理といった重要な保護機能を一貫して欠落していることが示された。明示的な単一のNISTコンテキストを提供することでコンプライアンスは大幅に改善するものの、これは構造的に不十分だと指摘されている。
本研究は、モデルをコンテキストに沿った自己監査ループに強制する反復的なRepromptingが、包括的な多層防御セキュリティアーキテクチャを実現するために厳密に必要であることを実証している。現在のAIコーディングアシスタントはデフォルトでセキュアなアプリケーションを生成しないため、企業での導入には単一のプロンプトエンジニアリングから、継続的で標準に基づいた検証パイプラインへの移行が求められると結論付けた。
参考: arXiv cs.CR — 2026年7月27日 00:16 (JST)
原文ハイライト"The Illusion of Secure LLM Code"