DeepSeek-V4 FlashとGPT-5.6 Luna比較: DeepSWEでのコスト効率と性能
Together AIは8月6日(現地時間)、大規模言語モデル「DeepSeek-V4 Flash 0731」と「GPT-5.6 Luna」を、ソフトウェアエンジニアリングタスクのベンチマークDeepSWEで比較評価した結果を発表しました。DeepSWEのpass@1スコアではGPT-5.6 LunaがDeepSeek-V4 Flash 0731を14ポイント上回りましたが、DeepSeek-V4 Flash 0731はタスクあたりのコストが約6分の1と安価であり、コスト効率では4.8倍の優位性を示しました。