Huatong Song 氏ら、エージェントハーネス向け強化学習フレームワーク「ClawGym II」発表
Huatong Song 氏らは2026年8月17日(現地時間)、arXivで公開された論文「ClawGym II: Exploring Black-Box RL on Agent Harness」にて、複雑なエージェントハーネスを通じた一般的なエージェントの安定かつスケーラブルな最適化を可能にする統一ブラックボックス強化学習(RL)フレームワークを発表した。同フレームワークは、Qwen3-30A3Bを用いた実験で、ClawGym-Bench上のPass@1スコアをOpenClawで9.98ポイント、Claude Codeで14.81ポイント改善し、200〜400の最適化ステップにわたって安定性を示した。