OpenAIは2026年9月28日(現地時間)、大規模言語モデルGPT-6 Astraが、税務ワークブックのタスクを従来モデルGPT-5.6 Solと比較して半分の時間で完了したと発表した。これによりユーザー意図の理解度も向上し、ベイシス (Basis) はGPT-6 Astraによって内部評価スコアが約20%向上したことを確認した。
ベイシス (Basis) は、会計士の手動作業を効率化するAIエージェントを構築しているテクノロジー企業である。同社は、エージェントが長時間にわたるタスクを安定して完了させる研究に注力している。
ベイシスは50タブから成る複雑な税務ワークブックを用いてGPT-6 AstraとGPT-5.6 Solを比較テストした。GPT-6 Astraは、ワークブックを半分の時間で正確かつ確実に完了した。ベイシスの共同創業者であるミッチ・トロヤノフスキー (Mitch Troyanovsky) 氏によると、GPT-6 Astraはユーザーの意図と問題理解において優れている。また、タスク開始時の意思決定が改善され、より直接的な処理経路を辿り、間違い修正に費やす時間が減少したため、トークン使用効率も向上した。
GPT-6 Astraは、タスクの進行に応じて推論の計算量を調整する機能も備えている。難しいステップでは計算量を増やし、容易なステップでは減らすことで、キャッシュを維持しながら調整が可能である。トロヤノフスキー氏は、これによりコストと応答時間が削減され、ベイシスとその顧客にとって長時間のタスクがより経済的になると述べている。
ベイシスはGPT-6 Astraの導入により、内部評価スコアで約20%の改善を記録した。これはユーザー意図のより良い理解に起因し、質問すべきタイミング、仮定のフラグ付け、指示への従順さなどを含む。GPT-6 Astraは、より少ない明示的な指示で広範な文脈から期待値を推測できるため、ベイシスが個別の状況に対応するルールを記述する必要性を減らし、エージェントが内部テストでカバーされていない状況にも対応できるという信頼性が向上した。
参考: OpenAI Blog (アーカイブ) — 2026年9月29日 10:00 (JST)
原文ハイライト"GPT‑6 Astra took 50% less time to finish complex tasks vs. GPT‑5.6 Sol"