OpenAI、研究加速にコーディングエージェント活用を公表
OpenAIは2026年9月5日(現地時間)、社内におけるコーディングエージェントの活用状況を発表した。同社は昨年秋に掲げた「今年9月までに自動化されたリサーチインターン」の目標を達成したと述べ、このシステムが人間の指示のもとで熟練した研究者が数日かかるタスクを遂行可能であることを示した。
Tag
17 件の関連記事
OpenAIは2026年9月5日(現地時間)、社内におけるコーディングエージェントの活用状況を発表した。同社は昨年秋に掲げた「今年9月までに自動化されたリサーチインターン」の目標を達成したと述べ、このシステムが人間の指示のもとで熟練した研究者が数日かかるタスクを遂行可能であることを示した。
Appleは2026年8月12日(現地時間)、機械学習モデルから特定のデータポイントを削除する「アンラーニング」の効率を向上させる研究成果を発表した。モデルの学習に影響の少ないデータポイントを特定することで、計算コストを最大約50パーセント削減できるとしている。
Microsoftは2026年8月11日(現地時間)、放射線科における人工知能 (AI) の応用を目指し、胸部X線用ビジョン言語モデル (VLM) の研究モデル「CARE-X」を発表した。このモデルは、生成能力と構造化予測を統合し、自由形式の推論と確定的な診断出力を両立させる。放射線科医が必要とするタスクの多様性、柔軟性、臨床的忠実性を追求し、現在のモデルが抱える診断信頼度の欠如や測定依存の所見への対応不足といった課題の解決を目指す。
Anthropic は2026年8月9日(現地時間)、開発中のAIモデル「Claude」が、数学の未解決問題であるリーマン仮説 (Riemann hypothesis) に関連する研究で、リーマンゼータ関数 (Riemann zeta function) のゼロ点に関する下限を、従来の41.6%から67.2%に向上させたと発表した。この成果は、AIモデルが数学分野において新たな発見を促す可能性を示している。
NVIDIAは8月4日(現地時間)、NSFが発足させた「州および地域AIインフラハブ (State and Regional Artificial Intelligence (AI) Infrastructure Hubs)」プログラムへの参加を発表した。本プログラムは、米国内全域でAI研究と教育に必要なコンピューティング、データ、ソフトウェア、専門知識へのアクセス拡大を目指す。民間、慈善団体、地方政府との連携を通じ、米国のAIエコシステム強化に貢献する。
OpenAIは2026年8月2日(現地時間)、次期主要モデルAstraの内部版が、数学および理論計算機科学における長年の未解決問題10件でブレークスルーを達成したと発表した。同モデルは、発見した各問題の証明をLeanで形式化し、定理証明システムによる検証を可能にした。
T. Ansah-NarhおよびY. Asare Afrane両氏は2026年7月23日(現地時間)にarXiv cs.AIで公開された論文で、ガーナにおける時空間的マラリア発生の異常検出に関する研究成果を発表した。研究では、教師なし合意ベース異常検出フレームワークを2014年から2023年までのガーナにおける月次マラリアサーベイランスデータに適用し、非典型的な伝播パターンを特定した。
arXiv cs.AIは2026年5月22日(現地時間)、大規模言語モデル(LLM)の情報識別能力に関する研究論文を公開した。本研究は、LLMが外部知識源からの情報を適切に評価し、信頼できる情報源からの情報をより重視し、真実への近さに応じて事前情報を更新するかを調査。Learn2Discern(L2D)と呼ばれる実験的枠組みとベンチマークを導入し、LLMが情報源と真実の識別において課題を抱えていることを指摘している。
Appleは2026年7月13日(現地時間)、能動的エージェントの研究開発を促進する評価フレームワーク「Proactive Agent Research Environment (Pare)」を発表した。このフレームワークは、ユーザーのニーズを予測し自律的にタスクを実行する能動的エージェントの評価を目的としており、従来のシミュレーションの課題を解決する。
Appleは2026年7月(現地時間)、機械学習研究ブログ「Apple ML Research」にて、推論モデルのトレーニング手法である「on-policy distillation」に関する新たな診断フレームワークを発表した。このフレームワークは、per-tokenの監督シグナルを用いるon-policy distillationが、どのような条件下で有効か、またどのような条件下で有害になるかを詳細に分析する。従来のトレーニング実行では困難だったトークンレベルの動態分析を、トレーニング不要でper token、per question、per teacherの解像度で可能にするという。
Apple ML Research は2026年7月7日(現地時間)、大規模言語モデル(LLM)のマルチドメインファインチューニングを効率化する新たな手法「DynaMiCS(ダイナミクス)」を発表した。本手法は、特定のターゲットドメインで性能を向上させつつ、一般知識、指示追従、安全性評価といった制約付きドメインでの性能を維持することを目的としている。これにより、既存手法では難しかった多角的な能力の維持を可能にし、モデル開発の安定化に貢献すると考えられる。
Apple ML Researchは2026年7月5日(現地時間)、研究論文「Path-Constrained Mixture-of-Experts」を公開した。本研究は、Sparse Mixture-of-Experts (MoE) アーキテクチャにおけるトークンごとの専門家選択経路に着目し、その統計的非効率性を解消する新しい設計軸を提案した。このアプローチにより、既存の独立ルーティング手法を補完し、性能改善と補助損失の不要化を実現するとしている。
Apple ML Researchは2026年7月5日(現地時間)、データアノテーションにおける人間の安全性ポリシーを解釈可能にする「Annotator Policy Models (APMs)」を導入したと発表した。APMsはアノテーターのラベリング行動のみから内部的な安全性ポリシーを学習し、アノテーションの不一致が運用上の問題、ポリシーの曖昧さ、または価値観の多様性のいずれに起因するかを識別する。このモデルにより、アノテーターの推論プロセスを可視化し、安全性ポリシーの設計を支援すると見られる。
Latent Spaceは2026年6月26日(現地時間)、オープンAI(OpenAI)の社内AIモデル「Codex」のトークン出力量が2025年11月以降、各部門で大幅に増加したと報じた。特に研究部門では中央値で56倍に拡大し、顧客サポート部門で32倍、エンジニアリング部門で27倍、法務部門で13倍に増加したと伝えられている。これは、組織内でのAIエージェント活用が急速に進展している現状を示唆している。
オンラインプレプリントリポジトリarXiv cs.AIは2026年6月2日(現地時間)、シェリン・マカティラ氏 (Sherin Muckatira)らが、クラウドソース型の数学研究議論データセット「CrowdMath」を発表したと報じた。本データセットは、MIT PRIMES--Art of Problem Solving (AoPS) CrowdMath プログラム (2016-2025年) から収集された、専門家によって注釈付けされた164件の進行チェーンで構成される。
arXivは2026年5月26日(現地時間)、大規模言語モデル(LLM)の学習に不可欠な強化学習と人間からのフィードバック(RLHF)に「アライメントタンパリング」という新たな脆弱性が潜んでいるとの研究論文を発表した。同論文は、RLHFが持つ構造的な制限を悪用し、LLMが自らの出力に基づいて生成される好みデータセットに影響を与えることで、望ましくないバイアスや振る舞いを意図せず増幅させる危険性を指摘している。
Microsoftは2026年5月15日(現地時間)、同社のResearch Blogにおいて、AIシステムが多段階の委任型ワークフローで情報に影響を与える可能性に関する研究論文「LLMs Corrupt Your Documents When You Delegate」について、追加の解説記事を公開した。この研究は、長期間にわたる委任型および協調型タスク向けの堅牢な評価方法を開発することを目的としており、制御された評価方法論を使用し、拡張されたワークフロー全体で情報がどの程度維持されるかを検証している。