リサーチ・論文

AUDITPLAN、AIモデルの安全性監査強化とアライメント改善

学術論文リポジトリarXiv cs.CRは9月16日(現地時間)付けで公開された論文にて、大規模言語モデルの安全性アライメントを強化する新アプローチ「AUDITPLAN」を提案した。この手法は、モデルがコンパクトな構造化された安全計画を生成し、その計画に基づいて回答することで、回答のみを評価する従来の安全性チューニングパイプラインが抱える課題の解決を目指す。

ベンダー・製品

Together AI、ファインチューニングサービスを拡充 新モデル追加と価格改定

Together AIは9月10日(現地時間)、AIモデルのファインチューニングサービスを大幅に拡張したと発表した。今回のリリースでは、最新のオープンウェイトモデルへのサポートを拡大したほか、トレーニング過程をリアルタイムで監視できるライブ実験追跡機能、トレーニングおよびデータ処理におけるきめ細かな制御機能が導入された。また、一部モデルのトレーニング価格引き下げも実施され、利用者の費用負担軽減を図る。

リサーチ・論文

大規模言語モデル、情報不足時のベイズ事前分布活用メカニズムを解明

arXiv cs.LGは2026年9月1日(現地時間)、大規模言語モデル (LLMs) が情報不足時にトレーニングコーパスのユニグラム分布をベイズ事前分布として活用するメカニズムを解明する研究論文「The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors」を公開した。同論文は、その根底にあるunembedding geometryの存在と、この構造が複数のモデルファミリーに共通していることを指摘している。

リサーチ・論文

クウェン、マルチモーダルMoEモデル「Qwen3.8-Flash-Next」発表

Simon Willison's Weblogは2026年8月26日(現地時間)、クウェン (Qwen) が新たなオープンウェイトモデル「Qwen3.8-Flash-Next」を発表したと報じた。このモデルはマルチモーダルなMoEモデルであり、同時にQwen4で採用されるアーキテクチャの早期プレビューとしての役割を持つ。合計1250億トークン規模ながら、アクティブなトークン数は60億に抑えられており、性能向上を実現している。

ポッドキャスト・動画

アンドリュー・ウン氏、DeepLearning.aiでAIエンジニアリングに注力

グーグルブレイン (Google Brain) とCourseraの共同創設者であるアンドリュー・ウン氏は2026年8月25日(現地時間)、自身が共同創設したオンライン学習プラットフォームDeepLearning.aiを「AI Engineering」に焦点を当てて再始動したと発表した。これは10,000件超の求人分析、AI専門家や採用担当者への数十回のインタビュー、調査データなどを総合的に分析した結果に基づいている。

ベンダー・製品

Alibaba、AIエージェント向けQwenプラットフォーム開放

Alibabaは8月10日(現地時間)、自社の人工知能 (AI) モデル「Qwen」を基盤とする「チエンウェン・オープン・プラットフォーム (Qianwen Open Platform)」を外部開発者向けに開放したと発表した。この開放により、サードパーティはスマートフォン、パーソナルコンピューター、スマートグラスなど多様なデバイス向けにカスタムAIエージェントを構築できるようになり、Qwenを中心とした広範なAIエージェントエコシステムの構築が加速される。

ベンダー・製品

ByteDanceとAlibaba、中国新AI規制で人間型エージェント機能を停止

ByteDance(バイトダンス)が提供するDoubao(ドウバオ)と、Alibaba Group Holding(アリババ・グループ・ホールディング)が提供するQwen(クウェン)は、中国の新たな人工知能(AI)規制に準拠するため、人間型AIエージェント機能の提供を停止することを2026年7月5日(現地時間)に発表した。Doubaoは7月15日にエージェント機能の提供を終了し、Qwenは7月10日に人間型インタラクティブエージェントとユーザー作成エージェント機能を無効化する。

リサーチ・論文

DeepReinforce、エージェントコーディング向けLLM「Ornith-1.0」を公開

ディープレインフォース (DeepReinforce) は2026年6月29日(現地時間)、エージェントコーディングに特化したオープンウェイトの大規模言語モデル (LLM) である「Ornith-1.0」をリリースした。これは同社にとって初のモデルリリースとなる。Ornith-1.0は既存のGemma 4とQwen 3.5を基盤として構築されており、同規模のオープンソースモデルと比較して、コーディングベンチマークにおいて最先端の性能を示すとしている。

ベンダー・製品

Zed 1.7.2がAI Agent機能強化とGit連携改善を導入

Zedは6月17日(現地時間)、統合開発環境(IDE) Zedのバージョン1.7.2をmacOS、Windows、Linux向けにリリースしました。今回のアップデートでは、AI Agent(AIエージェント)機能の効率を向上させるため、自動コンテキスト圧縮と手動トリガー用の「/compact」コマンドを追加。さらに、Gitグラフのref(ブランチ、リモートref、タグ)に対してカスタムGitコマンドを実行できるコンテキストメニューが導入され、開発者のワークフロー強化を図っています。Markdownプレビューのスタイリングも改善されました。

ベンダー・製品

【速報】Hugging Face Blog、異種小型モデル統合の金融シミュレーション開発報告

Hugging Face Blogは2026年6月6日(現地時間)、第2回Build Small Hackathonのレポートとして、複数の研究機関の異なる小型モデルを統合した金融ドラマシミュレーション「Thousand Token Wood v2」のエンジニアリング詳細を報告した。このプロジェクトでは、OpenAI、OpenBMB、NVIDIA製の小型モデルや、ファインチューニングされたQwenモデルがエージェントとして組み込まれている。

リサーチ・論文

小型言語モデルCoT算術、数コピーの「読み出しショートカット」判明

arXiv cs.LGは2026年5月20日(現地時間)、Ming Liu氏が発表した論文「The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models」の内容を報じた。この論文は、小型言語モデルが思考連鎖 (CoT) プロンプティングを用いた算術演算を行う際、「読み出しショートカット」と呼ばれる特異な現象が性能に影響を与えることを指摘している。モデルが中間推論内容にかかわらず、回答区切り記号の前の末尾にある数値を最終的な答えとしてコピーする傾向が明らかになった。

ポッドキャスト・動画

モデル開発企業が戦略転換、エージェント機能強化へ

テックメディア「Latent Space」は2026年5月23日(現地時間)、大手モデル開発企業が製品戦略をモデル単体からエージェント機能の構築へと大きく移行していると報じた。OpenAIのGreg Brockman氏の発言やAI21の組織再編、DeepSeekの新たな取り組みなどが、この市場の動向を明確に示している。モデルの性能のみならず、その活用方法と組み合わせた製品化が競争優位の鍵となるとの見方が広がっている。

リサーチ・論文

最先端LLM33種のメタ認知能力を分析、ドメイン別で顕著な能力変動

Jon-Paul Cacioli氏らの研究論文は2026年4月21日(現地時間)、arXiv cs.CLで公開され、最先端の大規模言語モデル(LLM)33種のメタ認知モニタリング能力をMMLUベンチマークの6つのドメインで評価した結果を報告した。この広範な調査は、8つのモデルファミリーから選ばれた33モデルを対象に、合計47,151回の観測に基づいている。これまで集計されたメタ認知品質スコアでは見過ごされがちだった、個々のモデルにおけるドメイン間の顕著な能力変動が浮き彫りとなり、LLMの特性理解に新たな視点を提供している。

ベンダー・製品

MachinaCheck、AMD MI300X上でCNC製造可能性分析システムを構築

Hugging Face Blogが2026年5月10日(現地時間)付けで報じたところによると、lablab.aiとAMD Developer Hackathonで構築されたMachinaCheckが、AMD Instinct MI300Xを活用したマルチエージェントAIシステムを発表した。このシステムは、CNC機械加工における部品の製造可能性分析を効率化し、手作業による時間とエラーを削減する。機密性の高い顧客データのオンプレミス処理を実現し、データ漏洩のリスクなしに製造プロセスを支援する。

リサーチ・論文

arXiv、LLM向けに新強化学習「POPO」を提案 正のロールアウトのみで学習

arXiv cs.CLは2026年5月7日(現地時間)、Mingwei Xu氏とHao Fang氏が、大規模言語モデル (LLM) の推論能力向上を目指す新しい強化学習フレームワーク「Positive-Only Policy Optimization (POPO)」を提案したと発表した。これは、検証可能な報酬を伴う強化学習 (RLVR) の領域において、既存手法Group Relative Policy Optimization (GRPO) の負のロールアウト問題を解決するもので、オンラインの正のロールアウトのみで学習を進める。