Together AI、ファインチューニングサービスを拡充 新モデル追加と価格改定
Together AIは9月10日(現地時間)、AIモデルのファインチューニングサービスを大幅に拡張したと発表した。今回のリリースでは、最新のオープンウェイトモデルへのサポートを拡大したほか、トレーニング過程をリアルタイムで監視できるライブ実験追跡機能、トレーニングおよびデータ処理におけるきめ細かな制御機能が導入された。また、一部モデルのトレーニング価格引き下げも実施され、利用者の費用負担軽減を図る。
Tag
24 件の関連記事
Together AIは9月10日(現地時間)、AIモデルのファインチューニングサービスを大幅に拡張したと発表した。今回のリリースでは、最新のオープンウェイトモデルへのサポートを拡大したほか、トレーニング過程をリアルタイムで監視できるライブ実験追跡機能、トレーニングおよびデータ処理におけるきめ細かな制御機能が導入された。また、一部モデルのトレーニング価格引き下げも実施され、利用者の費用負担軽減を図る。
arXiv cs.LGが2026年9月10日(現地時間)付けで公開した論文が、Mixture-of-Experts (MoE) モデルが学習データの繰り返しに対して、高密度活性化Transformerモデルよりも過学習しやすいことを指摘した。人間が作成したテキストデータの供給が枯渇する中、言語モデルの学習データ繰り返しは一般的な手法となっている。この研究は、MoEの性能劣化がデータの繰り返し率に大きく依存し、その影響がスパース性と共に増加することを示している。
Vercelは2026年9月4日(現地時間)、inclusionAIが開発した健康・医療分野に特化した大規模言語モデル「Ling 3.0 Flash Sante」を同社のAI Gatewayを通じて提供開始しました。このモデルはMixture-of-Experts(MoE)アーキテクチャを採用し、1240億の総パラメータと256Kトークンのコンテキストウィンドウを特徴とします。提供開始から2026年10月4日までは無料で利用可能です。
Vercelは8月27日(現地時間)、自社のAI Gatewayにおいて、Tencentが開発したオープンソースの大規模言語モデル(LLM)「Hy4 Preview」が利用可能になったことを発表した。Hy4 Previewは、合計770Bのパラメーターとトークンあたり49Bのアクティブパラメーターを持つMixture-of-Expertsモデルであり、1Mトークンのコンテキストウィンドウに対応。これにより、AI Gatewayのユーザーは、同モデルの高度な推論機能を活用し、多様な開発ニーズに対応できるようになる。
パーヴェル・グー (Parvel Gu) は7月14日(現地時間)、arXiv cs.AIで論文を公開し、Mixture-of-Experts (MoE) ルーティングの不連続性が、4ビットKVキャッシュの量子化によって引き起こされる「フリップ」現象を明らかにした。このフリップはトークンを決定境界を越えさせ、エキスパートの活性化を反転させる。本研究は新たな緩和策を提案するものではなく、因果関係の解明、経験的発見、および検出限界に関する結果を提供している。
ムーンショットAI (Moonshot AI) は7月27日(現地時間)、同社が開発するAIモデル「Kimi K3」の全重みをリリースした。2.8兆パラメータを持つ大規模なミクスチャー・オブ・エキスパート (Mixture-of-Experts: MoE) モデルであり、100万トークンのコンテキストウィンドウとマルチモーダル推論に対応する。同時に47ページの技術レポートと独立実行に必要なインフラも公開され、企業がAPI経由ではなく自己ホスティングで利用する選択肢を広げている。
Kimi Teamは2026年7月27日(現地時間)、大規模言語モデルの新たな旗手となる「Kimi K3」モデルを、学術論文公開サイトarXivで発表した。このモデルは、総パラメータ数2.8兆、アクティブ化パラメータ1040億のMixture-of-Experts (MoE) アーキテクチャを採用し、ネイティブな視覚能力と業界でも屈指の100万トークンに及ぶコンテキストウィンドウを特徴とする。既存モデルを凌駕する性能と効率性を目指した技術革新が注目されている。
Vercelは2026年7月22日(現地時間)、アント・グループ (Ant Group) が開発したAIモデル「Ling 3.0 Flash」が同社のAI Gatewayで利用可能になったと発表した。このモデルは、8月3日まで無料で利用できる。
Vercelは2026年7月21日(現地時間)、AI GatewayにおいてPoolsideの「Laguna S 2.1」モデルの提供を開始しました。このモデルはオープンウェイトのMixture-of-Expertsモデルで、最大1Mトークンのコンテキストウィンドウに対応します。エージェント型コーディングや長時間実行タスクに特化しており、思考モードと非思考モードの2つのバージョンが利用可能です。
アリ・カイアム氏は6月12日(現地時間)、arXiv(アーカイヴ)にて、Mixture-of-Experts(MoE)モデルの推論時メモリ効率を大幅に高める新トレーニング手法「StickyMoE」に関する研究論文を発表した。この手法は、MoEモデルが連続するトークン間で頻繁にエキスパートを切り替えることで生じる、メモリ内のウェイトスワッピング問題の解消を目指す。StickyMoEは、エキスパート割り当ての一貫性を高める新たな損失関数を導入し、推論の効率化に貢献する。
Tencentは7月6日(現地時間)、オープンウェイト言語モデル「Hy3」に関する詳細を公表した。Hy3は2950億パラメータを持つ大規模モデルでありながら、Mixture-of-Experts(MoE)アーキテクチャの採用により、任意のトークン処理にアクティブに稼働するパラメータを約210億に抑えている。地理的および利用制限のないApache 2.0ライセンスでの提供は、オープンモデル市場に新たな選択肢をもたらすと見られる。
Gemma Teamは2026年7月2日(現地時間)、オープンウェイトのネイティブマルチモーダル言語モデルの新世代「Gemma 4」に関する技術レポートを公開しました。このモデルは、計算効率と推論能力の向上を主眼に開発され、2.3Bから31Bパラメータの範囲で、DenseアーキテクチャとMixture-of-Expertsアーキテクチャの両方を特徴としています。
Mistral AIは2026年7月6日(現地時間)、CEOのアーサー・メンシュ (Arthur Mensch) 氏が、オープンウェイトの新しいMixture-of-Experts (MoE) モデルファミリーを7月中に研究、政府、産業パートナー向けに早期アクセスを開始すると発表した。同モデルは「fat but sparse」と表現され、閉鎖型APIモデルに対する有力なオープンウェイトの選択肢として提供される見込み。具体的なパラメータ数、ベンチマーク結果、ライセンス条件、正確なリリース日は現時点では未公表である。
Tencentは7月6日(現地時間)、Apache 2.0ライセンスに基づく大規模言語モデル「Hy3」を公開した。Simon Willison's Weblogが報じた。Hy3は、総パラメータ数2950億を誇るMixture-of-Experts(MoE)モデルで、アクティブパラメータ210億、MTPレイヤーパラメータ38億を持つ。Tencent Hy Teamが開発したこのモデルは、同規模の既存モデルを凌駕し、パラメータ数で2〜5倍の主要なオープンソースモデルに匹敵する性能を持つとTencentは説明している。
Apple ML Researchは2026年7月5日(現地時間)、研究論文「Path-Constrained Mixture-of-Experts」を公開した。本研究は、Sparse Mixture-of-Experts (MoE) アーキテクチャにおけるトークンごとの専門家選択経路に着目し、その統計的非効率性を解消する新しい設計軸を提案した。このアプローチにより、既存の独立ルーティング手法を補完し、性能改善と補助損失の不要化を実現するとしている。
arXiv (アーカイブ) は6月29日(現地時間)、論文を公開し、研究者らが開発した35Bパラメータの「Agents-A1」について詳述した。本モデルは、従来のパラメータ数を増やす手法ではなく、エージェントの「ホライズン」をスケールさせる独自のアプローチにより、1兆パラメータ級の高性能を実現したと報告されている。長ホライズンの軌跡生成と多様なエージェント能力のスケーリングに着目したこの研究は、AIエージェントの性能向上における新たな道筋を示すものだ。
Moonshot AIは2026年6月15日(現地時間)、Kimi K2.7-CodeのHighSpeed Modeの提供を開始したと発表した。同社はこれにより、中央値長コーディング入力で約180トークン/秒、短コンテキストタスクで最大260トークン/秒のスループットを実現し、標準版と比較して約6倍高速だと主張している。しかし、同社はモデルを独立したコーディングベンチマークに提出しておらず、開発者はベンダーが報告した数値のみを判断基準としている。
ムーンショットAIは2026年6月12日(現地時間)、1兆パラメータのMixture-of-Experts (MoE) コーディングモデル「Kimi K2.7-Code」をModified MITライセンスでオープンソース公開しました。このモデルはコーディングに特化しており、Hugging Faceを通じてモデルウェイトが提供されます。同社によると、Kimi K2.7-Codeは既存のK2.6モデルと比較して、Kimi Code Bench v2で21.8%の性能向上を達成し、推論トークンの使用量を約30%削減したと報告されています。
Cohereは2026年6月9日(現地時間)、開発者向けモデル「North Mini Code」をHugging Face上で公開した。これは同社初のモデルファミリーとなる300億パラメータのMixture-of-Expertsモデルで、30億のアクティブパラメータを持ち、エージェント型ソフトウェアエンジニアリングタスクに特化して設計・訓練された。Apache 2.0ライセンスで利用可能。
JetBrainsは2026年5月31日(現地時間)、自然言語とコードでゼロから学習した12BパラメータのMixture-of-Experts (MoE) モデル「Mellum2」を発表した。このモデルは、トークンごとに2.5Bのパラメータのみをアクティブにするため、高スループットかつ低レイテンシーの推論に効率的である。Apache 2.0ライセンスのもとで公開された。
オープンウェイトのMellum 2 (メラム2)は5月29日(現地時間)、その言語モデルに関する技術レポートを公開した。このモデルは120億パラメータのMixture-of-Experts (MoE)モデルであり、トークンあたり25億のアクティブパラメータを持つ。Mellum 2はソフトウェアエンジニアリングに特化した汎用言語モデルとして設計され、コード生成・編集、デバッグ、多段階推論、ツール利用と関数呼び出し、エージェントコーディング、対話型プログラミング支援といった幅広い領域をカバーする。
Ellwil Sharma氏とArastu Sharma氏は5月14日(太平洋時間)、マルチフィジックス基盤モデルにおける「ネガティブトランスファー」(互換性のない知識が学習を妨害する問題)を克服する新手法を発表した。これは「Shodh-MoE」と名付けられた潜在トランスフォーマーアーキテクチャを導入し、疎な混合エキスパートルーティングを用いる。異なる偏微分方程式(PDE)レジームの同時学習で生じる勾配衝突や不安定な最適化を抑制し、スケーラブルな科学機械学習(SciML)の実現を目指す。
arXiv cs.LGは2026年5月7日(現地時間)、Minbin Huang氏らがMixture-of-Experts (MoE) アーキテクチャの新しい設計「UniPool」を提案したと報じた。UniPoolは、従来層ごとに独立していたエキスパートセットをグローバルな共有プールとして扱い、各層のルーターからアクセスさせる構造を持つ。この設計変更により、LLaMAアーキテクチャの多様なモデルスケールにおいて、既存のMoEと比較して検証損失とパープレキシティの改善が確認された。
論文公開サイトarXiv cs.CLが2026年5月7日(現地時間)付けで報じたところによると、大規模言語モデル (Large language models) のモジュール性を高める新しいMixture-of-Experts (MoE) モデル「EMO」が発表された。EMOは、事前学習中に文書の境界のみを用いて、人間の定義する事前知識なしで首尾一貫した専門家グループを形成する。これにより、メモリ制約のある環境での大規模疎モデルの実用性が向上する可能性が示されている。