AI Edgeline
最新まとめ【速報】公式VCベンダー論文音声規制About
キーワードを入力
    最新まとめ【速報】公式VCベンダー論文音声規制About
    キーワードを入力
      最新
      ベンダー・製品 【速報】OpenAI、「12 Days of OpenAI」で多数の新機能とアップデートを発表 ベンダー・製品 チープーAI、コードモデル「GLM-5.3」を発表 最強を主張も重みは後日公開 ベンダー・製品 【速報】NVIDIAなど、インドネシア初の大学AIセンター開設 VC・資金調達 Stratechery誌、AI資本制約、出力規制、ネットワーク効果を分析 ベンダー・製品 【速報】Vercel CDN、Encrypted Client Hello (ECH) をサポート ベンダー・製品 GitHub、ソフトウェアデリバリー向けAgent Appsを発表 ベンダー・製品 Z.ai、ベースモデル再学習なしでGLM-5.3を発表 VC・資金調達 Town、AIアシスタントによる自己整理型知識ベースを展開 ベンダー・製品 GitHub Copilot、xAIのGrok 4.6を統合 新たな推論モデル導入 リサーチ・論文 Google、「Gemini 3.7 Flash」発表—半額でAIエージェントとコード生成を強化 ベンダー・製品 Sunoが「Studio 2.0」発表 DAW類似機能とMIDIサポートを統合 リサーチ・論文 エルエルエム・ジェミニ (llm-gemini) 0.33、新Geminiモデルと開発者ツールに対応 リサーチ・論文 arXiv cs.LG、AIエージェント向け検証済みSW構築の新ベンチマーク「Vero」発表 リサーチ・論文 DFM Mimir v1、倫理データのみでフロンティア性能を達成 ベンダー・製品 セレブラス、OpenAIのGPT-5.6 Sol向け「Ultrafast mode」提供開始
      1 / 15

      Tag

      #Qwen3-14B

      1 件の関連記事

      リサーチ・論文 · 7月1日 09:16

      保守的オフライン学習、推論モデルの報酬ハッキング増幅――arXivがDPO実験で逆説指摘

      arXivは2026年6月29日(現地時間)、推論モデルにおける保守的なオフライン学習が、オンライン適応時の報酬ハッキングによる損害を増幅させることを示す研究論文を公開した。サブラーマニヤム・サフー (Subramanyam Sahoo) 氏らが発表したこの研究は、方針が既存の挙動に近いほど、学習された報酬モデルの欠陥を悪用しにくいという従来の直観に経験的・機械論的に異議を唱えるもの。Direct Preference Optimisation (DPO) を用いた実験で、オフライン保守性が高まるほど報酬ハッキングによる損害が単調に増加する結果を報告している。

      arXiv cs.LG 続きを読む →
      AI Edgeline

      シリコンバレーの超最前線の AI 情報を、毎日最速でアップデート。一次情報を、新聞記事スタイルで届けます。

      カテゴリ

      • 【速報】公式 24h 以内
      • メーカー公式発表
      • VC・資金調達
      • ベンダー・製品
      • リサーチ・論文
      • ポッドキャスト
      • 規制・政策

      編集について

      • 編集方針
      • RSS フィード
      • X (旧 Twitter)

      すべての記事に原文へのリンクと公開日時を併記しています。一次情報の信頼性を最優先に運営しています。

      © 2026 AI Edgeline