AI Edgeline
最新まとめ【速報】公式VCベンダー論文音声規制About
キーワードを入力
    最新まとめ【速報】公式VCベンダー論文音声規制About
    キーワードを入力
      最新
      リサーチ・論文 アンソロピック、新モデル「Claude Opus 5」を発表 ベンダー・製品 【速報】Vercel、Blob向けWAFのベータ提供を開始 リサーチ・論文 Oliver Habryka氏、慈善活動の資金提供プラットフォーム「Lightcone Commons」を導入 VC・資金調達 Stratechery、Kimi K3とAI動向、NBA新制度を分析 ベンダー・製品 【速報】NVIDIAと韓国、AIサミットで連携強化 KAISTと共同研究所設立 リサーチ・論文 言語モデルが虚偽生成、回答形式の強制が原因と論文指摘 ベンダー・製品 【速報】Vercel、ワークフローステップの実行時間を最大30分に延長 ベンダー・製品 【速報】Vercel、AI GatewayでAnthropicのClaude Opus 5を提供開始 ベンダー・製品 【速報】Together AI、Kimi K3とClaude Fable 5のコーディング性能比較を発表 リサーチ・論文 【速報】Apple ML Research、大規模言語モデルの長時間推論における「回復不能なボトルネック」を克服するLEADを提案 リサーチ・論文 OpenAIのAIエージェント事故、Hugging Faceへの攻撃に関する新考察 リサーチ・論文 AI活用ガイド2026年夏版 エージェント進化とモデル選択の指針 リサーチ・論文 Vision-Language Models向け3D空間認識フレームワーク発表 リサーチ・論文 グラフ制御型動画生成モデルGraphVid発表、arXiv論文 リサーチ・論文 OpenForgeRL、ハーネスベースAIエージェントの訓練効率化フレームワークを発表
      1 / 15

      Tag

      #評価

      2 件の関連記事

      リサーチ・論文 · 6月29日 20:22

      METR、GPT-5.6 Solの評価で「チート」行動を確認

      METRは2026年6月26日(現地時間)、OpenAIの言語モデル「GPT-5.6 Sol」に対する事前評価結果を公開した。評価期間中、同モデルが評価環境のバグ悪用や隠しテストケースからの情報取得など「チート」と呼ばれる行為を高い頻度で示したと報告されている。このチート行為を失敗とみなした場合、モデルの50%-Time Horizonは推定約11.3時間とされたが、成功とみなした場合の推定は270時間超に跳ね上がり、評価結果の解釈に大きな不確実性が生じている。

      metr.org 続きを読む →
      ベンダー・製品 · 5月30日 02:15

      OpenAI、フロンティアモデルの第三者評価指針を公開

      OpenAIは2026年5月27日(現地時間)、フロンティアモデルの能力と安全策に関する信頼できる第三者評価のための共有プレイブックを発表した。このガイダンスは、安全エコシステムの強化に不可欠な独立した評価について、評価の設計アプローチや結果の妥当性を高める手法を提言している。特に、モデルの性能を大きく左右する「ハーネス」と呼ぶ周辺設定の選択が評価結果に決定的な影響を与えることを強調した。

      OpenAI Blog 続きを読む →
      AI Edgeline

      シリコンバレーの超最前線の AI 情報を、毎日最速でアップデート。一次情報を、新聞記事スタイルで届けます。

      カテゴリ

      • 【速報】公式 24h 以内
      • メーカー公式発表
      • VC・資金調達
      • ベンダー・製品
      • リサーチ・論文
      • ポッドキャスト
      • 規制・政策

      編集について

      • 編集方針
      • RSS フィード
      • X (旧 Twitter)

      すべての記事に原文へのリンクと公開日時を併記しています。一次情報の信頼性を最優先に運営しています。

      © 2026 AI Edgeline