ベンダー・製品

Replit、Ambient Intelligence搭載のデザインスイート「Replit Design」を発表

Replit(リプリット)は7月28日(現地時間)、Ambient Intelligenceを中核とする新たなクリエイティブスイート「Replit Design」を発表した。同サービスは、アイデアからデザインへの具現化プロセスを高速化し、思考と同じ速さで形にする設計を特徴とする。複数の主要なデザイン向けモデルであるClaude、GPT-5、Gemini、Kimi、GLMに対応している。

リサーチ・論文

AI活用ガイド2026年夏版 エージェント進化とモデル選択の指針

One Useful Thing (Ethan Mollick) は2026年7月23日(現地時間)、AIの利用に関する最新ガイド「An opinionated guide to which AI to use to do stuff The Summer 2026 Edition」を公開した。近年AIは単なるチャットボットから、ツールを組み合わせて計画・実行するエージェントシステムへと進化しており、これによりAIが人間の数時間分の作業を一度にこなせるようになったと指摘。同ガイドでは、目的やリスクレベルに応じたAIモデルの選択、特にChatGPTとClaudeを活用した具体的な実務への応用について解説している。

リサーチ・論文

エポックAI、オープンモデルと最先端クローズドの性能に4ヶ月の遅れを指摘

エポックAI (Epoch AI) は5月29日(現地時間)、オープンウェイトモデルが最先端のクローズドモデルに対し、平均4ヶ月、8 ECIポイントの遅れをとっているとの分析結果を発表しました。同社が独自に集計する「エポック能力指数 (ECI)」に基づく調査で、この遅延は2025年10月時点での3ヶ月から拡大しています。

ベンダー・製品

SWE-bench Liteリーダーボード更新、Claude Opus 4.6が62.7%で首位

pricepertoken.comは6月22日(現地時間)、ソフトウェアエンジニアリング能力を評価するベンチマーク「SWE-bench Lite」のリーダーボードが更新され、AnthropicのClaude Opus 4.6が62.7%のスコアで首位を獲得したと報じた。このベンチマークは、実際のGitHubの問題解決能力をテストするもので、人工知能 (AI) モデルのパフォーマンスを比較する際の重要な指標となっている。競争が激化するAI開発において、具体的なタスク解決能力の高さが注目されている。

リサーチ・論文

AIチャットボットのニュース仲介能力に地域格差と脆弱性

arXiv cs.CLは2026年5月21日(現地時間)、AIチャットボットのニュース仲介能力に関する研究論文を発表した。同研究は、AIチャットボットがニュースに接する人々の方法を急速に変える中、これらのシステムが新たな事実を言語や地域を超えていかに正確に処理するかを体系的に測定した先行研究の不足を指摘。2026年2月9日から22日までの14日間、Gemini 3 FlashおよびPro、Grok 4、Claude 4.5 Sonnet、GPT-5、GPT-4o miniの6システムを評価した。最良システムは、数時間前に報じられた出来事に関する多肢選択式質問で90%以上の精度を達成したが、自由回答形式では11-13%精度が低下したと報告されている。

ポッドキャスト・動画

OpenAI、リアルタイム音声APIで新モデル GPT-Realtime-2、-Translate、-Whisperを展開

OpenAIは2026年5月8日(現地時間)、3つの新しいストリーミング音声モデル「GPT-Realtime-2」「GPT-Realtime-Translate」「GPT-Realtime-Whisper」をRealtime APIでリリースしました。同社はGPT-Realtime-2を「最もインテリジェントな音声モデル」と位置付け、GPT-5クラスの推論能力をリアルタイム音声エージェントに提供すると説明しています。GPT-Realtime-Translateは70以上の入力言語から13の出力言語へのストリーミング翻訳をサポートし、GPT-Realtime-Whisperは音声が生成されると同時に文字起こしやキャプションを提供します。