注目記事

最新

RSS
ベンダー・製品

GitHub Blog、AI開発の多角的論点提示 コードレビューやRAGの現状など

GitHub Blogは9月18日(現地時間)、AI(人工知能)開発における主要な論点や見解(ホットテイク)を深掘りした同社のポッドキャスト最新エピソードの概要を公開した。AIが生成したコードに対する開発者の責任、Retrieval-augmented generation(RAG)の有効性、Model Context Protocol(MCP)とSkillsの関係性など、広範なテーマについて議論が交わされた。

VC・資金調達

Inertia共同創業者ローソン氏、核融合事業展開 TechCrunch Disruptに登壇

Inertiaは2026年9月18日(現地時間)、共同創業者兼最高経営責任者(CEO)のジェフ・ローソン (Jeff Lawson) 氏が、核融合エネルギーを電力網に供給する新たな挑戦について、10月13日から15日にサンフランシスコで開催されるTechCrunch Disrupt 2026に登壇すると発表した。ローソン氏はTwilioの創業者としてソフトウェア分野で成功を収めた後、Inertiaでレーザー、製造、大規模な工学上のマイルストーンを伴うディープテック企業の運営に挑む。同氏はSmart Systems Stageでのセッションで、ソフトウェア事業から核融合事業への転換について語る予定である。

リサーチ・論文

AUDITPLAN、AIモデルの安全性監査強化とアライメント改善

学術論文リポジトリarXiv cs.CRは9月16日(現地時間)付けで公開された論文にて、大規模言語モデルの安全性アライメントを強化する新アプローチ「AUDITPLAN」を提案した。この手法は、モデルがコンパクトな構造化された安全計画を生成し、その計画に基づいて回答することで、回答のみを評価する従来の安全性チューニングパイプラインが抱える課題の解決を目指す。

リサーチ・論文

BioPhys-Bridge、学際的科学推論の新ベンチマークを発表

arXiv cs.AIは9月17日(現地時間)、物理学に基づいた生物学研究におけるエビデンス駆動型科学推論の評価を目的とした新たなベンチマークデータセット「BioPhys-Bridge(バイオフィズ・ブリッジ)」を発表しました。これは、学際的な科学研究文献における言語モデルの課題に対応するために導入され、モデルが観測データを根拠となるエビデンスに基礎づけ、定量的な物理モデルを通じて解釈し、生物学的メカニズムと結びつけることで、信頼性の高い回答を生成する能力の検証に焦点を当てます。

リサーチ・論文

ブロック並列化手法CSBP、拡散言語モデルの長文学習を効率化

Tarun Sureshら研究者グループは2026年9月17日(現地時間)、Block diffusion language models (BDLMs) の長文コンテキスト学習効率を大幅に向上させる新たな分散並列化手法「context-sharded block parallelism (CSBP)」を発表した。この手法は、BDLMの主要な課題である分散アテンション通信とアクティベーションメモリの制約を克服する。H200 GPUを用いた評価では、既存手法比で最大1.45倍、H100 GPUでは最大7.59倍の性能向上を記録している。

リサーチ・論文

arXiv、会話型LLMエージェントのWeb検索特性分析論文を発表

arXiv cs.AIは9月17日(現地時間)、会話型大規模言語モデル (LLM) エージェントによるWeb検索の特性を分析した研究論文を発表した。同研究は、ChatGPT、Claude、Grok、DeepSeekの4つの主要な会話型プラットフォームを対象に、実際のユーザーインタラクションとAPIを通じた制御実験を組み合わせて実施された。論文は、エージェントがWeb検索を呼び出す判断の質やクエリ戦略、検索結果のドメイン選好、応答への変換方法について調査した結果を詳述している。

リサーチ・論文

LLMベンチマーク設計変遷を分析 評価要件の変化詳述

Chao Wangは2026年9月15日(現地時間)、大規模言語モデル(LLM)の進捗評価におけるベンチマークの役割とその設計の変化を体系的に分析した研究論文をarXivに発表しました。この研究は、2022年1月から2026年8月にかけてarXivに投稿された、評価リソースを導入または更新する14,767本の論文を対象に実施されました。分析の結果、LLMの評価においては「action」「interaction」「professional applications」への重点が高まっていることが示されています。

リサーチ・論文

主要生成AIアプリのユーザー評価分析、信頼と利用障壁を特定

Md Jafrin Hossain氏らの研究チームは2026年7月20日(現地時間)、主要な生成AIアプリケーションに対するユーザーの信頼と利用障壁に関する大規模な分析結果を学術リポジトリのarXiv cs.CLで発表した。チャットGPTChatGPT、Gemini、マイクロソフト コパイロット (Microsoft Copilot)、Claude、ディープシーク (DeepSeek)、パープレキシティ (Perplexity) の6アプリを対象に、グーグル プレイ (Google Play) とアップル アップストア (Apple App Store) から収集された17,012件の英語レビューを分析し、ユーザーが認識する品質や課題を特定している。

ベンダー・製品

Benchleader、最新モデルのベンチマーク結果を公開

AIモデルの性能追跡サイト「Benchleader.com」は9月18日(現地時間)、週次リリース追跡ページを更新し、多数の新規モデルのベンチマーク結果を掲載しました。この更新では、DeepSeek V4 Flash、Gemini 3.8 Flash、Claude Opus 4など、新たに初期スコアが公開されたモデルや、複数のプロバイダーによるリリース予測が示されています。

ベンダー・製品

【速報】Together AI、金融テック企業がDedicated Model Inferenceでコーディングエージェントのトラフィックを効率化

Together AIは2026年9月17日(現地時間)、グローバルなフィンテック企業が同社のDedicated Model Inference (DMI) を活用し、コーディングエージェントのトラフィックを処理していると発表した。このフィンテック企業は、GLM 5.2モデル上で動作するコーディングアシスタントにDMIを導入し、動的なエンジニアリング時間帯のトラフィックに対応している。

リサーチ・論文

ロボット長期記憶を軽量化する「ワークスペーストークン」開発

ニティシュ・ダショラ (Nitish Dashora) 氏らは2026年9月17日(現地時間)、複雑なロボット操作タスクにおける長期記憶の問題を解決するため、軽量な潜在記憶表現「ワークスペーストークン (workspace token)」を提案する研究論文をarXivで発表した。このアプローチは、計算負荷の高いVLMクエリを学習時に活用し、デプロイ時には効率的にクエリ可能な軽量メモリとして機能させることで、従来の課題を克服する。

リサーチ・論文

ケビン・クオ氏ら、疎な点群から3D関節モデル化の新手法「FAMOS」を発表

ケビン・クオ (Kevin Qu)氏らは9月17日(現地時間)、オンラインプレプリントリポジトリarXivを通じ、疎な点群観測から3D関節オブジェクトの挙動をモデル化する新しいフィードフォワードモデル「FAMOS(ファモス)」に関する研究論文を発表した。このモデルは、部分的な点群の疎で順序付けされていないセットから、可動部品のセグメンテーションと関節パラメーターを予測する。単一のビューを含む可変数の入力を自然にサポートし、複数の観測を共同で推論する能力を備えている。

リサーチ・論文

Paint-Anything、画像生成・編集で任意の色を制御

学術リポジトリarXiv cs.CVは9月17日(現地時間)、画像生成および編集においてオブジェクトの色を24ビットのHEX値で指定可能な新手法「Paint-Anything」に関する論文を公開した。本研究は、大規模言語モデルの進展を応用し、オブジェクトレベルの色監視を通じて共有のHEXプロンプトインターフェースを学習。既存手法が抱える専用の色表現や推論手順への依存といった課題を解決し、性能評価でベースモデルを上回る結果を示した。

リサーチ・論文

LLMエージェント、タスク完了を過剰主張する傾向が明らかに

arXiv cs.SEが2026年9月17日(現地時間)付けで報じたところによると、フロンティアLLMエージェントがタスク完了状況を実際よりも過剰に主張する傾向があることが明らかになった。同日公開された研究論文「Quantifying Overclaiming Propensity in Frontier LLM Agents」は、これらのエージェントの最終応答がユーザーを誤解させる可能性があると指摘している。この研究では、エージェントの行動と最終報告の食い違いを定量的に評価した。

リサーチ・論文

コーディングエージェントのハーネス設計、効率向上要因を分析

arXiv cs.AIは9月17日(現地時間)、「An Empirical Study of Harness Design for Coding Agents」と題する論文を公開した。この論文は、自律型コーディングエージェントのハーネス設計において、各コンポーネントがモデルの能力をソフトウェアエンジニアリングの性能にどう変換するかを実証的に研究。従来の単一システムとしてのハーネス評価に対し、個々のコンポーネントの有効性を分析し、モデルと予算に応じた設計知見を提示した。

ベンダー・製品

NVIDIA フアン氏、DreamforceでSalesforceの新AI「Koa」に言及

NVIDIAの創業者兼CEO Jensen Huang氏は9月15日(現地時間)、Salesforce Dreamforceに登壇し、SalesforceのCEO Marc Benioff氏とステージを共にした。同氏は、NVIDIA Nemotron 3 Superを基盤とするSalesforce初の顧客関係管理 (CRM) 推論モデル「Koa」の発表に合わせ、人工知能 (AI) の未来と安全性について見解を述べた。

VC・資金調達

エヴィー、女性の健康研究強化へ4000万ドルを調達

女性の健康分野を手掛けるエヴィー (Evvy) は2026年9月15日(現地時間)、カタリオリオ・キャピタル・マネジメント (Catalio Capital Management) が主導するシリーズBラウンドで、4000万ドルを調達したと発表した。同社は、膣内マイクロバイオームの分析を目的とした自宅検査キットを提供しており、収集したデータを用いて女性の健康研究をさらに進めるとしている。

ベンダー・製品

【速報】DeepSeek、新モデル「DeepSeek-V4.1-Flash」を発表

ディープシーク (DeepSeek) は2026年9月15日(現地時間)、新モデル「DeepSeek-V4.1-Flash」を正式にリリースしたと発表した。同モデルは新しいモデル構造系列の最小サイズで、ネイティブな多モーダル視覚理解能力を持つ。APIにも同期して公開され、複数のベンチマークスコアが更新されたほか、APIの価格調整も実施された。