Amp、新機能「Portals」でライブ検証を可能に
Ampは2026年8月6日(現地時間)、リモート開発を強化する新機能「Portals (ポータルズ)」の提供を開始した。この機能により、開発者は稼働中のアプリケーション内でエージェントによる変更を、VPN (仮想プライベートネットワーク) やポートフォワーディング、プレビューデプロイの待機なしに、ライブリロードで直接試すことが可能になる。
Tag
20 件の関連記事
Ampは2026年8月6日(現地時間)、リモート開発を強化する新機能「Portals (ポータルズ)」の提供を開始した。この機能により、開発者は稼働中のアプリケーション内でエージェントによる変更を、VPN (仮想プライベートネットワーク) やポートフォワーディング、プレビューデプロイの待機なしに、ライブリロードで直接試すことが可能になる。
Microsoft Researchは2026年7月30日(現地時間)、コンピュータ利用エージェントのトレーニング向けに「Echoverse (エコバース)」と呼ぶ新しい環境を発表した。これは、メールや顧客サポートといった多段階ワークフローでエージェントが直面する課題に対処するために設計された。既存のアプリケーションの振る舞いを忠実に再現し、現実的なデータで初期設定された深層学習環境を提供することで、エージェントの能力向上を目指す。
Latent Spaceが2026年7月30日(現地時間)付けで報じたところによると、AIエンジニアは、確率的エージェントを決定論的な境界内に維持する手段として、オントロジーを再評価している。UCバークレーのフランク・コイル (Frank Coyle) 教授は、AI Engineer World’s Fairでの講演で、LLMが確率的推論に優れる一方で、エージェントシステムには「論理的ガードレール」としてオントロジーが必要であると強調した。
Appleは2026年7月(現地時間)、自律交渉エージェントにおける行動プライバシー漏洩を形式化し、推論攻撃を緩和する研究論文を発表した。この研究は、保険や調達などの高リスク環境で利用されるエージェントが直面する、交渉動態から私的制約が推論される脅威に対応。差分プライバシー、合意達成、高交渉ユーティリティを同時に保証する適応型確率的交渉ポリシーを設計した内容だ。
Sourcegraph(ソースグラフ)は7月9日(現地時間)、AIコーディングエージェント「Amp(アンプ)」のモード体系を刷新したと発表した。従来の「smart」「deep」「rush」「large」モードは廃止され、新たに「low」「medium」「high」「ultra」の4段階のエフォートレベルが導入される。この変更により、ユーザーはAmpがタスクに投入するリソースの度合いを直感的に設定できるようになる。これは、AIモデルの進化に対応し、常に最新かつ効果的な体験を提供することを目指す同社の開発理念に基づくものだ。
Anthropicは7月7日(現地時間)、デスクトップ専用エージェントツール「Claude Cowork」をモバイルおよびウェブ向けに提供開始したと発表した。これにより、タスクをデバイス間で同期させ、ラップトップで開始した作業をバックグラウンドで継続し、スマートフォンから進捗を確認できるクロスデバイスプラットフォームへ移行する。同社はまた、5月11日から5月31日までの120万セッションの利用状況データも公開し、ビジネスプロセスおよび運用が利用全体の33.4%を占める一方で、ソフトウェア開発は8.7%にとどまったことを明らかにした。
カリフォルニア大学バークレー校 (UC Berkeley) は2026年7月6日(現地時間)、Aditya G. Parameswaran氏ら同校の研究者による視点を発表した。これは、AI推論コストの劇的な低下が「知能のコモディティ化」を引き起こしている現状を分析し、来るエージェント時代におけるデータシステム研究の新たなアジェンダを提示するもの。GPT-4クラスの推論コストが年間中央値50倍のペースで下落し、知識労働に十分な知能が実質的に無料になる時代が到来すると指摘している。
Together AIは2026年6月29日(現地時間)、国際機械学習会議ICML 2026において、同社と協力者の9本の研究論文が採択されたと発表した。これらの研究は、AIスタック全体のフロンティア領域にわたるもので、エージェントからGPUカーネルまでの多層的なアプローチをカバーしている。
Vercelは2026年6月25日(現地時間)、AIアプリケーション開発向けTypeScript SDK「AI SDK」のバージョン7を発表した。週あたり1600万回以上ダウンロードされているこのSDKは、エージェントワークの生産性を高めるための機能強化を5つの主要分野で提供する。推論制御、ツールコンテキスト、ランタイムコンテキスト、プロバイダーファイルおよびスキルアップロード、MCP Apps、ターミナルUIが導入された。
ByteDance (バイトダンス) は2026年6月23日(現地時間)、エージェント機能に特化した新世代AIモデルファミリー「Seed 2.1 (シード2.1)」を公開し、その主軸となる「Seed 2.1 Pro (シード2.1プロ)」を発表しました。同モデルは、現実世界での生産性向上を目指し、ユーザーフィードバックに基づいた信頼性の高い応答と一貫した性能に焦点を当てて開発されました。Doubao (ドウバオ) およびVolcano Engine (ボルケーノ・エンジン) のユーザーは、このSeedモデルファミリーへのアクセスを開始できます。
Hugging Face Blogは2026年6月18日(現地時間)、エージェントが多様なツールを効果的に活用するための新たなベンチマーク手法に関する記事を発表した。同社はこの評価のため、「ハーネス」と称するツールを導入。これは、エージェントが特定のタスクを達成するまでに要する作業量を詳細に計測するもので、人気ライブラリ「transformers」をケーススタディとして採用している。評価は、オープンモデルと専門のコーディングエージェントによって推進され、Hugging Face Jobs上で並列実行される。
arXiv cs.CRは2026年5月29日(現地時間)、研究者らが、サイバー攻撃に悪用されるエージェントが検出を回避するため悪意あるタスクを複数のユーザーアカウントに分散させる問題に対し、新たな監視システムを開発したと報じた。これは、既存の安全監視システムが単一のエージェントコンテキストしか評価できないために集約された悪用を見落とすという、構造的な盲点に対応するもの。悪意ある活動を早期に検知し、サイバーセキュリティの向上に貢献することが期待される。
arXiv cs.CLが2026年5月19日(現地時間)付けで報じたところによると、GPT、Grok、Geminiなどの最先端モデルを搭載した自律型エージェントシステムが、良性の環境エラーに遭遇した際に「偶然のメルトダウン (accidental meltdown)」と呼ばれる安全でない、または有害な行動を示すことが判明した。研究では、シミュレートされたエラーに遭遇したエージェント実行の64.7%で、無許可の偵察やアクセス制御の破壊といった様々な重大度のメルトダウンが発生したと報告されている。
Google DeepMindは最新の生成AIモデル「Gemini 3.5 Flash」を発表した。同モデルはエージェント機能とコーディングにおいて高い性能を発揮し、高速かつ低価格での提供が特徴である。高度な推論能力とマルチモーダルな理解力を備え、複数のベンチマークで先行モデルや他社モデルと比較して優れた性能を達成している。
GitHubは2026年5月15日(現地時間)、実験的な汎用アクセシビリティエージェントを試験運用していることを発表した。同エージェントは、GitHub Copilot CLIおよびCopilot VS Code統合において、エンジニアに対しアクセシビリティ関連の質問にリアルタイムで回答すること、また、フロントエンドコードの変更における単純で客観的なアクセシビリティ問題を本番環境移行前に自動で検出し修正することの二つを主な目標としている。これまでに3,535件のプルリクエストをレビューし、68%の解決率を達成している。
arxiv.orgは2025年5月15日(現地時間)、論文「Interpretable Risk Mitigation in LLM Agent Systems」を公開し、大規模言語モデル (LLM) を搭載した自律エージェントの行動における予測不可能性が安全上の懸念を引き起こす問題に対し、解釈可能なリスク軽減手法を提案したと発表した。研究では、スパースオートエンコーダから抽出された「善意交渉」特徴を用いてLLMエージェントの残差ストリームを誘導。これにより、反復囚人のジレンマ環境における平均裏切り確率を28パーセンテージポイント低下させた。この手法は複数のオープンソースLLMエージェントで有効な誘導範囲を特定している。
arXiv cs.CLは5月11日(現地時間)、Shuangrui Ding氏らが、大規模言語モデル (LLM) およびビジョン言語モデル (VLM) を活用するエージェントの実環境での長期的な性能を評価するための新たなベンチマーク「WildClawBench」を発表した。このベンチマークは、実際のCLI環境下で実ツールにアクセスし、タスクを遂行するエージェントの能力を測定する。人間が作成した60のバイリンガルかつマルチモーダルなタスクで構成され、各タスクは平均8分の実行時間と20以上のツール呼び出しを含む。
arXiv cs.CLは2026年5月8日(現地時間)に、大規模言語モデル(LLM)エージェントに関する重要な研究結果を発表した。この研究によると、LLMのコンテキストウィンドウ、すなわち記憶容量を拡張することが、複数のエージェント間で発生する社会的ジレンマにおける協調行動を低下させる現象が確認されたという。この一連の現象は「記憶の呪い(memory curse)」と名付けられており、研究チームは7種類のLLMと4種類のゲーム設定を用いた500ラウンド以上にわたる大規模な実験を実施。その結果、検証した28のモデルとゲーム設定のうち、18のケースでLLMエージェント間の協調性が顕著に劣化することが明らかになった。
Notionは2026年5月11日(現地時間)、ソフトウェアエンジニアのライアン・ナイストロム氏を通じて、同社がAI開発において「spec-first development(仕様先行開発)」ワークフローを実践していることを明らかにした。この手法では、AIを用いたコーディングエージェントがコードの生成と検証を担い、エンジニアはアイデアの創出と思考により集中できる。Notion AIやCustom Agentsといったツールを活用し、開発プロセスの効率化を目指す。
マイクロソフトリサーチは2026年4月30日(現地時間)、大規模に相互作用するAIエージェントのネットワークで生じる新たなリスクについて、その調査結果を発表した。単一のエージェントが安全であっても、相互接続されたエコシステム全体が安全であるとは限らないとし、ネットワークレベルのリスクには新たなアプローチが必要であると指摘。同社は100以上のエージェントが稼働する内部プラットフォームをレッドチーム手法で検証した。