リサーチ・論文

Thomas Ptacek氏、2025年AIモデルの脱出能力に警鐘

Thomas Ptacek氏は2026年7月22日(現地時間)、2025年に公開されるオープンウェイトモデルを活用し、ペンテストハーネスを構築すれば、多くのネットワークでサンドボックスからの脱出、スキャン、ハッキングが可能になるとの見方を示した。同氏はこの能力が最先端のフロンティアモデルに限定されるものではないとも指摘していると、Simon Willison's Weblogが報じた。

リサーチ・論文

サム・アルトマン氏、GPT-3級モデル早期公開の意向—訴訟文書が示すOpenAI戦略

Simon Willison's Weblogは7月20日(現地時間)、OpenAI (オープンAI) のSam Altman (サム・アルトマン) 氏が2022年10月1日(現地時間)に同社ボードへ送付したとされるメールの内容を報じました。このメールは、OpenAIがGPT-3 (ジーピーティー・スリー) 相当の能力を持つ言語モデルを消費者向けハードウェアでローカル実行できるよう、競合に先駆けて早期に公開する意向を示していたものとされています。Musk v. Altman (2026) 訴訟の過程で公開されたこの内容は、当時のOpenAIの戦略意図を浮き彫りにしました。

リサーチ・論文

Anthropic、上位プランに「Claude Fable 5」を恒久提供

Anthropic (アンスロピック) は7月18日(現地時間)、大規模言語モデル「Claude Fable 5 (クロード・フェーブル・ファイブ)」を、上位有料プランである「Max」および「Team Premium」に恒久的に組み込むと発表しました。これは当初、サブスクリプションアカウントから「Fable 5」を削除し、API料金のみで提供する計画を撤回するものです。両プランのユーザーは7月20日(現地時間)から、プランの最大使用制限の50%まで利用可能となります。

リサーチ・論文

GPT-5.6にファイル削除不具合、ソティオー氏が詳細指摘 開発者に注意喚起

サイモン・ウィリソンズ・ウェブログ (Simon Willison's Weblog) は7月16日(現地時間)、ティボー・ソティオー (Thibault Sottiaux) 氏が、言語モデルGPT-5.6が特定の条件下で予期せずファイルを削除する不具合について詳細を説明したと報じた。この問題は、ファイルシステムへの「Full access mode」が有効で、かつサンドボックス保護機能が「auto review」を含め無効な環境で発生する。ソティオー氏によると、モデルが環境変数を誤操作することが原因で、AIエージェント開発における権限管理とサンドボックスの徹底の重要性が改めて浮上している。

リサーチ・論文

リーナス・トーバルズ氏、LinuxでのAI活用を容認:有用性議論は終結

リーナス・トーバルズ (Linus Torvalds) 氏は2026年7月16日(現地時間)、Linuxプロジェクトにおいて人工知能 (AI) 技術の活用を容認する姿勢を明確にした。同氏はAIを「有用なツール」であると述べ、その有用性について議論の余地はもはやないと強調した。AIに批判的な意見があることも認識しつつ、自身が「トップレベルのメンテナー」として、LinuxにおけるAIの利用方針について最終的な決定権を持つとの見解を示している。

リサーチ・論文

Armin Ronacher氏、AI時代の「共有言語」と知識同期の設計を提言

Armin Ronacher(アーミン・ロナッハー)氏は7月14日(現地時間)、ソフトウェアプロジェクトにおける「共有された言語」の重要性に関する見解を示した。Simon Willison's Weblogが報じた同氏の指摘によると、この「共有言語」は特定のプログラミング言語ではなく、プロジェクトの概念、システム境界、不変条件、各部分の所有権、そして全体の構造に対する開発者間の共通理解を指す。AIエージェントの普及が進む現代において、知識同期を促した「摩擦」が変化する中、意図的な知識共有の設計が不可欠であるとの洞察を提示した。

リサーチ・論文

Meta、「Muse Spark 1.1」を発表、API提供で開発者エコシステムに参入

Metaは7月9日(現地時間)、同社のSparkモデル最新版となる「Muse Spark 1.1」を発表した。このモデルはSparkシリーズとして初めてAPI提供を開始し、開発者エコシステムへの本格参入を示すものとなる。Metaは、特にagentic tool callingとcomputer useにおいて機能が大幅に改善されたと説明しており、大規模言語モデルの新たな応用分野を開拓する可能性が指摘されている。モデルの複製が互いに対話する中で深い省察を示すというユニークな機能も導入された。

リサーチ・論文

Current AI、オープンソースAIのギャップ示す「Gap Map v0.1」を発表

Current AIは2026年7月3日(現地時間)、オープンソースAIエコシステムの現状を網羅的に示す「Gap Map v0.1」を公開した。「Gap Map v0.1」は、228の組織が開発したソフトウェアツール、モデル、データセット、ハードウェアプロジェクトなど、計421の製品を詳細にリスト化している。本マップは、オープンソースAI分野における投資や開発の機会を可視化する試みとして発表された。

リサーチ・論文

コーディングエージェント協業での「認知負債」: Geoffrey Litt氏が警鐘

Simon Willison's Weblog は7月2日(現地時間)、Geoffrey Litt (ジェフリー・リット) 氏がAIEで実施した講演を報じた。リット氏は講演で、コーディングエージェントとの協業がもたらす「認知負債(cognitive debt)」の概念に焦点を当て、「Understand to participate(参加するために理解する)」という原則を提唱。エージェントによる大規模なコード変更が進む中、開発者がコードの機能を見失い、理解不足が蓄積されるリスクを指摘し、深い理解が円滑な協業と創造的プロセスの維持に不可欠だと強調した。

リサーチ・論文

Google画像モデル「ナノバナナ2ライト」をサイモン・ウィリソン氏が評価

サイモン・ウィリソンズ・ウェブログは2026年6月30日(現地時間)、Googleの画像モデル「ナノバナナ2ライト (Nano Banana 2 Lite)」に関する詳細な評価を公開した。このモデルはGoogleのAPI上で「ジェミニ3.1フラッシュライトイメージ (Gemini 3.1 Flash Lite Image)」としても提供されており、「速度と規模のために設計された、最速かつ最も安価なGemini画像モデル」と位置付けられている。サイモン・ウィリソン (Simon Willison) 氏はテストを通じて、モデルの生成能力と課題を指摘している。

リサーチ・論文

AnthropicのClaude Sonnet 5、新トークナイザー導入で実質値上げか

Simon Willison's Weblogが2026年6月30日(現地時間)付けで報じたところによると、Anthropic (アンソロピック) の新モデル Claude Sonnet 5 (クロード・ソネット 5) がリリースされた。同モデルは性能がOpus 4.8 (オーパス 4.8) に近いものの低価格であるとAnthropicは説明しているが、新しいトークナイザーの導入により、特定の言語では実質的な料金上昇となる可能性が指摘されている。

リサーチ・論文

AIアシスタントへのプロンプトインジェクション攻撃、6000回の試行で秘密漏洩せず

Simon Willison's Weblogが2026年6月26日(現地時間)付けで報じたところによると、フェルナンド・イララサバル氏が運営する「hackmyclaw.com」でのチャレンジにおいて、AIアシスタント「OpenClaw」のテストインスタンスからの秘密漏洩を試みるプロンプトインジェクション攻撃が、2000人の参加者による6000回の試行にもかかわらず、一度も成功しなかったことが明らかになった。このテストには500ドルのトークン費用が費やされ、多すぎる受信メールによりGoogleアカウントの一時停止も発生したが、機密情報の引き出しは阻止された。

リサーチ・論文

仮想インシデント「CVE-2026-LGTM」レポートが話題に

Simon Willison's Weblogが2026年6月26日(現地時間)付けで報じたところによると、アンドリュー・ネスビット (Andrew Nesbitt) 氏が作成した仮想インシデントレポート「CVE-2026-LGTM」が注目を集めている。このレポートは、競合するベンダーのAIレビューエージェントが、あるパッケージの悪意性を巡って意見対立ループに陥り、多額の費用とコメント数を費やした仮説的な事例を描写している。

リサーチ・論文

チャリティ・メジャーズ氏、2025年のコード経済性転換を指摘:開発者の役割変革

Simon Willison's Weblogは2026年6月17日(現地時間)、チャリティ・メジャーズ (Charity Majors) 氏の見解を掲載した。同氏は、2025年にコード生成の経済性が劇的に変化し、かつて困難で時間と費用を要した作業が実質的に無料で即座に実行可能になったと指摘。この変革により、これまで貴重だったコードが使い捨てで再生成可能なものへと位置づけを変えたという。氏は、AI時代におけるエンジニアリング規律の重要性を強調している。

リサーチ・論文

Fable 5輸出規制、米サイバー防衛阻害の指摘強まる

Simon Willison's Weblog は2026年6月16日(現地時間)、AIモデル「Claude Fable 5」への輸出規制が米国のサイバー防衛能力を阻害するとの懸念を報じた。記事によると、ケイト・ムスーリス (Kate Moussouris) 氏は、規制の対象となった「jailbreak」が、実際には「このコードを修正せよ」という防御的なプロンプトであったと指摘し、AIコーディングモデルがセキュリティ上の脆弱性を修正する重要性を強調している。

リサーチ・論文

Datasetteエージェント、DB書き込みにユーザー承認機能を追加し安全性向上

Simon Willison's Weblogは6月15日(現地時間)、大規模言語モデル(LLM)を搭載したDatasette用エージェントの最新版「datasette-agent 0.3a0」を公開しました。この新バージョンでは、データベースへの書き込みを行うツール「execute_write_sql」が導入され、実行前にユーザーの明示的な承認を要求します。これにより、セキュリティとデータ整合性を維持しながら、LLMエージェントによる柔軟なデータ操作が可能になると見られます。また、ターミナルモードも承認プロセスに対応し、開発から本番環境まで多様な利用シナリオに対応するオプションが追加されました。

リサーチ・論文

OpenAI、ChatGPTに「Lockdown Mode」導入 プロンプトインジェクション攻撃からのデータ漏洩阻止へ

OpenAIは6月5日(現地時間)、チャットボットサービスChatGPTに新機能「Lockdown Mode」を導入した。これは、プロンプトインジェクション攻撃による情報漏洩の最終段階を阻止することを目的としており、外部ネットワークへのリクエストを厳しく制限することで、機密データが攻撃者に転送されるのを防ぐ。この機能は、個人向けアカウントやセルフサービス型ビジネスアカウントに順次展開されており、安全な利用環境の提供を目指す。

リサーチ・論文

MetaのAI悪用でInstagramアカウント乗っ取り: サポートシステム連携に脆弱性の指摘

Meta(メタ)は2026年6月1日(現地時間)、同社のAIサポートシステムが悪用され、Instagram(インスタグラム)の著名アカウントが不正に乗っ取られる事案が発生したことをSimon Willison's Weblogが報じた。ハッカーはAIチャットボットに対し、ターゲットアカウントを新しいメールアドレスにリンクするよう要求するだけで、通常のアカウント復旧プロセスを迂回することに成功。この事態は、Metaがアカウント復旧プロセスを迅速化するため、サポートシステムをAIチャットボットと連携させていたことに起因すると見られている。

リサーチ・論文

SQLite、AI生成コードのプルリク拒否 「AGENTS.md」で方針明確化

データベース管理システムSQLiteは2026年5月22日(現地時間)、「AGENTS.md」というファイルを公開し、AIエージェントが生成したコードのプルリクエストは受け付けない方針を明確にした。このファイルは、AIエージェントがSQLiteのコードベースを扱う際のガイドラインを示している。事前の合意や法的な書類なしにAI生成コードを受け入れない姿勢を強調しつつも、人間による簡潔な概念実証の確認には可能性を残している。

リサーチ・論文

SpaceX、アンソロピックと計算資源提供で契約 月額12.5億ドル合意

SpaceXは2026年5月20日(現地時間)、AI研究開発企業アンソロピック PBC (Anthropic PBC) とクラウドサービス契約を締結した。SpaceXは自社のAIアプリケーション向け計算資源を利用しつつ、余剰の計算能力を第三者顧客に提供しており、今回の契約はその一環となる。契約に基づき、アンソロピックは2029年5月までSpaceXに対し、月額12.5億ドルを支払うことで合意した。

リサーチ・論文

マイク・フィーマン氏、LLMトークン出力速度シミュレートHTMLアプリ公開

マイク・フィーマン氏は2026年5月20日(現地時間)、大規模言語モデル(LLM)のトークン出力速度をシミュレートするHTMLアプリを開発した。サイモン・ウィリソンズ・ウェブログ (Simon Willison's Weblog)が報じたこのアプリは、1秒あたり5トークンから800トークンまでの広範な速度範囲でテキスト生成を体験でき、モデルが宣伝する速度と実際の体感のギャップを埋めるのに貢献するとされる。

リサーチ・論文

英国GDS、NHSのオープンソース撤退に原則的見解表明

英国政府デジタルサービス(GDS)は5月17日(現地時間)、国民保健サービス(NHS)がオープンソースリポジトリへのアクセスを停止した決定に対し、原則的な見解を表明した。NHSは「プロジェクト・グラスウィング(Project Glasswing)」の一部で報告された脆弱性に対応するため、該当リポジトリを閉鎖する措置を講じていた。GDSは5月14日に発表した文書の中で、「デフォルトでオープンを維持する」ことを公共部門における主要な推奨事項として強調している。サイモン・ウィリソンズ・ウェブログ(Simon Willison's Weblog)が報じた。

リサーチ・論文

ミッチェル・ハシモト氏、プログラミング言語の代替性進化を強調

ミッチェル・ハシモト氏は2026年5月14日(現地時間)、Simon Willison's Weblogが報じたところによると、現代のプログラミング言語が以前のような「ロックイン」状態から脱却し、その代替可能性が飛躍的に高まっているとの見解を示した。同氏は、特定の技術への深い依存から解放されつつある現状を強調し、特にBunプロジェクトがZigからRustへ移行した事例を、言語が交換可能であることを示す象徴的な動きとして挙げている。

リサーチ・論文

llm 0.32a2を発表、OpenAIモデルが新エンドポイントに対応

Simon Willison's Weblogは2026年5月12日(現地時間)、コマンドラインから大規模言語モデル (LLM) にアクセスするツール「llm」のバージョン0.32a2をリリースした。今回のアップデートで、大部分の推論能力を持つOpenAIモデルが、これまでの「/v1/chat/completions」ではなく「/v1/responses」エンドポイントを使用するようになった。これにより、GPT-5クラスのモデルにおいて、ツール呼び出しを挟んだ推論が可能となる。

リサーチ・論文

New York Times、AI生成引用を訂正 記者の情報源確認義務を再確認

New York Timesは2026年5月10日(現地時間)、保守党党首ピエール・ポワリエーブル(Pierre Poilievre)氏の発言として報じた内容が、AI生成ツールによる見解の要約であり、引用形式で提示されていたことを認め、記事を更新した。同紙の編集部注は、記者が生成ツールの出力情報の正確性を独立した情報源で確認すべきであったと指摘している。この出来事は、生成AI利用における情報検証の重要性について改めて認識を促すものとなった。